PDFツール / 09

PDF to Text

PDFから選択可能なテキストをページごとに抽出します。処理はすべてブラウザ内で完結します。

PDF to Text: TOEAは各ページに格納された位置付きのテキストランを読み取り、位置情報から行に再構成します。出力では各ページにラベルを付け、ページ位置が分かるようにします。 サーバーへのファイルアップロードは一切なく、100%ブラウザ内でローカル実行します。

カテゴリ
PDFツール
実行回数
ブラウザ内で
コスト
無料 · 登録不要
提供状況
すぐに使えます
PDFテキスト抽出ローカル処理

完全にブラウザ内で実行します

↥
PDFを選択

PDF · 最大60 MB、何もアップロードしません

文字が崩れて出力されたとき

抽出でテキストは返されても、内容が間違っていることがあります。無関係な記号や四角、アルファベット順にずれた文字などです。これは、PDFのフォントにグリフを実際の文字へ対応付ける情報がない場合に起こります。一部のデザインソフトや印刷ソフトがその情報を省くためです。ページが正しく見えるのは図形として描画されるからで、内部の文字は表示されている文字と一致しません。そのファイルはスキャンとして扱い、スキャンPDFをテキストに変換してください。

比較的軽い異常には、より単純な原因があります。fiやflが1つの合字文字に結合されていたり、PDFが各文字を個別に配置するために単語が2つに分かれていたりします。

抽出したテキストを整える

印刷された行は別々の行として出力されるため、段落は数語ごとに改行された状態になり、行末でハイフン区切りされた単語も分割されたままになります。ヘッダー、フッター、ページ番号も本文中にページごとに繰り返し現れます。引用や再利用の前にこれらを削除し、テキストを1つにつなげる場合はページラベルも削除してください。

文書の単語数や文字数を数えるには、整えたテキストを文字数カウンターに貼り付けてください。未加工の出力から直接数えると、すべてのヘッダーやラベルも含まれます。

使い方

  1. PDFを選びます。
  2. テキストを抽出します。
  3. .txtファイルをダウンロードするか、コピーします。

プライバシーと制限事項

ファイルはブラウザ内で開いて書き換え、アップロードは一切行いません。これは、文書が契約書やスキャンなど、見知らぬ人に渡したくないものである場合に意味があります。スキャンされたPDFには抽出できるテキストが含まれていないため、空のファイルを返すのではなく、その旨を報告します。

関連ツール

よくある質問

PDFから何も出力されないのはなぜですか?

ほぼ確実にスキャン画像です。紙面の写真には内部にテキストは存在せず、復元にはOCRが必要ですが、このツールは対応していません。

レイアウトが違うのはなぜですか?

PDFは段落としてではなく、位置付きのテキストランとしてテキストを格納します。位置関係から行に再構成しますが、カラムや表の体裁は元の見た目のままは保てません。

ページ区切りはマークされていますか?

はい。出力では各ページにラベルが付くため、どこで終わるかが分かります。

保護されたファイルでも動作しますか?

パスワード保護された文書は開けません。先にパスワードを解除してください。

無料ツール · ブラウザ内で · アカウント不要