PDFツール / 11

スキャンPDFをテキスト化(OCR)

選択可能な文字がないスキャンPDFから、ページごとにテキストを読み取り、処理はすべてブラウザ内で完結します。

スキャンPDFをテキスト化(OCR): TOEAは各ページを画像にレンダリングし、それぞれに光学文字認識を実行します。出力にはページごとのラベルを付け、どのページ由来か分かるようにします。 サーバーへのファイルアップロードは一切なく、100%ブラウザ内でローカル実行します。

カテゴリ
PDFツール
実行回数
ブラウザ内で
コスト
無料 · 登録不要
提供状況
すぐに使えます
スキャンされたPDF→テキスト デスクローカル処理

完全にブラウザ内で実行します

↥
スキャンされたPDFを選択

PDF · 最大30 MB、一切アップロードされません

読み取り精度を高めるには

読み取り前にすべてのページを200 DPIでレンダリングするため、精度の上限はスキャン自体の品質で決まります。本文を300 DPIでスキャンしたものはきれいに読み取れますが、斜めから撮影したページのスマートフォン写真や、小さな文字をファクス品質でスキャンしたものでは推測が多くなります。横向きや上下逆さまのページは非常に読み取りにくいため、認識を実行する前にPDFを回転して正しい向きにしてください。

文書の記述言語を選択してください。言語ごとに別のモデルを使用します。中国語には簡体字モデルと繁体字モデルがあり、間違った方を選ぶと精度が大きく低下します。2言語が混在する文書は、本文の大部分で使われている言語を選ぶと最もよく読み取れます。

読み取り結果を確認する

信頼度の数値は全ページの平均なので、良いスコアの中に1ページだけの不良が隠れることがあります。通常、90前後以上なら誤りは時々ある程度ですが、75未満ではほとんどの段落に誤りがあると考えてください。よくある混同には、0とO、1、l、I、rnがmとして読まれるケース、5がSとして読まれるケースがあります。金額、日付、参照番号では特に影響が大きいため、すべての数値をページと照合してください。

文章では「行を段落に結合」をオンにしてください。印刷された各行の末尾で分断された文をつなげられます。住所、リスト、表では行の区切りに意味があるため、オフにしてください。

使い方

  1. スキャンPDFを選びます。
  2. テキストの言語を選びます。
  3. 結果を読んでコピーまたはダウンロードします。

プライバシーと制限事項

ファイルはアップロードされません。認識エンジンと言語モデルは一度だけ—約10 MB—ダウンロードされてブラウザにキャッシュされ、その後の処理はすべてご利用のマシン上で動作します。ホスト型のOCRサービスはその逆で、ドキュメントの送信が前提です。長いドキュメントは時間がかかります。各ページをレンダリングして順番に読み取るためです。

関連ツール

よくある質問

PDF to Textではなく、いつこちらを使いますか?

まずはPDF to Textをお試しください—文書に実テキストが含まれていれば即時かつ正確です。こちらのツールは何も返ってこない場合、つまりページが写真である場合に使います。

なぜ遅いのですか?

各ページを画像にレンダリングし、1文字ずつ読み取るためです。数ページなら速いですが、100ページのスキャンは相応の時間がかかり、タブは開いたままにしておく必要があります。

レイアウトは保持されますか?

いいえ。段組み、表、ヘッダーは読み順のプレーンな行として出力されるため、複雑なページは整形が必要になります。

PDFを検索可能にできますか?

ここではできません—それにはファイルに不可視のテキストレイヤーを書き戻す必要があります。ここでは他で使えるテキストを取得できます。

無料ツール · ブラウザ内で · アカウント不要