PDF工具 / 11

掃描 PDF 轉文字(OCR)

在瀏覽器中逐頁讀取沒有可選取文字的掃描 PDF,完全不需上傳檔案。

掃描 PDF 轉文字(OCR): TOEA會將每一頁轉成圖片,再對每頁執行光學字元辨識,並依頁面標示輸出內容,方便你確認每段文字的來源。 全程在瀏覽器中於本機執行,檔案不會上傳至伺服器。

分類
PDF工具
使用次數
在瀏覽器中
費用
免費・免註冊
可用狀態
可立即使用
掃描PDF→文字工作台本機處理

全程在瀏覽器中執行

↥
選擇掃描的PDF

PDF·上限30 MB,絕不上傳

取得更清楚的辨識結果

每頁都會先以200 DPI解析後再進行辨識,因此限制取決於掃描本身。以300 DPI掃描的內文通常辨識效果良好;斜拍的頁面手機照片,或小字的傳真品質掃描,則會產生猜測結果。橫放或上下顛倒的頁面辨識效果很差,因此請先使用旋轉PDF將頁面轉正,再執行辨識。

請選擇文件使用的語言,因為每種語言都是獨立的模型。中文分為簡體和繁體模型,選錯模型會大幅降低準確度。混合兩種語言的文件,使用文字占比最高的語言通常效果最好。

檢查辨識結果

信心分數是所有頁面的平均值,因此某一頁辨識不佳,可能會被整體的高分掩蓋。約90或以上通常表示只有偶發錯誤;低於75時,預期大多數段落都會有錯誤。常見混淆包括0和O、1、l和I、將rn讀成m,以及將5讀成S。這在金額、日期和參考編號中尤其重要,因此請逐一對照頁面確認所有數字。

處理散文時,請開啟「將行合併為段落」,它會修補每個列印行末尾被拆開的句子。對於地址、清單和表格,請關閉此功能,因為換行本身具有意義。

使用方式

  1. 選擇掃描 PDF。
  2. 選取文字的語言。
  3. 閱讀結果,並複製或下載文字。

隱私與限制

你的檔案絕不會上傳。辨識引擎和語言模型會下載一次,大小約 10 MB,並由瀏覽器快取,之後所有處理都在你的裝置上執行。線上 OCR 服務的運作方式正好相反:它們需要取得你的文件。較長的文件會需要一些時間,因為每一頁都必須依序轉成圖片,再進行讀取。

相關工具

常見問題

什麼時候該使用這個工具,而不是「PDF 轉文字」?

先使用「PDF 轉文字」——如果文件內含真正的文字,它會立即且準確地完成轉換。當該工具沒有傳回任何內容時,才使用這個工具,因為這表示頁面其實是照片。

為什麼速度很慢?

每一頁都會先轉成圖片,再逐字讀取。幾頁的文件很快;但上百頁的掃描文件確實需要時間,而且分頁必須保持開啟。

它會保留版面嗎?

不會。欄位、表格和標題會依閱讀順序變成純文字行,因此複雜的頁面需要另外整理。

可以讓 PDF 變成可搜尋嗎?

不行——這需要將不可見的文字層寫回檔案。這個工具只會提供文字,讓你在其他地方使用。

免費工具・使用在瀏覽器中次・免註冊