PDF工具 / 09

PDF轉文字

逐頁擷取PDF中的可選取文字,整個過程都在瀏覽器中完成。

PDF轉文字: TOEA會讀取PDF每頁儲存的定位文字片段,再將它們重新分組成行,並標示每一頁,讓輸出內容保持易於瀏覽。 全程在瀏覽器中於本機執行,檔案不會上傳至伺服器。

分類
PDF工具
使用次數
在瀏覽器中
費用
免費・免註冊
可用狀態
可立即使用
PDF文字擷取本機處理

全程在瀏覽器中執行

↥
選擇PDF

PDF · 最大60 MB,不會上傳

文字擷取結果變成亂碼時

有時候擷取確實會輸出文字,但內容是錯的:可能出現隨機符號、方框,或沿著字母順序錯位的字母。這種情況通常是因為PDF字型沒有將字形對應回實際字元的對照表,部分設計和印刷軟體會省略這項資訊。頁面看起來正常,是因為它繪製的是圖形;底層字元卻不是畫面上顯示的字母。請將該檔案視為掃描檔,改用掃描PDF轉文字。

較輕微的異常有更簡單的原因:fi和fl被合併成單一連字字元,或PDF將每個字母分開放置,導致一個詞被拆成兩部分。

整理擷取出的文字

列印行會被擷取成獨立的行,因此段落每隔幾個詞就會出現換行,而行尾的連字號詞也會維持拆開的狀態。頁首、頁尾和頁碼會在內文中每頁重複一次。引用或重新使用文字前,請先清除這些內容;如果文字要作為一個完整區塊使用,也請刪除頁面標籤。

若要計算文件的詞數或字元數,請將整理後的文字貼到字數計算機;直接從原始輸出計算會把所有頁首和標籤都算進去。

使用方式

  1. 選擇PDF。
  2. 擷取文字。
  3. 複製文字或下載.txt檔案。

隱私與限制

檔案會在瀏覽器中開啟並重新寫入,絕不上傳;當文件是合約、掃描檔或其他你不會交給陌生人的內容時,這點正是其重要之處。掃描PDF不包含可擷取的文字,工具會明確回報這種情況,而不是產生空白檔案。

相關工具

常見問題

為什麼我的PDF沒有產生任何內容?

幾乎可以確定是掃描圖片。頁面的照片裡沒有文字,而擷取這類文字需要OCR,這項工具無法執行OCR。

為什麼版面不一樣了?

PDF會將文字儲存為具有位置資訊的文字片段,而不是段落。工具會依位置將片段重新分組成行,但欄位和表格無法維持原本的樣子。

會標示換頁位置嗎?

會。輸出內容會標示每一頁,因此你可以看出頁面在哪裡結束。

受保護的檔案可以使用嗎?

受密碼保護的文件無法開啟,請先移除密碼。

免費工具・使用在瀏覽器中次・免註冊