PDF工具 / 09
PDF轉文字
逐頁擷取PDF中的可選取文字,整個過程都在瀏覽器中完成。
PDF轉文字: TOEA會讀取PDF每頁儲存的定位文字片段,再將它們重新分組成行,並標示每一頁,讓輸出內容保持易於瀏覽。 全程在瀏覽器中於本機執行,檔案不會上傳至伺服器。
- 分類
- PDF工具
- 使用次數
- 在瀏覽器中
- 費用
- 免費・免註冊
- 可用狀態
- 可立即使用
全程在瀏覽器中執行
PDF · 最大60 MB,不會上傳
文字擷取結果變成亂碼時
有時候擷取確實會輸出文字,但內容是錯的:可能出現隨機符號、方框,或沿著字母順序錯位的字母。這種情況通常是因為PDF字型沒有將字形對應回實際字元的對照表,部分設計和印刷軟體會省略這項資訊。頁面看起來正常,是因為它繪製的是圖形;底層字元卻不是畫面上顯示的字母。請將該檔案視為掃描檔,改用掃描PDF轉文字。
較輕微的異常有更簡單的原因:fi和fl被合併成單一連字字元,或PDF將每個字母分開放置,導致一個詞被拆成兩部分。
整理擷取出的文字
列印行會被擷取成獨立的行,因此段落每隔幾個詞就會出現換行,而行尾的連字號詞也會維持拆開的狀態。頁首、頁尾和頁碼會在內文中每頁重複一次。引用或重新使用文字前,請先清除這些內容;如果文字要作為一個完整區塊使用,也請刪除頁面標籤。
若要計算文件的詞數或字元數,請將整理後的文字貼到字數計算機;直接從原始輸出計算會把所有頁首和標籤都算進去。
使用方式
- 選擇PDF。
- 擷取文字。
- 複製文字或下載.txt檔案。
隱私與限制
檔案會在瀏覽器中開啟並重新寫入,絕不上傳;當文件是合約、掃描檔或其他你不會交給陌生人的內容時,這點正是其重要之處。掃描PDF不包含可擷取的文字,工具會明確回報這種情況,而不是產生空白檔案。
相關工具
常見問題
為什麼我的PDF沒有產生任何內容?
幾乎可以確定是掃描圖片。頁面的照片裡沒有文字,而擷取這類文字需要OCR,這項工具無法執行OCR。
為什麼版面不一樣了?
PDF會將文字儲存為具有位置資訊的文字片段,而不是段落。工具會依位置將片段重新分組成行,但欄位和表格無法維持原本的樣子。
會標示換頁位置嗎?
會。輸出內容會標示每一頁,因此你可以看出頁面在哪裡結束。
受保護的檔案可以使用嗎?
受密碼保護的文件無法開啟,請先移除密碼。
免費工具・使用在瀏覽器中次・免註冊