PDF 도구 / 11
스캔한 PDF를 텍스트로 변환 (OCR)
선택할 수 있는 텍스트가 없는 스캔 PDF를 페이지별로 읽습니다. 모든 작업은 브라우저에서 실행됩니다.
스캔한 PDF를 텍스트로 변환 (OCR): TOEA가 모든 페이지를 이미지로 렌더링한 다음 각 페이지에 광학 문자 인식을 실행하고, 결과에 페이지를 표시하여 어느 페이지에서 추출된 텍스트인지 확인할 수 있도록 합니다. 서버에 파일을 전혀 업로드하지 않고 브라우저에서 100% 로컬로 실행됩니다.
- 카테고리
- PDF 도구
- 실행 횟수
- 브라우저에서
- 비용
- 무료 · 가입 불필요
- 사용 가능 여부
- 사용 가능
브라우저에서 전부 실행됩니다
PDF · 최대 30 MB, 업로드하지 않습니다
더 정확하게 인식하기
각 페이지는 인식 전에 200 DPI로 렌더링되므로 한계는 스캔 자체에 있습니다. 300 DPI로 스캔한 본문은 잘 인식되지만, 비스듬히 찍은 페이지 사진이나 작은 글씨가 있는 팩스 품질의 스캔에서는 추측이 발생합니다. 페이지가 옆으로 누워 있거나 거꾸로 되어 있으면 인식 품질이 크게 떨어지므로, 인식을 실행하기 전에 PDF 회전으로 똑바로 돌리십시오.
문서가 작성된 언어를 선택하십시오. 언어마다 별도의 모델을 사용하기 때문입니다. 중국어는 간체와 번체 모델로 나뉘며, 잘못 선택하면 정확도가 크게 떨어집니다. 두 언어가 섞인 문서는 텍스트 대부분에 사용된 언어로 처리할 때 가장 잘 인식됩니다.
인식 결과 확인
신뢰도 수치는 모든 페이지의 평균이므로, 점수가 높아도 한 페이지의 잘못된 결과가 가려질 수 있습니다. 보통 90 이상이면 가끔 실수가 있는 정도이고, 75 미만이면 대부분의 문단에서 오류가 발생할 수 있습니다. 흔히 혼동되는 항목은 0과 O, 1, l, I, rn을 m으로 읽는 경우, 5를 S로 읽는 경우입니다. 특히 금액, 날짜, 참조 번호에서 중요하므로 모든 수치를 페이지와 대조하십시오.
문장 중심의 본문이라면 줄 이어 붙이기를 켜 두십시오. 인쇄된 각 줄 끝에서 끊긴 문장을 자연스럽게 이어 줍니다. 주소, 목록, 표처럼 줄바꿈 자체에 의미가 있는 경우에는 끄십시오.
사용 방법
- 스캔한 PDF를 선택합니다.
- 텍스트의 언어를 선택합니다.
- 결과를 확인하고 복사하거나 다운로드합니다.
개인정보 보호 및 제한사항
파일은 절대 업로드하지 않습니다. 인식 엔진과 언어 모델은 한 번만 다운로드되며(약 10 MB), 브라우저에 캐시된 후 모든 작업이 사용자의 기기에서 실행됩니다. 호스팅 OCR 서비스는 반대로 작동합니다. 문서를 서비스에 제공해야 합니다. 각 페이지를 렌더링한 다음 차례로 읽기 때문에 문서가 길면 시간이 걸립니다.
관련 도구
자주 묻는 질문
PDF를 텍스트로 변환하는 도구 대신 이 도구가 필요한 경우는 언제인가요?
먼저 PDF를 텍스트로 변환하는 도구를 사용하십시오. 문서에 실제 텍스트가 들어 있으면 즉시 정확하게 변환됩니다. 이 도구는 변환 결과가 아무것도 나오지 않는 경우를 위한 것으로, 페이지가 사진으로 구성되어 있다는 뜻입니다.
왜 느린가요?
모든 페이지를 이미지로 렌더링한 다음 문자 단위로 읽습니다. 몇 페이지는 빠르게 처리되지만, 100페이지 분량의 스캔 문서는 실제 처리 시간이 필요하며 탭을 열어 둬야 합니다.
레이아웃도 유지되나요?
아니요. 열, 표, 머리글은 읽는 순서에 따라 일반 텍스트 줄로 변환되므로 복잡한 페이지는 직접 정리해야 합니다.
PDF를 검색 가능하게 만들 수 있나요?
이 도구에서는 지원하지 않습니다. 검색 가능한 PDF를 만들려면 파일에 보이지 않는 텍스트 레이어를 다시 작성해야 합니다. 이 도구는 다른 곳에서 사용할 수 있는 텍스트를 제공합니다.
무료 도구 · 브라우저에서회 실행 · 계정 불필요