PDF 도구 / 09

PDF 텍스트 변환

PDF에서 선택 가능한 텍스트를 페이지별로 추출합니다. 모든 작업은 브라우저에서 실행됩니다.

PDF 텍스트 변환: TOEA는 각 페이지에 저장된 위치 정보가 있는 텍스트 조각을 읽고, 이를 줄 단위로 다시 묶습니다. 각 페이지에 라벨을 붙여 결과를 쉽게 탐색할 수 있도록 합니다. 서버에 파일을 전혀 업로드하지 않고 브라우저에서 100% 로컬로 실행됩니다.

카테고리
PDF 도구
실행 횟수
브라우저에서
비용
무료 · 가입 불필요
사용 가능 여부
사용 가능
PDF 텍스트 추출로컬 처리

브라우저에서 전부 실행됩니다

↥
PDF 선택

PDF · 최대 60 MB, 업로드하지 않습니다

텍스트가 깨져 나오는 경우

텍스트가 추출되기는 하지만 무작위 기호, 상자 또는 알파벳 순서가 어긋난 문자처럼 잘못 나오는 경우가 있습니다. PDF의 글꼴에 글리프를 실제 문자로 연결하는 매핑이 없을 때 발생하며, 일부 디자인 및 인쇄 소프트웨어가 이 정보를 제외하기도 합니다. 페이지가 정상적으로 보이는 것은 도형을 그리기 때문입니다. 실제로 표시된 글자는 아래의 문자와 일치하지 않습니다. 해당 파일을 스캔본으로 간주하고 스캔한 PDF를 텍스트로 변환하십시오.

더 가벼운 이상 현상은 원인이 단순합니다. fi와 fl이 하나의 합자 문자로 합쳐졌거나, PDF가 각 문자를 따로 배치해 단어가 두 부분으로 나뉜 경우입니다.

추출한 텍스트 정리

인쇄된 줄은 별도의 줄로 추출되므로 문단이 몇 단어마다 끊겨 나오고, 줄 끝에서 하이픈으로 나뉜 단어도 그대로 분리됩니다. 머리말, 바닥글, 페이지 번호는 본문 사이에 페이지마다 반복됩니다. 텍스트를 인용하거나 재사용하기 전에 이를 정리하고, 하나의 문서로 사용할 텍스트라면 페이지 표시도 삭제하십시오.

문서의 단어나 문자 수를 세려면 정리한 텍스트를 단어 수 세기에 붙여넣으십시오. 원본 출력에서 바로 세면 모든 머리말과 표시가 포함됩니다.

사용 방법

  1. PDF를 선택합니다.
  2. 텍스트를 추출합니다.
  3. 복사하거나 .txt 파일로 다운로드합니다.

개인정보 보호 및 제한사항

파일은 브라우저에서 열고 다시 작성하며 업로드하지 않습니다. 문서가 계약서, 스캔본 또는 낯선 사람에게 맡기고 싶지 않은 어떤 문서이든 이러한 방식이 중요합니다. 스캔된 PDF에는 추출할 텍스트가 없으므로 빈 파일을 반환하지 않고 해당 내용을 표시합니다.

관련 도구

자주 묻는 질문

PDF에서 아무것도 추출되지 않은 이유는 무엇인가요?

거의 확실히 스캔된 이미지이기 때문입니다. 페이지 사진에는 텍스트 데이터가 없으며, 이를 복원하려면 OCR이 필요합니다. 이 도구는 OCR을 지원하지 않습니다.

레이아웃이 다른 이유는 무엇인가요?

PDF는 텍스트를 문단이 아니라 위치 정보가 있는 텍스트 조각으로 저장합니다. 텍스트 조각을 위치에 따라 다시 줄로 묶지만, 열과 표는 원래 보이던 형태로 유지되지 않습니다.

페이지 나누기가 표시되나요?

예. 결과에서 각 페이지에 라벨을 표시하므로 페이지가 어디에서 끝나는지 알 수 있습니다.

보호된 파일에서도 작동하나요?

비밀번호로 보호된 문서는 열 수 없습니다. 먼저 비밀번호를 제거하십시오.

무료 도구 · 브라우저에서회 실행 · 계정 불필요