Ferramenta de PDF / 09
PDF para Texto
Extraia o texto selecionável de um PDF, página por página, totalmente no seu navegador.
PDF para Texto: TOEA lê os trechos de texto posicionados que cada página armazena e os reagrupa em linhas, identificando cada página para que a saída permaneça navegável. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.
- Categoria
- Ferramentas de PDF
- Execuções
- No seu navegador
- Custo
- Grátis · sem cadastro
- Disponibilidade
- Pronto para usar
Roda inteiramente no seu navegador
PDF · até 60 MB, nada enviado
Quando o texto sai ilegível
Às vezes, a extração retorna texto, mas ele está errado: símbolos aleatórios, caixas ou letras deslocadas no alfabeto. Isso acontece quando as fontes do PDF não têm um mapa que relacione seus glifos aos caracteres reais, algo que alguns programas de design e impressão deixam de incluir. A página parece correta porque desenha formas; os caracteres subjacentes não são as letras exibidas. Trate esse arquivo como uma digitalização e use PDF digitalizado para texto.
Estranhezas mais sutis têm causas simples: fi e fl unidos em um único caractere de ligadura ou uma palavra dividida em duas porque o PDF posiciona cada letra separadamente.
Organizando o texto extraído
As linhas impressas saem como linhas separadas, então um parágrafo chega com uma quebra a cada poucas palavras, e palavras hifenizadas no fim da linha continuam divididas. Cabeçalhos, rodapés e números de página são repetidos uma vez por página no meio do texto principal. Remova-os antes de citar ou reutilizar o texto e apague os identificadores de página se o texto for usado como um único bloco.
Para contar palavras ou caracteres de um documento, cole o texto limpo no contador de palavras; contar diretamente o resultado bruto inclui todos os cabeçalhos e identificadores.
Como usar
- Escolha um PDF.
- Extraia o texto.
- Copie-o ou baixe um arquivo .txt.
Privacidade e limitações
O arquivo é aberto e reescrito no seu navegador e nunca é enviado, o que é justamente a ideia quando o documento é um contrato, uma digitalização ou qualquer outra coisa que você não entregaria a um estranho. Um PDF digitalizado não contém texto para extrair e é sinalizado como tal, em vez de devolver um arquivo vazio.
Ferramentas relacionadas
Perguntas frequentes
Por que meu PDF não gerou nada?
Quase certamente são imagens digitalizadas. Uma fotografia de uma página não contém texto em si, e recuperá-lo exige OCR, o que esta ferramenta não faz.
Por que o layout está diferente?
Um PDF armazena o texto como trechos posicionados, não como parágrafos. Esses trechos são reagrupados em linhas pela posição, mas colunas e tabelas não preservam a aparência original.
As quebras de página são marcadas?
Sim. Cada página é identificada na saída para que você saiba onde uma termina.
Funciona com arquivos protegidos?
Documentos protegidos por senha não podem ser abertos. Remova a senha primeiro.
Ferramenta grátis · no seu navegador execuções · não precisa de conta