Ferramenta de PDF / 11

PDF digitalizado para texto (OCR)

Leia o texto de um PDF digitalizado que não tem texto selecionável, página por página, inteiramente no seu navegador.

PDF digitalizado para texto (OCR): TOEA renderiza cada página como imagem, executa reconhecimento óptico de caracteres em cada uma e rotula a saída por página, para você saber de onde veio cada trecho. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.

Execuções
No seu navegador
Custo
Grátis · sem cadastro
Disponibilidade
Pronto para usar
Área PDF digitalizado → textoProcessamento local

Roda inteiramente no seu navegador

↥
Escolha um PDF digitalizado

PDF · até 30 MB, nunca enviado

Como obter uma leitura mais limpa

Cada página é renderizada a 200 DPI antes da leitura, então o limite é a própria digitalização. Texto corrido digitalizado a 300 DPI costuma ser bem lido; uma foto de celular tirada em ângulo ou uma digitalização com qualidade de fax e letras pequenas gera suposições. Páginas de lado ou de cabeça para baixo são lidas muito mal, então deixe-as na posição correta com girar PDF antes de iniciar o reconhecimento.

Escolha o idioma em que o documento foi escrito, pois cada idioma usa um modelo separado. O chinês está disponível nos modelos Simplificado e Tradicional, e escolher o modelo errado reduz bastante a precisão. Um documento que mistura dois idiomas é melhor lido usando o idioma presente na maior parte do texto.

Verificando o resultado

O índice de confiança é uma média de todas as páginas, então uma página ruim pode ficar escondida em uma boa pontuação. Um valor em torno de 90 ou mais geralmente indica apenas erros ocasionais; abaixo de 75, espere erros na maioria dos parágrafos. As confusões mais comuns são 0 e O, 1, l e I, rn lido como m e 5 como S. Isso é mais importante em valores, datas e números de referência, portanto confira cada número na página.

Deixe a opção Unir linhas em parágrafos ativada para textos corridos, nos quais ela recompõe frases quebradas no fim de cada linha impressa. Desative-a para endereços, listas e tabelas, em que as quebras de linha têm significado.

Como usar

  1. Escolha um PDF digitalizado.
  2. Selecione o idioma do texto.
  3. Leia o resultado e copie ou baixe.

Privacidade e limitações

Seu arquivo nunca é enviado. O mecanismo de reconhecimento e o modelo de idioma são baixados uma vez — cerca de 10 MB — e armazenados em cache pelo seu navegador; depois, tudo roda na sua própria máquina. Serviços de OCR hospedados funcionam ao contrário: eles querem o documento. Um documento longo leva um tempo, porque cada página é renderizada e depois lida em sequência.

Ferramentas relacionadas

Perguntas frequentes

Quando eu preciso disto e não do PDF to Text?

Use o PDF to Text primeiro — é instantâneo e exato quando o documento tem texto real dentro dele. Esta ferramenta é para o caso em que aquilo não retorna nada, o que significa que as páginas são fotografias.

Por que é lento?

Cada página é renderizada como imagem e depois lida caractere por caractere. Poucas páginas são rápidas; um documento digitalizado de cem páginas leva tempo de verdade, e a aba precisa ficar aberta.

Ele mantém o layout?

Não. Colunas, tabelas e cabeçalhos saem como linhas simples na ordem de leitura, então uma página complexa vai precisar de ajustes.

Ele consegue deixar o PDF pesquisável?

Aqui não — isso significa gravar uma camada de texto invisível de volta no arquivo. Isto lhe dá o texto para usar em outro lugar.

Ferramenta grátis · no seu navegador execuções · não precisa de conta