Ferramenta de PDF / 11
PDF digitalizado para texto (OCR)
Leia o texto de um PDF digitalizado que não tem texto selecionável, página por página, inteiramente no seu navegador.
PDF digitalizado para texto (OCR): TOEA renderiza cada página como imagem, executa reconhecimento óptico de caracteres em cada uma e rotula a saída por página, para você saber de onde veio cada trecho. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.
- Categoria
- Ferramentas de PDF
- Execuções
- No seu navegador
- Custo
- Grátis · sem cadastro
- Disponibilidade
- Pronto para usar
Roda inteiramente no seu navegador
PDF · até 30 MB, nunca enviado
Como obter uma leitura mais limpa
Cada página é renderizada a 200 DPI antes da leitura, então o limite é a própria digitalização. Texto corrido digitalizado a 300 DPI costuma ser bem lido; uma foto de celular tirada em ângulo ou uma digitalização com qualidade de fax e letras pequenas gera suposições. Páginas de lado ou de cabeça para baixo são lidas muito mal, então deixe-as na posição correta com girar PDF antes de iniciar o reconhecimento.
Escolha o idioma em que o documento foi escrito, pois cada idioma usa um modelo separado. O chinês está disponível nos modelos Simplificado e Tradicional, e escolher o modelo errado reduz bastante a precisão. Um documento que mistura dois idiomas é melhor lido usando o idioma presente na maior parte do texto.
Verificando o resultado
O índice de confiança é uma média de todas as páginas, então uma página ruim pode ficar escondida em uma boa pontuação. Um valor em torno de 90 ou mais geralmente indica apenas erros ocasionais; abaixo de 75, espere erros na maioria dos parágrafos. As confusões mais comuns são 0 e O, 1, l e I, rn lido como m e 5 como S. Isso é mais importante em valores, datas e números de referência, portanto confira cada número na página.
Deixe a opção Unir linhas em parágrafos ativada para textos corridos, nos quais ela recompõe frases quebradas no fim de cada linha impressa. Desative-a para endereços, listas e tabelas, em que as quebras de linha têm significado.
Como usar
- Escolha um PDF digitalizado.
- Selecione o idioma do texto.
- Leia o resultado e copie ou baixe.
Privacidade e limitações
Seu arquivo nunca é enviado. O mecanismo de reconhecimento e o modelo de idioma são baixados uma vez — cerca de 10 MB — e armazenados em cache pelo seu navegador; depois, tudo roda na sua própria máquina. Serviços de OCR hospedados funcionam ao contrário: eles querem o documento. Um documento longo leva um tempo, porque cada página é renderizada e depois lida em sequência.
Ferramentas relacionadas
Perguntas frequentes
Quando eu preciso disto e não do PDF to Text?
Use o PDF to Text primeiro — é instantâneo e exato quando o documento tem texto real dentro dele. Esta ferramenta é para o caso em que aquilo não retorna nada, o que significa que as páginas são fotografias.
Por que é lento?
Cada página é renderizada como imagem e depois lida caractere por caractere. Poucas páginas são rápidas; um documento digitalizado de cem páginas leva tempo de verdade, e a aba precisa ficar aberta.
Ele mantém o layout?
Não. Colunas, tabelas e cabeçalhos saem como linhas simples na ordem de leitura, então uma página complexa vai precisar de ajustes.
Ele consegue deixar o PDF pesquisável?
Aqui não — isso significa gravar uma camada de texto invisível de volta no arquivo. Isto lhe dá o texto para usar em outro lugar.
Ferramenta grátis · no seu navegador execuções · não precisa de conta