Herramienta PDF / 11
PDF escaneado a texto (OCR)
Lee el texto de un PDF escaneado sin texto seleccionable, página a página, íntegramente en tu navegador.
PDF escaneado a texto (OCR): TOEA convierte cada página en una imagen, ejecuta reconocimiento óptico de caracteres en cada una y etiqueta el resultado por página para que sepas de dónde viene cada texto. Funciona al 100 % en tu navegador, sin subir archivos a ningún servidor.
- Categoría
- Herramientas PDF
- Se ejecuta
- En tu navegador
- Coste
- Gratis · sin registro
- Disponibilidad
- Lista para usar
Funciona por completo en tu navegador
PDF · hasta 30 MB, nunca se sube
Cómo obtener una lectura más limpia
Cada página se renderiza a 200 DPI antes de leerse, así que el límite está en el propio escaneo. El texto normal escaneado a 300 DPI se lee bien; una foto de una página tomada con el teléfono desde un ángulo, o un escaneo de calidad de fax con letra pequeña, produce conjeturas. Las páginas de lado o boca abajo se leen muy mal, así que colócalas en posición vertical con rotar PDF antes de iniciar el reconocimiento.
Elige el idioma en el que está escrito el documento, ya que cada uno utiliza un modelo distinto. El chino está disponible en modelos simplificado y tradicional, y elegir el incorrecto reduce mucho la precisión. Un documento que mezcla dos idiomas se lee mejor con el modelo del idioma que ocupa la mayor parte del texto.
Cómo comprobar el resultado
La cifra de confianza es un promedio de todas las páginas, por lo que una página defectuosa puede quedar oculta tras una puntuación buena. Un valor cercano a 90 o superior suele indicar solo errores ocasionales; por debajo de 75, espera errores en la mayoría de los párrafos. Las confusiones habituales son 0 y O, 1, l e I, rn interpretado como m, y 5 como S. Esto importa sobre todo en importes, fechas y números de referencia, así que comprueba cada cifra con la página.
Deja activada la opción Unir líneas en párrafos para el texto corrido: recompone las oraciones que se parten al final de cada línea impresa. Desactívala para direcciones, listas y tablas, donde los saltos de línea tienen significado.
Cómo se usa
- Elige un PDF escaneado.
- Selecciona el idioma del texto.
- Lee el resultado y cópialo o descárgalo.
Privacidad y límites
Tu archivo nunca se sube. El motor de reconocimiento y el modelo de idioma se descargan una vez — alrededor de 10 MB — y tu navegador los guarda en caché; después, todo se ejecuta en tu propio equipo. Los servicios de OCR alojados funcionan al revés: quieren el documento. Un documento largo tarda, porque cada página se representa y luego se lee, una tras otra.
Herramientas relacionadas
Preguntas frecuentes
¿Cuándo necesito esto en lugar de PDF to Text?
Usa primero PDF to Text — es instantáneo y exacto cuando el documento tiene texto real dentro. Esta herramienta es para cuando eso no devuelve nada, lo que significa que las páginas son fotografías.
¿Por qué es lento?
Cada página se convierte en una imagen y luego se lee carácter por carácter. Unas pocas páginas son rápidas; un escaneo de cien páginas lleva tiempo de verdad, y la pestaña debe permanecer abierta.
¿Conserva el diseño?
No. Las columnas, tablas y encabezados salen como líneas simples en orden de lectura, así que una página compleja necesitará limpieza.
¿Puede hacer que el PDF se pueda buscar?
Aquí no — eso implica escribir una capa de texto invisible dentro del archivo. Esto te da el texto para usarlo en otro lugar.
Herramienta gratuita · se ejecuta en tu navegador · sin cuenta