Herramienta PDF / 09

PDF a Texto

Extrae el texto seleccionable de un PDF, página por página, totalmente en tu navegador.

PDF a Texto: TOEA lee los fragmentos de texto posicionados que almacena cada página y los vuelve a agrupar en líneas, etiquetando cada página para que la salida siga siendo navegable. Funciona al 100 % en tu navegador, sin subir archivos a ningún servidor.

Se ejecuta
En tu navegador
Coste
Gratis · sin registro
Disponibilidad
Lista para usar
Extracción de texto de PDFProcesamiento local

Funciona por completo en tu navegador

↥
Elige un PDF

PDF · hasta 60 MB, no se sube nada

Cuando el texto aparece ilegible

A veces la extracción devuelve texto, pero es incorrecto: símbolos aleatorios, cuadros o letras desplazadas en el alfabeto. Ocurre cuando las fuentes del PDF no incluyen un mapa que relacione sus glifos con caracteres reales, algo que algunos programas de diseño e impresión omiten. La página se ve bien porque dibuja formas; los caracteres subyacentes no son las letras que se muestran. Trata ese archivo como un escaneo y pásalo por PDF escaneado a texto.

Las anomalías menores suelen tener causas más sencillas: fi y fl unidas en un único carácter de ligadura, o una palabra dividida en dos porque el PDF coloca cada letra por separado.

Limpiar el texto extraído

Las líneas impresas aparecen como líneas separadas, de modo que un párrafo llega con un salto cada pocas palabras, y las palabras con guion al final de una línea permanecen divididas. Los encabezados, pies de página y números de página se repiten una vez por página entre el texto principal. Elimínalos antes de citar o reutilizar el texto, y borra las etiquetas de página si el texto va a utilizarse como una sola pieza.

Para contar las palabras o los caracteres de un documento, pega el texto limpio en el contador de palabras; contar directamente el resultado sin procesar incluye todos los encabezados y etiquetas.

Cómo se usa

  1. Elige un PDF.
  2. Extrae el texto.
  3. Cópialo o descarga un archivo .txt.

Privacidad y límites

El archivo se abre y se reescribe en tu navegador y nunca se sube, lo cual es importante cuando el documento es un contrato, un escaneo o cualquier otra cosa que no le entregarías a un desconocido. Un PDF escaneado no contiene texto que extraer, y se informa como tal en lugar de devolver un archivo vacío.

Herramientas relacionadas

Preguntas frecuentes

¿Por qué mi PDF no generó nada?

Casi con seguridad son imágenes escaneadas. Una fotografía de una página no tiene texto dentro y para recuperarlo se necesita OCR, que esta herramienta no realiza.

¿Por qué la maquetación es diferente?

Un PDF guarda el texto como fragmentos posicionados, no como párrafos. Esos fragmentos se agrupan de nuevo en líneas por su posición, pero las columnas y las tablas no conservarán su aspecto.

¿Se marcan los saltos de página?

Sí. Cada página se etiqueta en la salida para que puedas ver dónde termina.

¿Funciona con archivos protegidos?

Los documentos protegidos con contraseña no se pueden abrir. Quita la contraseña primero.

Herramienta gratuita · se ejecuta en tu navegador · sin cuenta