Strumento per PDF / 09

Da PDF a testo

Estrai il testo selezionabile da un PDF, pagina per pagina, direttamente nel browser.

Da PDF a testo: TOEA legge i segmenti di testo posizionati memorizzati in ogni pagina e li raggruppa nuovamente in righe, indicando ogni pagina per mantenere l'output navigabile. Funziona al 100% localmente nel browser, senza caricare file sul server.

Categoria
Strumenti PDF
Esecuzioni
Nel browser
Costo
Gratuito · senza registrazione
Disponibilità
Pronto all'uso
Estrazione del testo dal PDFElaborazione locale

Funziona interamente nel browser

↥
Scegli un PDF

PDF · fino a 60 MB, non viene caricato nulla

Quando il testo risulta illeggibile

A volte l'estrazione restituisce del testo, ma il risultato è errato: simboli casuali, riquadri o lettere spostate nell'alfabeto. Succede quando i font del PDF non contengono una mappa che riconduca i glifi ai caratteri reali, cosa che alcuni software di progettazione e stampa omettono. La pagina appare corretta perché vengono disegnate delle forme, ma i caratteri sottostanti non corrispondono alle lettere visualizzate. Tratta il file come una scansione ed elaboralo con PDF scansionato in testo.

Le anomalie meno gravi hanno cause più semplici: fi e fl uniti in un unico carattere legatura oppure una parola divisa in due perché il PDF posiziona separatamente ogni lettera.

Riordinare il testo estratto

Le righe stampate vengono estratte come righe separate, quindi un paragrafo arriva con un'interruzione dopo poche parole e le parole sillabate alla fine di una riga restano divise. Intestazioni, piè di pagina e numeri di pagina vengono ripetuti una volta per pagina all'interno del testo principale. Eliminali prima di citare o riutilizzare il testo e rimuovi le etichette delle pagine se il testo deve essere usato come un unico blocco.

Per contare parole o caratteri di un documento, incolla il testo ripulito nel contatore di parole: contare direttamente dall'output grezzo include ogni intestazione ed etichetta.

Come usarlo

  1. Scegli un PDF.
  2. Estrai il testo.
  3. Copialo o scarica un file .txt.

Privacy e limitazioni

Il file viene aperto e riscritto nel browser e non viene mai caricato: è importante quando il documento è un contratto, una scansione o qualunque altra cosa che non consegneresti a uno sconosciuto. Un PDF scansionato non contiene testo da estrarre e viene indicato come tale, invece di restituire un file vuoto.

Strumenti correlati

Domande frequenti

Perché il mio PDF non ha prodotto nulla?

Quasi certamente si tratta di immagini scansionate. La fotografia di una pagina non contiene testo al suo interno; per recuperarlo serve l'OCR, che questo strumento non esegue.

Perché l'impaginazione è diversa?

Un PDF memorizza il testo come segmenti posizionati, non come paragrafi. I segmenti vengono raggruppati nuovamente in righe in base alla posizione, ma colonne e tabelle non manterranno l'aspetto originale.

Le interruzioni di pagina sono indicate?

Sì. Nell'output ogni pagina è contrassegnata, così puoi capire dove finisce.

Funziona con i file protetti?

I documenti protetti da password non possono essere aperti. Rimuovi prima la password.

Strumento gratuito · nel browser esecuzioni · senza account