Strumento per PDF / 09
Da PDF a testo
Estrai il testo selezionabile da un PDF, pagina per pagina, direttamente nel browser.
Da PDF a testo: TOEA legge i segmenti di testo posizionati memorizzati in ogni pagina e li raggruppa nuovamente in righe, indicando ogni pagina per mantenere l'output navigabile. Funziona al 100% localmente nel browser, senza caricare file sul server.
- Categoria
- Strumenti PDF
- Esecuzioni
- Nel browser
- Costo
- Gratuito · senza registrazione
- Disponibilità
- Pronto all'uso
Funziona interamente nel browser
PDF · fino a 60 MB, non viene caricato nulla
Quando il testo risulta illeggibile
A volte l'estrazione restituisce del testo, ma il risultato è errato: simboli casuali, riquadri o lettere spostate nell'alfabeto. Succede quando i font del PDF non contengono una mappa che riconduca i glifi ai caratteri reali, cosa che alcuni software di progettazione e stampa omettono. La pagina appare corretta perché vengono disegnate delle forme, ma i caratteri sottostanti non corrispondono alle lettere visualizzate. Tratta il file come una scansione ed elaboralo con PDF scansionato in testo.
Le anomalie meno gravi hanno cause più semplici: fi e fl uniti in un unico carattere legatura oppure una parola divisa in due perché il PDF posiziona separatamente ogni lettera.
Riordinare il testo estratto
Le righe stampate vengono estratte come righe separate, quindi un paragrafo arriva con un'interruzione dopo poche parole e le parole sillabate alla fine di una riga restano divise. Intestazioni, piè di pagina e numeri di pagina vengono ripetuti una volta per pagina all'interno del testo principale. Eliminali prima di citare o riutilizzare il testo e rimuovi le etichette delle pagine se il testo deve essere usato come un unico blocco.
Per contare parole o caratteri di un documento, incolla il testo ripulito nel contatore di parole: contare direttamente dall'output grezzo include ogni intestazione ed etichetta.
Come usarlo
- Scegli un PDF.
- Estrai il testo.
- Copialo o scarica un file .txt.
Privacy e limitazioni
Il file viene aperto e riscritto nel browser e non viene mai caricato: è importante quando il documento è un contratto, una scansione o qualunque altra cosa che non consegneresti a uno sconosciuto. Un PDF scansionato non contiene testo da estrarre e viene indicato come tale, invece di restituire un file vuoto.
Strumenti correlati
Domande frequenti
Perché il mio PDF non ha prodotto nulla?
Quasi certamente si tratta di immagini scansionate. La fotografia di una pagina non contiene testo al suo interno; per recuperarlo serve l'OCR, che questo strumento non esegue.
Perché l'impaginazione è diversa?
Un PDF memorizza il testo come segmenti posizionati, non come paragrafi. I segmenti vengono raggruppati nuovamente in righe in base alla posizione, ma colonne e tabelle non manterranno l'aspetto originale.
Le interruzioni di pagina sono indicate?
Sì. Nell'output ogni pagina è contrassegnata, così puoi capire dove finisce.
Funziona con i file protetti?
I documenti protetti da password non possono essere aperti. Rimuovi prima la password.
Strumento gratuito · nel browser esecuzioni · senza account