Strumento per PDF / 11
PDF scansionato in testo (OCR)
Estrai, pagina per pagina e interamente nel browser, il testo da un PDF scansionato senza testo selezionabile.
PDF scansionato in testo (OCR): TOEA converte ogni pagina in un’immagine, esegue il riconoscimento ottico dei caratteri su ciascuna e organizza il risultato per pagina, così puoi sapere da dove proviene ogni parte del testo. Funziona al 100% localmente nel browser, senza caricare file sul server.
- Categoria
- Strumenti PDF
- Esecuzioni
- Nel browser
- Costo
- Gratuito · senza registrazione
- Disponibilità
- Pronto all'uso
Funziona interamente nel browser
PDF · fino a 30 MB, non viene mai caricato
Ottenere una lettura più pulita
Ogni pagina viene resa a 200 DPI prima della lettura, quindi il limite è rappresentato dalla scansione stessa. Il testo principale scansionato a 300 DPI viene letto bene; una foto di una pagina scattata con il telefono in obliquo o una scansione di qualità fax con caratteri piccoli produce risultati incerti. Le pagine ruotate lateralmente o capovolte vengono lette molto male: raddrizzale con ruota PDF prima di avviare il riconoscimento.
Scegli la lingua in cui è scritto il documento, perché per ciascuna lingua viene usato un modello separato. Per il cinese esistono modelli semplificato e tradizionale, e scegliere quello sbagliato riduce notevolmente la precisione. Un documento che mescola due lingue viene letto meglio usando quella presente nella maggior parte del testo.
Controllare il risultato
Il valore di affidabilità è una media calcolata su tutte le pagine, quindi una pagina problematica può essere nascosta da un buon punteggio. Un valore intorno a 90 o superiore di solito indica solo errori occasionali; sotto 75, aspettati errori nella maggior parte dei paragrafi. Le confusioni più comuni sono 0 e O, 1, l e I, rn letto come m e 5 letto come S. Questo è particolarmente importante per importi, date e numeri di riferimento: verifica quindi ogni cifra sulla pagina.
Lascia attiva l'opzione Unisci le righe in paragrafi per la prosa, dove ricompone le frasi spezzate alla fine di ogni riga stampata. Disattivala per indirizzi, elenchi e tabelle, dove le interruzioni di riga hanno un significato.
Come usarlo
- Scegli un PDF scansionato.
- Seleziona la lingua del testo.
- Leggi il risultato e copialo o scaricalo.
Privacy e limitazioni
Il tuo file non viene mai caricato. Il motore di riconoscimento e il modello linguistico vengono scaricati una sola volta — circa 10 MB — e memorizzati nella cache del browser; poi tutto funziona sul tuo dispositivo. I servizi OCR online funzionano al contrario: richiedono il documento. Un documento lungo richiede un po’ di tempo, perché ogni pagina viene convertita in un’immagine e poi letta una alla volta.
Strumenti correlati
Domande frequenti
Quando mi serve questo strumento invece di PDF in testo?
Prova prima PDF in testo: è immediato e preciso quando il documento contiene vero testo. Questo strumento serve quando il primo non restituisce nulla, perché le pagine sono fotografie.
Perché è lento?
Ogni pagina viene convertita in un’immagine e poi letta carattere per carattere. Poche pagine vengono elaborate rapidamente; una scansione di 100 pagine richiede tempo e la scheda deve rimanere aperta.
Mantiene l’impaginazione?
No. Colonne, tabelle e intestazioni vengono restituite come righe di testo semplice nell’ordine di lettura, quindi una pagina complessa richiederà qualche sistemazione.
Può rendere il PDF ricercabile?
Non qui: per farlo bisognerebbe aggiungere al file un livello di testo invisibile. Questo strumento ti fornisce il testo da usare altrove.
Strumento gratuito · nel browser esecuzioni · senza account