Strumento per PDF / 11

PDF scansionato in testo (OCR)

Estrai, pagina per pagina e interamente nel browser, il testo da un PDF scansionato senza testo selezionabile.

PDF scansionato in testo (OCR): TOEA converte ogni pagina in un’immagine, esegue il riconoscimento ottico dei caratteri su ciascuna e organizza il risultato per pagina, così puoi sapere da dove proviene ogni parte del testo. Funziona al 100% localmente nel browser, senza caricare file sul server.

Categoria
Strumenti PDF
Esecuzioni
Nel browser
Costo
Gratuito · senza registrazione
Disponibilità
Pronto all'uso
Area PDF scansionato → testoElaborazione locale

Funziona interamente nel browser

↥
Scegli un PDF scansionato

PDF · fino a 30 MB, non viene mai caricato

Ottenere una lettura più pulita

Ogni pagina viene resa a 200 DPI prima della lettura, quindi il limite è rappresentato dalla scansione stessa. Il testo principale scansionato a 300 DPI viene letto bene; una foto di una pagina scattata con il telefono in obliquo o una scansione di qualità fax con caratteri piccoli produce risultati incerti. Le pagine ruotate lateralmente o capovolte vengono lette molto male: raddrizzale con ruota PDF prima di avviare il riconoscimento.

Scegli la lingua in cui è scritto il documento, perché per ciascuna lingua viene usato un modello separato. Per il cinese esistono modelli semplificato e tradizionale, e scegliere quello sbagliato riduce notevolmente la precisione. Un documento che mescola due lingue viene letto meglio usando quella presente nella maggior parte del testo.

Controllare il risultato

Il valore di affidabilità è una media calcolata su tutte le pagine, quindi una pagina problematica può essere nascosta da un buon punteggio. Un valore intorno a 90 o superiore di solito indica solo errori occasionali; sotto 75, aspettati errori nella maggior parte dei paragrafi. Le confusioni più comuni sono 0 e O, 1, l e I, rn letto come m e 5 letto come S. Questo è particolarmente importante per importi, date e numeri di riferimento: verifica quindi ogni cifra sulla pagina.

Lascia attiva l'opzione Unisci le righe in paragrafi per la prosa, dove ricompone le frasi spezzate alla fine di ogni riga stampata. Disattivala per indirizzi, elenchi e tabelle, dove le interruzioni di riga hanno un significato.

Come usarlo

  1. Scegli un PDF scansionato.
  2. Seleziona la lingua del testo.
  3. Leggi il risultato e copialo o scaricalo.

Privacy e limitazioni

Il tuo file non viene mai caricato. Il motore di riconoscimento e il modello linguistico vengono scaricati una sola volta — circa 10 MB — e memorizzati nella cache del browser; poi tutto funziona sul tuo dispositivo. I servizi OCR online funzionano al contrario: richiedono il documento. Un documento lungo richiede un po’ di tempo, perché ogni pagina viene convertita in un’immagine e poi letta una alla volta.

Strumenti correlati

Domande frequenti

Quando mi serve questo strumento invece di PDF in testo?

Prova prima PDF in testo: è immediato e preciso quando il documento contiene vero testo. Questo strumento serve quando il primo non restituisce nulla, perché le pagine sono fotografie.

Perché è lento?

Ogni pagina viene convertita in un’immagine e poi letta carattere per carattere. Poche pagine vengono elaborate rapidamente; una scansione di 100 pagine richiede tempo e la scheda deve rimanere aperta.

Mantiene l’impaginazione?

No. Colonne, tabelle e intestazioni vengono restituite come righe di testo semplice nell’ordine di lettura, quindi una pagina complessa richiederà qualche sistemazione.

Può rendere il PDF ricercabile?

Non qui: per farlo bisognerebbe aggiungere al file un livello di testo invisibile. Questo strumento ti fornisce il testo da usare altrove.

Strumento gratuito · nel browser esecuzioni · senza account