PDF-Werkzeug / 11
Gescanntes PDF zu Text (OCR)
Lies den Text aus einem gescannten PDF ohne auswählbaren Text – Seite für Seite, vollständig in deinem Browser.
Gescanntes PDF zu Text (OCR): TOEA rendert jede Seite als Bild, führt darauf optische Zeichenerkennung aus und kennzeichnet die Ausgabe seitenweise, damit du erkennen kannst, woher sie stammt. Läuft zu 100% lokal in deinem Browser, ohne Datei-Uploads zum Server.
- Kategorie
- PDF‑Werkzeuge
- Ausführungen
- In deinem Browser
- Kosten
- Kostenlos · ohne Anmeldung
- Verfügbarkeit
- Einsatzbereit
Läuft vollständig in deinem Browser
PDF · bis zu 30 MB, niemals hochgeladen
Für eine bessere Texterkennung
Jede Seite wird vor der Erkennung mit 200 DPI gerendert, daher liegt die Grenze im Scan selbst. Bei 300 DPI gescannter Fließtext wird gut erkannt. Ein schräg aufgenommenes Handyfoto einer Seite oder ein Faxscan mit kleiner Schrift führt dagegen zu Vermutungen. Seitlich oder auf dem Kopf stehende Seiten werden sehr schlecht erkannt. Drehe sie daher mit PDF drehen richtig herum, bevor du die Erkennung startest.
Wähle die Sprache, in der das Dokument geschrieben ist, da jede Sprache ein eigenes Modell verwendet. Chinesisch gibt es als Modell für vereinfachte und traditionelle Schriftzeichen. Die falsche Auswahl kostet viel Genauigkeit. Ein Dokument mit zwei Sprachen wird am besten mit dem Modell der Sprache erkannt, die den größten Teil des Textes ausmacht.
Das Ergebnis prüfen
Der Vertrauenswert ist ein Durchschnitt über alle Seiten, daher kann sich eine schlechte Seite in einem guten Ergebnis verstecken. Ein Wert um 90 oder höher bedeutet meist nur gelegentliche Fehler. Unter 75 solltest du in den meisten Absätzen mit Fehlern rechnen. Häufig verwechselt werden 0 und O, 1, l und I, rn als m sowie 5 als S. Das ist besonders bei Beträgen, Datumsangaben und Referenznummern wichtig. Prüfe daher jede Zahl anhand der Seite.
Lass Zeilen zu Absätzen verbinden für Fließtext aktiviert. Damit werden Sätze wieder zusammengesetzt, die am Ende jeder gedruckten Zeile unterbrochen wurden. Deaktiviere die Option für Adressen, Listen und Tabellen, bei denen die Zeilenumbrüche eine Bedeutung haben.
So benutzt du es
- Wähle ein gescanntes PDF.
- Wähle die Sprache des Textes.
- Lies das Ergebnis und kopiere es oder lade es herunter.
Datenschutz & Einschränkungen
Deine Datei wird nie hochgeladen. Die Erkennungs-Engine und das Sprachmodell werden einmal heruntergeladen — ca. 10 MB — und vom Browser zwischengespeichert, dann läuft alles auf deinem eigenen Rechner. Gehostete OCR-Dienste funktionieren umgekehrt: Sie wollen das Dokument. Ein langes Dokument braucht seine Zeit, weil jede Seite gerendert und dann nacheinander gelesen wird.
Ähnliche Tools
Häufige Fragen
Wann brauche ich das statt PDF to Text?
Benutze zuerst PDF to Text — es ist sofort und exakt, wenn das Dokument echten Text enthält. Dieses Tool ist für den Fall, dass dort nichts herauskommt; dann sind die Seiten Fotos.
Warum ist es langsam?
Jede Seite wird in ein Bild gerendert und dann Zeichen für Zeichen gelesen. Ein paar Seiten gehen schnell; ein hundertseitiger Scan braucht spürbar Zeit, und der Browser-Tab muss offen bleiben.
Bleibt das Layout erhalten?
Nein. Spalten, Tabellen und Kopfzeilen kommen als einfache Zeilen in Lesereihenfolge heraus, daher muss eine komplexe Seite nachbearbeitet werden.
Kann es das PDF durchsuchbar machen?
Nicht hier — das würde bedeuten, eine unsichtbare Textebene zurück in die Datei zu schreiben. Hier bekommst du den Text für die Nutzung anderswo.
Kostenloses Tool · läuft in deinem browser · kein Konto nötig