PDF-Werkzeug / 09
PDF zu Text
Extrahiere den auswählbaren Text seitenweise aus einem PDF – komplett in deinem Browser.
PDF zu Text: TOEA liest die auf jeder Seite gespeicherten positionierten Textläufe und fasst sie anhand ihrer Position wieder zu Zeilen zusammen; jede Seite wird beschriftet, damit die Ausgabe navigierbar bleibt. Läuft zu 100% lokal in deinem Browser, ohne Datei-Uploads zum Server.
- Kategorie
- PDF‑Werkzeuge
- Ausführungen
- In deinem Browser
- Kosten
- Kostenlos · ohne Anmeldung
- Verfügbarkeit
- Einsatzbereit
Läuft vollständig in deinem Browser
PDF · bis zu 60 MB, nichts hochgeladen
Wenn der Text unleserlich herauskommt
Manchmal liefert die Textextraktion zwar Text, aber er ist falsch: zufällige Symbole, Kästchen oder im Alphabet verschobene Buchstaben. Das passiert, wenn die Schriftarten des PDFs keine Zuordnung ihrer Glyphen zu echten Zeichen enthalten. Manche Design- und Druckprogramme lassen diese Zuordnung weg. Die Seite sieht richtig aus, weil Formen gezeichnet werden, doch die darunterliegenden Zeichen sind nicht die angezeigten Buchstaben. Behandle die Datei wie einen Scan und verarbeite sie mit gescanntes PDF in Text.
Harmlosere Abweichungen haben einfachere Ursachen: fi und fl wurden zu einem einzigen Ligaturzeichen verbunden oder ein Wort wurde in zwei Teile getrennt, weil das PDF jeden Buchstaben einzeln positioniert.
Extrahierten Text aufräumen
Gedruckte Zeilen werden als einzelne Zeilen ausgegeben. Daher enthält ein Absatz nach wenigen Wörtern einen Umbruch, und am Zeilenende getrennte Wörter bleiben gespalten. Laufende Kopfzeilen, Fußzeilen und Seitenzahlen wiederholen sich zwischen dem Fließtext einmal pro Seite. Entferne sie, bevor du den Text zitierst oder weiterverwendest, und lösche die Seitenangaben, wenn der Text als zusammenhängender Inhalt verwendet werden soll.
Für die Wort- oder Zeichenanzahl eines Dokuments fügst du den bereinigten Text in den Wortzähler ein. Wenn du direkt die Rohfassung zählst, werden alle Kopfzeilen und Bezeichnungen mitgezählt.
So benutzt du es
- Wähle ein PDF aus.
- Extrahiere den Text.
- Kopiere ihn oder lade eine .txt-Datei herunter.
Datenschutz & Einschränkungen
Die Datei wird in deinem Browser geöffnet und umgeschrieben und niemals hochgeladen – entscheidend, wenn es sich um einen Vertrag, einen Scan oder etwas anderes handelt, das du einer fremden Person nicht geben würdest. Ein gescanntes PDF enthält keinen extrahierbaren Text; das wird gemeldet, statt eine leere Datei zurückzugeben.
Ähnliche Tools
Häufige Fragen
Warum hat mein PDF nichts ergeben?
Mit sehr hoher Wahrscheinlichkeit handelt es sich um gescannte Bilder. Ein Foto einer Seite enthält keinen Text; um ihn wiederzugewinnen, bräuchte es OCR, was dieses Tool nicht bietet.
Warum sieht das Layout anders aus?
Ein PDF speichert Text als positionierte Läufe, nicht als Absätze. Läufe werden nach Position wieder zu Zeilen gruppiert, aber Spalten und Tabellen bleiben nicht so erhalten, wie sie aussahen.
Sind Seitenumbrüche markiert?
Ja. Jede Seite wird in der Ausgabe beschriftet, damit du siehst, wo eine endet.
Funktioniert das bei geschützten Dateien?
Passwortgeschützte Dokumente können nicht geöffnet werden. Entferne das Passwort zuerst.
Kostenloses Tool · läuft in deinem browser · kein Konto nötig