Datei-Werkzeug / 05

Textkodierungs-Detektor

Prüfe BOM-Markierungen, ASCII-Kompatibilität und strikte UTF-8-Gültigkeit in einem lokalen Dateiausschnitt.

Textkodierungs-Detektor: TOEA erkennt UTF-8- und UTF-16-BOMs, reines ASCII sowie strikt gültiges UTF-8; bei anderen Bytes gibt es vorsichtshalber unbekannt/Legacy aus. Läuft zu 100% lokal in deinem Browser, ohne Datei-Uploads zum Server.

Ausführungen
In deinem Browser
Kosten
Kostenlos · ohne Anmeldung
Verfügbarkeit
Einsatzbereit
Text encoding detectorLokale Verarbeitung

Läuft vollständig in deinem Browser

Wenn das Ergebnis veraltet oder unbekannt ist

Text, der kein gültiges UTF-8 ist, liegt meistens in einer älteren Einzelbyte-Kodierung vor. Bei westeuropäischem Text handelt es sich meist um Windows-1252 oder ISO-8859-1. Konvertiere die Datei einmal und verwende danach UTF-8: unter Linux oder macOS mit iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt oder in einem Editor, in dem du die Kodierung auswählen und die Datei als UTF-8 speichern kannst. Es wird nur das erste 1 MB untersucht. Eine große Datei, deren erstes Megabyte aus einfachem ASCII besteht, kann daher weiter hinten trotzdem Nicht-ASCII-Text enthalten.

Byte-Reihenfolgemarkierungen und UTF-16

Eine UTF-8-Byte-Reihenfolgemarkierung (EF BB BF) hilft Excel, eine CSV mit Akzenten korrekt zu öffnen, verursacht aber an anderer Stelle Probleme: bei der #!-Zeile eines Shell-Skripts, bei PHP-Ausgaben vor dem Senden der Header und beim Namen der ersten CSV-Spalte, wenn der einlesende Code die Markierung nicht entfernt. UTF-16-Dateien stammen häufig aus Windows, zum Beispiel von der Umleitung > in Windows PowerShell 5.1. Viele Unix-Werkzeuge lesen sie als Text voller Nullbytes.

So benutzt du es

  1. Wähle eine textartige Datei bis 50 MB.
  2. Untersuche lokal die ersten 1 MB.
  3. Sieh dir Kodierung und Zuverlässigkeitsstufe an.

Datenschutz & Einschränkungen

Die Datei bleibt lokal. Die Erkennung ohne BOM ist heuristisch und kann ältere Zeichensätze nicht immer eindeutig unterscheiden.

Ähnliche Tools

Häufige Fragen

Warum gilt ASCII als UTF-8-kompatibel?

ASCII-Bytes haben in UTF-8 dieselben Werte, daher lässt sich gültiges ASCII auch als UTF-8 dekodieren.

Erkennt es jede ältere Kodierung?

Nein. Viele Ein-Byte-Kodierungen sind ohne Sprachkontext mehrdeutig.

Kostenloses Tool · läuft in deinem browser · kein Konto nötig