Outil fichier / 05

Détecteur d’encodage texte

Vérifiez les marqueurs BOM, la compatibilité ASCII et la validité UTF-8 stricte dans un échantillon de fichier local.

Détecteur d’encodage texte: TOEA détecte les marques d’ordre des octets (BOM) UTF-8 et UTF-16, l’ASCII pur et l’UTF-8 strictement valide ; les autres octets donnent un résultat prudent : inconnu/legacy. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.

Exécutions
Dans votre navigateur
Coût
Gratuit · sans inscription
Disponibilité
Prêt à l'emploi
Text encoding detectorTraitement local

Fonctionne entièrement dans votre navigateur

Quand le résultat est ancien ou inconnu

Un texte qui n’est pas valide en UTF-8 utilise le plus souvent un ancien encodage sur un seul octet. Pour un texte d’Europe occidentale, il s’agit généralement de Windows-1252 ou d’ISO-8859-1. Convertissez-le une fois et utilisez ensuite UTF-8 : iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt sous Linux ou macOS, ou ouvrez-le dans un éditeur qui permet de choisir l’encodage, puis enregistrez-le en UTF-8. Seul le premier 1 MB est inspecté ; un fichier volumineux dont le premier mégaoctet est uniquement en ASCII peut donc encore contenir du texte non ASCII plus loin.

Marques d’ordre des octets et UTF-16

Une marque d’ordre des octets UTF-8 (EF BB BF) aide Excel à ouvrir correctement un CSV contenant des accents, mais elle perturbe d’autres éléments : la ligne #! d’un script shell, une sortie PHP envoyée avant les en-têtes et le nom de la première colonne d’un CSV lu par du code qui ne la supprime pas. Les fichiers UTF-16 proviennent généralement de Windows, par exemple d’une redirection > de Windows PowerShell 5.1. De nombreux outils Unix les lisent comme du texte rempli d’octets nuls.

Comment l'utiliser

  1. Choisissez un fichier de type texte jusqu’à 50 MB.
  2. Inspectez en local les 1 MB initiaux.
  3. Vérifiez l’encodage et le niveau de confiance.

Confidentialité et limitations

Le fichier reste local. La détection d’encodage sans BOM est heuristique et ne peut pas toujours distinguer les jeux de caractères legacy.

Outils associés

Questions fréquentes

Pourquoi dit-on qu’ASCII est compatible UTF-8 ?

Les octets ASCII ont les mêmes valeurs en UTF-8 ; un ASCII valide se décode donc aussi en UTF-8.

Peut-il identifier tous les encodages legacy ?

Non. De nombreux encodages monooctet sont ambigus sans contexte linguistique.

Outil gratuit · dans votre navigateur exécutions · aucun compte requis