Outil de développement / 17

Inspecteur Unicode et de caractères invisibles

Analysez un texte pour détecter les espaces de largeur nulle, les caractères de contrôle, les marques de forçage RTL et les points de code Unicode.

Inspecteur Unicode et de caractères invisibles: TOEA décode le texte en points de code Unicode individuels, identifie les caractères invisibles (tels que ZWSP ou NBSP) et calcule les séquences d'octets UTF-8. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.

Exécutions
Dans votre navigateur
Coût
Gratuit · sans inscription
Disponibilité
Prêt à l'emploi
Inspecteur de caractères Unicode et invisiblesTraitement local

Fonctionne entièrement dans votre navigateur

Résumé du texte et des caractères

Nombre de caractères26
Points de code25
Octets UTF-833
Invisible / largeur nulle3

Décomposition détaillée des points de code

PositionCaractèrePoint de codeOctets UTF-8Catégorie / Nom
0HU+004848Letter 'H'
1eU+006565Letter 'e'
2lU+006C6CLetter 'l'
3lU+006C6CLetter 'l'
4oU+006F6FLetter 'o'
5⚠️U+200BE2 80 8BZero Width Space[CACHÉ]
6WU+005757Letter 'W'
7oU+006F6FLetter 'o'
8rU+007272Letter 'r'
9lU+006C6CLetter 'l'
10dU+006464Letter 'd'
11!U+002121Symbol '!'
12⚠️U+00A0C2 A0Non-Breaking Space (NBSP)[CACHÉ]
13🚀U+1F680F0 9F 9A 80Character '🚀'
14 U+002020Space
15TU+005454Letter 'T'
16eU+006565Letter 'e'
17sU+007373Letter 's'
18tU+007474Letter 't'
19 U+002020Space
20⚠️U+200EE2 80 8ELeft-To-Right Mark[CACHÉ]
21TU+005454Letter 'T'
22eU+006565Letter 'e'
23xU+007878Letter 'x'
24tU+007474Letter 't'

Origine des caractères masqués

La plupart sont introduits par des copier-coller. Les traitements de texte et les pages web ajoutent des espaces insécables, certains systèmes de gestion de contenu ajoutent des espaces de largeur nulle, et les éditeurs de texte arabe ou hébreu ajoutent des marques de direction. Ils provoquent des erreurs difficiles à voir : un nom d’utilisateur qui semble correct ne correspond pas, grep ne trouve pas un mot, et Python refuse le code source contenant un espace insécable. Les assembleurs de largeur nulle à l’intérieur des emoji sont légitimes ; vérifiez donc le rôle d’un caractère avant de le supprimer.

Forçages de direction

Le forçage de droite à gauche U+202E inverse l’affichage du texte qui le suit. Il a été utilisé pour dissimuler des noms de fichiers : invoice suivi de U+202E et de fdp.exe s’affiche alors comme invoiceexe.pdf. En 2021, la même astuce, appelée Trojan Source, a montré que le code source pouvait s’afficher différemment de la façon dont il est compilé. Considérez comme suspect tout forçage trouvé dans un nom de fichier, du code ou un message.

Caractères non signalés

La liste des caractères invisibles couvre les cas courants. D’autres caractères qui ne produisent aucun affichage, notamment le trait d’union conditionnel U+00AD, le séparateur de mots U+2060, les isolats directionnels U+2066–U+2069 et les sélecteurs de variante comme U+FE0F, apparaissent comme des caractères étendus ordinaires. Examinez la colonne des points de code ou comparez les nombres : un texte dont le compte de caractères est supérieur à ce que vous pouvez voir contient des éléments masqués.

Comment l'utiliser

  1. Saisissez ou collez le texte dans la zone de saisie.
  2. Passez en revue le nombre de caractères, la répartition des octets UTF-8 et les avertissements sur les caractères de largeur nulle.
  3. Copiez la liste détaillée des points de code.

Confidentialité et limitations

L'inspection du texte s'effectue entièrement en mémoire locale dans votre navigateur.

Outils associés

Questions fréquentes

Quels caractères cachés sont détectés ?

Espace de largeur nulle (U+200B), espace insécable (U+00A0), BOM (U+FEFF), ZWJ/ZWNJ et codes de contrôle.

Pourquoi le nombre de caractères diffère-t-il du nombre de points de code ?

Les paires de substitution ou les séquences d'emoji peuvent se composer de plusieurs unités de code UTF-16 ou de plusieurs points de code.

Outil gratuit · dans votre navigateur exécutions · aucun compte requis