Outil de développement / 17
Inspecteur Unicode et de caractères invisibles
Analysez un texte pour détecter les espaces de largeur nulle, les caractères de contrôle, les marques de forçage RTL et les points de code Unicode.
Inspecteur Unicode et de caractères invisibles: TOEA décode le texte en points de code Unicode individuels, identifie les caractères invisibles (tels que ZWSP ou NBSP) et calcule les séquences d'octets UTF-8. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.
- Catégorie
- Outils développeur
- Exécutions
- Dans votre navigateur
- Coût
- Gratuit · sans inscription
- Disponibilité
- Prêt à l'emploi
Fonctionne entièrement dans votre navigateur
Résumé du texte et des caractères
Décomposition détaillée des points de code
| Position | Caractère | Point de code | Octets UTF-8 | Catégorie / Nom |
|---|---|---|---|---|
| 0 | H | U+0048 | 48 | Letter 'H' |
| 1 | e | U+0065 | 65 | Letter 'e' |
| 2 | l | U+006C | 6C | Letter 'l' |
| 3 | l | U+006C | 6C | Letter 'l' |
| 4 | o | U+006F | 6F | Letter 'o' |
| 5 | ⚠️ | U+200B | E2 80 8B | Zero Width Space[CACHÉ] |
| 6 | W | U+0057 | 57 | Letter 'W' |
| 7 | o | U+006F | 6F | Letter 'o' |
| 8 | r | U+0072 | 72 | Letter 'r' |
| 9 | l | U+006C | 6C | Letter 'l' |
| 10 | d | U+0064 | 64 | Letter 'd' |
| 11 | ! | U+0021 | 21 | Symbol '!' |
| 12 | ⚠️ | U+00A0 | C2 A0 | Non-Breaking Space (NBSP)[CACHÉ] |
| 13 | 🚀 | U+1F680 | F0 9F 9A 80 | Character '🚀' |
| 14 | U+0020 | 20 | Space | |
| 15 | T | U+0054 | 54 | Letter 'T' |
| 16 | e | U+0065 | 65 | Letter 'e' |
| 17 | s | U+0073 | 73 | Letter 's' |
| 18 | t | U+0074 | 74 | Letter 't' |
| 19 | U+0020 | 20 | Space | |
| 20 | ⚠️ | U+200E | E2 80 8E | Left-To-Right Mark[CACHÉ] |
| 21 | T | U+0054 | 54 | Letter 'T' |
| 22 | e | U+0065 | 65 | Letter 'e' |
| 23 | x | U+0078 | 78 | Letter 'x' |
| 24 | t | U+0074 | 74 | Letter 't' |
Origine des caractères masqués
La plupart sont introduits par des copier-coller. Les traitements de texte et les pages web ajoutent des espaces insécables, certains systèmes de gestion de contenu ajoutent des espaces de largeur nulle, et les éditeurs de texte arabe ou hébreu ajoutent des marques de direction. Ils provoquent des erreurs difficiles à voir : un nom d’utilisateur qui semble correct ne correspond pas, grep ne trouve pas un mot, et Python refuse le code source contenant un espace insécable. Les assembleurs de largeur nulle à l’intérieur des emoji sont légitimes ; vérifiez donc le rôle d’un caractère avant de le supprimer.
Forçages de direction
Le forçage de droite à gauche U+202E inverse l’affichage du texte qui le suit. Il a été utilisé pour dissimuler des noms de fichiers : invoice suivi de U+202E et de fdp.exe s’affiche alors comme invoiceexe.pdf. En 2021, la même astuce, appelée Trojan Source, a montré que le code source pouvait s’afficher différemment de la façon dont il est compilé. Considérez comme suspect tout forçage trouvé dans un nom de fichier, du code ou un message.
Caractères non signalés
La liste des caractères invisibles couvre les cas courants. D’autres caractères qui ne produisent aucun affichage, notamment le trait d’union conditionnel U+00AD, le séparateur de mots U+2060, les isolats directionnels U+2066–U+2069 et les sélecteurs de variante comme U+FE0F, apparaissent comme des caractères étendus ordinaires. Examinez la colonne des points de code ou comparez les nombres : un texte dont le compte de caractères est supérieur à ce que vous pouvez voir contient des éléments masqués.
Comment l'utiliser
- Saisissez ou collez le texte dans la zone de saisie.
- Passez en revue le nombre de caractères, la répartition des octets UTF-8 et les avertissements sur les caractères de largeur nulle.
- Copiez la liste détaillée des points de code.
Confidentialité et limitations
L'inspection du texte s'effectue entièrement en mémoire locale dans votre navigateur.
Outils associés
Questions fréquentes
Quels caractères cachés sont détectés ?
Espace de largeur nulle (U+200B), espace insécable (U+00A0), BOM (U+FEFF), ZWJ/ZWNJ et codes de contrôle.
Pourquoi le nombre de caractères diffère-t-il du nombre de points de code ?
Les paires de substitution ou les séquences d'emoji peuvent se composer de plusieurs unités de code UTF-16 ou de plusieurs points de code.
Outil gratuit · dans votre navigateur exécutions · aucun compte requis