Strumento per sviluppatori / 17
Strumento di analisi dei caratteri Unicode e invisibili
Analizza il testo per trovare spazi a larghezza zero, caratteri di controllo, marcatori RTL e punti di codice Unicode.
Strumento di analisi dei caratteri Unicode e invisibili: TOEA scompone il testo nei singoli punti di codice Unicode, identifica i caratteri invisibili (come ZWSP o NBSP) e calcola le sequenze di byte UTF-8. Funziona al 100% localmente nel browser, senza caricare file sul server.
- Categoria
- Strumenti per sviluppatori
- Esecuzioni
- Nel browser
- Costo
- Gratuito · senza registrazione
- Disponibilità
- Pronto all'uso
Funziona interamente nel browser
Riepilogo del testo e dei caratteri
Dettaglio dei punti di codice
| Pos. | Car. | Punto di codice | Byte UTF-8 | Categoria / Nome |
|---|---|---|---|---|
| 0 | H | U+0048 | 48 | Letter 'H' |
| 1 | e | U+0065 | 65 | Letter 'e' |
| 2 | l | U+006C | 6C | Letter 'l' |
| 3 | l | U+006C | 6C | Letter 'l' |
| 4 | o | U+006F | 6F | Letter 'o' |
| 5 | ⚠️ | U+200B | E2 80 8B | Zero Width Space[NASCOSTO] |
| 6 | W | U+0057 | 57 | Letter 'W' |
| 7 | o | U+006F | 6F | Letter 'o' |
| 8 | r | U+0072 | 72 | Letter 'r' |
| 9 | l | U+006C | 6C | Letter 'l' |
| 10 | d | U+0064 | 64 | Letter 'd' |
| 11 | ! | U+0021 | 21 | Symbol '!' |
| 12 | ⚠️ | U+00A0 | C2 A0 | Non-Breaking Space (NBSP)[NASCOSTO] |
| 13 | 🚀 | U+1F680 | F0 9F 9A 80 | Character '🚀' |
| 14 | U+0020 | 20 | Space | |
| 15 | T | U+0054 | 54 | Letter 'T' |
| 16 | e | U+0065 | 65 | Letter 'e' |
| 17 | s | U+0073 | 73 | Letter 's' |
| 18 | t | U+0074 | 74 | Letter 't' |
| 19 | U+0020 | 20 | Space | |
| 20 | ⚠️ | U+200E | E2 80 8E | Left-To-Right Mark[NASCOSTO] |
| 21 | T | U+0054 | 54 | Letter 'T' |
| 22 | e | U+0065 | 65 | Letter 'e' |
| 23 | x | U+0078 | 78 | Letter 'x' |
| 24 | t | U+0074 | 74 | Letter 't' |
Da dove provengono i caratteri nascosti
La maggior parte arriva dal copia e incolla. I programmi di videoscrittura e le pagine web aggiungono spazi non interrompibili, alcuni sistemi di gestione dei contenuti aggiungono spazi a larghezza zero e gli editor per il testo arabo o ebraico aggiungono marcatori di direzione. Possono causare bug difficili da individuare: un nome utente che sembra corretto non corrisponde, grep non trova una parola e Python rifiuta il codice sorgente che contiene uno spazio non interrompibile. I joiner a larghezza zero all'interno delle emoji sono legittimi, quindi verifica a cosa appartiene un carattere prima di rimuoverlo.
Override della direzione
L'override da destra a sinistra, U+202E, inverte la visualizzazione del testo che lo segue. È stato usato per camuffare i nomi dei file, facendo visualizzare invoice seguito da U+202E e fdp.exe come invoiceexe.pdf. Nel 2021 lo stesso trucco, chiamato Trojan Source, ha mostrato che il codice sorgente poteva essere visualizzato in modo diverso da come viene compilato. Considera sospetto qualsiasi override trovato in un nome di file, nel codice o in un messaggio.
Caratteri che non vengono segnalati
L'elenco degli invisibili copre i casi più comuni. Altri caratteri che non producono alcun elemento visibile, tra cui il soft hyphen U+00AD, il word joiner U+2060, gli isolatori di direzione U+2066–U+2069 e i selettori di variazione come U+FE0F, vengono mostrati come normali caratteri estesi. Cerca la colonna dei code point oppure confronta i conteggi: un testo il cui conteggio dei caratteri è superiore a ciò che riesci a vedere contiene qualcosa di nascosto.
Come usarlo
- Digita o incolla il testo nel campo di input.
- Controlla il conteggio dei caratteri, la scomposizione in byte UTF-8 e gli avvisi sui caratteri a larghezza zero.
- Copia l’elenco dettagliato dei punti di codice.
Privacy e limitazioni
L’analisi del testo avviene interamente nella memoria locale del browser.
Strumenti correlati
Domande frequenti
Quali caratteri nascosti vengono rilevati?
Spazio a larghezza zero (U+200B), spazio unificatore (U+00A0), BOM (U+FEFF), ZWJ/ZWNJ e codici di controllo.
Perché il conteggio dei caratteri è diverso da quello dei punti di codice?
Le coppie surrogate o le sequenze emoji possono essere composte da più unità di codice UTF-16 o punti di codice.
Strumento gratuito · nel browser esecuzioni · senza account