Strumento per sviluppatori / 17

Strumento di analisi dei caratteri Unicode e invisibili

Analizza il testo per trovare spazi a larghezza zero, caratteri di controllo, marcatori RTL e punti di codice Unicode.

Strumento di analisi dei caratteri Unicode e invisibili: TOEA scompone il testo nei singoli punti di codice Unicode, identifica i caratteri invisibili (come ZWSP o NBSP) e calcola le sequenze di byte UTF-8. Funziona al 100% localmente nel browser, senza caricare file sul server.

Esecuzioni
Nel browser
Costo
Gratuito · senza registrazione
Disponibilità
Pronto all'uso
Strumento di verifica dei caratteri Unicode e invisibiliElaborazione locale

Funziona interamente nel browser

Riepilogo del testo e dei caratteri

Conteggio caratteri26
Punti di codice25
Byte UTF-833
Invisibile / a larghezza zero3

Dettaglio dei punti di codice

Pos.Car.Punto di codiceByte UTF-8Categoria / Nome
0HU+004848Letter 'H'
1eU+006565Letter 'e'
2lU+006C6CLetter 'l'
3lU+006C6CLetter 'l'
4oU+006F6FLetter 'o'
5⚠️U+200BE2 80 8BZero Width Space[NASCOSTO]
6WU+005757Letter 'W'
7oU+006F6FLetter 'o'
8rU+007272Letter 'r'
9lU+006C6CLetter 'l'
10dU+006464Letter 'd'
11!U+002121Symbol '!'
12⚠️U+00A0C2 A0Non-Breaking Space (NBSP)[NASCOSTO]
13🚀U+1F680F0 9F 9A 80Character '🚀'
14 U+002020Space
15TU+005454Letter 'T'
16eU+006565Letter 'e'
17sU+007373Letter 's'
18tU+007474Letter 't'
19 U+002020Space
20⚠️U+200EE2 80 8ELeft-To-Right Mark[NASCOSTO]
21TU+005454Letter 'T'
22eU+006565Letter 'e'
23xU+007878Letter 'x'
24tU+007474Letter 't'

Da dove provengono i caratteri nascosti

La maggior parte arriva dal copia e incolla. I programmi di videoscrittura e le pagine web aggiungono spazi non interrompibili, alcuni sistemi di gestione dei contenuti aggiungono spazi a larghezza zero e gli editor per il testo arabo o ebraico aggiungono marcatori di direzione. Possono causare bug difficili da individuare: un nome utente che sembra corretto non corrisponde, grep non trova una parola e Python rifiuta il codice sorgente che contiene uno spazio non interrompibile. I joiner a larghezza zero all'interno delle emoji sono legittimi, quindi verifica a cosa appartiene un carattere prima di rimuoverlo.

Override della direzione

L'override da destra a sinistra, U+202E, inverte la visualizzazione del testo che lo segue. È stato usato per camuffare i nomi dei file, facendo visualizzare invoice seguito da U+202E e fdp.exe come invoiceexe.pdf. Nel 2021 lo stesso trucco, chiamato Trojan Source, ha mostrato che il codice sorgente poteva essere visualizzato in modo diverso da come viene compilato. Considera sospetto qualsiasi override trovato in un nome di file, nel codice o in un messaggio.

Caratteri che non vengono segnalati

L'elenco degli invisibili copre i casi più comuni. Altri caratteri che non producono alcun elemento visibile, tra cui il soft hyphen U+00AD, il word joiner U+2060, gli isolatori di direzione U+2066–U+2069 e i selettori di variazione come U+FE0F, vengono mostrati come normali caratteri estesi. Cerca la colonna dei code point oppure confronta i conteggi: un testo il cui conteggio dei caratteri è superiore a ciò che riesci a vedere contiene qualcosa di nascosto.

Come usarlo

  1. Digita o incolla il testo nel campo di input.
  2. Controlla il conteggio dei caratteri, la scomposizione in byte UTF-8 e gli avvisi sui caratteri a larghezza zero.
  3. Copia l’elenco dettagliato dei punti di codice.

Privacy e limitazioni

L’analisi del testo avviene interamente nella memoria locale del browser.

Strumenti correlati

Domande frequenti

Quali caratteri nascosti vengono rilevati?

Spazio a larghezza zero (U+200B), spazio unificatore (U+00A0), BOM (U+FEFF), ZWJ/ZWNJ e codici di controllo.

Perché il conteggio dei caratteri è diverso da quello dei punti di codice?

Le coppie surrogate o le sequenze emoji possono essere composte da più unità di codice UTF-16 o punti di codice.

Strumento gratuito · nel browser esecuzioni · senza account