Ferramenta de desenvolvedor / 17

Inspetor de Unicode e Caracteres Invisíveis

Inspecione texto e encontre espaços de largura zero, caracteres de controle, marcas de sobrescrita RTL e pontos de código Unicode.

Inspetor de Unicode e Caracteres Invisíveis: TOEA decodifica o texto em pontos de código Unicode individuais, identifica caracteres invisíveis (como ZWSP ou NBSP) e calcula sequências de bytes UTF-8. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.

Execuções
No seu navegador
Custo
Grátis · sem cadastro
Disponibilidade
Pronto para usar
Inspetor de Unicode e de caracteres invisíveisProcessamento local

Roda inteiramente no seu navegador

Resumo do texto e dos caracteres

Contagem de caracteres26
Pontos de código25
Bytes UTF-833
Invisível / Largura zero3

Detalhamento dos pontos de código

PosiçãoCaracterePonto de códigoBytes UTF-8Categoria / Nome
0HU+004848Letter 'H'
1eU+006565Letter 'e'
2lU+006C6CLetter 'l'
3lU+006C6CLetter 'l'
4oU+006F6FLetter 'o'
5⚠️U+200BE2 80 8BZero Width Space[OCULTO]
6WU+005757Letter 'W'
7oU+006F6FLetter 'o'
8rU+007272Letter 'r'
9lU+006C6CLetter 'l'
10dU+006464Letter 'd'
11!U+002121Symbol '!'
12⚠️U+00A0C2 A0Non-Breaking Space (NBSP)[OCULTO]
13🚀U+1F680F0 9F 9A 80Character '🚀'
14 U+002020Space
15TU+005454Letter 'T'
16eU+006565Letter 'e'
17sU+007373Letter 's'
18tU+007474Letter 't'
19 U+002020Space
20⚠️U+200EE2 80 8ELeft-To-Right Mark[OCULTO]
21TU+005454Letter 'T'
22eU+006565Letter 'e'
23xU+007878Letter 'x'
24tU+007474Letter 't'

De onde vêm os caracteres ocultos

A maioria chega por copiar e colar. Editores de texto e páginas da web adicionam espaços incondicionais, alguns sistemas de conteúdo adicionam espaços de largura zero, e editores de texto em árabe ou hebraico adicionam marcas de direção. Eles causam bugs difíceis de perceber: um nome de usuário que parece correto não corresponde, grep não encontra uma palavra e o Python rejeita código-fonte que contém um espaço incondicional. Juntadores de largura zero dentro de emojis são legítimos, então verifique do que um caractere faz parte antes de removê-lo.

Substituições de direção

A substituição da direita para a esquerda, U+202E, inverte a exibição do texto que vem depois dela. Ela já foi usada para disfarçar nomes de arquivos, fazendo com que invoice seguido por U+202E e fdp.exe seja exibido como invoiceexe.pdf. Em 2021, o mesmo truque, chamado Trojan Source, mostrou que o código-fonte poderia ser exibido de forma diferente daquela como é compilado. Trate qualquer substituição encontrada em um nome de arquivo, código ou mensagem como suspeita.

Caracteres não sinalizados

A lista de invisíveis cobre os casos comuns. Outros caracteres que não exibem nada, incluindo o hífen opcional U+00AD, o juntador de palavras U+2060, os isolados de direção U+2066–U+2069 e seletores de variação como U+FE0F, aparecem como caracteres estendidos comuns. Examine a coluna de pontos de código ou compare as contagens: um texto cuja contagem de caracteres seja maior do que o que você consegue ver contém algo oculto.

Como usar

  1. Digite ou cole o texto na caixa de texto.
  2. Confira as contagens de caracteres, o detalhamento de bytes UTF-8 e os alertas sobre caracteres de largura zero.
  3. Copie a lista detalhada de pontos de código.

Privacidade e limitações

A inspeção do texto ocorre inteiramente na memória local do navegador.

Ferramentas relacionadas

Perguntas frequentes

Quais caracteres ocultos são detectados?

Espaço de largura zero (U+200B), espaço não separável (U+00A0), BOM (U+FEFF), ZWJ/ZWNJ e códigos de controle.

Por que a contagem de caracteres difere do número de pontos de código?

Pares substitutos ou sequências de emoji podem consistir em várias unidades de código UTF-16 ou em vários pontos de código.

Ferramenta grátis · no seu navegador execuções · não precisa de conta