Ferramenta de arquivos / 05

Detector de Codificação de Texto

Verifique marcadores BOM, compatibilidade com ASCII e validade estrita de UTF-8 em uma amostra local do arquivo.

Detector de Codificação de Texto: TOEA detecta marcas de ordem de bytes (BOM) de UTF-8 e UTF-16, ASCII puro e UTF-8 estritamente válido; outros bytes recebem um resultado cauteloso de desconhecido/legado. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.

Execuções
No seu navegador
Custo
Grátis · sem cadastro
Disponibilidade
Pronto para usar
Text encoding detectorProcessamento local

Roda inteiramente no seu navegador

Quando o resultado é legado ou desconhecido

Textos que não são UTF-8 válidos geralmente usam uma codificação de byte único mais antiga. Para textos da Europa Ocidental, isso normalmente significa Windows-1252 ou ISO-8859-1. Converta uma vez e mantenha UTF-8 de então em diante: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt no Linux ou macOS, ou abra o arquivo em um editor que permita escolher a codificação e salve como UTF-8. Apenas o primeiro 1 MB é inspecionado, portanto um arquivo grande cujo primeiro megabyte seja ASCII puro ainda pode conter texto não ASCII mais adiante.

Marcas de ordem dos bytes e UTF-16

Uma marca de ordem dos bytes UTF-8 (EF BB BF) ajuda o Excel a abrir corretamente um CSV com acentos, mas causa problemas em outros contextos: na linha #! de um script de shell, em uma saída PHP enviada antes dos cabeçalhos e no nome da primeira coluna de um CSV lido por código que não a remove. Arquivos UTF-16 geralmente vêm do Windows, por exemplo do redirecionamento > do Windows PowerShell 5.1. Muitas ferramentas Unix os leem como texto cheio de bytes nulos.

Como usar

  1. Escolha um arquivo de texto (ou semelhante) de até 50 MB.
  2. Inspecione localmente os primeiros 1 MB.
  3. Confira a codificação e o rótulo de confiança.

Privacidade e limitações

O arquivo permanece local. A detecção de codificação sem BOM é heurística e nem sempre consegue distinguir conjuntos de caracteres legados.

Ferramentas relacionadas

Perguntas frequentes

Por que o ASCII é chamado de compatível com UTF-8?

Os bytes ASCII usam os mesmos valores em UTF-8, então ASCII válido também é decodificado como UTF-8.

Ele consegue identificar todas as codificações legadas?

Não. Muitas codificações de byte único são ambíguas sem contexto de idioma.

Ferramenta grátis · no seu navegador execuções · não precisa de conta