Ferramenta de arquivos / 05
Detector de Codificação de Texto
Verifique marcadores BOM, compatibilidade com ASCII e validade estrita de UTF-8 em uma amostra local do arquivo.
Detector de Codificação de Texto: TOEA detecta marcas de ordem de bytes (BOM) de UTF-8 e UTF-16, ASCII puro e UTF-8 estritamente válido; outros bytes recebem um resultado cauteloso de desconhecido/legado. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.
- Categoria
- Ferramentas para desenvolvedores
- Execuções
- No seu navegador
- Custo
- Grátis · sem cadastro
- Disponibilidade
- Pronto para usar
Roda inteiramente no seu navegador
Quando o resultado é legado ou desconhecido
Textos que não são UTF-8 válidos geralmente usam uma codificação de byte único mais antiga. Para textos da Europa Ocidental, isso normalmente significa Windows-1252 ou ISO-8859-1. Converta uma vez e mantenha UTF-8 de então em diante: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt no Linux ou macOS, ou abra o arquivo em um editor que permita escolher a codificação e salve como UTF-8. Apenas o primeiro 1 MB é inspecionado, portanto um arquivo grande cujo primeiro megabyte seja ASCII puro ainda pode conter texto não ASCII mais adiante.
Marcas de ordem dos bytes e UTF-16
Uma marca de ordem dos bytes UTF-8 (EF BB BF) ajuda o Excel a abrir corretamente um CSV com acentos, mas causa problemas em outros contextos: na linha #! de um script de shell, em uma saída PHP enviada antes dos cabeçalhos e no nome da primeira coluna de um CSV lido por código que não a remove. Arquivos UTF-16 geralmente vêm do Windows, por exemplo do redirecionamento > do Windows PowerShell 5.1. Muitas ferramentas Unix os leem como texto cheio de bytes nulos.
Como usar
- Escolha um arquivo de texto (ou semelhante) de até 50 MB.
- Inspecione localmente os primeiros 1 MB.
- Confira a codificação e o rótulo de confiança.
Privacidade e limitações
O arquivo permanece local. A detecção de codificação sem BOM é heurística e nem sempre consegue distinguir conjuntos de caracteres legados.
Ferramentas relacionadas
Perguntas frequentes
Por que o ASCII é chamado de compatível com UTF-8?
Os bytes ASCII usam os mesmos valores em UTF-8, então ASCII válido também é decodificado como UTF-8.
Ele consegue identificar todas as codificações legadas?
Não. Muitas codificações de byte único são ambíguas sem contexto de idioma.
Ferramenta grátis · no seu navegador execuções · não precisa de conta