Herramienta de archivos / 05
Detector de codificación de texto
Comprueba marcadores BOM, compatibilidad ASCII y validez estricta de UTF-8 en una muestra de archivo local.
Detector de codificación de texto: TOEA detecta marcas de orden de bytes UTF-8 y UTF-16 (BOM), ASCII puro y UTF-8 estrictamente válido; otros bytes reciben un resultado prudente de desconocido/legacy. Funciona al 100 % en tu navegador, sin subir archivos a ningún servidor.
- Categoría
- Herramientas de desarrollo
- Se ejecuta
- En tu navegador
- Coste
- Gratis · sin registro
- Disponibilidad
- Lista para usar
Funciona por completo en tu navegador
Cuando el resultado es antiguo o desconocido
El texto que no es UTF-8 válido suele estar en una codificación antigua de un solo byte. Para texto de Europa occidental, normalmente será Windows-1252 o ISO-8859-1. Conviértelo una vez y usa UTF-8 a partir de entonces: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt en Linux o macOS, o ábrelo en un editor que permita elegir la codificación y guárdalo como UTF-8. Solo se inspecciona el primer 1 MB, por lo que un archivo grande cuyo primer megabyte sea ASCII simple aún puede contener texto no ASCII más adelante.
Marcas de orden de bytes y UTF-16
Una marca de orden de bytes UTF-8 (EF BB BF) ayuda a que Excel abra correctamente un CSV con caracteres acentuados, pero rompe otras cosas: la línea #! de un script de shell, la salida de PHP enviada antes de las cabeceras y el nombre de la primera columna de un CSV leído por código que no la elimina. Los archivos UTF-16 suelen proceder de Windows, por ejemplo, de la redirección > de Windows PowerShell 5.1. Muchas herramientas de Unix los leen como texto lleno de bytes nulos.
Cómo se usa
- Elige un archivo de texto o similar de hasta 50 MB.
- Inspecciona localmente los primeros 1 MB.
- Revisa la codificación y la etiqueta de confianza.
Privacidad y límites
El archivo permanece local. La detección de codificación sin BOM es heurística y no siempre puede distinguir conjuntos de caracteres heredados.
Herramientas relacionadas
Preguntas frecuentes
¿Por qué se dice que ASCII es compatible con UTF-8?
Los bytes ASCII usan los mismos valores en UTF-8, por lo que un ASCII válido también se decodifica como UTF-8.
¿Puede identificar todas las codificaciones heredadas?
No. Muchas codificaciones de un solo byte son ambiguas sin contexto de idioma.
Herramienta gratuita · se ejecuta en tu navegador · sin cuenta