Herramienta de archivos / 05

Detector de codificación de texto

Comprueba marcadores BOM, compatibilidad ASCII y validez estricta de UTF-8 en una muestra de archivo local.

Detector de codificación de texto: TOEA detecta marcas de orden de bytes UTF-8 y UTF-16 (BOM), ASCII puro y UTF-8 estrictamente válido; otros bytes reciben un resultado prudente de desconocido/legacy. Funciona al 100 % en tu navegador, sin subir archivos a ningún servidor.

Se ejecuta
En tu navegador
Coste
Gratis · sin registro
Disponibilidad
Lista para usar
Text encoding detectorProcesamiento local

Funciona por completo en tu navegador

Cuando el resultado es antiguo o desconocido

El texto que no es UTF-8 válido suele estar en una codificación antigua de un solo byte. Para texto de Europa occidental, normalmente será Windows-1252 o ISO-8859-1. Conviértelo una vez y usa UTF-8 a partir de entonces: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt en Linux o macOS, o ábrelo en un editor que permita elegir la codificación y guárdalo como UTF-8. Solo se inspecciona el primer 1 MB, por lo que un archivo grande cuyo primer megabyte sea ASCII simple aún puede contener texto no ASCII más adelante.

Marcas de orden de bytes y UTF-16

Una marca de orden de bytes UTF-8 (EF BB BF) ayuda a que Excel abra correctamente un CSV con caracteres acentuados, pero rompe otras cosas: la línea #! de un script de shell, la salida de PHP enviada antes de las cabeceras y el nombre de la primera columna de un CSV leído por código que no la elimina. Los archivos UTF-16 suelen proceder de Windows, por ejemplo, de la redirección > de Windows PowerShell 5.1. Muchas herramientas de Unix los leen como texto lleno de bytes nulos.

Cómo se usa

  1. Elige un archivo de texto o similar de hasta 50 MB.
  2. Inspecciona localmente los primeros 1 MB.
  3. Revisa la codificación y la etiqueta de confianza.

Privacidad y límites

El archivo permanece local. La detección de codificación sin BOM es heurística y no siempre puede distinguir conjuntos de caracteres heredados.

Herramientas relacionadas

Preguntas frecuentes

¿Por qué se dice que ASCII es compatible con UTF-8?

Los bytes ASCII usan los mismos valores en UTF-8, por lo que un ASCII válido también se decodifica como UTF-8.

¿Puede identificar todas las codificaciones heredadas?

No. Muchas codificaciones de un solo byte son ambiguas sin contexto de idioma.

Herramienta gratuita · se ejecuta en tu navegador · sin cuenta