Strumento per file / 05

Rilevatore della codifica del testo

Controlla i marcatori BOM, la compatibilità ASCII e la validità rigorosa di UTF-8 in un campione di file locale.

Rilevatore della codifica del testo: TOEA rileva i marcatori di ordine dei byte UTF-8 e UTF-16, l'ASCII puro e l'UTF-8 rigorosamente valido; per gli altri byte restituisce con cautela un risultato sconosciuto/legacy. Funziona al 100% localmente nel browser, senza caricare file sul server.

Esecuzioni
Nel browser
Costo
Gratuito · senza registrazione
Disponibilità
Pronto all'uso
Text encoding detectorElaborazione locale

Funziona interamente nel browser

Quando il risultato è obsoleto o sconosciuto

Il testo che non è UTF-8 valido usa molto spesso una codifica a singolo byte più vecchia. Per il testo dell'Europa occidentale si tratta di solito di Windows-1252 o ISO-8859-1. Converti il file una volta e da quel momento mantieni UTF-8: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt su Linux o macOS, oppure aprilo in un editor che consenta di scegliere la codifica e salvalo come UTF-8. Viene esaminato solo il primo 1 MB, quindi un file grande i cui primi megabyte contengono solo ASCII può comunque contenere più avanti testo non ASCII.

Byte order mark e UTF-16

Un byte order mark UTF-8 (EF BB BF) aiuta Excel ad aprire correttamente un CSV con caratteri accentati, ma può creare problemi altrove: nella riga #! di uno script shell, nell'output PHP inviato prima degli header e nel nome della prima colonna di un CSV letto da codice che non lo rimuove. I file UTF-16 provengono di solito da Windows, per esempio dal redirect > di Windows PowerShell 5.1. Molti strumenti Unix li leggono come testo pieno di byte nulli.

Come usarlo

  1. Scegli un file di testo o simile fino a 50 MB.
  2. Esamina localmente il primo 1 MB.
  3. Controlla la codifica e l'etichetta del livello di affidabilità.

Privacy e limitazioni

Il file rimane in locale. Il rilevamento della codifica senza BOM è euristico e non consente sempre di distinguere i set di caratteri legacy.

Strumenti correlati

Domande frequenti

Perché l'ASCII è considerato compatibile con UTF-8?

I byte ASCII usano gli stessi valori in UTF-8, quindi anche un testo ASCII valido viene decodificato come UTF-8.

Può identificare ogni codifica legacy?

No. Molte codifiche a singolo byte sono ambigue senza il contesto della lingua.

Strumento gratuito · nel browser esecuzioni · senza account