Strumento per file / 05
Rilevatore della codifica del testo
Controlla i marcatori BOM, la compatibilità ASCII e la validità rigorosa di UTF-8 in un campione di file locale.
Rilevatore della codifica del testo: TOEA rileva i marcatori di ordine dei byte UTF-8 e UTF-16, l'ASCII puro e l'UTF-8 rigorosamente valido; per gli altri byte restituisce con cautela un risultato sconosciuto/legacy. Funziona al 100% localmente nel browser, senza caricare file sul server.
- Categoria
- Strumenti per sviluppatori
- Esecuzioni
- Nel browser
- Costo
- Gratuito · senza registrazione
- Disponibilità
- Pronto all'uso
Funziona interamente nel browser
Quando il risultato è obsoleto o sconosciuto
Il testo che non è UTF-8 valido usa molto spesso una codifica a singolo byte più vecchia. Per il testo dell'Europa occidentale si tratta di solito di Windows-1252 o ISO-8859-1. Converti il file una volta e da quel momento mantieni UTF-8: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt su Linux o macOS, oppure aprilo in un editor che consenta di scegliere la codifica e salvalo come UTF-8. Viene esaminato solo il primo 1 MB, quindi un file grande i cui primi megabyte contengono solo ASCII può comunque contenere più avanti testo non ASCII.
Byte order mark e UTF-16
Un byte order mark UTF-8 (EF BB BF) aiuta Excel ad aprire correttamente un CSV con caratteri accentati, ma può creare problemi altrove: nella riga #! di uno script shell, nell'output PHP inviato prima degli header e nel nome della prima colonna di un CSV letto da codice che non lo rimuove. I file UTF-16 provengono di solito da Windows, per esempio dal redirect > di Windows PowerShell 5.1. Molti strumenti Unix li leggono come testo pieno di byte nulli.
Come usarlo
- Scegli un file di testo o simile fino a 50 MB.
- Esamina localmente il primo 1 MB.
- Controlla la codifica e l'etichetta del livello di affidabilità.
Privacy e limitazioni
Il file rimane in locale. Il rilevamento della codifica senza BOM è euristico e non consente sempre di distinguere i set di caratteri legacy.
Strumenti correlati
Domande frequenti
Perché l'ASCII è considerato compatibile con UTF-8?
I byte ASCII usano gli stessi valori in UTF-8, quindi anche un testo ASCII valido viene decodificato come UTF-8.
Può identificare ogni codifica legacy?
No. Molte codifiche a singolo byte sono ambigue senza il contesto della lingua.
Strumento gratuito · nel browser esecuzioni · senza account