Dosya aracı / 05
Metin Kodlama Algılayıcı
Yerel bir dosya örneğinde BOM işaretlerini, ASCII uyumluluğunu ve katı UTF-8 geçerliliğini kontrol edin.
Metin Kodlama Algılayıcı: TOEA, UTF-8 ve UTF-16 bayt sırası işaretlerini, saf ASCII'yi ve katı biçimde geçerli UTF-8'i algılar; diğer baytlar için temkinli bir bilinmeyen/eski kodlama sonucu gösterir. Sunucuya hiçbir dosya yüklenmeden tarayıcınızda %100 yerel olarak çalışır.
- Kategori
- Geliştirici araçları
- Çalıştırma sayısı
- Tarayıcınızda
- Maliyet
- Ücretsiz · kayıt gerekmez
- Kullanılabilirlik
- Kullanıma hazır
Tamamen tarayıcınızda çalışır
Sonuç eski veya bilinmiyorsa
Geçerli UTF-8 olmayan metin çoğunlukla daha eski, tek byte'lık bir kodlamadadır. Batı Avrupa metinleri için bu genellikle Windows-1252 veya ISO-8859-1 anlamına gelir. Bir kez dönüştürün ve bundan sonra UTF-8 kullanın: Linux veya macOS'ta iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt komutunu çalıştırın ya da kodlamayı seçmenize izin veren bir düzenleyicide açıp UTF-8 olarak kaydedin. Yalnızca ilk 1 MB incelenir; bu nedenle ilk megabyte'ı düz ASCII olan büyük bir dosyanın ilerleyen kısımlarında ASCII dışı metin yine bulunabilir.
Byte sırası işaretleri ve UTF-16
Bir UTF-8 byte sırası işareti (EF BB BF), Excel'in aksanlı bir CSV'yi doğru açmasına yardımcı olur; ancak başka şeyleri bozar: kabuk betiğinin #! satırını, başlıklardan önce gönderilen PHP çıktısını ve onu kaldırmayan kod tarafından okunan CSV'nin ilk sütun adını. UTF-16 dosyaları genellikle Windows'tan gelir; örneğin Windows PowerShell 5.1'in > yönlendirmesinden. Birçok Unix aracı bunları null byte'larla dolu metin olarak okur.
Nasıl kullanılır?
- 50 MB'a kadar metin türünde bir dosya seçin.
- İlk 1 MB'ı yerel olarak inceleyin.
- Kodlamayı ve güven düzeyi etiketini inceleyin.
Gizlilik ve sınırlamalar
Dosya yerel olarak kalır. BOM olmadan yapılan kodlama algılama işlemi buluşsaldır ve eski karakter kümelerini her zaman birbirinden ayırt edemez.
İlgili araçlar
Sık sorulan sorular
ASCII neden UTF-8 uyumlu olarak adlandırılır?
ASCII baytları UTF-8'de aynı değerleri kullanır; bu nedenle geçerli ASCII, UTF-8 olarak da çözümlenir.
Her eski kodlamayı tanımlayabilir mi?
Hayır. Tek baytlı birçok kodlama, dil bağlamı olmadan belirsizdir.
Ücretsiz araç · tarayıcınızda kez çalıştırma · hesap gerekmez