Dosya aracı / 05

Metin Kodlama Algılayıcı

Yerel bir dosya örneğinde BOM işaretlerini, ASCII uyumluluğunu ve katı UTF-8 geçerliliğini kontrol edin.

Metin Kodlama Algılayıcı: TOEA, UTF-8 ve UTF-16 bayt sırası işaretlerini, saf ASCII'yi ve katı biçimde geçerli UTF-8'i algılar; diğer baytlar için temkinli bir bilinmeyen/eski kodlama sonucu gösterir. Sunucuya hiçbir dosya yüklenmeden tarayıcınızda %100 yerel olarak çalışır.

Çalıştırma sayısı
Tarayıcınızda
Maliyet
Ücretsiz · kayıt gerekmez
Kullanılabilirlik
Kullanıma hazır
Text encoding detectorYerel işleme

Tamamen tarayıcınızda çalışır

Sonuç eski veya bilinmiyorsa

Geçerli UTF-8 olmayan metin çoğunlukla daha eski, tek byte'lık bir kodlamadadır. Batı Avrupa metinleri için bu genellikle Windows-1252 veya ISO-8859-1 anlamına gelir. Bir kez dönüştürün ve bundan sonra UTF-8 kullanın: Linux veya macOS'ta iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt komutunu çalıştırın ya da kodlamayı seçmenize izin veren bir düzenleyicide açıp UTF-8 olarak kaydedin. Yalnızca ilk 1 MB incelenir; bu nedenle ilk megabyte'ı düz ASCII olan büyük bir dosyanın ilerleyen kısımlarında ASCII dışı metin yine bulunabilir.

Byte sırası işaretleri ve UTF-16

Bir UTF-8 byte sırası işareti (EF BB BF), Excel'in aksanlı bir CSV'yi doğru açmasına yardımcı olur; ancak başka şeyleri bozar: kabuk betiğinin #! satırını, başlıklardan önce gönderilen PHP çıktısını ve onu kaldırmayan kod tarafından okunan CSV'nin ilk sütun adını. UTF-16 dosyaları genellikle Windows'tan gelir; örneğin Windows PowerShell 5.1'in > yönlendirmesinden. Birçok Unix aracı bunları null byte'larla dolu metin olarak okur.

Nasıl kullanılır?

  1. 50 MB'a kadar metin türünde bir dosya seçin.
  2. İlk 1 MB'ı yerel olarak inceleyin.
  3. Kodlamayı ve güven düzeyi etiketini inceleyin.

Gizlilik ve sınırlamalar

Dosya yerel olarak kalır. BOM olmadan yapılan kodlama algılama işlemi buluşsaldır ve eski karakter kümelerini her zaman birbirinden ayırt edemez.

İlgili araçlar

Sık sorulan sorular

ASCII neden UTF-8 uyumlu olarak adlandırılır?

ASCII baytları UTF-8'de aynı değerleri kullanır; bu nedenle geçerli ASCII, UTF-8 olarak da çözümlenir.

Her eski kodlamayı tanımlayabilir mi?

Hayır. Tek baytlı birçok kodlama, dil bağlamı olmadan belirsizdir.

Ücretsiz araç · tarayıcınızda kez çalıştırma · hesap gerekmez