Metin / Kodlama

Bayt Sayacı (UTF-8, UTF-16 ve SMS)

Bir metnin UTF-8 ve UTF-16 baytlarını, kod noktalarını ve görünen karakterlerini, ayrıca gereken SMS bölümlerini sayın; karakterleri bozmadan bayt sınırına göre kısaltın.

Bayt Sayacı (UTF-8, UTF-16 ve SMS): Farklı sistemler uzunluğu farklı şekilde ölçer. Web sayfalarında ve çoğu veritabanında kullanılan UTF-8; ASCII için 1 bayt, çoğu aksanlı, Yunanca veya Kiril harfi için 2 bayt, Çince, Japonca ve Korece için 3 bayt, emojiler için 4 bayt kullanır. JavaScript UTF-16 kod birimlerini, Python kod noktalarını, insanlar ise grapheme kümelerini sayar. Bu nedenle ten rengi belirten bir emoji, okuyucu için tek karakter olsa da iki kod noktası ve UTF-8'de sekiz bayttır. SMS mesajları GSM alfabesindeki 160 karaktere veya başka herhangi bir karakter kullanılırsa 70 karaktere sığar. Sunucuya hiçbir dosya yüklenmeden tarayıcınızda %100 yerel olarak çalışır.

Çalıştırma sayısı
Tarayıcınızda
Maliyet
Ücretsiz · kayıt gerekmez
Kullanılabilirlik
Kullanıma hazır
Bayt sayacıYerel işleme

Tamamen tarayıcınızda çalışır

UTF-8 baytları24web sayfaları, dosyalar, çoğu veritabanı
UTF-16 baytları26JavaScript, Java, Windows
Gördüğünüz karakterler10grafem kümeleri
Kod noktaları11Python'ın len() işlevinin saydığı
JavaScript uzunluğu13UTF-16 kod birimleri
Kelimeler ve satırlar3 · 1
SMS parçaları1UCS-2 · Parça başına 70 üzerinden 13

Bu karakterler GSM alfabesinin dışındadır; bu nedenle mesajın tamamı parça başına 70 karakterle UCS-2 olarak gönderilir: 👍 🏽 日 本 語

Emoji gibi 4 baytlık karakterler içerir: MySQL bunları depolamak için utf8mb4 karakter kümesine ihtiyaç duyar; eski utf8 (utf8mb3) kümesi bu karakterleri kabul etmez.

Bayt cinsinden ölçülen sınırlar

Birçok sınır karakterleri değil, baytları sayar: veritabanı sütunları ve dizin anahtarları, HTTP üst bilgileri ve çerezler (çerez başına yaklaşık 4 KB), dosya adları (çoğu dosya sisteminde 255 bayt) ve ödeme veya mesajlaşma API'leri. 255 İngilizce harfine sığan bir sınır yalnızca 85 Çince karakter veya 63 emoji içerebilir.

Sosyal medya gönderileri gibi karakterlerle sayılan sınırlar için karakter sayacını, bir dosyanın nasıl kodlandığını öğrenmek için metin kodlaması algılayıcısını kullanın.

SMS mesajlarını kısa tutma

Kıvrımlı tırnak işaretlerini ve kesme işaretlerini düz olanlarla, kısa çizgileri tirelerle değiştirin ve emoji kullanmaktan kaçının; böylece mesaj GSM alfabesinde kalır ve 70 yerine bölüm başına 160 karaktere sığar. Her ek bölüm genellikle ayrı bir mesaj olarak ücretlendirilir.

Nasıl kullanılır?

  1. Metni yazın veya yapıştırın.
  2. Bayt sayılarını, karakter sayılarını ve SMS bölümlerini okuyun.
  3. Metnin sığıp sığmadığını görmek için bir bayt sınırı girin ve güvenle kısaltılmış sürümü alın.

Gizlilik ve sınırlamalar

Metin tarayıcınızda ölçülür ve hiçbir zaman yüklenmez.

İlgili araçlar

Sık sorulan sorular

Veritabanım metnin çok uzun olduğunu neden söylüyor?

Sütun sınırları karakterler yerine baytları sayabilir: MySQL dizin ön ekleri ve birçok eski sistem bayt kullanır; bu nedenle UTF-8'de 255 Çince karakter 765 bayt gerektirir.

Tek bir emoji SMS'imi neden Unicode olarak gönderiyor?

Her karakter GSM'nin 7 bitlik alfabesindeyse SMS bu alfabeyi kullanır; emoji veya kıvrımlı tırnak işareti gibi tek bir karakter bile bunun dışındaysa mesajın tamamı UCS-2'ye geçer. Bu durumda bölüm başına 160 yerine 70 karakter sığar.

Uzun bir SMS hangi bölümlere ayrılır?

GSM'de 153 karakterlik, UCS-2'de 67 kod birimlik bölümlere ayrılır; çünkü her bölüm, telefonda birleştirilmelerini sağlayan bir başlık taşır. € ve [ ] gibi bazı karakterler GSM'de iki karakter sayılır.

Ücretsiz araç · tarayıcınızda kez çalıştırma · hesap gerekmez