Metin / Kodlama
Bayt Sayacı (UTF-8, UTF-16 ve SMS)
Bir metnin UTF-8 ve UTF-16 baytlarını, kod noktalarını ve görünen karakterlerini, ayrıca gereken SMS bölümlerini sayın; karakterleri bozmadan bayt sınırına göre kısaltın.
Bayt Sayacı (UTF-8, UTF-16 ve SMS): Farklı sistemler uzunluğu farklı şekilde ölçer. Web sayfalarında ve çoğu veritabanında kullanılan UTF-8; ASCII için 1 bayt, çoğu aksanlı, Yunanca veya Kiril harfi için 2 bayt, Çince, Japonca ve Korece için 3 bayt, emojiler için 4 bayt kullanır. JavaScript UTF-16 kod birimlerini, Python kod noktalarını, insanlar ise grapheme kümelerini sayar. Bu nedenle ten rengi belirten bir emoji, okuyucu için tek karakter olsa da iki kod noktası ve UTF-8'de sekiz bayttır. SMS mesajları GSM alfabesindeki 160 karaktere veya başka herhangi bir karakter kullanılırsa 70 karaktere sığar. Sunucuya hiçbir dosya yüklenmeden tarayıcınızda %100 yerel olarak çalışır.
- Kategori
- Metin araçları
- Çalıştırma sayısı
- Tarayıcınızda
- Maliyet
- Ücretsiz · kayıt gerekmez
- Kullanılabilirlik
- Kullanıma hazır
Tamamen tarayıcınızda çalışır
Bu karakterler GSM alfabesinin dışındadır; bu nedenle mesajın tamamı parça başına 70 karakterle UCS-2 olarak gönderilir: 👍 🏽 日 本 語
Emoji gibi 4 baytlık karakterler içerir: MySQL bunları depolamak için utf8mb4 karakter kümesine ihtiyaç duyar; eski utf8 (utf8mb3) kümesi bu karakterleri kabul etmez.
Bayt cinsinden ölçülen sınırlar
Birçok sınır karakterleri değil, baytları sayar: veritabanı sütunları ve dizin anahtarları, HTTP üst bilgileri ve çerezler (çerez başına yaklaşık 4 KB), dosya adları (çoğu dosya sisteminde 255 bayt) ve ödeme veya mesajlaşma API'leri. 255 İngilizce harfine sığan bir sınır yalnızca 85 Çince karakter veya 63 emoji içerebilir.
Sosyal medya gönderileri gibi karakterlerle sayılan sınırlar için karakter sayacını, bir dosyanın nasıl kodlandığını öğrenmek için metin kodlaması algılayıcısını kullanın.
SMS mesajlarını kısa tutma
Kıvrımlı tırnak işaretlerini ve kesme işaretlerini düz olanlarla, kısa çizgileri tirelerle değiştirin ve emoji kullanmaktan kaçının; böylece mesaj GSM alfabesinde kalır ve 70 yerine bölüm başına 160 karaktere sığar. Her ek bölüm genellikle ayrı bir mesaj olarak ücretlendirilir.
Nasıl kullanılır?
- Metni yazın veya yapıştırın.
- Bayt sayılarını, karakter sayılarını ve SMS bölümlerini okuyun.
- Metnin sığıp sığmadığını görmek için bir bayt sınırı girin ve güvenle kısaltılmış sürümü alın.
Gizlilik ve sınırlamalar
Metin tarayıcınızda ölçülür ve hiçbir zaman yüklenmez.
İlgili araçlar
Sık sorulan sorular
Veritabanım metnin çok uzun olduğunu neden söylüyor?
Sütun sınırları karakterler yerine baytları sayabilir: MySQL dizin ön ekleri ve birçok eski sistem bayt kullanır; bu nedenle UTF-8'de 255 Çince karakter 765 bayt gerektirir.
Tek bir emoji SMS'imi neden Unicode olarak gönderiyor?
Her karakter GSM'nin 7 bitlik alfabesindeyse SMS bu alfabeyi kullanır; emoji veya kıvrımlı tırnak işareti gibi tek bir karakter bile bunun dışındaysa mesajın tamamı UCS-2'ye geçer. Bu durumda bölüm başına 160 yerine 70 karakter sığar.
Uzun bir SMS hangi bölümlere ayrılır?
GSM'de 153 karakterlik, UCS-2'de 67 kod birimlik bölümlere ayrılır; çünkü her bölüm, telefonda birleştirilmelerini sağlayan bir başlık taşır. € ve [ ] gibi bazı karakterler GSM'de iki karakter sayılır.
Ücretsiz araç · tarayıcınızda kez çalıştırma · hesap gerekmez