Teks / Pengodean
Penghitung Byte (UTF-8, UTF-16, dan SMS)
Hitung byte teks dalam UTF-8 dan UTF-16, titik kode dan karakter yang terlihat, serta bagian SMS yang diperlukan. Potong teks hingga batas byte tanpa memecah karakter.
Penghitung Byte (UTF-8, UTF-16, dan SMS): Sistem yang berbeda mengukur panjang dengan cara yang berbeda. UTF-8, yang digunakan oleh halaman web dan sebagian besar database, menggunakan 1 byte untuk ASCII, 2 byte untuk sebagian besar huruf beraksen serta huruf Yunani atau Kiril, 3 byte untuk bahasa Tionghoa, Jepang, dan Korea, serta 4 byte untuk emoji. JavaScript menghitung unit kode UTF-16, Python menghitung titik kode, sedangkan manusia melihat klaster grafem. Jadi, emoji dengan warna kulit adalah satu karakter bagi pembaca, tetapi terdiri dari dua titik kode dan delapan byte UTF-8. Pesan SMS memuat 160 karakter dari alfabet GSM, atau 70 karakter jika ada karakter lain yang digunakan. Berjalan 100% lokal di browser Anda tanpa upload file ke server.
- Kategori
- Tools teks
- Dijalankan
- Di browser Anda
- Biaya
- Gratis · tanpa daftar
- Ketersediaan
- Siap digunakan
Berjalan sepenuhnya di browser Anda
Karakter ini berada di luar alfabet GSM, sehingga seluruh pesan dikirim sebagai UCS-2 dengan 70 karakter per bagian: 👍 🏽 日 本 語
Berisi karakter 4 byte seperti emoji: MySQL memerlukan set karakter utf8mb4 untuk menyimpannya; set utf8 (utf8mb3) yang lebih lama akan menolaknya.
Batas yang diukur dalam byte
Banyak batas menghitung byte, bukan karakter: kolom database dan kunci indeks, header dan cookie HTTP (sekitar 4 KB per cookie), nama file (255 byte di sebagian besar sistem file), serta API pembayaran atau pesan. Batas yang memuat 255 huruf bahasa Inggris mungkin hanya memuat 85 karakter Tionghoa atau 63 emoji.
Untuk batas yang dihitung dalam karakter, seperti postingan media sosial, gunakan penghitung karakter; untuk mengetahui encoding sebuah file, gunakan pendeteksi encoding teks.
Menjaga pesan SMS tetap singkat
Ganti tanda kutip dan apostrof melengkung dengan tanda lurus, tanda pisah dengan tanda hubung, dan hindari emoji agar pesan tetap menggunakan alfabet GSM dan memuat 160 karakter per bagian, bukan 70. Setiap bagian tambahan biasanya ditagihkan sebagai pesan terpisah.
Cara menggunakannya
- Ketik atau tempel teks.
- Lihat jumlah byte, jumlah karakter, dan bagian SMS.
- Masukkan batas byte untuk melihat apakah teks sesuai, lalu dapatkan versi yang dipotong dengan aman.
Privasi & batasan
Teks diukur di browser Anda dan tidak pernah di-upload.
Alat terkait
Pertanyaan umum
Mengapa database saya menyatakan teks terlalu panjang?
Batas kolom mungkin menghitung byte, bukan karakter: prefix indeks MySQL dan banyak sistem lama menggunakan byte, sehingga 255 karakter Tionghoa membutuhkan 765 byte dalam UTF-8.
Mengapa satu emoji membuat SMS saya dikirim sebagai Unicode?
SMS menggunakan alfabet GSM 7-bit jika setiap karakternya termasuk di dalamnya. Satu karakter di luar alfabet tersebut, seperti emoji atau tanda kutip melengkung, mengalihkan seluruh pesan ke UCS-2, yang memuat 70 karakter per bagian, bukan 160.
Menjadi apa SMS panjang dibagi?
SMS dibagi menjadi bagian yang masing-masing memuat 153 karakter GSM atau 67 unit UCS-2, karena setiap bagian membawa header untuk menyatukannya di ponsel. Beberapa karakter, seperti € dan [ ], dihitung dua kali dalam GSM.
Alat gratis · berjalan di browser anda · tanpa perlu akun