Teks / Pengodean

Penghitung Byte (UTF-8, UTF-16, dan SMS)

Hitung byte teks dalam UTF-8 dan UTF-16, titik kode dan karakter yang terlihat, serta bagian SMS yang diperlukan. Potong teks hingga batas byte tanpa memecah karakter.

Penghitung Byte (UTF-8, UTF-16, dan SMS): Sistem yang berbeda mengukur panjang dengan cara yang berbeda. UTF-8, yang digunakan oleh halaman web dan sebagian besar database, menggunakan 1 byte untuk ASCII, 2 byte untuk sebagian besar huruf beraksen serta huruf Yunani atau Kiril, 3 byte untuk bahasa Tionghoa, Jepang, dan Korea, serta 4 byte untuk emoji. JavaScript menghitung unit kode UTF-16, Python menghitung titik kode, sedangkan manusia melihat klaster grafem. Jadi, emoji dengan warna kulit adalah satu karakter bagi pembaca, tetapi terdiri dari dua titik kode dan delapan byte UTF-8. Pesan SMS memuat 160 karakter dari alfabet GSM, atau 70 karakter jika ada karakter lain yang digunakan. Berjalan 100% lokal di browser Anda tanpa upload file ke server.

Kategori
Tools teks
Dijalankan
Di browser Anda
Biaya
Gratis · tanpa daftar
Ketersediaan
Siap digunakan
Penghitung bytePemrosesan lokal

Berjalan sepenuhnya di browser Anda

Byte UTF-824halaman web, file, sebagian besar database
Byte UTF-1626JavaScript, Java, Windows
Karakter yang terlihat10klaster grafem
Titik kode11yang dihitung oleh len() Python
Panjang JavaScript13Unit kode UTF-16
Kata dan baris3 · 1
Bagian SMS1UCS-2 · 13 dari 70 per bagian

Karakter ini berada di luar alfabet GSM, sehingga seluruh pesan dikirim sebagai UCS-2 dengan 70 karakter per bagian: 👍 🏽 日 本 語

Berisi karakter 4 byte seperti emoji: MySQL memerlukan set karakter utf8mb4 untuk menyimpannya; set utf8 (utf8mb3) yang lebih lama akan menolaknya.

Batas yang diukur dalam byte

Banyak batas menghitung byte, bukan karakter: kolom database dan kunci indeks, header dan cookie HTTP (sekitar 4 KB per cookie), nama file (255 byte di sebagian besar sistem file), serta API pembayaran atau pesan. Batas yang memuat 255 huruf bahasa Inggris mungkin hanya memuat 85 karakter Tionghoa atau 63 emoji.

Untuk batas yang dihitung dalam karakter, seperti postingan media sosial, gunakan penghitung karakter; untuk mengetahui encoding sebuah file, gunakan pendeteksi encoding teks.

Menjaga pesan SMS tetap singkat

Ganti tanda kutip dan apostrof melengkung dengan tanda lurus, tanda pisah dengan tanda hubung, dan hindari emoji agar pesan tetap menggunakan alfabet GSM dan memuat 160 karakter per bagian, bukan 70. Setiap bagian tambahan biasanya ditagihkan sebagai pesan terpisah.

Cara menggunakannya

  1. Ketik atau tempel teks.
  2. Lihat jumlah byte, jumlah karakter, dan bagian SMS.
  3. Masukkan batas byte untuk melihat apakah teks sesuai, lalu dapatkan versi yang dipotong dengan aman.

Privasi & batasan

Teks diukur di browser Anda dan tidak pernah di-upload.

Alat terkait

Pertanyaan umum

Mengapa database saya menyatakan teks terlalu panjang?

Batas kolom mungkin menghitung byte, bukan karakter: prefix indeks MySQL dan banyak sistem lama menggunakan byte, sehingga 255 karakter Tionghoa membutuhkan 765 byte dalam UTF-8.

Mengapa satu emoji membuat SMS saya dikirim sebagai Unicode?

SMS menggunakan alfabet GSM 7-bit jika setiap karakternya termasuk di dalamnya. Satu karakter di luar alfabet tersebut, seperti emoji atau tanda kutip melengkung, mengalihkan seluruh pesan ke UCS-2, yang memuat 70 karakter per bagian, bukan 160.

Menjadi apa SMS panjang dibagi?

SMS dibagi menjadi bagian yang masing-masing memuat 153 karakter GSM atau 67 unit UCS-2, karena setiap bagian membawa header untuk menyatukannya di ponsel. Beberapa karakter, seperti € dan [ ], dihitung dua kali dalam GSM.

Alat gratis · berjalan di browser anda · tanpa perlu akun