Pengembang / Token

Penghitung Token: Hitung Token untuk Model OpenAI

Hitung token dalam teks apa pun secara tepat seperti yang dilakukan model OpenAI, dengan tokenizer o200k_base yang digunakan GPT-4o dan versi lebih baru serta cl100k_base yang digunakan GPT-4 dan GPT-3.5 Turbo. Lihat juga jumlah karakter, kata, karakter per token, dan setiap token yang disorot—semuanya tanpa mengirimkan teks Anda ke mana pun.

Penghitung Token: Hitung Token untuk Model OpenAI: Teks dienkode di browser Anda menggunakan js-tiktoken dan kosakata byte-pair yang dipublikasikan OpenAI—kosakata yang sama dengan yang digunakan model—sehingga hasil hitungnya benar-benar sama: "tiktoken is great!" terdiri dari enam token dalam cl100k_base. Setiap token ditampilkan sebagai potongan berwarna, sehingga Anda dapat melihat bahwa kata umum biasanya menjadi satu token, sedangkan kata langka, angka, dan skrip lainnya dapat dipecah menjadi beberapa token. Berjalan 100% lokal di browser Anda tanpa upload file ke server.

Dijalankan
Di browser Anda
Biaya
Gratis · tanpa daftar
Ketersediaan
Siap digunakan
Penghitung tokenPemrosesan lokal

Berjalan sepenuhnya di browser Anda

Token…
Karakter0
Kata0
Karakter per token—

Jumlahnya akurat untuk model OpenAI yang menggunakan encoding ini, dihitung di browser Anda dengan js-tiktoken (MIT) dan kosakata yang dipublikasikan OpenAI; teks Anda tidak dikirim ke mana pun. Model dari perusahaan lain menggunakan tokenizer mereka sendiri, jadi anggap jumlah ini sebagai perkiraan: dalam bahasa Inggris, satu token sering kali terdiri dari sekitar empat karakter.

Token dan biaya

Harga model dihitung per satu juta token input dan output, jadi jumlah token membantu memperkirakan biaya permintaan; periksa daftar harga terbaru dari penyedia.

Patokan umum

Dalam bahasa Inggris, 100 token kira-kira setara dengan 75 kata, atau empat karakter per token; bahasa lain dan kode biasanya membutuhkan lebih banyak token per kata.

Cara menggunakannya

  1. Tempel prompt atau teks Anda.
  2. Pilih tokenizer untuk model Anda.
  3. Lihat jumlah token dan perhatikan bagaimana teks dipecah.

Privasi & batasan

Teks Anda ditokenisasi di browser dan tidak pernah di-upload.

Alat terkait

Pertanyaan umum

Apakah ini menghitung token untuk Claude, Gemini, atau Llama?

Tidak secara tepat: setiap perusahaan menggunakan tokenizer sendiri, sehingga jumlah token untuk model lain dapat berbeda cukup signifikan. Gunakan hasil hitung di sini sebagai perkiraan kasar untuk model-model tersebut.

Mengapa bahasa Mandarin atau Jepang menggunakan lebih banyak token?

Kosakata mempelajari potongan teks yang paling umum dari data pelatihannya. o200k_base memiliki lebih banyak potongan non-Inggris dibandingkan cl100k_base, sehingga teks Jepang yang sama biasanya membutuhkan lebih sedikit token saat menggunakan tokenizer tersebut.

Apakah spasi dan jeda baris ikut dihitung?

Ya. Spasi biasanya digabungkan dengan kata setelahnya, dan jeda baris juga merupakan token.

Alat gratis · berjalan di browser anda · tanpa perlu akun