Geliştirici / Tokenlar

Token Sayacı: OpenAI Modelleri için Token'ları Sayın

Herhangi bir metindeki token'ları OpenAI modellerinin yaptığı gibi tam olarak sayın. GPT-4o ve daha yeni modellerde kullanılan o200k_base tokenizer'ı ile GPT-4 ve GPT-3,5 Turbo'da kullanılan cl100k_base tokenizer'ını seçin; karakterleri, kelimeleri ve token başına karakter sayısını görün. Metniniz hiçbir yere gönderilmez.

Token Sayacı: OpenAI Modelleri için Token'ları Sayın: Metin, modellerin kullandığı aynı js-tiktoken kitaplığı ve OpenAI'nin yayımladığı byte-pair sözcük dağarcıklarıyla tarayıcınızda kodlanır. Böylece sayımlar tam olarak eşleşir: "tiktoken is great!" cl100k_base'de altı token'dır. Her token renkli bir parça olarak gösterilir; yaygın kelimelerin tek token, nadir kelimelerin, sayıların ve diğer yazı sistemlerinin ise birden fazla token olarak bölündüğünü görebilirsiniz. Sunucuya hiçbir dosya yüklenmeden tarayıcınızda %100 yerel olarak çalışır.

Çalıştırma sayısı
Tarayıcınızda
Maliyet
Ücretsiz · kayıt gerekmez
Kullanılabilirlik
Kullanıma hazır
Token sayacıYerel işleme

Tamamen tarayıcınızda çalışır

Token'lar…
Karakterler0
Kelimeler0
Token başına karakter—

Sayımlar, bu kodlamaları kullanan OpenAI modelleri için kesindir; js-tiktoken (MIT) ve OpenAI'nin yayımladığı kelime dağarcıkları kullanılarak tarayıcınızda hesaplanır ve metniniz hiçbir yere gönderilmez. Diğer şirketlerin modelleri kendi tokenizer'larını kullanır. Bu nedenle bu modeller için bu sayımları tahmini kabul edin: İngilizcede bir token genellikle yaklaşık dört karakterdir.

Token'lar ve maliyet

Model fiyatları, bir milyon giriş ve çıkış token'ı üzerinden belirlenir; bu nedenle token sayıları bir isteğin maliyetini tahmin etmenizi sağlar. Sağlayıcının güncel fiyat listesini kontrol edin.

Pratik kural

İngilizcede 100 token yaklaşık 75 kelimeye veya token başına dört karaktere karşılık gelir; diğer diller ve kodlar genellikle kelime başına daha fazla token gerektirir.

Nasıl kullanılır?

  1. Prompt'unuzu veya metninizi yapıştırın.
  2. Modeliniz için tokenizer'ı seçin.
  3. Token sayısını okuyun ve metnin nasıl bölündüğüne bakın.

Gizlilik ve sınırlamalar

Metniniz tarayıcınızda token'lara ayrılır ve hiçbir zaman yüklenmez.

İlgili araçlar

Sık sorulan sorular

Bu araç Claude, Gemini veya Llama için token'ları sayar mı?

Tam olarak saymaz: Her şirket kendi tokenizer'ını kullandığından diğer modellerin sayımları belirgin biçimde farklı olabilir. Buradaki sayımı onlar için yaklaşık bir tahmin olarak kullanın.

Çince veya Japonca neden daha fazla token kullanır?

Sözcük dağarcıkları, eğitim metinlerindeki en yaygın parçaları öğrenir. o200k_base, cl100k_base'e göre İngilizce dışı daha fazla parça içerir; bu nedenle aynı Japonca metin genellikle o200k_base ile daha az token kullanır.

Boşluklar ve satır sonları sayılır mı?

Evet. Bir boşluk genellikle kendisinden sonraki kelimeyle birleşir; satır sonları da token'dır.

Ücretsiz araç · tarayıcınızda kez çalıştırma · hesap gerekmez