开发者 / 令牌

Token计数器:统计OpenAI模型的Token数量

按照OpenAI模型的处理方式,精确统计任意文本中的Token数量。支持GPT-4o及更新模型使用的o200k_base分词器,以及GPT-4和GPT-3.5 Turbo使用的cl100k_base分词器,同时显示字符数、单词数和每个Token对应的字符数,并突出显示每个Token,整个过程不会将文本发送到任何地方。

Token计数器:统计OpenAI模型的Token数量: 工具会在你的浏览器中使用js-tiktoken和OpenAI公开的字节对词表对文本进行编码,这些词表与模型使用的相同,因此统计结果完全一致:"tiktoken is great!"在cl100k_base中是六个Token。每个Token都会以彩色片段显示,让你看到常见词通常是一个Token,而生僻词、数字和其他文字系统的文本会拆分成多个Token。 完全在浏览器中本地运行,文件不会上传到服务器。

使用次数
在浏览器中
费用
免费·无需注册
可用性
可直接使用
词元计数器本地处理

完全在浏览器中运行

词元…
字符0
单词0
每个词元的字符数—

对于使用这些编码的OpenAI模型,统计结果是准确的;结果由浏览器中的js-tiktoken(MIT)根据OpenAI发布的词汇表计算得出,你的文本不会发送到任何地方。其他公司的模型使用各自的分词器,因此这些统计结果仅供参考:在英语中,一个词元通常约包含四个字符。

词元与成本

模型价格按每百万个输入和输出词元计算,因此词元数量可以帮助你估算请求成本;请查看服务提供商当前的价格表。

经验法则

在英语中,100个词元约等于75个单词,或每个词元包含4个字符;其他语言和代码通常每个单词需要更多词元。

使用方法

  1. 粘贴提示词或文本。
  2. 选择模型使用的分词器。
  3. 查看Token数量,并了解文本是如何拆分的。

隐私与限制

你的文本会在浏览器中进行Token切分,绝不会上传。

相关工具

常见问题

这个工具能统计Claude、Gemini或Llama的Token吗?

不能完全准确:每家公司使用自己的分词器,因此其他模型的统计结果可能有明显差异。对于这些模型,请将此处的数量作为粗略估计。

为什么中文或日文会使用更多Token?

词表会学习训练文本中最常见的片段。o200k_base包含的非英语片段比cl100k_base更多,因此相同的日文文本通常使用它时所需的Token更少。

空格和换行也算Token吗?

算。空格通常会与后面的单词合并,换行也属于Token。

免费工具·使用在浏览器中次·无需账户