开发者 / 令牌
Token计数器:统计OpenAI模型的Token数量
按照OpenAI模型的处理方式,精确统计任意文本中的Token数量。支持GPT-4o及更新模型使用的o200k_base分词器,以及GPT-4和GPT-3.5 Turbo使用的cl100k_base分词器,同时显示字符数、单词数和每个Token对应的字符数,并突出显示每个Token,整个过程不会将文本发送到任何地方。
Token计数器:统计OpenAI模型的Token数量: 工具会在你的浏览器中使用js-tiktoken和OpenAI公开的字节对词表对文本进行编码,这些词表与模型使用的相同,因此统计结果完全一致:"tiktoken is great!"在cl100k_base中是六个Token。每个Token都会以彩色片段显示,让你看到常见词通常是一个Token,而生僻词、数字和其他文字系统的文本会拆分成多个Token。 完全在浏览器中本地运行,文件不会上传到服务器。
- 类别
- 开发者工具
- 使用次数
- 在浏览器中
- 费用
- 免费·无需注册
- 可用性
- 可直接使用
完全在浏览器中运行
对于使用这些编码的OpenAI模型,统计结果是准确的;结果由浏览器中的js-tiktoken(MIT)根据OpenAI发布的词汇表计算得出,你的文本不会发送到任何地方。其他公司的模型使用各自的分词器,因此这些统计结果仅供参考:在英语中,一个词元通常约包含四个字符。
词元与成本
模型价格按每百万个输入和输出词元计算,因此词元数量可以帮助你估算请求成本;请查看服务提供商当前的价格表。
经验法则
在英语中,100个词元约等于75个单词,或每个词元包含4个字符;其他语言和代码通常每个单词需要更多词元。
使用方法
- 粘贴提示词或文本。
- 选择模型使用的分词器。
- 查看Token数量,并了解文本是如何拆分的。
隐私与限制
你的文本会在浏览器中进行Token切分,绝不会上传。
相关工具
常见问题
这个工具能统计Claude、Gemini或Llama的Token吗?
不能完全准确:每家公司使用自己的分词器,因此其他模型的统计结果可能有明显差异。对于这些模型,请将此处的数量作为粗略估计。
为什么中文或日文会使用更多Token?
词表会学习训练文本中最常见的片段。o200k_base包含的非英语片段比cl100k_base更多,因此相同的日文文本通常使用它时所需的Token更少。
空格和换行也算Token吗?
算。空格通常会与后面的单词合并,换行也属于Token。
免费工具·使用在浏览器中次·无需账户