Token 计数器
用 gpt-tokenizer 的 BPE 词表统计文本的 token 数,同时给出字符数、词数、行数、UTF-8 字节数、前 N 个 token 的分段预览,以及按单价估算的调用费用;空输入返回 0。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
文本
分词用的是 gpt-tokenizer 的默认词表(o200k_base,GPT-4o / 4.1 / GPT-5 / o 系列),中文与英文都按同一套 BPE 规则切分。
统计结果
155518285$0.000038- Uni
- Kit
- 是
- 一个
- 在线
- 工具
- 集合
- ,
- 永久免费
- 。
- Token
- counting
- is
- deterministic
- .
每个 token 用 · 分隔,空格与换行会原样显示;这就是模型实际看到的切分方式。
这个工具能做什么
- 把提示词贴进来先量一下长度:上下文窗口是硬限制,超了会被截断,写代码前先确认 token 数比事后调参便宜。
- 估算调用成本:选模型或手填单价,看这段输入大概多少钱,批量跑任务前心里有数。
- 检查中文内容的 token 消耗:中文没有空格,凭字符数猜 token 很容易低估,这里直接给出真实切分。
- 看模型到底怎么切词的:分段预览把每个 token 还原成文本,能解释「为什么一个英文单词算两个 token」或者「为什么这段 JSON 特别费」。
示例
输入
你好,世界
输出
Token 数 3 · 字符数(码点)5 · 词数 4 · 行数 1 · UTF-8 字节数 15 · 分段预览:你好 / , / 世界
分词用的是 gpt-tokenizer 的默认词表(o200k_base):常见的中文词组「你好」「世界」各自是一个 token,标点单独占一个,所以 5 个字符只用了 3 个 token。
常见问题
统计的是哪个模型的 token?
gpt-tokenizer 的默认词表 o200k_base,也就是 GPT-4o、GPT-4.1、GPT-5 与 o 系列用的那套,对这些模型的数字是精确的。Claude、Gemini、旧版 GPT-3.5(cl100k_base)用的是别的词表,数字只能当量级参考——同一段文本在不同词表下的 token 数本来就会差 10%–30%。
为什么英文一段话 token 数比词数少,中文却接近字符数?
BPE 词表按频率合并:常见英文单词整词就是一个 token,所以 100 个英文词大约 130 个 token 左右;中文常用词组也有合并(「你好」是一个 token),但粒度比英文碎,通常 1 个汉字约 0.5–1 个 token。所以中文内容按字符数估 token 会偏乐观,直接用这里的真实数字更稳。
估算的费用准吗?
公式是 token 数 ÷ 100 万 × 单价,只算输入 token,不含输出、缓存折扣与批处理优惠。默认单价是几个常见 OpenAI 模型的参考价,价格随时会变,请以官方定价页为准——输入框可以随便改,改成你实际付的价格即可。
文本特别长会怎样?
超过 50000 个字符时只统计前 50000 个字符,并在结果上方提示,不会静默给出一份错的整篇数字。需要精确统计超长文本时,请分段粘进来分别统计再相加。
文本会被上传吗?
不会。分词词表随页面一起加载,所有计算都在浏览器里完成,页面不发任何请求,刷新后输入内容也不会保留。
关键词:token counterllm tokensgpt tokenizerbpe tokensprompt costToken 计数Token 计数器大模型 Token提示词长度费用估算