跳到主内容
UniKit

Token 计数器

用 gpt-tokenizer 的 BPE 词表统计文本的 token 数,同时给出字符数、词数、行数、UTF-8 字节数、前 N 个 token 的分段预览,以及按单价估算的调用费用;空输入返回 0。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

文本

分词用的是 gpt-tokenizer 的默认词表(o200k_base,GPT-4o / 4.1 / GPT-5 / o 系列),中文与英文都按同一套 BPE 规则切分。

统计结果

Token 数15
字符数(码点)55
词数18
行数2
UTF-8 字节数85
估算费用$0.000038
不超过上限token 上限检查: 1000
token 分段预览
  • Uni
  • Kit
  • 是
  • 一个
  • 在线
  • 工具
  • 集合
  • ,
  • 永久免费
  • 。
  • Token
  • counting
  • is
  • deterministic
  • .

每个 token 用 · 分隔,空格与换行会原样显示;这就是模型实际看到的切分方式。

这个工具能做什么

  • 把提示词贴进来先量一下长度:上下文窗口是硬限制,超了会被截断,写代码前先确认 token 数比事后调参便宜。
  • 估算调用成本:选模型或手填单价,看这段输入大概多少钱,批量跑任务前心里有数。
  • 检查中文内容的 token 消耗:中文没有空格,凭字符数猜 token 很容易低估,这里直接给出真实切分。
  • 看模型到底怎么切词的:分段预览把每个 token 还原成文本,能解释「为什么一个英文单词算两个 token」或者「为什么这段 JSON 特别费」。

示例

输入

你好,世界

输出

Token 数 3 · 字符数(码点)5 · 词数 4 · 行数 1 · UTF-8 字节数 15 · 分段预览:你好 / , / 世界

分词用的是 gpt-tokenizer 的默认词表(o200k_base):常见的中文词组「你好」「世界」各自是一个 token,标点单独占一个,所以 5 个字符只用了 3 个 token。

常见问题

统计的是哪个模型的 token?

gpt-tokenizer 的默认词表 o200k_base,也就是 GPT-4o、GPT-4.1、GPT-5 与 o 系列用的那套,对这些模型的数字是精确的。Claude、Gemini、旧版 GPT-3.5(cl100k_base)用的是别的词表,数字只能当量级参考——同一段文本在不同词表下的 token 数本来就会差 10%–30%。

为什么英文一段话 token 数比词数少,中文却接近字符数?

BPE 词表按频率合并:常见英文单词整词就是一个 token,所以 100 个英文词大约 130 个 token 左右;中文常用词组也有合并(「你好」是一个 token),但粒度比英文碎,通常 1 个汉字约 0.5–1 个 token。所以中文内容按字符数估 token 会偏乐观,直接用这里的真实数字更稳。

估算的费用准吗?

公式是 token 数 ÷ 100 万 × 单价,只算输入 token,不含输出、缓存折扣与批处理优惠。默认单价是几个常见 OpenAI 模型的参考价,价格随时会变,请以官方定价页为准——输入框可以随便改,改成你实际付的价格即可。

文本特别长会怎样?

超过 50000 个字符时只统计前 50000 个字符,并在结果上方提示,不会静默给出一份错的整篇数字。需要精确统计超长文本时,请分段粘进来分别统计再相加。

文本会被上传吗?

不会。分词词表随页面一起加载,所有计算都在浏览器里完成,页面不发任何请求,刷新后输入内容也不会保留。

关键词:token counterllm tokensgpt tokenizerbpe tokensprompt costToken 计数Token 计数器大模型 Token提示词长度费用估算

同类工具