跳到主内容
UniKit

关键词密度分析

统计文本的词频与关键词密度,中英文分别按 2 字滑动窗口与字母数字分词,支持自定义停用词、Top N 与 CSV 导出。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

分析选项

概览

输入文本后即可看到词频与密度统计

关键词密度

0 条

文本长度不足或全部是停用词,没有可统计的关键词。

这个工具能做什么

  • 检查一篇文案的关键词是否堆得过密:Top N 列表给出每个词的出现次数和占比,一眼看出哪个词刷得太多。
  • 中文没有空格,这里用 2 字滑动窗口切词(bigram),不需要分词词典也能统计出「工具」「数据」这类高频双字词。
  • 中英混排时两边各自处理:英文和数字按连续字母数字段切词(允许 don't 这种内部撇号),中文按窗口切分,互不干扰。
  • 过滤无意义的高频虚词:内置停用词表覆盖英文虚词和常见中文双字虚词,还可以补自己的停用词(品牌名、产品名等),Top N 和 CSV 导出方便交给别人复核。

示例

输入

UniKit runs locally. UniKit never uploads your data.

输出

总词数:8
唯一词数:6

unikit   2 次  25.00%
data     1 次  12.50%
locally  1 次  12.50%
never    1 次  12.50%
runs     1 次  12.50%
uploads  1 次  12.50%

大小写默认忽略,所以两句里的 UniKit 合并成 1 个词;密度分母是切分出的全部词元(含停用词),所以 it / is 这类词会占掉分母但不出现在结果里。

常见问题

中文为什么会出现「具站」「的工」这种不是词的组合?

中文用的是 2 字滑动窗口(bigram),不做词典分词,所以「工具站」会被切成「工具」「具站」,「站的工具」会切成「站的」「的工」「工具」。这是无词典方案的固有代价,好处是任何中文文本都能统计。把窗口长度改成 3 或 4 会得到更长的片段,但噪声同样存在。

密度是怎么算的?

密度 = 该词出现次数 ÷ 全部词元数 × 100%,保留两位小数。注意分母包含被停用词过滤掉的词,所以 Top N 的密度之和不会等于 100%。

停用词会影响哪些数字?

停用词只从关键词列表里剔除,不会从总词数里扣除。所以「总词数」始终是切分出的原始词元数,改停用词只会改变唯一词数和 Top N 列表。

关键词密度多少算合适?

这个工具不替你定标准。搜索引擎早已不靠密度排名,所谓「2%–8%」只是经验值。实际用法是看有没有明显的异常堆积(单个词占比高得离谱),以及高频词是不是你想强调的主题词。

文本会被上传吗?

不会。分词、统计和 CSV 导出都在浏览器本地完成,不发网络请求,断网可用。

关键词:keyword density关键词密度词频word frequencyseo停用词分词top n密度分析

同类工具