关键词密度分析
统计文本的词频与关键词密度,中英文分别按 2 字滑动窗口与字母数字分词,支持自定义停用词、Top N 与 CSV 导出。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
分析选项
概览
输入文本后即可看到词频与密度统计
关键词密度
0 条
文本长度不足或全部是停用词,没有可统计的关键词。
这个工具能做什么
- 检查一篇文案的关键词是否堆得过密:Top N 列表给出每个词的出现次数和占比,一眼看出哪个词刷得太多。
- 中文没有空格,这里用 2 字滑动窗口切词(bigram),不需要分词词典也能统计出「工具」「数据」这类高频双字词。
- 中英混排时两边各自处理:英文和数字按连续字母数字段切词(允许 don't 这种内部撇号),中文按窗口切分,互不干扰。
- 过滤无意义的高频虚词:内置停用词表覆盖英文虚词和常见中文双字虚词,还可以补自己的停用词(品牌名、产品名等),Top N 和 CSV 导出方便交给别人复核。
示例
输入
UniKit runs locally. UniKit never uploads your data.
输出
总词数:8 唯一词数:6 unikit 2 次 25.00% data 1 次 12.50% locally 1 次 12.50% never 1 次 12.50% runs 1 次 12.50% uploads 1 次 12.50%
大小写默认忽略,所以两句里的 UniKit 合并成 1 个词;密度分母是切分出的全部词元(含停用词),所以 it / is 这类词会占掉分母但不出现在结果里。
常见问题
中文为什么会出现「具站」「的工」这种不是词的组合?
中文用的是 2 字滑动窗口(bigram),不做词典分词,所以「工具站」会被切成「工具」「具站」,「站的工具」会切成「站的」「的工」「工具」。这是无词典方案的固有代价,好处是任何中文文本都能统计。把窗口长度改成 3 或 4 会得到更长的片段,但噪声同样存在。
密度是怎么算的?
密度 = 该词出现次数 ÷ 全部词元数 × 100%,保留两位小数。注意分母包含被停用词过滤掉的词,所以 Top N 的密度之和不会等于 100%。
停用词会影响哪些数字?
停用词只从关键词列表里剔除,不会从总词数里扣除。所以「总词数」始终是切分出的原始词元数,改停用词只会改变唯一词数和 Top N 列表。
关键词密度多少算合适?
这个工具不替你定标准。搜索引擎早已不靠密度排名,所谓「2%–8%」只是经验值。实际用法是看有没有明显的异常堆积(单个词占比高得离谱),以及高频词是不是你想强调的主题词。
文本会被上传吗?
不会。分词、统计和 CSV 导出都在浏览器本地完成,不发网络请求,断网可用。
关键词:keyword density关键词密度词频word frequencyseo停用词分词top n密度分析