跳到主内容
UniKit

词云数据

把一段文本分词、去停用词、统计词频,导出「词,频次」CSV、频次排序表格与 1–100 的归一化权重,供词云可视化或设计工具直接使用;本工具只产出数据,不渲染图片。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

文本输入

要统计的文本

统计选项

过滤停用词内置中英停用词表(the / and / 的 / 了 等)
拉丁词统一小写

1 – 500

统计结果

本工具只产出数据:CSV、表格与归一化权重。词云图片请把数据交给可视化库或设计工具渲染。

粘贴文本后即可看到词频统计。

这个工具能做什么

  • 给词云可视化准备数据:粘贴评论或文章,导出「词,频次」CSV,直接丢进 ECharts、D3 或设计工具就能出图。
  • 快速看一篇文章的主题词:去掉 the / and / 的 / 了 这些停用词后,排在最前面的几个词通常就是文章重点。
  • 做中文文本统计时按 2-gram 切分,避免单字统计把「数据」「统计」这类词拆散,结果更接近人的阅读直觉。
  • 需要按权重调字号时用 1–100 的归一化权重:最高频词固定 100,其余按比例缩放,不用担心原始频次跨度太大。

示例

输入

The quick brown fox. The QUICK fox runs!(默认选项:最小长度 2、过滤停用词)

输出

CSV:word,count / fox,2 / quick,2 / brown,1 / runs,1;最高频次 2,权重 fox 与 quick 为 100,brown 与 runs 为 50

the 被内置英文停用词表过滤,QUICK 统一小写后与 quick 合并计数,标点当作分隔符处理。

常见问题

为什么只给数据,不直接画词云?

画图涉及字体、布局、颜色与导出格式,交给专门的图表库或设计工具效果更好。这里把最容易出错的部分——分词、去停用词、词频与权重——算准,并把结果导出成 CSV 和表格。

中文是怎么分词的?

不依赖第三方分词库:可以按单字切分,也可以按 2-gram(相邻两字滑窗)切分。2-gram 能把「词云数据」拆成「词云 / 云数 / 数据」,统计结果通常比单字更有意义。

停用词表可以改吗?

内置中英停用词表可以整体关闭,也可以在「额外停用词」里补充自己的词(用逗号分隔)。自定义词在开启小写选项时会一并转成小写,与拉丁词合并统计。

CSV 里的词会被转义吗?

会。含有逗号、引号或换行的词会按 CSV 规则用双引号包裹、内部引号翻倍,所以把文件导入 Excel 或 Google Sheets 不会串列。

文本会被上传吗?

不会。分词与统计全部在浏览器里完成,页面不发任何请求,刷新后结果即清空。

关键词:word cloudword frequencyword counterword cloud datacsv exportstopwords词云词频统计词云数据分词停用词中文分词

同类工具