跳到主内容
UniKit

文本统计

统计字符数(含/不含空格)、UTF-8 字节数、词数、中文字数、行数与段落数,找出最长行与最长词,并给出字符频率 Top 10 与预估阅读时间。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

统计结果

词数 = 拉丁词 + 汉字数(中文按字计词),字符数按 Unicode 码点计算。

输入文本后即可看到统计结果

这个工具能做什么

  • 交稿前核对字数:一次看到字符数(含/不含空格)、UTF-8 字节数、词数、中文字数、行数与段落数。
  • 写标题、摘要、产品描述时卡字数上限:中英文混排的稿子只看「词数」会算错,这里会把汉字按字计入。
  • 找出最长的一行和最长的词,顺手看看字符频率 Top 10,快速发现某个字是不是用得太滥。
  • 估算阅读时间,判断这篇稿子适合当 1 分钟速读还是需要预留更长时间。

示例

输入

UniKit 是在线工具箱。
所有计算都在浏览器里完成。

不上传任何数据。

输出

字符数(含空格):39
字符数(不含空格):35
字节数(UTF-8):97
词数:27
中文字数:26
行数:4
段落数:2
平均词长:1.19
最长行:UniKit 是在线工具箱。
最长词:UniKit
预估阅读时间:不足 1 分钟

词数 27 = 26 个汉字 + 1 个拉丁词(UniKit);行数是 4,因为中间的空行也算一行,段落数则是 2。

常见问题

词数为什么比想象中大这么多?

因为中文按字计词:每个汉字单独算一个「词」。所以一段 100 字的中文,词数至少是 100。这个规则是为了让中英文混排时的统计口径统一、结果可预期。

字符数和字节数为什么差很多?

字符数按 Unicode 码点计(emoji 记 1 个),字节数是 UTF-8 编码后的长度。一个汉字占 3 字节、emoji 通常占 4 字节,所以中文和表情越多,字节数越明显高于字符数。

行数和段落数是怎么算的?

行数按 \n、\r\n、\r 切分,所以中间的空行也计入;段落数按空行分隔,只有空白字符的段落不计入。上面的示例里 4 行分成 2 段就是这个原因。

标点和空格算进字符数吗?

「字符数(含空格)」算所有字符;「字符数(不含空格)」只去掉空白(空格、换行、制表符),标点仍然计入。字符频率 Top 10 则同时忽略空白和标点,并且不区分大小写。

文本会上传吗?

不会。统计全部在浏览器里完成,输入不会离开这台设备,断网也能用。

关键词:text statistics字符统计字数统计word countcharacter count字节数中文字数character frequency字符频率阅读时间

同类工具