教程中心/文本统计
Aa

文本统计怎么读:字符、结构、阅读时间与批量分析指南

从实时字数统计开始,进一步查看字符占比、高频词、自定义正则规则,并批量比较多个文本文件。

打开文本统计 返回全部教程
01
QUICK START

先用起来:四步完成

  1. 1

    粘贴文本,或导入一个不超过 5MB 的常见文本文件。

  2. 2

    先看总字符数、去除空白后的字符数、内容分类、结构与 UTF-8 字节。

  3. 3

    按需要切换“字符占比”“高频词”或“自定义规则”继续分析。

  4. 4

    需要比较多份文件时,使用“批量处理”,一次最多分析 20 个文件。

02
UNDERSTAND

字符、单词、行和段落分别怎样统计

总字符数按 Unicode 字符统计,空格、换行、标点和 emoji 也会计入;“不含空白”会排除空格与换行。中文字符、英文字母、英文单词、数字、标点和其他符号则按各自规则分别归类。

行数按换行符划分,段落数按空行分隔,句子数依据中英文句号、问号、感叹号和分号估算。不同编辑器或平台采用的口径可能不同,因此结果不一定与办公软件完全一致。

  • UTF-8 字节数反映文本编码后的数据大小,不等于屏幕上看到的字符数。
  • 平均字节/字符可帮助判断内容里中文、英文和多字节符号的大致比例。
  • 默读与朗读时间是按常见速度估算,用于内容规划,不是个人阅读能力测评。
03
UNDERSTAND

怎样使用字符占比和高频词

“字符占比”把中文、英文字母、数字、标点、空白和其他符号放在同一条比例条中,适合快速检查数字过多、空白异常或符号混杂等问题。

“高频词”可以在中文字符和英文单词之间切换,并设置显示前 1 到 50 项。英文单词会统一按小写统计;中文当前按单字统计,不会自动进行中文分词。

04
UNDERSTAND

自定义规则适合检查什么

“自定义规则”使用正则表达式统计匹配次数,可以检查话题标签、邮箱、链接、编号或团队约定的格式。每次最多添加 8 条规则,错误表达式会直接提示。

正则表达式按全局 Unicode 模式执行。来自他人的复杂表达式应先在少量非敏感文本上验证,避免把错误匹配当成真实结论。

  • 话题标签示例:#[^\s#]+
  • 简单编号示例:TASK-\d+
  • 需要更严格的邮箱、网址或业务格式时,应根据真实规则调整,而不是照搬通用示例。
05
UNDERSTAND

文件导入、批量处理与隐私

单文件导入支持 TXT、Markdown、CSV、日志及常见代码和标记文本,每个文件不超过 5MB。批量处理一次最多读取 20 个文件,并汇总字符、中文、英文词、行数和字节。

文件内容只在当前浏览器中读取,不会因为使用文本统计而上传到网站服务器。页面刷新或关闭后,未另行保存的输入和结果不会由工具替你保留。

06
FAQ

常见问题

为什么字符数和“字数”不一样?

“字符”包含字母、数字、标点、空白和 emoji;不同软件对中文“字数”、英文单词和空白的定义不同,应先确认比较口径。

为什么中文高频词只显示单个汉字?

当前中文版高频统计按单个中文字符计算,不进行自动分词;需要统计词组时,可以在自定义规则中写出对应表达式。

导入的文本文件会上传吗?

不会。单文件和批量分析都在浏览器本地进行;仍建议只在可信设备上处理敏感内容。

现在你已经知道怎么用了

打开工具,边做边看。

教程不会替你保存任何输入内容,具体数据仍按工具页面标注的方式处理。

开始使用