中文和英文的统计方式为什么不同
英文单词之间天然有空格分隔,只要按连续字母切分就能得到词,本工具允许单词中间带连字符和撇号,因此 e-mail、don't 会被当作一个词。中文没有词间空格,真正的分词需要词典和统计模型(如结巴分词使用的隐马尔可夫模型),在纯前端实现代价很高,所以本工具提供两种折中方案:按单字统计,适合观察用字偏好和字频分布;按双字词组统计,把每段连续汉字按两字一组滑动切分,因为现代汉语中双音节词占绝大多数,这种方式能捞出“统计”“分析”“关键”这类高频词。
双字滑窗的代价是会产生一些跨词边界的伪词,例如“文本分析”会同时切出“本分”。工具默认排除含停用字的组合以减少噪声,但仍需要人工判断。如果你需要准确的中文分词结果,建议使用 Python 的 jieba、HanLP 等专业工具,本页定位是快速查看用词倾向。
停用词、占比与常见用途
停用词指“的、了、是、在、和”以及 the、a、of、and 这类几乎在任何文本里都高频出现、却不携带主题信息的词。不排除它们的话,排行榜前十几乎全是虚词,看不出文章讲了什么。本工具内置一份精简的中英文停用词表,默认开启排除;如果你正在做语言学统计或需要完整字频,取消勾选即可。占比的分母是全部计入统计的词次总数,排除停用词后分母也会相应变小,所以两种模式下的百分比不能直接对比。
常见用途包括:内容运营检查核心关键词是否自然出现、密度是否合理,一般建议主关键词密度控制在 2% 到 5%,超过 8% 容易被搜索引擎判定为堆砌;写作时检查自己是否反复使用同一个词,从而替换近义表达;整理用户反馈、评论、问卷开放题,快速找出被反复提及的问题点。统计完全在浏览器本地完成,文本不会上传,可以放心处理内部文档。