首页文本与开发 › 词频统计工具

词频统计工具

粘贴文本,统计英文单词或中文单字、双字词组的出现次数和占比,可排除常见停用词,导出 Top N。

 

中文和英文的统计方式为什么不同

英文单词之间天然有空格分隔,只要按连续字母切分就能得到词,本工具允许单词中间带连字符和撇号,因此 e-mail、don't 会被当作一个词。中文没有词间空格,真正的分词需要词典和统计模型(如结巴分词使用的隐马尔可夫模型),在纯前端实现代价很高,所以本工具提供两种折中方案:按单字统计,适合观察用字偏好和字频分布;按双字词组统计,把每段连续汉字按两字一组滑动切分,因为现代汉语中双音节词占绝大多数,这种方式能捞出“统计”“分析”“关键”这类高频词。

双字滑窗的代价是会产生一些跨词边界的伪词,例如“文本分析”会同时切出“本分”。工具默认排除含停用字的组合以减少噪声,但仍需要人工判断。如果你需要准确的中文分词结果,建议使用 Python 的 jieba、HanLP 等专业工具,本页定位是快速查看用词倾向。

停用词、占比与常见用途

停用词指“的、了、是、在、和”以及 the、a、of、and 这类几乎在任何文本里都高频出现、却不携带主题信息的词。不排除它们的话,排行榜前十几乎全是虚词,看不出文章讲了什么。本工具内置一份精简的中英文停用词表,默认开启排除;如果你正在做语言学统计或需要完整字频,取消勾选即可。占比的分母是全部计入统计的词次总数,排除停用词后分母也会相应变小,所以两种模式下的百分比不能直接对比。

常见用途包括:内容运营检查核心关键词是否自然出现、密度是否合理,一般建议主关键词密度控制在 2% 到 5%,超过 8% 容易被搜索引擎判定为堆砌;写作时检查自己是否反复使用同一个词,从而替换近义表达;整理用户反馈、评论、问卷开放题,快速找出被反复提及的问题点。统计完全在浏览器本地完成,文本不会上传,可以放心处理内部文档。

常见问题

为什么中文统计出来的是单个字?

中文分词需要词典支持。请把统计方式切换为“中文双字词组”,工具会按两字滑窗切分,更接近词语的结果。

停用词表能自定义吗?

目前使用内置的精简表。若某个词干扰结果,可先用查找替换工具把它删掉再统计。

关键词密度多少合适?

一般建议核心关键词占比 2%–5%,标题和首段自然出现即可。刻意堆砌到 8% 以上反而有被降权的风险。

能统计多长的文本?

十万字以内通常一秒内完成。更大的语料建议使用 Python 等本地脚本处理。