教程 ·

词频分析怎么做?文本数据量化用 AI 一句话完成 — 分词/词云/政策文本/访谈分析全攻略

词频分析完整教程:用 AI 一句话完成中英文分词、词频统计、词云绘制、共现矩阵,覆盖政策文本、访谈内容、问卷开放题,并给出符合 APA 7th 格式的论文报告模板。

手上有政策文件、访谈记录、问卷开放题,但不知道怎么把文字变成数据?这篇教程教你用 AI 一句话完成中文分词、词频统计、词云生成和共现矩阵,60 秒得到可直接写进论文的量化结果。


文本数据为什么难量化?

在质性研究、政策研究、社会学和管理学论文里,大量原始数据以文本形式存在:

  • 政策文件:国家/地方政府发布的规划、意见、条例
  • 访谈记录:半结构化或深度访谈的逐字稿
  • 问卷开放题:"您对本服务还有什么建议?"
  • 新闻报道/社交媒体:媒体话语、公众舆论

这类数据的共同难点在于:文字无法直接进 SPSS 跑统计。传统做法是人工编码——耗时极长,且编码者之间的一致性(Kappa 系数)很难控制。

词频分析(Word Frequency Analysis) 是文本量化的第一步:先把文本切割成词,再统计每个词出现的频率,从高频词的分布中推断文本的主题重心。这是内容分析(Content Analysis)框架下最基础、最可重现的量化操作,在教育学、政策研究、管理学、公共卫生等领域大量应用。

ChatSRS 把从分词到报告的全套流程压进一条自然语言指令——无需安装 Python 环境,无需写 jieba/NLTK 代码。


词频分析的核心概念

理解三个概念,就能读懂所有输出结果。

1. 分词(Tokenization)

英文靠空格自然切词;中文没有空格,必须用分词工具(如 jieba、pkuseg、哈工大 LTP)将连续字符串切成词语单元:

原始句子:推进乡村振兴战略,促进农村一二三产业融合发展
分词结果:推进 / 乡村振兴 / 战略 / 促进 / 农村 / 一二三产业 / 融合 / 发展

分词质量直接决定后续统计的意义。ChatSRS 对政策、学术、医疗等领域加载了专有词典,避免"机器学习"被切成"机器 / 学 / 习"等错误。

2. 停用词(Stop Words)过滤

"的""了""是""在""和"等高频虚词对语义分析无意义,必须在词频统计前过滤。ChatSRS 内置了中英文停用词表,并支持自定义追加(如过滤特定机构名、无意义数字)。

3. 词频(Term Frequency,TF)与 TF-IDF

指标含义适用场景
原始词频(Count)词在全部文本中出现的绝对次数单文档/语料整体主题
相对词频(TF%)词频 / 总词数,控制文档长度多文档横向比较
TF-IDF词频 x 逆文档频率,越独特的词权重越高识别各文档的特色关键词

论文中最常报告的是原始词频 + 相对频率(%),部分研究加入 TF-IDF 以区分各组文本的差异词汇。


案例数据:2015—2025 年乡村振兴政策文本分析

研究背景

某管理学研究团队收集了 2015 年至 2025 年间国务院及农业农村部发布的 48 份政策文件,研究政策话语的演变轨迹及核心议题变迁。

数据结构

文件名                    发布年份   字数
乡村振兴战略规划2018.txt   2018       12400
中央一号文件2019.txt        2019       8600
...(共 48 个 txt 文件)

每个文件为一份政策文本,UTF-8 编码,纯文字(已去除页眉页脚)。

与博客 84(LCA 潜在类别分析)中处理量表数据的场景不同:本案例的原始数据是非结构化文本,分析目标是话语分布而非个体分类。


用 AI 一句话完成词频分析

chatsrs.com 上传文本文件(支持 .txt / .csv / .xlsx 中的文本列)后输入:

"对上传的 48 份政策文本进行词频分析:

  1. 中文分词(加载农业/政策专有词典,自定义停用词:请、将、已、各、其)
  2. 输出 Top 50 高频词表(词语、词频、累计频率%)
  3. 按年份分组,输出各年度 Top 20 词汇及词频热力图
  4. 绘制词云图(按词频加权字体大小,蓝色系配色)
  5. 输出 Top 30 词语的共现矩阵(窗口大小 = 5 个词)
  6. APA 格式文字描述,包含分词工具、停用词处理和词频统计说明"

60 秒后,ChatSRS 输出完整六部分结果,含三线表、热力图、词云图、共现矩阵和 APA 报告句式。


输出结果怎么读

输出 1:Top 50 高频词表

表 1  政策文本 Top 50 高频词(N = 48 份,总词数 = 412,680)

排名   词语         词频     相对频率(%)   累计频率(%)
 1     发展          8,342     2.02          2.02
 2     农村          7,218     1.75          3.77
 3     乡村          6,891     1.67          5.44
 4     建设          6,430     1.56          7.00
 5     振兴          5,972     1.45          8.45
 6     产业          5,644     1.37          9.82
 7     农业          5,201     1.26         11.08
 8     推进          4,889     1.18         12.26
 9     农民          4,677     1.13         13.39
10     土地          3,921     0.95         14.34
...
50     数字化         892      0.22         42.18

注:分词工具为 jieba 0.42.1(农业/政策扩充词典 v3.2);
   停用词采用哈工大停用词表(1,893 词)+ 自定义追加 5 词;
   总词数统计于去停用词后。

解读要点

  • Top 10 词语覆盖约 14.3% 的有效词汇,说明词汇集中度较高
  • "乡村""农村""农业""农民"四词同时高频,反映政策文本的"三农"导向
  • "数字化"出现在 Top 50,可进一步检验其在时间序列上的词频趋势(2015 年前几乎不出现,2020 年后快速上升)

输出 2:年度词频热力图

横轴为年份(2015—2025),纵轴为 Top 20 词语,颜色深浅反映标准化词频(TF%)。热力图由 ChatSRS 自动生成,直观呈现话语重心随时间的移动轨迹。

典型观察:

  • "生态""绿色"从 2018 年起显著深色,对应生态文明战略加速落地
  • "数字化""电商"自 2020 年起骤然升温,与乡村数字经济政策相呼应

输出 3:词云图

词云图以词频为权重调整字体大小,蓝色系渐变配色(与论文图表的灰度兼容)。ChatSRS 输出的词云图默认为 1200×800 像素 PNG,分辨率满足期刊投稿要求。

注意:词云图在论文中通常作为附录或补充图,正文以三线表(词频表)为主,审稿人看的是数字,不是图形。

输出 4:共现矩阵(Top 30 词语)

共现矩阵(Co-occurrence Matrix)反映两个词在同一窗口(本例窗口大小 = 5)内同时出现的次数,是后续主题网络分析的基础:

         发展    农村    乡村    建设    振兴
发展       —     2,341   1,892   2,108   1,654
农村     2,341     —     3,421   1,876   2,230
乡村     1,892   3,421     —     1,543   2,891
建设     2,108   1,876   1,543     —     1,287
振兴     1,654   2,230   2,891   1,287     —

注:矩阵对称,对角线为词与自身共现(无意义,置为 —)。

"乡村"与"农村"共现次数最高(3,421),说明两词在政策文本中几乎可互换使用,需在编码手册中统一处理。


常见文本分析场景的指令示例

场景 A:访谈内容分析

上传访谈逐字稿(支持合并多人稿为单一 txt),输入:

"对 12 名受访者的访谈逐字稿进行词频分析,输出 Top 30 高频名词和动词(分词时保留专有名词),并按受访者职业分组对比词频差异(卡方检验检验词频组间差异显著性)。"

场景 B:问卷开放题

上传 Excel(开放题在 B 列,共 320 行),输入:

"对 B 列的 320 条开放题回答做词频分析,过滤单字词,输出 Top 20 高频词三线表,并识别出现频率超过 10% 的主题词作为后续编码类目建议。"

场景 C:中英文混合文本

上传英文学术摘要数据集,输入:

"对 200 篇英文摘要做词频分析,保留名词、动词、形容词(POS tagging 过滤),输出 Top 40 词汇并生成词云,同时计算 TF-IDF 识别最具区分度的前 20 词。"


论文里怎么报告(APA 7th 格式)

APA 7th 对内容分析/词频分析的方法节有专项要求:必须报告分词工具、停用词处理方式、统计单元定义,以及编码信度(若有人工编码环节)。

方法节写法

本研究采用词频分析对 48 份政策文本进行量化处理。使用 jieba(v0.42.1)分词库完成中文分词,并加载农业政策专有词典(扩充词条 1,240 条)以提升分词准确性。停用词处理采用哈工大通用停用词表(1,893 词)并追加领域定制停用词 5 词,最终有效词语总量为 412,680 词次。以词频(TF)和相对频率(TF%)为核心指标,按年份分组输出各时期 Top 20 高频词,并构建 Top 30 词语的共现矩阵(窗口大小 = 5)用于后续社会网络分析。所有文本分析通过 ChatSRS 平台(chatsrs.com)实现,底层引擎为 R 4.4 + tidytext 包。

结果节写法(词频部分)

词频分析结果显示,在全部 48 份政策文本去除停用词后的 412,680 词次中,高频词高度集中于"三农"核心词汇。"发展"(TF = 8,342,TF% = 2.02%)、"农村"(TF = 7,218,TF% = 1.75%)和"乡村"(TF = 6,891,TF% = 1.67%)位居前三,Top 10 词语合计占全部有效词汇的 14.34%(见表 1)。

按年度分组的词频热力图显示,"生态""绿色"两词的相对频率自 2018 年起显著上升(2015 年 TF% = 0.38%,2023 年 TF% = 1.12%),"数字化"一词在 2020 年前后进入 Top 20 并持续攀升(2015 年未入前 100,2025 年 TF% = 0.54%),反映政策话语的生态转型与数字化导向趋势。

APA 句式模板(可抄进论文)

方法节标准句式:

本研究采用词频分析(Word Frequency Analysis)方法对 [N] 份 [文本类型] 进行量化处理。
分词工具为 [工具名+版本],停用词表采用 [停用词表名称](共 [X] 词),
去除停用词后有效词次共 [N] 词次。
以 Top [N] 高频词的词频(TF)及相对频率(TF%)为主要分析指标
[视情况追加]:并构建共现矩阵(窗口大小 = [X])以识别词语关联结构。

结果节高频词报告句式:

词频分析结果显示,[词语](TF = [X],TF% = [X]%)、[词语](TF = [X],TF% = [X]%)
和 [词语](TF = [X],TF% = [X]%)位居词频前三,
Top [N] 词语合计覆盖全部有效词汇的 [X]%(见表 [N])。

时间趋势句式:

按 [分组变量] 的分组词频分析显示,"[词语]"的相对频率
自 [时间点 A](TF% = [X]%)至 [时间点 B](TF% = [X]%)呈 [上升/下降] 趋势,
反映 [研究结论]。

APA 报告细节提醒

  • 词频(TF)报告绝对值时写整数,相对频率(TF%)保留两位小数
  • 软件/工具引用格式:jieba 分词(Sun, Z. (2020). jieba [Software]. GitHub. https://github.com/fxsjy/jieba);或在方法节脚注注明版本号(如 v0.42.1)
  • 词云图在 APA 中无固定引用格式,建议在图注中注明"字体大小与词频成比例"
  • 如有人工编码环节,必须报告编码者间信度(Cohen's kappa >= .70 为可接受,>= .80 为良好)

FAQ

Q1:词频分析算"量化"还是"质性"?在论文方法论框架里怎么定位?

A:词频分析是量化内容分析(Quantitative Content Analysis),属于混合研究方法中"质性数据量化"的典型路径。它以文本为原始数据,但输出的是可统计的数字(频率、矩阵),因此可以跟 SPSS/R 的推断统计结合使用(如比较不同组文本的词频差异是否显著)。在方法论章节,建议明确写"采用定量内容分析法(Quantitative Content Analysis),以词频为主要量化指标",避免被审稿人归为纯质性研究而质疑其规范性。

Q2:分词错误怎么处理?"机器学习"被切成"机器/学/习"怎么办?

A:专有术语被切碎是中文分词最常见的问题。解决方案有三层:(1) 使用领域词典——ChatSRS 针对学术、政策、医疗等领域预置了专有词典,覆盖绝大多数常见术语;(2) 自定义词典——在指令中追加"加载自定义词典:机器学习、深度学习、强化学习";(3) 人工校验样本——从结果中随机抽取 100 条词语,人工核查分词准确率,若准确率 < 90% 则需扩充词典。ChatSRS 会在词频表中标注低置信度词条供人工复核。

Q3:政策文本分析和访谈分析在操作上有什么区别?

A:核心流程相同,但有三处差异需要注意:(1) 统计单元:政策文本通常以"篇"为单元做文档级分析;访谈分析通常以"段落"或"句子"为单元做语句级分析,颗粒度更细;(2) 停用词:政策文本需过滤"指出""强调""提出"等官方套话;访谈文本需过滤"就是""然后""那个"等口语填充词,两类停用词表不完全相同;(3) 信度报告:访谈内容分析若涉及编码(如把词语归入主题类目),必须报告编码者间信度(Kappa),政策文本纯词频分析通常不需要。

Q4:词频分析的结果能直接作为推断统计的输入变量吗?

A:可以,有两种常见路径:(1) 词频矩阵 + 聚类/主题模型:把每篇文档的词频向量构成文档-词语矩阵(DTM),再用 K-means 聚类或 LDA 主题模型识别文档簇和潜在主题(ChatSRS 支持一句话完成 LDA);(2) 特定词频作为变量进入回归:例如统计每份政策文本中"创新"一词的出现频率作为"创新导向"的代理变量,再与政策落地效果做回归分析。无论哪种路径,在 ChatSRS 中只需在词频分析后追加"输出文档-词语矩阵 CSV,用于后续 LDA 分析"即可直接对接。

Q5:词频分析怎么报告效应量?有没有类似 Cohen d 的标准?

A:词频分析本身是描述性统计,没有直接对应的效应量指标。但在以下场景需要报告统计量:(1) 两组文本词频比较(如政策文本 A vs B 中某词的词频差异):用卡方检验,报告 Cramer's V(小效应 V = .10,中效应 V = .30,大效应 V = .50,Cohen, 1988;以上阈值源自效应量 w,仅在 2×2 列联表即 df_min = 1 时与 Cramer's V 等价;多行多列列联表需按自由度调整阈值);(2) 词语共现强度:报告 PMI(点互信息,Pointwise Mutual Information),正值表示正向关联,负值表示排斥;(3) TF-IDF 分布比较:可计算 Kullback-Leibler 散度(KL 散度)衡量两组文本话语分布的差异程度。ChatSRS 在比较分析指令中自动附带上述统计量,无需手动计算。


小结

词频分析是把非结构化文本转化为可量化数据的关键桥梁:

  1. 分词质量是基础:领域专有词典 + 停用词过滤,决定后续统计的信度
  2. 报告相对频率而非仅绝对词频:TF% 允许不同长度的文本横向比较
  3. 共现矩阵是进阶起点:为主题网络分析、LDA 主题模型提供输入
  4. APA 报告有固定要素:分词工具+版本、停用词来源、统计单元缺一不可
  5. 效应量看场景:组间词频比较用 Cramer's V,共现强度用 PMI

chatsrs.com 用一句自然语言指令,即可获得:

  • 专业分词(中英文双引擎,支持领域词典)
  • Top N 词频三线表(含 TF、TF%、累计频率)
  • 词云图(1200x800 PNG,直接插入论文附录)
  • 词语共现矩阵 + 热力图
  • 可直接复制进论文的 APA 7th 格式文字描述

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。