教程 ·
词频分析怎么做?文本数据量化用 AI 一句话完成 — 分词/词云/政策文本/访谈分析全攻略
词频分析完整教程:用 AI 一句话完成中英文分词、词频统计、词云绘制、共现矩阵,覆盖政策文本、访谈内容、问卷开放题,并给出符合 APA 7th 格式的论文报告模板。
手上有政策文件、访谈记录、问卷开放题,但不知道怎么把文字变成数据?这篇教程教你用 AI 一句话完成中文分词、词频统计、词云生成和共现矩阵,60 秒得到可直接写进论文的量化结果。
文本数据为什么难量化?
在质性研究、政策研究、社会学和管理学论文里,大量原始数据以文本形式存在:
- 政策文件:国家/地方政府发布的规划、意见、条例
- 访谈记录:半结构化或深度访谈的逐字稿
- 问卷开放题:"您对本服务还有什么建议?"
- 新闻报道/社交媒体:媒体话语、公众舆论
这类数据的共同难点在于:文字无法直接进 SPSS 跑统计。传统做法是人工编码——耗时极长,且编码者之间的一致性(Kappa 系数)很难控制。
词频分析(Word Frequency Analysis) 是文本量化的第一步:先把文本切割成词,再统计每个词出现的频率,从高频词的分布中推断文本的主题重心。这是内容分析(Content Analysis)框架下最基础、最可重现的量化操作,在教育学、政策研究、管理学、公共卫生等领域大量应用。
ChatSRS 把从分词到报告的全套流程压进一条自然语言指令——无需安装 Python 环境,无需写 jieba/NLTK 代码。
词频分析的核心概念
理解三个概念,就能读懂所有输出结果。
1. 分词(Tokenization)
英文靠空格自然切词;中文没有空格,必须用分词工具(如 jieba、pkuseg、哈工大 LTP)将连续字符串切成词语单元:
原始句子:推进乡村振兴战略,促进农村一二三产业融合发展
分词结果:推进 / 乡村振兴 / 战略 / 促进 / 农村 / 一二三产业 / 融合 / 发展
分词质量直接决定后续统计的意义。ChatSRS 对政策、学术、医疗等领域加载了专有词典,避免"机器学习"被切成"机器 / 学 / 习"等错误。
2. 停用词(Stop Words)过滤
"的""了""是""在""和"等高频虚词对语义分析无意义,必须在词频统计前过滤。ChatSRS 内置了中英文停用词表,并支持自定义追加(如过滤特定机构名、无意义数字)。
3. 词频(Term Frequency,TF)与 TF-IDF
| 指标 | 含义 | 适用场景 |
|---|---|---|
| 原始词频(Count) | 词在全部文本中出现的绝对次数 | 单文档/语料整体主题 |
| 相对词频(TF%) | 词频 / 总词数,控制文档长度 | 多文档横向比较 |
| TF-IDF | 词频 x 逆文档频率,越独特的词权重越高 | 识别各文档的特色关键词 |
论文中最常报告的是原始词频 + 相对频率(%),部分研究加入 TF-IDF 以区分各组文本的差异词汇。
案例数据:2015—2025 年乡村振兴政策文本分析
研究背景
某管理学研究团队收集了 2015 年至 2025 年间国务院及农业农村部发布的 48 份政策文件,研究政策话语的演变轨迹及核心议题变迁。
数据结构
文件名 发布年份 字数
乡村振兴战略规划2018.txt 2018 12400
中央一号文件2019.txt 2019 8600
...(共 48 个 txt 文件)
每个文件为一份政策文本,UTF-8 编码,纯文字(已去除页眉页脚)。
与博客 84(LCA 潜在类别分析)中处理量表数据的场景不同:本案例的原始数据是非结构化文本,分析目标是话语分布而非个体分类。
用 AI 一句话完成词频分析
在 chatsrs.com 上传文本文件(支持 .txt / .csv / .xlsx 中的文本列)后输入:
"对上传的 48 份政策文本进行词频分析:
- 中文分词(加载农业/政策专有词典,自定义停用词:请、将、已、各、其)
- 输出 Top 50 高频词表(词语、词频、累计频率%)
- 按年份分组,输出各年度 Top 20 词汇及词频热力图
- 绘制词云图(按词频加权字体大小,蓝色系配色)
- 输出 Top 30 词语的共现矩阵(窗口大小 = 5 个词)
- APA 格式文字描述,包含分词工具、停用词处理和词频统计说明"
60 秒后,ChatSRS 输出完整六部分结果,含三线表、热力图、词云图、共现矩阵和 APA 报告句式。
输出结果怎么读
输出 1:Top 50 高频词表
表 1 政策文本 Top 50 高频词(N = 48 份,总词数 = 412,680)
排名 词语 词频 相对频率(%) 累计频率(%)
1 发展 8,342 2.02 2.02
2 农村 7,218 1.75 3.77
3 乡村 6,891 1.67 5.44
4 建设 6,430 1.56 7.00
5 振兴 5,972 1.45 8.45
6 产业 5,644 1.37 9.82
7 农业 5,201 1.26 11.08
8 推进 4,889 1.18 12.26
9 农民 4,677 1.13 13.39
10 土地 3,921 0.95 14.34
...
50 数字化 892 0.22 42.18
注:分词工具为 jieba 0.42.1(农业/政策扩充词典 v3.2);
停用词采用哈工大停用词表(1,893 词)+ 自定义追加 5 词;
总词数统计于去停用词后。
解读要点:
- Top 10 词语覆盖约 14.3% 的有效词汇,说明词汇集中度较高
- "乡村""农村""农业""农民"四词同时高频,反映政策文本的"三农"导向
- "数字化"出现在 Top 50,可进一步检验其在时间序列上的词频趋势(2015 年前几乎不出现,2020 年后快速上升)
输出 2:年度词频热力图
横轴为年份(2015—2025),纵轴为 Top 20 词语,颜色深浅反映标准化词频(TF%)。热力图由 ChatSRS 自动生成,直观呈现话语重心随时间的移动轨迹。
典型观察:
- "生态""绿色"从 2018 年起显著深色,对应生态文明战略加速落地
- "数字化""电商"自 2020 年起骤然升温,与乡村数字经济政策相呼应
输出 3:词云图
词云图以词频为权重调整字体大小,蓝色系渐变配色(与论文图表的灰度兼容)。ChatSRS 输出的词云图默认为 1200×800 像素 PNG,分辨率满足期刊投稿要求。
注意:词云图在论文中通常作为附录或补充图,正文以三线表(词频表)为主,审稿人看的是数字,不是图形。
输出 4:共现矩阵(Top 30 词语)
共现矩阵(Co-occurrence Matrix)反映两个词在同一窗口(本例窗口大小 = 5)内同时出现的次数,是后续主题网络分析的基础:
发展 农村 乡村 建设 振兴
发展 — 2,341 1,892 2,108 1,654
农村 2,341 — 3,421 1,876 2,230
乡村 1,892 3,421 — 1,543 2,891
建设 2,108 1,876 1,543 — 1,287
振兴 1,654 2,230 2,891 1,287 —
注:矩阵对称,对角线为词与自身共现(无意义,置为 —)。
"乡村"与"农村"共现次数最高(3,421),说明两词在政策文本中几乎可互换使用,需在编码手册中统一处理。
常见文本分析场景的指令示例
场景 A:访谈内容分析
上传访谈逐字稿(支持合并多人稿为单一 txt),输入:
"对 12 名受访者的访谈逐字稿进行词频分析,输出 Top 30 高频名词和动词(分词时保留专有名词),并按受访者职业分组对比词频差异(卡方检验检验词频组间差异显著性)。"
场景 B:问卷开放题
上传 Excel(开放题在 B 列,共 320 行),输入:
"对 B 列的 320 条开放题回答做词频分析,过滤单字词,输出 Top 20 高频词三线表,并识别出现频率超过 10% 的主题词作为后续编码类目建议。"
场景 C:中英文混合文本
上传英文学术摘要数据集,输入:
"对 200 篇英文摘要做词频分析,保留名词、动词、形容词(POS tagging 过滤),输出 Top 40 词汇并生成词云,同时计算 TF-IDF 识别最具区分度的前 20 词。"
论文里怎么报告(APA 7th 格式)
APA 7th 对内容分析/词频分析的方法节有专项要求:必须报告分词工具、停用词处理方式、统计单元定义,以及编码信度(若有人工编码环节)。
方法节写法
本研究采用词频分析对 48 份政策文本进行量化处理。使用 jieba(v0.42.1)分词库完成中文分词,并加载农业政策专有词典(扩充词条 1,240 条)以提升分词准确性。停用词处理采用哈工大通用停用词表(1,893 词)并追加领域定制停用词 5 词,最终有效词语总量为 412,680 词次。以词频(TF)和相对频率(TF%)为核心指标,按年份分组输出各时期 Top 20 高频词,并构建 Top 30 词语的共现矩阵(窗口大小 = 5)用于后续社会网络分析。所有文本分析通过 ChatSRS 平台(chatsrs.com)实现,底层引擎为 R 4.4 + tidytext 包。
结果节写法(词频部分)
词频分析结果显示,在全部 48 份政策文本去除停用词后的 412,680 词次中,高频词高度集中于"三农"核心词汇。"发展"(TF = 8,342,TF% = 2.02%)、"农村"(TF = 7,218,TF% = 1.75%)和"乡村"(TF = 6,891,TF% = 1.67%)位居前三,Top 10 词语合计占全部有效词汇的 14.34%(见表 1)。
按年度分组的词频热力图显示,"生态""绿色"两词的相对频率自 2018 年起显著上升(2015 年 TF% = 0.38%,2023 年 TF% = 1.12%),"数字化"一词在 2020 年前后进入 Top 20 并持续攀升(2015 年未入前 100,2025 年 TF% = 0.54%),反映政策话语的生态转型与数字化导向趋势。
APA 句式模板(可抄进论文)
方法节标准句式:
本研究采用词频分析(Word Frequency Analysis)方法对 [N] 份 [文本类型] 进行量化处理。
分词工具为 [工具名+版本],停用词表采用 [停用词表名称](共 [X] 词),
去除停用词后有效词次共 [N] 词次。
以 Top [N] 高频词的词频(TF)及相对频率(TF%)为主要分析指标
[视情况追加]:并构建共现矩阵(窗口大小 = [X])以识别词语关联结构。
结果节高频词报告句式:
词频分析结果显示,[词语](TF = [X],TF% = [X]%)、[词语](TF = [X],TF% = [X]%)
和 [词语](TF = [X],TF% = [X]%)位居词频前三,
Top [N] 词语合计覆盖全部有效词汇的 [X]%(见表 [N])。
时间趋势句式:
按 [分组变量] 的分组词频分析显示,"[词语]"的相对频率
自 [时间点 A](TF% = [X]%)至 [时间点 B](TF% = [X]%)呈 [上升/下降] 趋势,
反映 [研究结论]。
APA 报告细节提醒:
- 词频(TF)报告绝对值时写整数,相对频率(TF%)保留两位小数
- 软件/工具引用格式:jieba 分词(Sun, Z. (2020). jieba [Software]. GitHub. https://github.com/fxsjy/jieba);或在方法节脚注注明版本号(如 v0.42.1)
- 词云图在 APA 中无固定引用格式,建议在图注中注明"字体大小与词频成比例"
- 如有人工编码环节,必须报告编码者间信度(Cohen's kappa >= .70 为可接受,>= .80 为良好)
FAQ
Q1:词频分析算"量化"还是"质性"?在论文方法论框架里怎么定位?
A:词频分析是量化内容分析(Quantitative Content Analysis),属于混合研究方法中"质性数据量化"的典型路径。它以文本为原始数据,但输出的是可统计的数字(频率、矩阵),因此可以跟 SPSS/R 的推断统计结合使用(如比较不同组文本的词频差异是否显著)。在方法论章节,建议明确写"采用定量内容分析法(Quantitative Content Analysis),以词频为主要量化指标",避免被审稿人归为纯质性研究而质疑其规范性。
Q2:分词错误怎么处理?"机器学习"被切成"机器/学/习"怎么办?
A:专有术语被切碎是中文分词最常见的问题。解决方案有三层:(1) 使用领域词典——ChatSRS 针对学术、政策、医疗等领域预置了专有词典,覆盖绝大多数常见术语;(2) 自定义词典——在指令中追加"加载自定义词典:机器学习、深度学习、强化学习";(3) 人工校验样本——从结果中随机抽取 100 条词语,人工核查分词准确率,若准确率 < 90% 则需扩充词典。ChatSRS 会在词频表中标注低置信度词条供人工复核。
Q3:政策文本分析和访谈分析在操作上有什么区别?
A:核心流程相同,但有三处差异需要注意:(1) 统计单元:政策文本通常以"篇"为单元做文档级分析;访谈分析通常以"段落"或"句子"为单元做语句级分析,颗粒度更细;(2) 停用词:政策文本需过滤"指出""强调""提出"等官方套话;访谈文本需过滤"就是""然后""那个"等口语填充词,两类停用词表不完全相同;(3) 信度报告:访谈内容分析若涉及编码(如把词语归入主题类目),必须报告编码者间信度(Kappa),政策文本纯词频分析通常不需要。
Q4:词频分析的结果能直接作为推断统计的输入变量吗?
A:可以,有两种常见路径:(1) 词频矩阵 + 聚类/主题模型:把每篇文档的词频向量构成文档-词语矩阵(DTM),再用 K-means 聚类或 LDA 主题模型识别文档簇和潜在主题(ChatSRS 支持一句话完成 LDA);(2) 特定词频作为变量进入回归:例如统计每份政策文本中"创新"一词的出现频率作为"创新导向"的代理变量,再与政策落地效果做回归分析。无论哪种路径,在 ChatSRS 中只需在词频分析后追加"输出文档-词语矩阵 CSV,用于后续 LDA 分析"即可直接对接。
Q5:词频分析怎么报告效应量?有没有类似 Cohen d 的标准?
A:词频分析本身是描述性统计,没有直接对应的效应量指标。但在以下场景需要报告统计量:(1) 两组文本词频比较(如政策文本 A vs B 中某词的词频差异):用卡方检验,报告 Cramer's V(小效应 V = .10,中效应 V = .30,大效应 V = .50,Cohen, 1988;以上阈值源自效应量 w,仅在 2×2 列联表即 df_min = 1 时与 Cramer's V 等价;多行多列列联表需按自由度调整阈值);(2) 词语共现强度:报告 PMI(点互信息,Pointwise Mutual Information),正值表示正向关联,负值表示排斥;(3) TF-IDF 分布比较:可计算 Kullback-Leibler 散度(KL 散度)衡量两组文本话语分布的差异程度。ChatSRS 在比较分析指令中自动附带上述统计量,无需手动计算。
小结
词频分析是把非结构化文本转化为可量化数据的关键桥梁:
- 分词质量是基础:领域专有词典 + 停用词过滤,决定后续统计的信度
- 报告相对频率而非仅绝对词频:TF% 允许不同长度的文本横向比较
- 共现矩阵是进阶起点:为主题网络分析、LDA 主题模型提供输入
- APA 报告有固定要素:分词工具+版本、停用词来源、统计单元缺一不可
- 效应量看场景:组间词频比较用 Cramer's V,共现强度用 PMI
在 chatsrs.com 用一句自然语言指令,即可获得:
- 专业分词(中英文双引擎,支持领域词典)
- Top N 词频三线表(含 TF、TF%、累计频率)
- 词云图(1200x800 PNG,直接插入论文附录)
- 词语共现矩阵 + 热力图
- 可直接复制进论文的 APA 7th 格式文字描述
相关阅读
- AI 描述统计全攻略 — 均值/标准差/分布/APA 报告
- 卡方检验用 AI 一句话完成 — 列联表/Fisher/Cramer's V
- 毕业论文统计分析救星 — 从 SPSS 苦力到 AI 对话式
- 医学问卷数据 AI 分析 — ROC/生存分析/SCI 标准三线表
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。