统计百科 ·
词频分析 APA 报告怎么写?词云 + 频率表 + 共现矩阵全格式指南
统计百科:专攻词频分析/文本挖掘 APA 7th 报告格式——词云说明文字、频率分布表三线表规范、共现矩阵写法、方法章节模板,给出可直接套用进论文的完整报告句式,并说明在 ChatSRS 一句话获得规范输出的方法。
词频分析已成为质性与混合研究的标配工具,但真正让论文被认可的,不是那张五颜六色的词云图,而是图后面规范的 APA 报告文字。频率表怎么做成三线表?词云配图说明文字怎么写?共现矩阵汇报几个数字、什么格式?这篇文章只讲这一件事:词频分析/文本挖掘结果如何按 APA 7th 规范写进论文,给出可直接套用的完整模板。
你的词频分析报告有这些问题吗?
审稿人或导师关于词频分析报告最常见的反馈:
- "词云图缺少图题和说明文字,不符合 APA 图表格式"
- "词频表应采用三线表格式,不能用全框线"
- "频次和频率的单位要说清楚,是词次(token)还是文档频次(document frequency)"
- "共现矩阵只给了图,需要在正文中报告关键数值"
- "方法章节未说明分词工具、停用词表、最小词频阈值"
- "缺少对高频词提取标准的说明(Top N 词还是频率阈值)"
这些问题的根源在于:词频分析横跨定量与定性两个传统,APA 第七版本身对其格式规范分散于图表规范(第 7 章)、结果呈现(第 3 章)和混合研究方法(第 3.15 节),没有集中的专题指南。本文将这些分散规定汇总为可操作的格式模板。
一、词频分析的核心概念与报告要素
报告前必须厘清的三个频次概念
在开始写任何报告文字之前,先确认使用的是哪种频次统计口径,并在方法章节明确说明:
| 概念 | 英文 | 含义 | 适用场景 |
|---|---|---|---|
| 词次 / 词频 | Term Frequency (TF) | 词在所有文档中出现的总次数 | 单篇长文、访谈稿分析 |
| 文档频次 | Document Frequency (DF) | 词出现在几篇文档中(不计重复) | 多文档语料库比较 |
| 相对频率 | Relative Frequency | TF 除以总词次,以百分比或每千词频率表示 | 不同长度文档的横向比较 |
| TF-IDF | — | 词频乘以逆文档频率,突出区分性词汇 | 关键词提取、主题识别 |
APA 格式要求:在方法章节明确说明使用了哪种统计口径,结果章节首次出现频率数据时给出计算说明。
词频分析报告的三个核心产出
| 产出 | APA 对应格式 | 写法要点 |
|---|---|---|
| 频率分布表 | 三线表 (Table) | Top N 词、频次、相对频率、排名 |
| 词云图 | 图 (Figure) | 图题 + 图注,说明映射规则和停用词处理 |
| 共现矩阵 / 共现网络 | 三线表 + 图 | 报告共现窗口大小、阈值、关键节点中心性 |
二、词频分布表:APA 三线表规范
标准三线表结构
APA 7th 要求表格采用"三线表"格式:顶线(标题上方)、栏线(表头下方)、底线(表格末尾),不使用竖线或内部横线。
格式示例(Top 20 高频词表):
表 X
[研究对象/语料库名称] 词频分析结果(Top 20 高频词)
排名 词语 词次(TF) 文档频次(DF) 相对频率(%)*
---- ------ -------- ----------- -----------
1 [词1] XXX XX X.XX
2 [词2] XXX XX X.XX
...
20 [词20] XXX XX X.XX
注. 语料库总词次 N = XXXXX。相对频率 = TF / N × 100。已去除停用词(参照哈工大停用词表,共 XXXX 词)。
* 相对频率保留两位小数。
完整报告段落模板
词频分析结果(见表 X)显示,在[语料库描述,如"2020—2024年政策文本,
共 XX 篇,总词次 N = XXXXX"]中,排名前 20 的高频词覆盖了总词次的 X.XX%。
最高频词为"[词1]"(TF = XXX,相对频率 = X.XX%),其次为"[词2]"(TF = XXX,
相对频率 = X.XX%)和"[词3]"(TF = XXX,相对频率 = X.XX%)。
这三个词的集中出现反映了[研究议题/政策焦点的描述性解读]。
频率分布呈右偏(Zipfian 分布),少数核心词汇承载了大量语义信息,
与文本语料的一般统计规律一致(Zipf, 1949)。
填入数值的示例:
词频分析结果(见表 3)显示,在 2020—2024 年人工智能相关政策文本(共 86 篇,总词次 N = 142,437)中,排名前 20 的高频词覆盖了总词次的 18.64%。最高频词为"数据"(TF = 1,842,相对频率 = 1.29%),其次为"人工智能"(TF = 1,706,相对频率 = 1.20%)和"平台"(TF = 1,253,相对频率 = 0.88%)。这三个词的集中出现反映了政策文本对数字基础设施与技术平台的持续关注。频率分布呈右偏,前 5 词覆盖总词次的 5.61%,与 Zipf(1949)规律吻合。
三、词云图:APA 图题与图注规范
词云图在 APA 体系中属于"图"(Figure),必须遵守 APA 第七版第 7.22–7.36 节的图格式要求。
必须包含的图格式要素
| 要素 | 格式 | 说明 |
|---|---|---|
| 图序号 | 图 X(斜体) | 连续编号,图 1、图 2…… |
| 图题 | 简洁描述性标题(非斜体,句首大写) | 紧接图序号 |
| 图注 | 以"注."开头,说明设计细节 | 包括颜色/大小映射规则、停用词处理、最小词频 |
词云图注标准写法
图 X
[研究对象] 高频词词云图
注. 词云由 Python wordcloud 库生成(v1.9.3;Mueller, 2023)。
词语字体大小正比于词次(TF),颜色为随机着色,不具有语义含义。
分词采用 jieba 库(v0.42.1);停用词参照哈工大停用词表(XXXX 词),
并手动补充领域无意义词汇(如"以"、"进行")。
最小显示词次阈值为 TF ≥ [X],图中共展示 [N] 个词语。
正文引用词云图的规范写法
图 X 以词云形式直观展示了高频词的相对权重。
词语字体大小正比于词次,可见"[词1]""[词2]"等词汇在语料库中
占据主导地位(TF > XXX),构成[研究主题]话语的核心词汇框架。
需要注意的是,词云图仅用于辅助直觉理解,
精确词频数值参见表 X 的三线表报告。
四、共现矩阵与共现网络:APA 报告格式
共现分析(Co-occurrence Analysis)是词频分析的延伸,揭示词汇之间的语义关联。在 APA 报告中,共现结果通常以三线表 + 网络图两种形式呈现。
共现矩阵三线表
共现矩阵完整呈现篇幅较大,论文中通常报告局部共现矩阵(核心词与其 Top K 共现词)或关键共现对列表。
格式示例(关键共现词对):
表 X
[研究对象] 核心词共现分析结果(共现窗口 = X 词)
词对 共现次数 共现强度(Dice)* 文档共现频次
-------------- -------- --------------- -----------
[词A] — [词B] XXX 0.XXX XX
[词A] — [词C] XXX 0.XXX XX
...
注. 共现窗口大小为前后各 X 词(共 X 词窗口)。
Dice 系数 = 2 × f(A,B) / (f(A) + f(B)),取值范围 [0, 1],
值越大表示两词共现强度越高。
仅列出共现次数 ≥ [阈值] 的词对,共 [N] 对。
共现分析完整报告段落模板
共现分析结果(见表 X)显示,在[窗口大小]词的共现窗口内,
"[核心词]"与"[共现词1]"(共现次数 = XXX,Dice = 0.XXX)和
"[共现词2]"(共现次数 = XXX,Dice = 0.XXX)的共现强度最高,
表明[词义关联的实质性解读]。共现网络(见图 X)以最小共现次数
[阈值] 为筛选标准,共纳入 [N1] 个节点(词语)和 [N2] 条边(共现关系)。
网络中心性最高的词语为"[词1]"(度中心性 = X.XX)和
"[词2]"(度中心性 = X.XX),构成连接其他高频词的语义枢纽。
填入数值的示例:
共现分析结果(见表 5)显示,在前后各 5 词(共 10 词窗口)的共现窗口内,"人工智能"与"数据"(共现次数 = 423,Dice = 0.238)和"平台"(共现次数 = 312,Dice = 0.211)的共现强度最高,表明政策文本倾向于将人工智能与数据治理和平台监管议题相互关联。共现网络(见图 4)以最小共现次数 50 为筛选标准,共纳入 38 个节点和 97 条边。网络中心性最高的词语为"数据"(度中心性 = 0.784)和"平台"(度中心性 = 0.621),构成连接其他技术词汇的语义枢纽,与词频排名结果相互印证。
五、方法章节:词频分析的标准描述
方法章节是最容易被审稿人忽略、也最容易因缺漏被退稿的部分。以下模板涵盖 APA 要求的全部说明要素。
标准方法章节模板
文本预处理与词频分析
本研究采用词频分析(Word Frequency Analysis)对[语料库描述]进行文本量化分析。
语料库共包含 [N] 篇文档,总字符数约 [X] 万字。
文本预处理步骤如下:
(1)去噪:去除文档元数据、页眉页脚及特殊符号;
(2)分词:采用[分词工具,如 jieba v0.42.1 / 结巴分词]进行中文分词,
词典来源为[说明];
(3)停用词过滤:参照[停用词表来源,如哈工大停用词表(XXX 词)],
并手动补充领域无效词汇 [X] 个;
(4)词性筛选(若有):仅保留[词性,如名词和动词],
以聚焦于实质性概念词汇;
(5)最小词频阈值:过滤词次 TF < [X] 的词语。
词频统计以词次(Term Frequency, TF)为主要指标,
同时计算各词的文档频次(Document Frequency, DF)和相对频率(TF / N × 100%)。
共现分析采用[窗口大小]词的滑动窗口,
以 Dice 系数衡量词对共现强度。
统计分析使用 ChatSRS(Python + R 引擎),可视化采用 Python wordcloud 库。
显著性水平设为 alpha = .05(适用于词频差异卡方检验,若有)。
六、在 ChatSRS 一句话获得规范词频分析报告
打开 chatsrs.com,上传文本数据(支持 .txt/.csv/.xlsx 格式,多篇文档可打包上传)后输入:
"对上传的政策文本语料库做词频分析:先分词并去除哈工大停用词表中的词语,统计前 20 高频词的词次、文档频次和相对频率,生成 APA 7th 格式三线表;再绘制词云图并提供规范图注文字;最后做共现矩阵分析(窗口=10词),报告前 15 个高强度共现词对的 Dice 系数,给出可直接复制进论文的完整方法章节和结果章节 APA 报告段落。"
ChatSRS word_frequency 模块(68 指令内可完成)将自动完成分词、停用词过滤、频率统计、词云绘制和共现矩阵计算,输出格式与本文示例完全一致,数值自动填入,图注和段落可直接粘贴进论文。
如需按文档类别比较词频差异(如不同年份政策文本的高频词变化),在指令中补充说明分组变量,ChatSRS 自动切换为分组词频分析并添加卡方检验或相对频率差异说明。
七、论文中词频结果的完整呈现顺序
APA 结果章节的最佳呈现顺序如下:
- 先概述语料库规模:文档数、总词次、时间跨度
- 报告预处理参数:停用词表、最小词频阈值
- 呈现频率分布表(三线表,Top 20 或 Top 30)
- 引用词云图(辅助直觉,强调精确数值在表格中)
- 报告共现分析(表 + 图,说明窗口大小和阈值)
- 给出实质性解读(词汇聚类/主题归纳,不只是罗列数字)
一个常见错误:有研究者把词云图放在结果章节首位,并仅凭词云图讨论结果,而不报告任何具体频次数值。APA 体系中,图是对文字数值的补充,而非替代——即使有了词云,也必须在正文和表格中报告具体的 TF、DF 和 Dice 数值。
常见 FAQ
Q:词频分析的结果属于定性研究还是定量研究,APA 报告格式有区别吗?
A:词频分析属于混合方法研究(Mixed Methods)或量化内容分析(Quantitative Content Analysis)的范畴,核心报告要素——三线表、精确数值、效应量等——与定量研究要求一致。区别在于:纯定量研究只需报告统计数值;混合方法研究在统计数值之后还需补充"实质性解读"段落,说明高频词反映了什么研究现象,这一段不是描述统计数字,而是将数字翻译为研究洞见。APA 7th 第 3.15 节对混合研究结果呈现(JARS-Mixed)有专门指导。
Q:共现矩阵要完整列出所有词对吗?矩阵太大放不进论文怎么办?
A:不需要完整列出。APA 论文中通常只报告"关键共现词对"——设定共现强度阈值(如 Dice >= 0.15 或共现次数 >= 50),仅列出高于阈值的词对。如果核心词只有几个,可用局部共现矩阵(核心词 × Top K 共现词)。完整矩阵可放在论文附录(Appendix),正文中引用附录编号即可。共现网络图比矩阵更紧凑,适合在正文图中直观呈现,但正文仍需用三线表报告关键节点的中心性数值。
Q:词频报告里的数字需要加统计检验(p 值)吗?
A:取决于研究问题。如果只是描述性地展示语料库的词频分布,不涉及组间比较,则不需要 p 值——报告 TF、DF 和相对频率即可。如果涉及组间比较(如比较不同年份、不同类型文档的词频差异),则需要卡方检验(Chi-square test)并报告 χ²(df) = X.XX, p = .XXX,效应量 phi 或 Cramer's V。ChatSRS 在分组词频分析时会自动判断并添加对应的检验结果。
Q:词云图可以替代频率分布表,不单独列表吗?
A:不可以。APA 7th 图表规范要求:图(Figure)是对表(Table)或文字数值的视觉补充,不能替代精确数值的呈现。词云中字体大小的视觉映射存在感知误差,读者无法从词云准确判断两个词的频次差异是 10% 还是 100%。因此,只要词频分析被用作正式结果报告(而非仅在演示幻灯片中),就必须同时提供三线表和词云图,缺一不可。方法得当的处理是:三线表提供精确数值,词云图提供整体直觉,两者在结果章节中相互引用、互为补充。
Q:TF-IDF 结果怎么在 APA 报告中呈现?
A:TF-IDF 的报告方式与 TF 类似,但要在方法章节说明采用了 TF-IDF 加权,并给出 IDF 的计算公式或来源(如 scikit-learn 的默认公式)。三线表新增"TF-IDF 权重"列,保留四位小数。结果段落说明:"TF-IDF 权重最高的词语为'[词1]'(TF-IDF = 0.XXXX),表明该词在本文档中出现频繁而在整体语料库中较为罕见,具有较强的区分性"。与 TF 的高频词表对比,两张表通常会显示不同词语——这种差异本身就是值得讨论的结果。
快速参考:词频分析 APA 报告速查卡
[频率分布表 — 三线表]
表 X [语料库名] 词频分析结果(Top N 高频词)
列:排名 | 词语 | 词次(TF) | 文档频次(DF) | 相对频率(%)
注. 语料库总词次 N = XXXXX;停用词参照[来源];
最小词次阈值 TF >= [X]。
[词云图 — 图注]
图 X [研究对象] 高频词词云图
注. 字体大小正比于词次;颜色为随机着色(不含语义);
最小显示词次 TF >= [X];共展示 [N] 个词语。
[共现词对表 — 三线表]
表 X [核心词/全局] 共现分析结果(共现窗口 = X 词)
列:词对 | 共现次数 | Dice系数 | 文档共现频次
注. Dice = 2×f(A,B) / (f(A)+f(B));仅列共现次数 >= [阈值] 的词对。
[共现网络图 — 图注]
图 X [研究对象] 词语共现网络图
注. 节点大小正比于度中心性;边粗细正比于共现次数;
共 [N1] 个节点,[N2] 条边;最小共现次数阈值 = [X]。
[结果段落最小集]
"词频分析结果(见表 X)显示,最高频词为'[词]'
(TF = XXX,相对频率 = X.XX%)……
共现分析(见表 X)显示,'[核心词]'与'[词]'
的共现强度最高(Dice = 0.XXX)……"
相关阅读
- 词频分析怎么做?AI 一句话完成分词/词云/共现全攻略
- 描述统计的 APA 报告怎么写?均值、标准差、相关矩阵格式全解
- 网络分析的 APA 报告怎么写?节点、边与中心性指标格式全解
- 主成分分析(PCA)的 APA 报告怎么写?
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。