场景案例 ·
语言学语料库分析用 AI 一句话完成 — 词频、搭配与卡方检验
语言学/应用语言学必看:从词频统计、搭配强度 MI/t-score 到卡方与对数似然检验,ChatSRS AI 一句话跑完语料库分析全流程,生成 APA 7th 格式报告,可直接写进语言学论文。
语言学、应用语言学、外语教育方向的论文有一道绕不过去的坎:语料库数据大、方法多、APA 格式对统计数字的要求细。从词频表到搭配显著性,从卡方到对数似然,每步都需要报告 df、p 值、效应量……这篇文章把语料库分析最核心的三条分析链串通,每步给出 ChatSRS 可直接使用的一句话指令,以及可抄进论文的 APA 7th 报告句式。
语料库论文数据分析为什么难
如果你在写语言学、应用语言学、英语教育或翻译研究方向的论文,以下场景大概率经历过:
- 词频表用 Excel 手数,整理完才发现还要做相对频率归一化
- 搭配分析不知道用 MI(互信息)还是 t-score,更不知道怎么写进论文
- 卡方检验做出来不知道要不要报效应量,期望频数不足 5 怎么处理
- 对数似然(Log-Likelihood)听说比卡方更适合语料库比较,但不知道怎么算
- 不同语料/文体之间词频差异的比较,不确定应该用什么显著性检验
这些困惑不是能力不足,而是语料库统计方法分散在不同的工具和文献中——AntConc 做搭配、SPSS 做卡方、Wordsmith 做词频……换个思路,把所有计算都交给一个能理解自然语言指令的 AI,从数据到 APA 报告在对话里一次完成。
chatsrs.com 的 R 引擎支持语料库常用的全部指标。下面按三个典型分析场景逐步演示。
三个核心语料库分析场景
场景一:词频统计与归一化
研究问题举例:学术英语语料库中,情态动词的使用频率如何分布?书面语与口语语料中高频词是否存在差异?
典型数据结构:
语料文本(txt/csv),每行一个词条(token)或已分词,含文体/来源标注
语料库 A:学术论文 30 篇,共 120,000 词次
语料库 B:口语对话转写 30 段,共 98,000 词次
关键统计链:原始频次 → 相对频率(每百万词 pmw)→ 词频排序表 → 双语料库对比 → 显著性检验
场景二:搭配强度分析(MI / t-score / z-score)
研究问题举例:"make" 在学术语料中的典型搭配动词是什么?哪些名词与 "decision" 形成显著搭配?
典型数据结构:
节点词(node word)+ 搭配窗口(±2 到 ±5 词)
每个搭配对:(node, collocate, frequency, left_freq, right_freq)
关键统计链:共现频次 → 期望频次 → MI / t-score / z-score 计算 → 显著搭配排序 → 过滤低频噪音
场景三:语料库对比 — 卡方与对数似然检验
研究问题举例:新闻语料与学术语料中被动语态的使用频率是否存在显著差异?两种文体对于某词汇特征的使用有无统计上的显著区别?
典型数据结构:
语料 A 中词 X 频次: a,语料 A 总词次: b
语料 B 中词 X 频次: c,语料 B 总词次: d
→ 形成 2×2 列联表
关键统计链:列联表构建 → 卡方检验(chi-square)或对数似然比(Log-Likelihood) → 效应量(Cramér's V / %DIFF) → APA 报告
全流程分析演示(情态动词语料库研究场景)
以"学术语料与口语语料中情态动词使用频率差异"为研究场景:学术语料库 120,000 词次,口语语料库 98,000 词次,研究情态动词 may / must / should / can / will 的频率分布及跨语料差异。
第一步:词频统计 — 建立基准频率表
打开 chatsrs.com,上传包含词条和语料标注的 CSV 文件后输入:
"请统计学术语料库和口语语料库中 may/must/should/can/will 五个情态动词的原始频次和相对频率(每百万词 pmw),生成 APA 格式三线表,并按相对频率降序排列。"
ChatSRS 自动输出:
表 1 两类语料库情态动词频率分布(pmw = 每百万词次)
学术语料 (N = 120,000) 口语语料 (N = 98,000)
情态动词 原始频次 相对频率(pmw) 原始频次 相对频率(pmw)
will 1,824 15,200 2,156 22,000
can 1,476 12,300 1,862 19,000
may 1,332 11,100 588 6,000
should 960 8,000 490 5,000
must 480 4,000 196 2,000
注. pmw = per million words(每百万词频次),用于跨语料库归一化比较。
为什么要做归一化:两个语料库规模不同(120k vs 98k),直接比较原始频次会产生误导。相对频率(pmw)消除了语料库规模差异,是语料库研究的标准做法。
第二步:搭配分析 — 找出显著搭配词
以情态动词 may 为节点词,在学术语料中分析其右侧窗口 ±2 词内的搭配强度:
"请对节点词 may 在学术语料中做搭配分析,窗口为左右各 2 词,计算每个搭配词的原始频次、期望频次、MI 值(互信息)和 t-score,输出按 MI 值降序排列的搭配表,只保留共现频次 >= 5 的搭配对。"
ChatSRS 输出:
表 2 "may" 的显著搭配词(学术语料,窗口 ±2,f >= 5)
搭配词 共现频次 期望频次 MI 值 t-score 显著性
indicate 87 12.4 2.81 8.00 ***
reflect 72 10.6 2.76 7.24 ***
suggest 91 18.3 2.32 7.62 ***
contribute 54 9.1 2.47 6.87 ***
affect 48 8.7 2.39 6.41 ***
注. MI 阈值设为 3.0 为强搭配参考,但结合频次使用更稳健。
*** p < .001(t-score > 2.576 判定为显著)
MI 与 t-score 的选择逻辑:
- MI(互信息):偏好稀有但固定的搭配组合,适合识别"专业术语搭配",容易被低频词拉高
- t-score:偏好高频稳定搭配,适合识别"通用语篇模式搭配",更稳健
- 学术论文通常同时报告两个指标,并说明截断阈值
第三步:卡方检验 — 检验词频跨语料差异
检验情态动词 may 在两个语料库中的使用频率是否存在统计显著差异:
"请用卡方检验比较情态动词 may 在学术语料(频次=1332,总词次=120000)和口语语料(频次=588,总词次=98000)中的使用频率差异。报告列联表、χ² 值、自由度、p 值和效应量 Cramér's V;并同时计算对数似然比(Log-Likelihood G²)作为辅助参考。"
ChatSRS 输出:
列联表
may 出现 may 未出现 合计
学术语料 1,332 118,668 120,000
口语语料 588 97,412 98,000
合计 1,920 216,080 218,000
卡方检验结果
chi_square(1) = 160.73, p < .001
Cramér's V = 0.026(可忽略效应,远低于小效应阈值 0.10)
95% CI for V: [0.021, 0.031]
对数似然比(G²)
G²(1) = 166.38, p < .001
期望频次最小值 = 863.1 > 5,满足卡方检验前提。
为什么语料库研究推荐 Log-Likelihood 而非卡方:语料库数据量通常极大(万级至百万级),卡方检验对大样本极度敏感——即使很小的频率差异也会产生显著的 p 值。对数似然比(G²)同样检验分布差异,但对样本量的依赖相对较小,Rayson & Garside(2000)建议语料库比较优先使用 G²,以 G² > 10.83(df=1)对应 p < .001 为参考。ChatSRS 会自动同时输出两个指标,不需要在工具之间切换。
第四步:多词频跨语料系统比较
对五个情态动词批量做跨语料显著性检验:
"请对 may/must/should/can/will 五个情态动词分别做学术语料 vs 口语语料的卡方检验和对数似然比检验,汇总输出一张多重比较结果表,包含每个词的 chi_square 值、G² 值、p 值和效应量,并用 Bonferroni 校正控制多重比较错误率(alpha = .05/5 = .01)。"
ChatSRS 输出:
表 3 情态动词跨语料频率差异检验结果(Bonferroni 校正后 alpha = .010)
情态动词 chi_square(1) G²(1) p 值 Cramér's V 显著性*
will 312.4 318.1 < .001 0.038 ***
can 241.8 245.6 < .001 0.033 ***
may 142.4 146.8 < .001 0.026 ***
should 87.3 89.2 < .001 0.020 ***
must 52.1 53.0 < .001 0.015 ***
注. * Bonferroni 校正后显著性水平 alpha = .010;*** p < .001。
所有词项均满足期望频次 > 5 的前提假设。
论文方法/结果写法(APA 7th,语料库研究报告句式)
以下句式可直接写进论文,替换括号内的数值即可。
方法章节:数据分析策略
本研究采用语料库定量方法分析情态动词的使用频率。词频统计以每百万词(pmw)为单位进行归一化,以消除语料库规模差异的影响。搭配强度采用互信息(MI)和 t-score 两个指标衡量,共现窗口设定为节点词左右各 2 词,频次截断阈值为 5 次。跨语料库频率差异采用卡方检验(χ²)和对数似然比(G²)检验(Rayson & Garside, 2000),效应量以 Cramér's V 报告。针对五个情态动词的多重比较采用 Bonferroni 校正(alpha = .05/5 = .010)。所有统计分析使用 ChatSRS 完成(R 引擎,统计显著性水平 alpha = .05)。
结果章节:词频分布结果
如表 1 所示,情态动词在两类语料库中的使用频率存在明显差异。will 在口语语料中的相对频率最高(22,000 pmw),远超学术语料(15,200 pmw);而 may 呈现出相反趋势,在学术语料中更为常见(11,100 pmw vs. 6,000 pmw)。
结果章节:卡方/对数似然检验结果
卡方检验结果显示,may 在学术语料(1,332/120,000)与口语语料(588/98,000)中的使用频率存在显著差异,χ²(1) = 160.73, p < .001, Cramér's V = 0.026(可忽略效应), 95% CI [0.021, 0.031]。对数似然比检验同样显著,G²(1) = 166.38, p < .001,两种方法结论一致。上述结果表明,may 是具有文体区分功能的情态动词,在正式学术语境中使用更为普遍。
结果章节:搭配分析结果
搭配分析(表 2)显示,may 在学术语料中最显著的右搭配词为 suggest(f = 91, MI = 2.32, t = 7.62),indicate(f = 87, MI = 2.81, t = 8.00)和 reflect(f = 72, MI = 2.76, t = 7.24),均在 p < .001 水平显著(t-score > 2.576)。这一搭配模式与 may 在学术写作中承载认识情态(epistemic modality)功能的定性分析结果相吻合。
上面这三段可以直接进论文 Methods 和 Results 章节,只需替换你自己语料的数值。ChatSRS 的"APA 报告"功能可自动生成对应段落,无需手动转写统计数字。
常见 FAQ
Q1: 语料库研究应该用卡方还是对数似然比(Log-Likelihood)?
两者都是检验"两个语料库中某词使用频率是否有显著差异"的工具,但适用场景略有不同:
- 卡方(chi-square):适合期望频次 >= 5 的情形,语料库大时极容易出现显著结果,效应量(Cramér's V)更重要
- 对数似然比(G²):Rayson & Garside(2000)推荐用于语料库比较,对样本量的依赖比卡方小,报告时写 G²(df) = xx, p = xx
- 建议:同时报告两个(如本文示例),说明两者结论是否一致,一致则结论更可靠
在 ChatSRS 里,一句话指令即可同时得到两个检验的输出,无需分开操作。
Q2: MI(互信息)值多少算显著搭配?
MI 本身没有显著性检验的临界值,而是一个连续的"关联强度"度量。实践中常用的经验规则:
- MI > 3:通常认为是强搭配(Hunston, 2002)
- MI > 0:正向搭配(实际共现 > 期望共现)
- MI < 0:负向搭配(回避搭配)
但 MI 对低频词非常敏感——两个词只共现 2 次,MI 值可能很高,但并不稳定。正确做法:设置频次截断阈值(通常 f >= 5),结合 t-score(反映搭配的统计显著性)综合判断。ChatSRS 同时输出 MI 和 t-score,并自动标注 t-score 显著性。
Q3: 词频归一化为什么用"每百万词"而不是百分比?
两种方法都合理,但语料库语言学领域的惯例是"每百万词(per million words, pmw)":
- 百分比(%):每百个词中出现 X 次,适合高频词
- pmw:每百万词中出现 X 次,适合低频词——学术功能词频率通常在千次以下,用 pmw 表达的数字更直观(如 may 在学术语料中 11,100 pmw 比 1.11% 可读性更好)
- 还有"每万词(per 10,000 words)"的用法,中文语料库研究较常用
ChatSRS 默认输出 pmw,但可以在指令中指定"请用每万词频率"。
Q4: 搭配窗口应该设多大?
没有唯一标准,需要根据研究目的决定:
- ±1 词(紧密搭配):捕捉最核心的语法搭配,如动词 + 直接宾语
- ±2 词(标准搭配):语料库研究最常用的默认设置
- ±4 到 ±5 词(宽窗口搭配):研究跨度较大的词汇语法结构或话语搭配
在 ChatSRS 里可以在指令中直接指定窗口大小:> "窗口设为左右各 3 词"。如果论文中没有说明,默认 ±2 是安全的起点。
Q5: 做多个词项的跨语料比较时,必须做多重比较校正吗?
是的,只要同时检验多个假设就应该校正,否则会虚高 I 型错误率。常用方法:
- Bonferroni 校正(最严格):alpha' = alpha / k,k 为检验次数。如 5 个词项用 .05/5 = .010
- FDR(Benjamini-Hochberg)校正(较温和):控制假发现率,比 Bonferroni 拒绝更少的真实差异
- 如果只是探索性研究(无需严格控制 I 型错误),可以报告原始 p 值并在局限性中说明未校正
ChatSRS 支持在指令中要求 Bonferroni 或 FDR 校正,自动输出校正后结果。
语料库分析小结
语言学、应用语言学、外语教育论文的语料库定量分析,核心方法链条清晰但每步有专业陷阱:
| 分析目的 | 方法 | ChatSRS 一句话关键词 |
|---|---|---|
| 词频分布概览 | 相对频率归一化(pmw) | "原始频次和每百万词 pmw,三线表" |
| 找显著搭配 | MI + t-score 搭配分析 | "搭配分析,窗口±2,MI 和 t-score" |
| 两语料频率差异 | 卡方 + Log-Likelihood | "chi_square 和 G²,Cramér's V 效应量" |
| 多词项批量对比 | 多重比较 + Bonferroni | "批量卡方检验,Bonferroni 校正" |
| 报告格式 | APA 7th | "生成 APA 格式报告句" |
每一步 ChatSRS 都直接输出 APA 7th 格式的报告句式,改改数字就能进论文。
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。