统计百科 ·
Fisher 精确检验 APA 报告格式 — 小样本 2x2 列联表、精确 p 值与比值比 OR 全解
统计百科:专攻"Fisher 精确检验怎么写进论文"这一具体格式点——期望频数<5时为何舍弃卡方、精确p值书写规则、比值比OR及95%CI的APA报告模板,并与卡方检验逐项对比,给出可直接套用的完整论文段落。
许多学生跑完卡方检验后才发现"有单元格期望频数低于 5"的警告,然后换成 Fisher 精确检验——但对于 Fisher 结果该怎么写进论文,却找不到清晰的 APA 格式指引。这篇文章专攻这一具体格式点:Fisher 精确检验的适用条件、精确 p 值的书写规则、比值比(OR)的计算与报告,以及与卡方检验的格式对比,给出可直接套用的完整报告模板。
你的 Fisher 检验报告有这些问题吗?
导师或审稿人关于 Fisher 精确检验最常见的批注:
- "期望频数低于 5 的单元格超过 25%,请改用 Fisher 精确检验"
- "Fisher 检验不报告 chi^2 值,只报告精确 p 值,格式写错了"
- "Fisher 检验也需要效应量,请补充 Phi 系数或比值比 OR"
- "OR 必须配 95% 置信区间,缺少置信区间不符合 APA 要求"
- "p = .000 不规范,Fisher 精确检验的 p 值应改为 p < .001"
- "方法章节没有说明为何使用 Fisher 而非卡方,请补充前提检验说明"
这些错误集中在 APA Publication Manual 第七版关于非参数检验和关联强度报告的相关要求。本文只讲一件事:Fisher 精确检验结果该怎么规范写进论文的每一个位置。
一、Fisher 精确检验是什么,与卡方检验有何不同
卡方检验的根本假设:样本够大
Pearson 卡方检验(chi^2 test)的统计量基于渐进理论——只有当样本足够大,理论频数分布才能被 chi^2 分布良好近似。当某些单元格的**期望频数(expected frequency)**过低时,近似失效,卡方统计量的 p 值会系统性偏差,导致假阳性或假阴性。
卡方检验适用的前提(APA 7th 及主流教材标准):
| 条件 | 具体要求 |
|---|---|
| 期望频数全部 >= 5 | 最严格版本:无任何单元格低于 5 |
| 宽松版本(2x2 列联表) | 允许不超过 20% 的单元格期望频数 < 5,且最小期望频数 >= 1 |
| 样本量 | 总 N >= 20 时通常可接受 |
当不满足以上条件时,尤其是 2x2 列联表且有期望频数低于 5 的单元格,应改用 Fisher 精确检验(Fisher's Exact Test)。
Fisher 精确检验的逻辑:直接算概率
Fisher 精确检验不依赖大样本近似。它的核心思想是:
在行边际合计与列边际合计(marginal totals)均固定不变的前提下,直接枚举所有可能的 2x2 表格,计算"观测结果或更极端结果"出现的精确概率。
$p_{exact} = \sum_{t \text{ at least as extreme}} \frac{\binom{n_{1+}}{t_{11}} \binom{n_{2+}}{t_{21}}}{\binom{n}{n_{+1}}}$
这个概率是**超几何分布(hypergeometric distribution)**计算得到的精确值,不依赖渐进近似,因此特别适合小样本场景。
卡方 vs. Fisher:何时用哪个
| 判断标准 | 使用卡方检验 | 使用 Fisher 精确检验 |
|---|---|---|
| 期望频数 | 所有单元格 >= 5 | 任意单元格 < 5 |
| 样本量 | N >= 40(2x2 表格经验值) | N 较小(通常 < 40) |
| 表格维度 | 2x2 或更大 | 主要适用于 2x2(2xC 扩展需专用软件) |
| SPSS 提示 | 无警告 | "有单元格期望频数低于 5" |
| 报告统计量 | chi^2(df) = X.XX | 省略 chi^2,只报告精确 p |
注意:Fisher 精确检验并不"更好",它是小样本的替代方案,而非卡方检验的升级版。样本量充足时,卡方检验与 Fisher 检验结论通常一致,此时优先使用卡方(因 chi^2 统计量有明确的效应量配套公式)。
二、Fisher 精确检验报告必须包含哪些要素
APA 7th 核心要求
APA 第七版对 Fisher 精确检验的报告并无单独章节,但结合其对非参数检验和关联性检验的通用要求,规范报告须包含:
| 要素 | 格式 | 说明 |
|---|---|---|
| 检验类型 | Fisher's exact test | 明确说明是 Fisher 精确检验,不写 chi^2 |
| 精确 p 值 | p = .XXX 或 p < .001 | 不加前导零;不写 p = .000 |
| 效应量 | Phi = .XX 或 OR = X.XX | 至少报告一种效应量 |
| 置信区间(OR 时) | 95% CI [X.XX, X.XX] | OR 必须配 95% CI |
| 方向描述 | 文字描述两组差异方向 | 卡方是无方向检验,需用语言补充 |
| 频数表 | 观测频数 + 期望频数 | 表格或正文均可,期望频数便于审稿人核查 |
关键格式规则:Fisher 不写 chi^2 值
这是最常见的格式错误。由于 Fisher 精确检验不通过 chi^2 统计量导出 p 值,论文中不应出现类似 "chi^2(1) = X.XX" 这样的写法。正确写法只需报告:
Fisher's exact test 显示……p = .XXX
或:
Fisher 精确检验结果显示两变量间存在显著关联,p = .032
SPSS 的"精确显著性(双尾)"栏即为此处应报告的精确 p 值,不要使用"渐进显著性"栏(那是卡方的 p 值)。
三、精确 p 值的书写规则
Fisher 精确检验的 p 值是精确计算值,书写规则与其他检验相同:
| 情形 | 正确写法 | 错误写法 |
|---|---|---|
| p 精确值为 .032 | p = .032 | p = 0.032 |
| p 精确值为 .000(显示为 .000) | p < .001 | p = .000 或 p = 0.000 |
| p 精确值为 .001 | p = .001 | p < .001(此处 .001 是精确值,非上限) |
| p 精确值为 1.000 | p = 1.000(或 p > .999) | p = 1 |
| 单尾还是双尾 | Fisher 精确检验默认报告双尾 | 单尾仅在有明确方向性假设时使用,须说明 |
关于单尾与双尾:大多数社会科学研究应报告双尾精确 p 值(two-tailed exact p),SPSS 输出中标注为"精确显著性(双尾)"。如研究有明确方向性假设,可报告单尾,但须在方法章节说明理由。
四、比值比(OR):计算方法与 APA 报告格式
什么是比值比
比值比(Odds Ratio, OR)是衡量 2x2 列联表中两个二值变量关联强度的最常用效应量,在医学、公共卫生和社会科学中广泛使用。
给定 2x2 列联表:
| 结局+ | 结局- | 合计 | |
|---|---|---|---|
| 暴露+ | a | b | a+b |
| 暴露- | c | d | c+d |
| 合计 | a+c | b+d | N |
$OR = \frac{a/b}{c/d} = \frac{ad}{bc}$
解读规则(Cohen, 1988 等效标准):
| OR 值 | 含义 |
|---|---|
| OR = 1 | 两组无差异(无关联) |
| OR > 1 | 暴露组结局+ 的比值更高 |
| OR < 1 | 暴露组结局+ 的比值更低 |
| 效应量参考 | 小: ~1.5,中: ~2.5,大: ~4.3(Chinn, 2000) |
OR 的 95% 置信区间
95% CI 是报告 OR 的必要组成部分,APA 7th 要求所有点估计量都配置信区间。常用方法(Woolf 法):
$\ln OR \pm 1.96 \times SE_{\ln OR}$
$SE_{\ln OR} = \sqrt{\frac{1}{a} + \frac{1}{b} + \frac{1}{c} + \frac{1}{d}}$
置信区间的 APA 书写规则:
OR = 3.24, 95% CI [1.18, 8.91]
- 方括号(不用圆括号)
- OR 和下限、上限均保留两位小数
- CI 不加前导零(如 [.47, 1.23] 而非 [0.47, 1.23])
Phi 系数:另一种效应量选择
Phi 系数(phi coefficient, phi)适用于 2x2 列联表,与 OR 互为补充:
$\phi = \sqrt{\frac{\chi^2}{N}}$
注意:即使使用 Fisher 精确检验(不产生 chi^2),也可计算 Phi 作为效应量,此时可用:
$\phi = \sqrt{\frac{(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)}}$
Phi 效应量标准(Cohen, 1988):
| 效应大小 | Phi |
|---|---|
| 小效应 | .10 |
| 中效应 | .30 |
| 大效应 | .50 |
五、完整 APA 报告模板
场景:小样本医疗研究(2x2 列联表)
研究背景:比较两种治疗方案(A 组 vs. B 组)的治疗有效/无效结果,样本量较小,某单元格期望频数低于 5。
数据:
| 有效 | 无效 | 合计 | |
|---|---|---|---|
| A 组 | 12 | 3 | 15 |
| B 组 | 5 | 8 | 13 |
| 合计 | 17 | 11 | 28 |
期望频数:A 组有效格 = 15 x 17 / 28 = 9.11,A 组无效格 = 15 x 11 / 28 = 5.89,B 组有效格 = 7.89,B 组无效格 = 5.11(最小格接近 5,且如调整可能更低)。
OR = (12 x 8) / (3 x 5) = 6.40,95% CI 计算后约 [1.18, 34.61],精确 p = .039(双尾)。
Phi = sqrt((12x8 - 3x5)^2 / (15 x 13 x 17 x 11)) = sqrt(6561/36465) ≈ .42。
结果段落模板
由于列联表中存在期望频数低于 5 的单元格,采用 Fisher 精确检验
替代 Pearson 卡方检验评估治疗方案与治疗结果的关联。
结果显示,治疗方案与治疗结果之间存在显著关联,Fisher's exact test,
p = .039(双尾),效应量 Phi = .42,为中等效应(接近大效应,Cohen,1988)。
A 组有效率(80.0%,12/15)显著高于 B 组有效率(38.5%,5/13),
比值比 OR = 6.40,95% CI [1.18, 34.61],表明 A 组患者治疗有效的
比值约为 B 组的 6.4 倍。
填入数值的完整示例
由于列联表中存在期望频数低于 5 的单元格(最小期望频数为 5.11),采用 Fisher 精确检验替代 Pearson 卡方检验评估两种治疗方案(A 组、B 组)与治疗结果(有效、无效)的关联。Fisher 精确检验结果显示,治疗方案与治疗结果之间存在显著关联,p = .039(双尾),效应量 Phi = .42,为中等效应(接近大效应,Cohen,1988)。A 组有效率(80.0%,n = 12/15)显著高于 B 组(38.5%,n = 5/13),比值比 OR = 6.40,95% CI [1.18, 34.61],表明接受 A 方案治疗的患者治疗有效的比值约为 B 方案的 6.4 倍。
场景:社会调查(性别 x 行为分类,小样本)
数据:调查 25 名受访者是否参与某健康行为,按性别分组。
| 参与 | 未参与 | 合计 | |
|---|---|---|---|
| 男性 | 4 | 8 | 12 |
| 女性 | 9 | 4 | 13 |
| 合计 | 13 | 12 | 25 |
期望频数:男性参与 = 12 x 13 / 25 = 6.24,男性未参与 = 5.76,女性参与 = 6.76,女性未参与 = 6.24(所有期望频数均 >= 5,但 N=25 较小且分布不均,Fisher 更稳健)。精确 p = .099,OR = (4 x 4) / (8 x 9) = 0.22,95% CI [.04, 1.19]。
结果段落模板
由于样本量较小(N = 25),且列联表最小期望频数低于 5,
采用 Fisher 精确检验检验性别与健康行为参与的关联。
Fisher's exact test 结果显示,p = .099(双尾),
未达到显著性水平(alpha = .05),效应量 Phi = .32,为中等效应,
表明在本样本中性别与健康行为参与之间的关联虽具实质意义(中等效应),
但未达统计显著,可能与样本量不足导致的检验功效偏低有关。
六、Fisher 精确检验 vs. 卡方检验:报告格式对比
理解两者的报告差异,避免格式混用是核心要点:
| 报告要素 | Pearson 卡方检验 | Fisher 精确检验 |
|---|---|---|
| 统计量 | chi^2(df) = X.XX | 不报告 chi^2(省略) |
| 自由度 | 写入括号,如 chi^2(1) | 不报告 df |
| p 值来源 | 渐进 p 值 | 精确 p 值(exact p) |
| p 值格式 | p = .032 | p = .032(格式相同) |
| 效应量 | Phi(2x2)/ Cramer's V(更大表格) | Phi 或 OR,2x2 首选 OR |
| 置信区间 | OR 时配 95% CI | OR 时配 95% CI(要求相同) |
| 方法章节说明 | 说明使用卡方 | 说明为何用 Fisher(前提检验结果) |
完整对比示例
同一份数据,若期望频数满足要求(正常报告 Pearson 卡方):
性别与购买意愿之间存在显著关联,chi^2(1, N = 120) = 8.74,p = .003,Phi = .27,为中等效应(Cohen,1988)。女性(72.3%)的购买意愿显著高于男性(52.4%),OR = 2.35,95% CI [1.18, 4.67]。
若期望频数不满足,改用 Fisher 精确检验:
由于列联表中存在期望频数低于 5 的单元格,采用 Fisher 精确检验。结果显示,性别与购买意愿之间的关联显著,p = .042(双尾),Phi = .27,为中等效应(Cohen,1988)。女性(72.3%)的购买意愿显著高于男性(52.4%),OR = 2.35,95% CI [1.18, 4.67]。
注意:只有 p 值来源和统计量写法发生变化,效应量(Phi、OR)的报告格式完全相同。
七、方法章节如何说明使用了 Fisher 精确检验
APA 7th 要求方法章节交代所有统计检验的选用理由,对 Fisher 精确检验尤为重要,因为它不是"默认选择",需要说明为何替代卡方。
标准方法章节描述模板
采用列联表分析评估[变量A]与[变量B]之间的关联。
分析前检查各单元格期望频数:若所有单元格期望频数均 >= 5,
使用 Pearson 卡方检验(chi^2 test);若存在期望频数低于 5 的单元格
(超过总单元格数的 20%),改用 Fisher 精确检验(Fisher's exact test)。
效应量报告 Phi 系数及比值比(OR)与 95% 置信区间,
参照 Cohen(1988)标准(.10 = 小效应,.30 = 中效应,.50 = 大效应)。
显著性水平设为 alpha = .05,所有检验均为双尾。
统计分析使用 ChatSRS(chi_square 指令,68 类检验引擎),
软件自动判断期望频数条件并输出对应检验结果。
八、在 ChatSRS 一键获得规范 Fisher 检验报告
打开 chatsrs.com,上传数据后输入:
"对性别(男/女)和购买意愿(是/否)做列联表分析;先检查期望频数,若有单元格低于 5 则自动切换 Fisher 精确检验;输出精确 p 值(双尾)、Phi 效应量、比值比 OR 及 95% 置信区间,并给出符合 APA 7th 格式的完整结果报告段落,标注哪些单元格期望频数不足。"
ChatSRS 的 chi_square 指令(68 类关联检验引擎)会自动:
- 计算各单元格期望频数,判断是否满足卡方前提
- 不满足时自动切换 Fisher 精确检验,在输出中注明切换原因
- 输出精确 p 值(双尾/单尾可选)、OR 及 95% CI
- 生成符合 APA 7th 格式的完整报告段落,可直接复制进论文
如需同时查看观测频数与期望频数对照表,在指令末尾加"同时输出频数表格(含期望频数和残差)"。
九、常见错误对照表
| 常见错误 | 正确写法 | 违反规则 |
|---|---|---|
| Fisher 结果写成 chi^2(1) = X.XX | 省略 chi^2,只报告 p 值 | Fisher 不产生 chi^2 统计量 |
| p = .000 | p < .001 | .000 是舍入假值 |
| p = 0.042 | p = .042 | APA 不加前导零 |
| OR 无置信区间:OR = 6.40 | OR = 6.40, 95% CI [1.18, 34.61] | 点估计必须配置信区间 |
| 置信区间用圆括号:(1.18, 34.61) | [1.18, 34.61] | APA 规定用方括号 |
| 未说明为何用 Fisher 而非卡方 | 方法章节注明期望频数检查结果 | 方法透明性要求 |
| 期望频数满足时仍用 Fisher | 满足条件时用 Pearson 卡方 | Fisher 是替代方案,非首选 |
| 报告渐进 p 值(来自卡方栏) | 报告精确 p 值(SPSS "精确"栏) | Fisher p 值必须来自精确计算 |
| 无效应量 | 报告 Phi 或 OR(两者均可) | APA 7th 要求所有检验报告效应量 |
常见 FAQ
Q:Fisher 精确检验只适用于 2x2 表格吗?超过两行两列怎么办?
A:标准 Fisher 精确检验设计用于 2x2 列联表,但已有扩展版本(Freeman-Halton 检验)可处理 2x3、3x3 等更大表格。SPSS 在"精确检验"模块中支持对任意维度列联表进行精确检验;R 的 fisher.test() 函数同样支持更大表格(但计算量随样本量和表格维度增长,超大样本可能运行较慢)。报告格式与 2x2 类似,省略 chi^2,报告精确 p 值,效应量改用 Cramer's V(不再是 Phi)。
Q:OR 低于 1 怎么解读和报告?
A:OR < 1 表示"暴露组"结局事件的比值低于"对照组"。OR = 0.22 意味着暴露组事件比值约为对照组的 22%,即暴露组发生事件的可能性更低。报告时直接写出数值即可,不需要取倒数:OR = 0.22,95% CI [.04, 1.19]。如果置信区间包含 1.0(如本例),则说明效应不显著(与精确 p > .05 对应)。为了文字表达清晰,可写"B 组有效率显著低于 A 组(OR = 0.22),约为 A 组的五分之一",同时说明 95% CI 包含 1.00,p = .099,结果未达显著。
Q:精确 p 值比卡方 p 值更小还是更大?
A:不固定,取决于数据分布。通常情况下,当期望频数偏低(卡方前提不满足)时,卡方的渐进 p 值往往比 Fisher 精确 p 值更小(即卡方倾向于"高估显著性"),这正是小样本时卡方容易误导结论的原因。但也存在卡方 p 值较大的情形。规则很简单:期望频数不满足,无论结论如何都应改用 Fisher,不能因为卡方结果更"好看"就保留卡方。
Q:方法章节一定要写"为什么用 Fisher 而非卡方"吗?
A:强烈建议写明。审稿人看到 Fisher 精确检验,首先会检查你是否符合使用条件(期望频数不足)。如果方法章节只写"采用 Fisher 精确检验"而不说明原因,审稿人可能会质疑"为什么不用卡方?"。规范写法是:在方法章节的统计分析部分说明"分析前检查期望频数,存在不满足卡方前提的单元格(期望频数 < 5),因此采用 Fisher 精确检验"。这既符合透明性要求,也让审稿人一眼看出你对统计前提了然于胸。
快速参考:Fisher 精确检验报告格式速查卡
[结果段落 — 显著]
由于 [某单元格] 期望频数为 X.XX(< 5),采用 Fisher 精确检验。
Fisher's exact test 结果显示,[变量A]与[变量B]之间存在显著关联,
p = .XXX(双尾),Phi = .XX([大小]效应)。
[组1] 的[结局+]比率(XX.X%)[显著高于/低于][组2](XX.X%),
OR = X.XX,95% CI [X.XX, X.XX]。
[结果段落 — 不显著]
Fisher's exact test 结果显示,[变量A]与[变量B]之间的关联未达显著,
p = .XXX(双尾),Phi = .XX([大小]效应)。
置信区间 95% CI [X.XX, X.XX] 包含 1.00,进一步证实两变量无显著差异。
[方法章节说明]
分析前检查期望频数,存在单元格期望频数低于 5(最小期望频数 = X.XX),
采用 Fisher 精确检验(Fisher's exact test)替代 Pearson 卡方检验。
效应量报告 Phi 系数及 OR(95% CI),显著性水平 alpha = .05,双尾。
[卡方 vs. Fisher 格式对比速查]
Pearson 卡方: chi^2(1, N = 28) = X.XX, p = .XXX, Phi = .XX
Fisher 精确: Fisher's exact test, p = .XXX, Phi = .XX, OR = X.XX [X.XX, X.XX]
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。