统计百科 ·

Fisher 精确检验 APA 报告格式 — 小样本 2x2 列联表、精确 p 值与比值比 OR 全解

统计百科:专攻"Fisher 精确检验怎么写进论文"这一具体格式点——期望频数<5时为何舍弃卡方、精确p值书写规则、比值比OR及95%CI的APA报告模板,并与卡方检验逐项对比,给出可直接套用的完整论文段落。

许多学生跑完卡方检验后才发现"有单元格期望频数低于 5"的警告,然后换成 Fisher 精确检验——但对于 Fisher 结果该怎么写进论文,却找不到清晰的 APA 格式指引。这篇文章专攻这一具体格式点:Fisher 精确检验的适用条件、精确 p 值的书写规则、比值比(OR)的计算与报告,以及与卡方检验的格式对比,给出可直接套用的完整报告模板。


你的 Fisher 检验报告有这些问题吗?

导师或审稿人关于 Fisher 精确检验最常见的批注:

  • "期望频数低于 5 的单元格超过 25%,请改用 Fisher 精确检验"
  • "Fisher 检验不报告 chi^2 值,只报告精确 p 值,格式写错了"
  • "Fisher 检验也需要效应量,请补充 Phi 系数或比值比 OR"
  • "OR 必须配 95% 置信区间,缺少置信区间不符合 APA 要求"
  • "p = .000 不规范,Fisher 精确检验的 p 值应改为 p < .001"
  • "方法章节没有说明为何使用 Fisher 而非卡方,请补充前提检验说明"

这些错误集中在 APA Publication Manual 第七版关于非参数检验和关联强度报告的相关要求。本文只讲一件事:Fisher 精确检验结果该怎么规范写进论文的每一个位置


一、Fisher 精确检验是什么,与卡方检验有何不同

卡方检验的根本假设:样本够大

Pearson 卡方检验(chi^2 test)的统计量基于渐进理论——只有当样本足够大,理论频数分布才能被 chi^2 分布良好近似。当某些单元格的**期望频数(expected frequency)**过低时,近似失效,卡方统计量的 p 值会系统性偏差,导致假阳性或假阴性。

卡方检验适用的前提(APA 7th 及主流教材标准):

条件具体要求
期望频数全部 >= 5最严格版本:无任何单元格低于 5
宽松版本(2x2 列联表)允许不超过 20% 的单元格期望频数 < 5,且最小期望频数 >= 1
样本量总 N >= 20 时通常可接受

当不满足以上条件时,尤其是 2x2 列联表且有期望频数低于 5 的单元格,应改用 Fisher 精确检验(Fisher's Exact Test)

Fisher 精确检验的逻辑:直接算概率

Fisher 精确检验不依赖大样本近似。它的核心思想是:

在行边际合计与列边际合计(marginal totals)均固定不变的前提下,直接枚举所有可能的 2x2 表格,计算"观测结果或更极端结果"出现的精确概率。

$p_{exact} = \sum_{t \text{ at least as extreme}} \frac{\binom{n_{1+}}{t_{11}} \binom{n_{2+}}{t_{21}}}{\binom{n}{n_{+1}}}$

这个概率是**超几何分布(hypergeometric distribution)**计算得到的精确值,不依赖渐进近似,因此特别适合小样本场景。

卡方 vs. Fisher:何时用哪个

判断标准使用卡方检验使用 Fisher 精确检验
期望频数所有单元格 >= 5任意单元格 < 5
样本量N >= 40(2x2 表格经验值)N 较小(通常 < 40)
表格维度2x2 或更大主要适用于 2x2(2xC 扩展需专用软件)
SPSS 提示无警告"有单元格期望频数低于 5"
报告统计量chi^2(df) = X.XX省略 chi^2,只报告精确 p

注意:Fisher 精确检验并不"更好",它是小样本的替代方案,而非卡方检验的升级版。样本量充足时,卡方检验与 Fisher 检验结论通常一致,此时优先使用卡方(因 chi^2 统计量有明确的效应量配套公式)。


二、Fisher 精确检验报告必须包含哪些要素

APA 7th 核心要求

APA 第七版对 Fisher 精确检验的报告并无单独章节,但结合其对非参数检验和关联性检验的通用要求,规范报告须包含:

要素格式说明
检验类型Fisher's exact test明确说明是 Fisher 精确检验,不写 chi^2
精确 p 值p = .XXX 或 p < .001不加前导零;不写 p = .000
效应量Phi = .XX 或 OR = X.XX至少报告一种效应量
置信区间(OR 时)95% CI [X.XX, X.XX]OR 必须配 95% CI
方向描述文字描述两组差异方向卡方是无方向检验,需用语言补充
频数表观测频数 + 期望频数表格或正文均可,期望频数便于审稿人核查

关键格式规则:Fisher 不写 chi^2 值

这是最常见的格式错误。由于 Fisher 精确检验不通过 chi^2 统计量导出 p 值,论文中不应出现类似 "chi^2(1) = X.XX" 这样的写法。正确写法只需报告:

Fisher's exact test 显示……p = .XXX

或:

Fisher 精确检验结果显示两变量间存在显著关联,p = .032

SPSS 的"精确显著性(双尾)"栏即为此处应报告的精确 p 值,不要使用"渐进显著性"栏(那是卡方的 p 值)。


三、精确 p 值的书写规则

Fisher 精确检验的 p 值是精确计算值,书写规则与其他检验相同:

情形正确写法错误写法
p 精确值为 .032p = .032p = 0.032
p 精确值为 .000(显示为 .000)p < .001p = .000 或 p = 0.000
p 精确值为 .001p = .001p < .001(此处 .001 是精确值,非上限)
p 精确值为 1.000p = 1.000(或 p > .999)p = 1
单尾还是双尾Fisher 精确检验默认报告双尾单尾仅在有明确方向性假设时使用,须说明

关于单尾与双尾:大多数社会科学研究应报告双尾精确 p 值(two-tailed exact p),SPSS 输出中标注为"精确显著性(双尾)"。如研究有明确方向性假设,可报告单尾,但须在方法章节说明理由。


四、比值比(OR):计算方法与 APA 报告格式

什么是比值比

比值比(Odds Ratio, OR)是衡量 2x2 列联表中两个二值变量关联强度的最常用效应量,在医学、公共卫生和社会科学中广泛使用。

给定 2x2 列联表:

结局+结局-合计
暴露+aba+b
暴露-cdc+d
合计a+cb+dN

$OR = \frac{a/b}{c/d} = \frac{ad}{bc}$

解读规则(Cohen, 1988 等效标准):

OR 值含义
OR = 1两组无差异(无关联)
OR > 1暴露组结局+ 的比值更高
OR < 1暴露组结局+ 的比值更低
效应量参考小: ~1.5,中: ~2.5,大: ~4.3(Chinn, 2000)

OR 的 95% 置信区间

95% CI 是报告 OR 的必要组成部分,APA 7th 要求所有点估计量都配置信区间。常用方法(Woolf 法):

$\ln OR \pm 1.96 \times SE_{\ln OR}$

$SE_{\ln OR} = \sqrt{\frac{1}{a} + \frac{1}{b} + \frac{1}{c} + \frac{1}{d}}$

置信区间的 APA 书写规则:

OR = 3.24, 95% CI [1.18, 8.91]
  • 方括号(不用圆括号)
  • OR 和下限、上限均保留两位小数
  • CI 不加前导零(如 [.47, 1.23] 而非 [0.47, 1.23])

Phi 系数:另一种效应量选择

Phi 系数(phi coefficient, phi)适用于 2x2 列联表,与 OR 互为补充:

$\phi = \sqrt{\frac{\chi^2}{N}}$

注意:即使使用 Fisher 精确检验(不产生 chi^2),也可计算 Phi 作为效应量,此时可用:

$\phi = \sqrt{\frac{(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)}}$

Phi 效应量标准(Cohen, 1988)

效应大小Phi
小效应.10
中效应.30
大效应.50

五、完整 APA 报告模板

场景:小样本医疗研究(2x2 列联表)

研究背景:比较两种治疗方案(A 组 vs. B 组)的治疗有效/无效结果,样本量较小,某单元格期望频数低于 5。

数据

有效无效合计
A 组12315
B 组5813
合计171128

期望频数:A 组有效格 = 15 x 17 / 28 = 9.11,A 组无效格 = 15 x 11 / 28 = 5.89,B 组有效格 = 7.89,B 组无效格 = 5.11(最小格接近 5,且如调整可能更低)。

OR = (12 x 8) / (3 x 5) = 6.40,95% CI 计算后约 [1.18, 34.61],精确 p = .039(双尾)。

Phi = sqrt((12x8 - 3x5)^2 / (15 x 13 x 17 x 11)) = sqrt(6561/36465) ≈ .42。

结果段落模板

由于列联表中存在期望频数低于 5 的单元格,采用 Fisher 精确检验
替代 Pearson 卡方检验评估治疗方案与治疗结果的关联。
结果显示,治疗方案与治疗结果之间存在显著关联,Fisher's exact test,
p = .039(双尾),效应量 Phi = .42,为中等效应(接近大效应,Cohen,1988)。
A 组有效率(80.0%,12/15)显著高于 B 组有效率(38.5%,5/13),
比值比 OR = 6.40,95% CI [1.18, 34.61],表明 A 组患者治疗有效的
比值约为 B 组的 6.4 倍。

填入数值的完整示例

由于列联表中存在期望频数低于 5 的单元格(最小期望频数为 5.11),采用 Fisher 精确检验替代 Pearson 卡方检验评估两种治疗方案(A 组、B 组)与治疗结果(有效、无效)的关联。Fisher 精确检验结果显示,治疗方案与治疗结果之间存在显著关联,p = .039(双尾),效应量 Phi = .42,为中等效应(接近大效应,Cohen,1988)。A 组有效率(80.0%,n = 12/15)显著高于 B 组(38.5%,n = 5/13),比值比 OR = 6.40,95% CI [1.18, 34.61],表明接受 A 方案治疗的患者治疗有效的比值约为 B 方案的 6.4 倍。

场景:社会调查(性别 x 行为分类,小样本)

数据:调查 25 名受访者是否参与某健康行为,按性别分组。

参与未参与合计
男性4812
女性9413
合计131225

期望频数:男性参与 = 12 x 13 / 25 = 6.24,男性未参与 = 5.76,女性参与 = 6.76,女性未参与 = 6.24(所有期望频数均 >= 5,但 N=25 较小且分布不均,Fisher 更稳健)。精确 p = .099,OR = (4 x 4) / (8 x 9) = 0.22,95% CI [.04, 1.19]。

结果段落模板

由于样本量较小(N = 25),且列联表最小期望频数低于 5,
采用 Fisher 精确检验检验性别与健康行为参与的关联。
Fisher's exact test 结果显示,p = .099(双尾),
未达到显著性水平(alpha = .05),效应量 Phi = .32,为中等效应,
表明在本样本中性别与健康行为参与之间的关联虽具实质意义(中等效应),
但未达统计显著,可能与样本量不足导致的检验功效偏低有关。

六、Fisher 精确检验 vs. 卡方检验:报告格式对比

理解两者的报告差异,避免格式混用是核心要点:

报告要素Pearson 卡方检验Fisher 精确检验
统计量chi^2(df) = X.XX不报告 chi^2(省略)
自由度写入括号,如 chi^2(1)不报告 df
p 值来源渐进 p 值精确 p 值(exact p)
p 值格式p = .032p = .032(格式相同)
效应量Phi(2x2)/ Cramer's V(更大表格)Phi 或 OR,2x2 首选 OR
置信区间OR 时配 95% CIOR 时配 95% CI(要求相同)
方法章节说明说明使用卡方说明为何用 Fisher(前提检验结果)

完整对比示例

同一份数据,若期望频数满足要求(正常报告 Pearson 卡方):

性别与购买意愿之间存在显著关联,chi^2(1, N = 120) = 8.74,p = .003,Phi = .27,为中等效应(Cohen,1988)。女性(72.3%)的购买意愿显著高于男性(52.4%),OR = 2.35,95% CI [1.18, 4.67]。

若期望频数不满足,改用 Fisher 精确检验:

由于列联表中存在期望频数低于 5 的单元格,采用 Fisher 精确检验。结果显示,性别与购买意愿之间的关联显著,p = .042(双尾),Phi = .27,为中等效应(Cohen,1988)。女性(72.3%)的购买意愿显著高于男性(52.4%),OR = 2.35,95% CI [1.18, 4.67]。

注意:只有 p 值来源和统计量写法发生变化,效应量(Phi、OR)的报告格式完全相同


七、方法章节如何说明使用了 Fisher 精确检验

APA 7th 要求方法章节交代所有统计检验的选用理由,对 Fisher 精确检验尤为重要,因为它不是"默认选择",需要说明为何替代卡方。

标准方法章节描述模板

采用列联表分析评估[变量A]与[变量B]之间的关联。
分析前检查各单元格期望频数:若所有单元格期望频数均 >= 5,
使用 Pearson 卡方检验(chi^2 test);若存在期望频数低于 5 的单元格
(超过总单元格数的 20%),改用 Fisher 精确检验(Fisher's exact test)。
效应量报告 Phi 系数及比值比(OR)与 95% 置信区间,
参照 Cohen(1988)标准(.10 = 小效应,.30 = 中效应,.50 = 大效应)。
显著性水平设为 alpha = .05,所有检验均为双尾。
统计分析使用 ChatSRS(chi_square 指令,68 类检验引擎),
软件自动判断期望频数条件并输出对应检验结果。

八、在 ChatSRS 一键获得规范 Fisher 检验报告

打开 chatsrs.com,上传数据后输入:

"对性别(男/女)和购买意愿(是/否)做列联表分析;先检查期望频数,若有单元格低于 5 则自动切换 Fisher 精确检验;输出精确 p 值(双尾)、Phi 效应量、比值比 OR 及 95% 置信区间,并给出符合 APA 7th 格式的完整结果报告段落,标注哪些单元格期望频数不足。"

ChatSRS 的 chi_square 指令(68 类关联检验引擎)会自动:

  1. 计算各单元格期望频数,判断是否满足卡方前提
  2. 不满足时自动切换 Fisher 精确检验,在输出中注明切换原因
  3. 输出精确 p 值(双尾/单尾可选)、OR 及 95% CI
  4. 生成符合 APA 7th 格式的完整报告段落,可直接复制进论文

如需同时查看观测频数与期望频数对照表,在指令末尾加"同时输出频数表格(含期望频数和残差)"。


九、常见错误对照表

常见错误正确写法违反规则
Fisher 结果写成 chi^2(1) = X.XX省略 chi^2,只报告 p 值Fisher 不产生 chi^2 统计量
p = .000p < .001.000 是舍入假值
p = 0.042p = .042APA 不加前导零
OR 无置信区间:OR = 6.40OR = 6.40, 95% CI [1.18, 34.61]点估计必须配置信区间
置信区间用圆括号:(1.18, 34.61)[1.18, 34.61]APA 规定用方括号
未说明为何用 Fisher 而非卡方方法章节注明期望频数检查结果方法透明性要求
期望频数满足时仍用 Fisher满足条件时用 Pearson 卡方Fisher 是替代方案,非首选
报告渐进 p 值(来自卡方栏)报告精确 p 值(SPSS "精确"栏)Fisher p 值必须来自精确计算
无效应量报告 Phi 或 OR(两者均可)APA 7th 要求所有检验报告效应量

常见 FAQ

Q:Fisher 精确检验只适用于 2x2 表格吗?超过两行两列怎么办?

A:标准 Fisher 精确检验设计用于 2x2 列联表,但已有扩展版本(Freeman-Halton 检验)可处理 2x3、3x3 等更大表格。SPSS 在"精确检验"模块中支持对任意维度列联表进行精确检验;R 的 fisher.test() 函数同样支持更大表格(但计算量随样本量和表格维度增长,超大样本可能运行较慢)。报告格式与 2x2 类似,省略 chi^2,报告精确 p 值,效应量改用 Cramer's V(不再是 Phi)。

Q:OR 低于 1 怎么解读和报告?

A:OR < 1 表示"暴露组"结局事件的比值低于"对照组"。OR = 0.22 意味着暴露组事件比值约为对照组的 22%,即暴露组发生事件的可能性更低。报告时直接写出数值即可,不需要取倒数:OR = 0.22,95% CI [.04, 1.19]。如果置信区间包含 1.0(如本例),则说明效应不显著(与精确 p > .05 对应)。为了文字表达清晰,可写"B 组有效率显著低于 A 组(OR = 0.22),约为 A 组的五分之一",同时说明 95% CI 包含 1.00,p = .099,结果未达显著。

Q:精确 p 值比卡方 p 值更小还是更大?

A:不固定,取决于数据分布。通常情况下,当期望频数偏低(卡方前提不满足)时,卡方的渐进 p 值往往比 Fisher 精确 p 值更小(即卡方倾向于"高估显著性"),这正是小样本时卡方容易误导结论的原因。但也存在卡方 p 值较大的情形。规则很简单:期望频数不满足,无论结论如何都应改用 Fisher,不能因为卡方结果更"好看"就保留卡方。

Q:方法章节一定要写"为什么用 Fisher 而非卡方"吗?

A:强烈建议写明。审稿人看到 Fisher 精确检验,首先会检查你是否符合使用条件(期望频数不足)。如果方法章节只写"采用 Fisher 精确检验"而不说明原因,审稿人可能会质疑"为什么不用卡方?"。规范写法是:在方法章节的统计分析部分说明"分析前检查期望频数,存在不满足卡方前提的单元格(期望频数 < 5),因此采用 Fisher 精确检验"。这既符合透明性要求,也让审稿人一眼看出你对统计前提了然于胸。


快速参考:Fisher 精确检验报告格式速查卡

[结果段落 — 显著]
由于 [某单元格] 期望频数为 X.XX(< 5),采用 Fisher 精确检验。
Fisher's exact test 结果显示,[变量A]与[变量B]之间存在显著关联,
p = .XXX(双尾),Phi = .XX([大小]效应)。
[组1] 的[结局+]比率(XX.X%)[显著高于/低于][组2](XX.X%),
OR = X.XX,95% CI [X.XX, X.XX]。

[结果段落 — 不显著]
Fisher's exact test 结果显示,[变量A]与[变量B]之间的关联未达显著,
p = .XXX(双尾),Phi = .XX([大小]效应)。
置信区间 95% CI [X.XX, X.XX] 包含 1.00,进一步证实两变量无显著差异。

[方法章节说明]
分析前检查期望频数,存在单元格期望频数低于 5(最小期望频数 = X.XX),
采用 Fisher 精确检验(Fisher's exact test)替代 Pearson 卡方检验。
效应量报告 Phi 系数及 OR(95% CI),显著性水平 alpha = .05,双尾。

[卡方 vs. Fisher 格式对比速查]
Pearson 卡方: chi^2(1, N = 28) = X.XX, p = .XXX, Phi = .XX
Fisher 精确: Fisher's exact test, p = .XXX, Phi = .XX, OR = X.XX [X.XX, X.XX]

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。