教程 ·

配对样本 t 检验完整教程 — 前后测/自身对照用 AI 一句话完成 + APA 报告

配对样本 t 检验(前后测/自身对照)专项教程:与独立样本 t 区分、d_z 效应量计算、APA 7th 格式报告句式,以及在 ChatSRS 用一句话完成 SPSS/R/Stata 三引擎全套输出。

同一批人测了两次,干预前 vs 干预后,每人自己跟自己比——这就是配对设计。SPSS 里找对话框、手算差值、再查 Cohen's d 公式……一套下来半小时。这篇教程教你用 AI 一句话跑完整个流程,差值分布、t 检验、d_z 效应量、APA 报告全部一次给齐。


为什么前后测数据不能用独立样本 t 检验

很多初学者在拿到前后测数据时,会下意识地把"干预前"和"干预后"当作两个独立组来比较——用独立样本 t 检验。这是一个经典且严重的方法论错误。

独立样本 t 检验的前提假设是:两组观测值互相独立,两组之间没有任何匹配关系。 但在前后测设计中,同一个人同时贡献了"前测"和"后测"两个数值,这两个数值天然相关——记忆力好的人在前测和后测都可能偏高,焦虑水平低的人两次都可能偏低。这种被试间的个体差异如果不加控制,就会混入误差项,使检验功效大幅下降。

配对样本 t 检验(paired-samples t-test) 的做法是:先计算每个被试的差值 d_i = 后测 - 前测,再对这 n 个差值做单样本 t 检验(检验差值均值是否等于 0)。通过这一步,个体差异被彻底消除,检验功效显著提升。

对比维度独立样本 t 检验配对样本 t 检验
被试结构两组不同的人同一批人测两次(或两个匹配的人)
误差来源包含被试间个体差异个体差异已从误差中剥离
检验功效较低较高(尤其当个体差异大时)
自由度df = n1 + n2 - 2df = n - 1(n 为配对数)
效应量Cohen's d(两组均值差/合并标准差)Cohen's d_z(均值差/差值标准差)
典型场景实验组 vs 对照组干预前 vs 干预后;左手 vs 右手;同一人两种条件

何时必须用配对 t 检验:

  • 前后测设计(Pre-Post Design):同一批人接受干预,测量干预前后指标
  • 自身对照(Crossover Design):同一个体先后接受两种处理
  • 匹配对设计(Matched-Pairs Design):按某些特征人为匹配的两组(如双胞胎研究、按年龄体重1:1配对)

效应量 d_z:配对设计的专属指标

配对 t 检验有自己的效应量计算公式,不能直接套用独立样本 t 检验的 Cohen's d 公式

d_z 的定义与公式

d_z = M_diff / SD_diff

其中:

  • M_diff:差值(d_i = 后测 - 前测)的均值
  • SD_diff:差值的标准差(注意:不是两次测量标准差的平均,而是差值序列本身的标准差)

d_z 又称"差值效应量",直接反映干预产生的变化量相对于差值变异的大小。

为什么不能用普通 Cohen's d

普通 Cohen's d 的分母是两组合并标准差(pooled SD),包含了被试间的个体差异。配对设计中个体差异已从误差中消除,如果仍用 pooled SD 作分母,会低估真实效应量,因为分母被额外的个体差异"稀释"了。

例如,同样的干预效果,如果被试间原始分数差异很大(SD_pooled 很大),用普通 Cohen's d 计算出来的效应量会偏小;而 d_z 只关注差值的变异,不受被试间差异影响,更准确地刻画干预效应。

Cohen's d_z 效应量阈值(Cohen 1988 标准)

d_z 值效应量等级含义
< 0.20可忽略干预效果极小
0.20 - 0.49小效应有统计意义但实践意义有限
0.50 - 0.79中效应具有实践价值的干预效果
>= 0.80大效应干预效果显著,实践价值高

特别说明:部分文献(如 Lakens, 2013)指出 d_z 在不同软件中可能有两种计算口径:一种以 sqrt(n) 缩放(等价于 t/sqrt(n)),另一种直接用 SD_diff。ChatSRS 输出的 d_z 采用 APA 推荐的 M_diff/SD_diff 定义,与 SPSS 输出一致,并在结果中明确标注计算口径。


案例数据:正念冥想对焦虑水平的干预效果

研究背景

某高校心理健康中心评估为期 4 周的正念冥想课程对大学生焦虑水平的改善效果。研究对象为 42 名自愿参加的大学生,课程前后各用广泛性焦虑量表(GAD-7,0-21 分,分数越高焦虑越重) 测量一次。

数据结构

participant_id    pre_gad7    post_gad7
001               14          9
002               11          8
003               16          10
004               8           6
...(共 42 行,每人 1 行,含前测和后测两列)

研究问题:4 周正念冥想课程是否显著降低大学生的焦虑水平?效应量有多大?


用 AI 一句话完成配对样本 t 检验

chatsrs.com 上传数据后输入:

"以 pre_gad7 为干预前、post_gad7 为干预后,对 42 名被试做配对样本 t 检验。 请输出:

  1. 前测和后测的描述统计(M、SD、95% CI)及差值描述统计(M_diff、SD_diff)
  2. 差值正态性检验(Shapiro-Wilk)及差值分布图(直方图 + QQ 图)
  3. 配对 t 检验结果(t 值、df、p 值、95% CI of difference)
  4. Cohen's d_z 效应量(M_diff / SD_diff 口径)及效应量等级
  5. 三线表格式
  6. APA 7th 中文报告句式"

60 秒后 ChatSRS 输出完整六部分结果,SPSS、R、Stata 三引擎任选,结果保持一致。


输出结果怎么读

第一块:描述统计

表 1  正念冥想干预前后 GAD-7 焦虑得分描述统计(N = 42)

                    M        SD       95% CI
前测(pre_gad7)   11.83    3.47     [10.75, 12.91]
后测(post_gad7)   8.26    3.12     [7.29, 9.23]
差值(pre - post)  3.57    2.84     [2.69, 4.45]

注:差值 = 前测 - 后测,正值表示焦虑分数下降(改善)。

怎么看:均值差 3.57 分,95% CI 不含 0([2.69, 4.45]),从描述统计阶段就可以看出干预方向。


第二块:差值正态性检验

Shapiro-Wilk 正态性检验(差值序列,n = 42)
  W = 0.972, p = .382

-> 差值服从正态分布,满足配对 t 检验前提假设。

配对 t 检验的正态性假设对象是差值序列,而非前测或后测的原始分布。差值 W = 0.972,p = .382 > .05,正态假设满足,可直接使用参数检验。

若差值不服从正态分布(p < .05),且样本量较小(n < 30),应改用 Wilcoxon 符号秩检验(非参数配对检验)。ChatSRS 在 Shapiro-Wilk p < .05 时会自动警告并提供非参数替代方案。


第三块:配对 t 检验结果三线表

表 2  配对样本 t 检验结果(N = 42)

                  M_diff   SD_diff   95% CI           t       df    p          d_z
pre - post        3.57     2.84     [2.69, 4.45]     8.14    41    < .001     0.84

注:CI = 差值均值的 95% 置信区间;d_z = M_diff / SD_diff;效应量等级参照 Cohen(1988):
   小 >= 0.20,中 >= 0.50,大 >= 0.80。d_z = 0.84 为大效应。

逐列解读:

列名含义本例解读
M_diff差值均值(前测 - 后测)3.57 分,干预后平均改善 3.57 分
SD_diff差值标准差2.84,被试改善幅度的个体差异
95% CI差值均值的置信区间[2.69, 4.45],不含 0,干预有效
tt 统计量 = M_diff / (SD_diff / sqrt(n))8.14,远超临界值
df自由度 = n - 141
p双尾 p 值< .001,极显著
d_z差值效应量0.84,大效应

论文里怎么报告(APA 7th 格式)

APA 7th 对配对样本 t 检验的报告要求:必须报告 t、df、p 值和效应量 d_z,并报告 95% CI


方法节(统计方法说明):

采用配对样本 t 检验比较正念冥想干预前后 GAD-7 焦虑得分的差异。在分析前对差值序列进行 Shapiro-Wilk 正态性检验,以确认参数检验前提假设。采用 Cohen's d_z(M_diff/SD_diff)作为效应量指标,效应量等级参照 Cohen(1988)标准:小效应 d_z >= 0.20,中效应 d_z >= 0.50,大效应 d_z >= 0.80。统计分析以 SPSS 27 实施,检验水准 alpha = .05(双尾)。


结果节(可直接复制进论文):

Shapiro-Wilk 检验结果显示差值序列正态性良好,W = 0.97, p = .382,满足配对 t 检验前提假设。

配对样本 t 检验结果表明,正念冥想干预前的 GAD-7 焦虑得分(M = 11.83, SD = 3.47)显著高于干预后(M = 8.26, SD = 3.12),t(41) = 8.14, p < .001, 95% CI [2.69, 4.45], d_z = 0.84,为大效应,表明 4 周正念冥想课程对大学生焦虑水平有显著改善作用。


APA 格式规范总结:

要素格式示例
t 值 + dft(41) = 8.14
p 值p < .001(小数点前不写 0)
95% CI of difference95% CI [2.69, 4.45]
效应量d_z = 0.84
描述统计M = 11.83, SD = 3.47
效应量来源引用Cohen(1988)

APA 7th 细节提醒

  • t 的自由度写在括号内:t(41) 而非 t = 8.14 (df = 41)
  • 95% CI 用方括号 [ ],两端数值间用逗号加空格
  • p 值小数点前不写 0(p < .001,不写 p < 0.001)
  • 效应量 d_z 需注明计算口径,避免与普通 Cohen's d 混淆

配对 t 检验 vs 其他检验方法:选对的关键

许多研究者对"两次测量"数据的方法选择感到困惑,下表提供决策框架:

场景推荐方法理由
同一批人测 2 次,差值正态配对样本 t 检验参数检验,功效最高
同一批人测 2 次,差值不正态且 n 小Wilcoxon 符号秩检验非参数替代
同一批人测 3 次及以上重复测量方差分析(Repeated Measures ANOVA)处理多时点全局检验
两组不同的人各测 1 次独立样本 t 检验无配对关系
两组不同的人各测多次混合 ANOVA(Mixed ANOVA)组间 + 组内双因素

配对 t 检验与重复测量 ANOVA 的关系:当被试内因素只有 2 个水平时,重复测量 ANOVA 与配对 t 检验完全等价,F = t^2,p 值一致。被试内因素 >= 3 个水平时,必须使用重复测量 ANOVA(含球形检验 + Greenhouse-Geisser 校正)。


常见问题 FAQ

Q1:配对 t 检验的"配对"是什么意思?非前后测的数据能用吗?

A:配对(paired)的本质是:每两个观测值之间存在一一对应的关联,这种关联导致它们不再相互独立。典型的三类配对设计:(1) 时间配对——同一人的前测和后测;(2) 条件配对——同一人在两种实验条件下的表现;(3) 人为匹配——按年龄、性别、体重等特征将两组受试者1:1配对(如双胞胎研究、匹配病例对照研究)。只要满足"每个第一组数值都有唯一对应的第二组数值",均可使用配对 t 检验。

Q2:我的差值分布不正态,还能用配对 t 检验吗?

A:取决于样本量。当 n >= 30 时,中心极限定理保证 t 统计量近似正态分布,即使差值轻度偏斜也可继续使用配对 t 检验,结果仍然可靠。当 n < 30 且 Shapiro-Wilk p < .05 时,应改用 Wilcoxon 符号秩检验(非参数配对检验),报告中位数差而非均值差。ChatSRS 在检测到正态性违反时会自动同时输出参数和非参数两套结果,方便你根据审稿要求选择。

Q3:d_z = 0.84 是"大效应",这个阈值是怎么来的?

A:来自 Cohen(1988)提出的效应量分级标准,适用于 t 检验族。对于 d 系列效应量,小效应 d >= 0.20、中效应 d >= 0.50、大效应 d >= 0.80。需要注意:这些阈值是 Cohen 基于行为科学研究惯例提出的经验参考值,不是绝对标准。在医学或生理研究中,0.30 的 d_z 可能已有显著临床意义;在心理学教育研究中,0.80 的效应量才能说明实践价值。报告时需结合具体领域背景解读效应量大小。

Q4:配对 t 检验 p < .05,但 95% CI 很窄(比如 [0.02, 0.08]),这个结果有实践意义吗?

A:这是统计显著性与临床/实践显著性的经典区分。大样本下,即使效应量极小(d_z = 0.03)也能达到统计显著(p < .05),但实际改善幅度微乎其微。APA 要求同时报告效应量和 95% CI 正是为了这个目的:CI 的范围告诉你效应大小的精确区间,d_z 告诉你效应的实践意义。只有同时关注 p 值(是否有效)和 d_z(效应多大),才能得出完整的统计结论。

Q5:单尾还是双尾?我有方向假设(预期后测 < 前测),能用单尾检验吗?

A:原则上,如果在数据收集前(而非看完结果后)已有明确的方向性假设,使用单尾检验在统计上是允许的,检验功效更高(相当于把 alpha = .05 全部放在一侧)。但实践中,大多数心理学和医学期刊、APA 及 CONSORT 指南均建议使用双尾检验,原因是:(1) 单尾检验容易被事后合理化滥用;(2) 双尾检验更保守、结论更可信。ChatSRS 默认输出双尾结果,若需单尾可在指令中明确说明"预期方向为下降,用单尾检验",系统将同时输出双尾和单尾 p 值并加注说明。


小结

配对样本 t 检验是处理前后测 / 自身对照数据的标准方法,三个核心要点:

  1. 与独立样本 t 区分:同一批人测两次,差值检验,绝不能当作两个独立组
  2. 效应量用 d_z:分母是差值标准差,不是合并标准差,准确刻画干预效应
  3. APA 报告格式:t(df) + p + 95% CI of difference + d_z,缺一不可

chatsrs.com 上传前后测数据,一句自然语言指令即可获得:

  • Shapiro-Wilk 差值正态性诊断
  • 差值描述统计 + 三线表
  • t 值、df、双尾 p 值、95% CI
  • Cohen's d_z 效应量及等级解读
  • 可直接粘贴进论文的 APA 7th 中文报告句式
  • SPSS、R、Stata 三引擎结果,论文附注引用任选

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。