教程 ·
配对样本 t 检验完整教程 — 前后测/自身对照用 AI 一句话完成 + APA 报告
配对样本 t 检验(前后测/自身对照)专项教程:与独立样本 t 区分、d_z 效应量计算、APA 7th 格式报告句式,以及在 ChatSRS 用一句话完成 SPSS/R/Stata 三引擎全套输出。
同一批人测了两次,干预前 vs 干预后,每人自己跟自己比——这就是配对设计。SPSS 里找对话框、手算差值、再查 Cohen's d 公式……一套下来半小时。这篇教程教你用 AI 一句话跑完整个流程,差值分布、t 检验、d_z 效应量、APA 报告全部一次给齐。
为什么前后测数据不能用独立样本 t 检验
很多初学者在拿到前后测数据时,会下意识地把"干预前"和"干预后"当作两个独立组来比较——用独立样本 t 检验。这是一个经典且严重的方法论错误。
独立样本 t 检验的前提假设是:两组观测值互相独立,两组之间没有任何匹配关系。 但在前后测设计中,同一个人同时贡献了"前测"和"后测"两个数值,这两个数值天然相关——记忆力好的人在前测和后测都可能偏高,焦虑水平低的人两次都可能偏低。这种被试间的个体差异如果不加控制,就会混入误差项,使检验功效大幅下降。
配对样本 t 检验(paired-samples t-test) 的做法是:先计算每个被试的差值 d_i = 后测 - 前测,再对这 n 个差值做单样本 t 检验(检验差值均值是否等于 0)。通过这一步,个体差异被彻底消除,检验功效显著提升。
| 对比维度 | 独立样本 t 检验 | 配对样本 t 检验 |
|---|---|---|
| 被试结构 | 两组不同的人 | 同一批人测两次(或两个匹配的人) |
| 误差来源 | 包含被试间个体差异 | 个体差异已从误差中剥离 |
| 检验功效 | 较低 | 较高(尤其当个体差异大时) |
| 自由度 | df = n1 + n2 - 2 | df = n - 1(n 为配对数) |
| 效应量 | Cohen's d(两组均值差/合并标准差) | Cohen's d_z(均值差/差值标准差) |
| 典型场景 | 实验组 vs 对照组 | 干预前 vs 干预后;左手 vs 右手;同一人两种条件 |
何时必须用配对 t 检验:
- 前后测设计(Pre-Post Design):同一批人接受干预,测量干预前后指标
- 自身对照(Crossover Design):同一个体先后接受两种处理
- 匹配对设计(Matched-Pairs Design):按某些特征人为匹配的两组(如双胞胎研究、按年龄体重1:1配对)
效应量 d_z:配对设计的专属指标
配对 t 检验有自己的效应量计算公式,不能直接套用独立样本 t 检验的 Cohen's d 公式。
d_z 的定义与公式
d_z = M_diff / SD_diff
其中:
M_diff:差值(d_i = 后测 - 前测)的均值SD_diff:差值的标准差(注意:不是两次测量标准差的平均,而是差值序列本身的标准差)
d_z 又称"差值效应量",直接反映干预产生的变化量相对于差值变异的大小。
为什么不能用普通 Cohen's d
普通 Cohen's d 的分母是两组合并标准差(pooled SD),包含了被试间的个体差异。配对设计中个体差异已从误差中消除,如果仍用 pooled SD 作分母,会低估真实效应量,因为分母被额外的个体差异"稀释"了。
例如,同样的干预效果,如果被试间原始分数差异很大(SD_pooled 很大),用普通 Cohen's d 计算出来的效应量会偏小;而 d_z 只关注差值的变异,不受被试间差异影响,更准确地刻画干预效应。
Cohen's d_z 效应量阈值(Cohen 1988 标准)
| d_z 值 | 效应量等级 | 含义 |
|---|---|---|
| < 0.20 | 可忽略 | 干预效果极小 |
| 0.20 - 0.49 | 小效应 | 有统计意义但实践意义有限 |
| 0.50 - 0.79 | 中效应 | 具有实践价值的干预效果 |
| >= 0.80 | 大效应 | 干预效果显著,实践价值高 |
特别说明:部分文献(如 Lakens, 2013)指出 d_z 在不同软件中可能有两种计算口径:一种以 sqrt(n) 缩放(等价于 t/sqrt(n)),另一种直接用 SD_diff。ChatSRS 输出的 d_z 采用 APA 推荐的 M_diff/SD_diff 定义,与 SPSS 输出一致,并在结果中明确标注计算口径。
案例数据:正念冥想对焦虑水平的干预效果
研究背景
某高校心理健康中心评估为期 4 周的正念冥想课程对大学生焦虑水平的改善效果。研究对象为 42 名自愿参加的大学生,课程前后各用广泛性焦虑量表(GAD-7,0-21 分,分数越高焦虑越重) 测量一次。
数据结构
participant_id pre_gad7 post_gad7
001 14 9
002 11 8
003 16 10
004 8 6
...(共 42 行,每人 1 行,含前测和后测两列)
研究问题:4 周正念冥想课程是否显著降低大学生的焦虑水平?效应量有多大?
用 AI 一句话完成配对样本 t 检验
在 chatsrs.com 上传数据后输入:
"以 pre_gad7 为干预前、post_gad7 为干预后,对 42 名被试做配对样本 t 检验。 请输出:
- 前测和后测的描述统计(M、SD、95% CI)及差值描述统计(M_diff、SD_diff)
- 差值正态性检验(Shapiro-Wilk)及差值分布图(直方图 + QQ 图)
- 配对 t 检验结果(t 值、df、p 值、95% CI of difference)
- Cohen's d_z 效应量(M_diff / SD_diff 口径)及效应量等级
- 三线表格式
- APA 7th 中文报告句式"
60 秒后 ChatSRS 输出完整六部分结果,SPSS、R、Stata 三引擎任选,结果保持一致。
输出结果怎么读
第一块:描述统计
表 1 正念冥想干预前后 GAD-7 焦虑得分描述统计(N = 42)
M SD 95% CI
前测(pre_gad7) 11.83 3.47 [10.75, 12.91]
后测(post_gad7) 8.26 3.12 [7.29, 9.23]
差值(pre - post) 3.57 2.84 [2.69, 4.45]
注:差值 = 前测 - 后测,正值表示焦虑分数下降(改善)。
怎么看:均值差 3.57 分,95% CI 不含 0([2.69, 4.45]),从描述统计阶段就可以看出干预方向。
第二块:差值正态性检验
Shapiro-Wilk 正态性检验(差值序列,n = 42)
W = 0.972, p = .382
-> 差值服从正态分布,满足配对 t 检验前提假设。
配对 t 检验的正态性假设对象是差值序列,而非前测或后测的原始分布。差值 W = 0.972,p = .382 > .05,正态假设满足,可直接使用参数检验。
若差值不服从正态分布(p < .05),且样本量较小(n < 30),应改用 Wilcoxon 符号秩检验(非参数配对检验)。ChatSRS 在 Shapiro-Wilk p < .05 时会自动警告并提供非参数替代方案。
第三块:配对 t 检验结果三线表
表 2 配对样本 t 检验结果(N = 42)
M_diff SD_diff 95% CI t df p d_z
pre - post 3.57 2.84 [2.69, 4.45] 8.14 41 < .001 0.84
注:CI = 差值均值的 95% 置信区间;d_z = M_diff / SD_diff;效应量等级参照 Cohen(1988):
小 >= 0.20,中 >= 0.50,大 >= 0.80。d_z = 0.84 为大效应。
逐列解读:
| 列名 | 含义 | 本例解读 |
|---|---|---|
| M_diff | 差值均值(前测 - 后测) | 3.57 分,干预后平均改善 3.57 分 |
| SD_diff | 差值标准差 | 2.84,被试改善幅度的个体差异 |
| 95% CI | 差值均值的置信区间 | [2.69, 4.45],不含 0,干预有效 |
| t | t 统计量 = M_diff / (SD_diff / sqrt(n)) | 8.14,远超临界值 |
| df | 自由度 = n - 1 | 41 |
| p | 双尾 p 值 | < .001,极显著 |
| d_z | 差值效应量 | 0.84,大效应 |
论文里怎么报告(APA 7th 格式)
APA 7th 对配对样本 t 检验的报告要求:必须报告 t、df、p 值和效应量 d_z,并报告 95% CI。
方法节(统计方法说明):
采用配对样本 t 检验比较正念冥想干预前后 GAD-7 焦虑得分的差异。在分析前对差值序列进行 Shapiro-Wilk 正态性检验,以确认参数检验前提假设。采用 Cohen's d_z(M_diff/SD_diff)作为效应量指标,效应量等级参照 Cohen(1988)标准:小效应 d_z >= 0.20,中效应 d_z >= 0.50,大效应 d_z >= 0.80。统计分析以 SPSS 27 实施,检验水准 alpha = .05(双尾)。
结果节(可直接复制进论文):
Shapiro-Wilk 检验结果显示差值序列正态性良好,W = 0.97, p = .382,满足配对 t 检验前提假设。
配对样本 t 检验结果表明,正念冥想干预前的 GAD-7 焦虑得分(M = 11.83, SD = 3.47)显著高于干预后(M = 8.26, SD = 3.12),t(41) = 8.14, p < .001, 95% CI [2.69, 4.45], d_z = 0.84,为大效应,表明 4 周正念冥想课程对大学生焦虑水平有显著改善作用。
APA 格式规范总结:
| 要素 | 格式示例 |
|---|---|
| t 值 + df | t(41) = 8.14 |
| p 值 | p < .001(小数点前不写 0) |
| 95% CI of difference | 95% CI [2.69, 4.45] |
| 效应量 | d_z = 0.84 |
| 描述统计 | M = 11.83, SD = 3.47 |
| 效应量来源引用 | Cohen(1988) |
APA 7th 细节提醒:
- t 的自由度写在括号内:t(41) 而非 t = 8.14 (df = 41)
- 95% CI 用方括号 [ ],两端数值间用逗号加空格
- p 值小数点前不写 0(p < .001,不写 p < 0.001)
- 效应量 d_z 需注明计算口径,避免与普通 Cohen's d 混淆
配对 t 检验 vs 其他检验方法:选对的关键
许多研究者对"两次测量"数据的方法选择感到困惑,下表提供决策框架:
| 场景 | 推荐方法 | 理由 |
|---|---|---|
| 同一批人测 2 次,差值正态 | 配对样本 t 检验 | 参数检验,功效最高 |
| 同一批人测 2 次,差值不正态且 n 小 | Wilcoxon 符号秩检验 | 非参数替代 |
| 同一批人测 3 次及以上 | 重复测量方差分析(Repeated Measures ANOVA) | 处理多时点全局检验 |
| 两组不同的人各测 1 次 | 独立样本 t 检验 | 无配对关系 |
| 两组不同的人各测多次 | 混合 ANOVA(Mixed ANOVA) | 组间 + 组内双因素 |
配对 t 检验与重复测量 ANOVA 的关系:当被试内因素只有 2 个水平时,重复测量 ANOVA 与配对 t 检验完全等价,F = t^2,p 值一致。被试内因素 >= 3 个水平时,必须使用重复测量 ANOVA(含球形检验 + Greenhouse-Geisser 校正)。
常见问题 FAQ
Q1:配对 t 检验的"配对"是什么意思?非前后测的数据能用吗?
A:配对(paired)的本质是:每两个观测值之间存在一一对应的关联,这种关联导致它们不再相互独立。典型的三类配对设计:(1) 时间配对——同一人的前测和后测;(2) 条件配对——同一人在两种实验条件下的表现;(3) 人为匹配——按年龄、性别、体重等特征将两组受试者1:1配对(如双胞胎研究、匹配病例对照研究)。只要满足"每个第一组数值都有唯一对应的第二组数值",均可使用配对 t 检验。
Q2:我的差值分布不正态,还能用配对 t 检验吗?
A:取决于样本量。当 n >= 30 时,中心极限定理保证 t 统计量近似正态分布,即使差值轻度偏斜也可继续使用配对 t 检验,结果仍然可靠。当 n < 30 且 Shapiro-Wilk p < .05 时,应改用 Wilcoxon 符号秩检验(非参数配对检验),报告中位数差而非均值差。ChatSRS 在检测到正态性违反时会自动同时输出参数和非参数两套结果,方便你根据审稿要求选择。
Q3:d_z = 0.84 是"大效应",这个阈值是怎么来的?
A:来自 Cohen(1988)提出的效应量分级标准,适用于 t 检验族。对于 d 系列效应量,小效应 d >= 0.20、中效应 d >= 0.50、大效应 d >= 0.80。需要注意:这些阈值是 Cohen 基于行为科学研究惯例提出的经验参考值,不是绝对标准。在医学或生理研究中,0.30 的 d_z 可能已有显著临床意义;在心理学教育研究中,0.80 的效应量才能说明实践价值。报告时需结合具体领域背景解读效应量大小。
Q4:配对 t 检验 p < .05,但 95% CI 很窄(比如 [0.02, 0.08]),这个结果有实践意义吗?
A:这是统计显著性与临床/实践显著性的经典区分。大样本下,即使效应量极小(d_z = 0.03)也能达到统计显著(p < .05),但实际改善幅度微乎其微。APA 要求同时报告效应量和 95% CI 正是为了这个目的:CI 的范围告诉你效应大小的精确区间,d_z 告诉你效应的实践意义。只有同时关注 p 值(是否有效)和 d_z(效应多大),才能得出完整的统计结论。
Q5:单尾还是双尾?我有方向假设(预期后测 < 前测),能用单尾检验吗?
A:原则上,如果在数据收集前(而非看完结果后)已有明确的方向性假设,使用单尾检验在统计上是允许的,检验功效更高(相当于把 alpha = .05 全部放在一侧)。但实践中,大多数心理学和医学期刊、APA 及 CONSORT 指南均建议使用双尾检验,原因是:(1) 单尾检验容易被事后合理化滥用;(2) 双尾检验更保守、结论更可信。ChatSRS 默认输出双尾结果,若需单尾可在指令中明确说明"预期方向为下降,用单尾检验",系统将同时输出双尾和单尾 p 值并加注说明。
小结
配对样本 t 检验是处理前后测 / 自身对照数据的标准方法,三个核心要点:
- 与独立样本 t 区分:同一批人测两次,差值检验,绝不能当作两个独立组
- 效应量用 d_z:分母是差值标准差,不是合并标准差,准确刻画干预效应
- APA 报告格式:t(df) + p + 95% CI of difference + d_z,缺一不可
在 chatsrs.com 上传前后测数据,一句自然语言指令即可获得:
- Shapiro-Wilk 差值正态性诊断
- 差值描述统计 + 三线表
- t 值、df、双尾 p 值、95% CI
- Cohen's d_z 效应量及等级解读
- 可直接粘贴进论文的 APA 7th 中文报告句式
- SPSS、R、Stata 三引擎结果,论文附注引用任选
相关阅读
- 重复测量方差分析完整教程 — 配对 t 的多时点扩展,含球形检验 + GG 校正
- 独立样本与单样本 t 检验完整教程 — t 检验全系,与本文互为参照
- 非参数检验完整教程 — 差值非正态时的 Wilcoxon 符号秩替代方案
- 毕业论文统计分析救星 — 从选方法到写论文的完整 AI 工作流
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。