统计百科 ·

PSM 倾向得分匹配的 APA 报告怎么写?平衡性检验、ATT 估计与敏感性分析格式全解

统计百科:专攻倾向得分匹配(PSM)的 APA 7th 报告格式——匹配前后协变量平衡性检验、ATT 平均处理效应估计量的 APA 写法、Rosenbaum 敏感性分析报告模板,及方法章节可直接套用的完整句式。

PSM(Propensity Score Matching,倾向得分匹配)是准实验设计中模拟随机化的主流方法,但许多论文只报告了"成功匹配",却漏掉了审稿人最在意的三件事:匹配后协变量是否真的平衡、ATT 的置信区间与效应量、以及隐藏混淆变量的敏感性。本文专攻"PSM 结果怎么规范写进论文",给出 APA 7th 所有关键环节的完整模板,并逐一盘点审稿人最常挑的 PSM 格式问题。


你的 PSM 报告有这些问题吗?

审稿人或导师关于 PSM 结果最常见的反馈:

  • "只说'已完成 1:1 最近邻匹配',匹配后协变量平衡性在哪里?"
  • "标准化均值差(SMD)的判断标准是什么?为什么说达到了平衡?"
  • "ATT 估计结果缺置信区间和 p 值,无法判断统计显著性"
  • "没有做 Rosenbaum 敏感性分析,如何排除未观测混淆变量的威胁?"
  • "倾向得分模型包含哪些协变量、用什么估计方法,方法章节未说明"
  • "匹配后样本量从多少降到多少,损失率多大,未报告"

这些问题集中在 PSM 报告的三个核心环节:匹配过程平衡性检验因果估计与不确定性。本文只讲一件事:PSM 结果到底怎么规范写进论文的每一个位置

如果你还没看过姊妹篇 F 值的 APA 7th 报告写法,建议先掌握基础格式规则(p 值不加前导零、效应量必报等),本文默认已了解。


一、PSM 是什么,为什么需要专门的报告规范

倾向得分的直觉含义

倾向得分(Propensity Score)定义为:在给定观测协变量 X 的条件下,个体被分配到处理组的条件概率

$e(X) = P(W = 1 \mid X)$

  • W = 1 表示处理组(如接受干预/政策),W = 0 表示对照组
  • 核心思想:若两个个体的倾向得分相同,则他们在已观测协变量上的分布"如同随机分配"——可以用来估计处理效应

ATT:最常报告的因果估计量

PSM 最常估计的因果量是 ATT(Average Treatment Effect on the Treated,处理组的平均处理效应)

$\text{ATT} = E[Y(1) - Y(0) \mid W = 1]$

含义:"对于实际接受处理的那批人,如果反事实地让他们不接受处理,结果均值差异是多少?"

ATT 是 PSM 的自然估计目标,因为匹配是从对照组中为每个处理组个体找"替身"——估计的是处理组的处理效应,而非全样本的 ATE。

PSM 报告为何比 ANOVA 复杂

环节需要报告的内容
倾向得分模型logistic 回归 / 机器学习;纳入的协变量;AUC / C 统计量
匹配策略1:1 / 1:k 最近邻;有无放回;卡钳值(caliper);匹配后样本量
平衡性检验每个协变量的 SMD(匹配前 vs. 匹配后);Love plot;KS 检验(可选)
因果估计ATT、标准误(bootstrap 或解析式)、95% CI、p 值
敏感性分析Rosenbaum bounds 的 Gamma 值;结论稳健性陈述

二、平衡性检验:标准化均值差(SMD)的 APA 写法

为什么用 SMD 而不用 t 检验

传统上用 t 检验评估组间协变量差异,但这在 PSM 中不合适:

  • t 检验的 p 值受样本量影响,匹配后样本量缩小,功效降低,即使 SMD 仍大也可能 p > .05
  • SMD 不依赖样本量,是比较匹配前后平衡程度的标准指标

标准化均值差(SMD)公式(连续变量):

$\text{SMD} = \frac{\bar{X}{treatment} - \bar{X}{control}}{\sqrt{(s_{treatment}^2 + s_{control}^2) / 2}}$

注意:上式中的分母为匹配前全样本(通常取处理组)的标准差,而非匹配后两组的合并 SD。Austin(2009,Statistics in Medicine)明确推荐以匹配前全样本 SD 作为参照,以确保匹配前后 SMD 在同一尺度上可比;若在匹配后阶段重新计算分母,则分母会随匹配结果变化,导致匹配前后 SMD 失去可比性。

判断标准(主流文献):

  • SMD < .10(绝对值):平衡良好(Austin,2009;Rubin,2001)
  • SMD < .20:可接受(部分期刊宽松标准)
  • SMD >= .20:平衡不足,需说明或重新匹配

SMD 的 APA 报告格式

单个协变量报告(嵌入正文)

匹配后,年龄的标准化均值差由匹配前的 SMD = 0.43 降至 SMD = 0.06,低于 .10 的平衡阈值(Austin,2009)。

汇总报告(推荐表格 + 正文描述)

表 X 呈现了 12 个协变量在匹配前后的标准化均值差(SMD)。匹配前,6 个协变量的 SMD 超过 .20,最大值为 SMD = 0.61(教育年限);经 1:1 最近邻匹配(卡钳值 = 0.02)后,所有协变量的 SMD 均低于 .10(最大 SMD = 0.08,年龄),表明匹配后处理组与对照组在已观测协变量上达到良好平衡。

APA 7th 表格标题格式

表 X 匹配前后协变量平衡性检验(标准化均值差)

表格列建议:协变量名 | 处理组 M(SD) [匹配前] | 对照组 M(SD) [匹配前] | SMD [匹配前] | 处理组 M(SD) [匹配后] | 对照组 M(SD) [匹配后] | SMD [匹配后]


三、ATT 估计结果的 APA 完整报告模板

必报要素清单

要素格式要求
ATT 点估计ATT = X.XX(原始单位或标准化)
标准误SE = X.XX(说明用 bootstrap 还是解析式)
95% 置信区间95% CI [下限, 上限]
p 值p = .XXX 或 p < .001(不加前导零)
效应量Cohen's d = .XX 或 Hedges' g = .XX
匹配后样本量处理组 n = XX,对照组 n = XX

ATT 报告段落模板

经倾向得分匹配([匹配策略]),共保留处理组 n = XX、对照组 n = XX(
匹配前总样本 N = XX,样本保留率 XX%)。
以[结果变量]为因变量,对匹配样本进行[分析方法:配对 t 检验/回归],
结果显示处理组的平均处理效应(ATT)为 [方向:正向/负向] X.XX [单位]
(SE = X.XX,95% CI [XX, XX],p [值],Cohen's d = .XX,[大/中/小]效应)。

填入数值的示例

经 1:1 最近邻倾向得分匹配(卡钳值 = 0.02,有放回 = 否),共保留处理组 n = 283、对照组 n = 283(匹配前总样本 N = 1,042,样本保留率 54.4%)。以毕业后一年薪资(元/月)为因变量,对匹配样本进行配对 t 检验,结果显示参加职业培训项目的平均处理效应(ATT)为正向 1,248 元(SE = 187,95% CI [881, 1,615],p < .001,Cohen's d = 0.48,中效应)。

效应量的 Cohen's d 标准(PSM 场景)

PSM 后配对样本的 Cohen's d 与独立样本略有不同,使用匹配后合并标准差:

$d = \frac{\text{ATT}}{\text{pooled SD (matched sample)}}$

效应大小Cohen's d
小效应.20
中效应.50
大效应.80

四、Rosenbaum 敏感性分析的 APA 报告写法

为什么必须做敏感性分析

PSM 的核心假设是强可忽略性(Strong Ignorability):在给定观测协变量后,处理分配与潜在结果相互独立。然而,不可能观测所有混淆变量——敏感性分析回答的问题是:

如果存在一个未观测混淆变量,使得两个具有相同倾向得分的个体被分配到处理组的几率相差 Gamma 倍,ATT 的结论还能维持吗?

Gamma 值的含义与报告格式

  • Gamma = 1:无未观测混淆(强可忽略性假设完全成立)
  • Gamma = 1.5:允许两个观测协变量相同的个体,被分配到处理组的几率相差最多 50%
  • Gamma 越大,结论对未观测混淆越稳健

APA 报告句式模板

Rosenbaum 敏感性分析结果显示,当 Gamma = X.X 时,
匹配后处理效应的统计显著性仍可维持(p < .05);
当 Gamma 提升至 X.X 时,结果不再显著(p > .05)。
这表明,结论对中等程度的未观测混淆具有一定稳健性,
但若存在未观测混淆变量使处理分配几率相差超过 XX%,
处理效应的显著性可能受到影响(Rosenbaum,2002)。

填入数值的示例

Rosenbaum 敏感性分析结果显示,当 Gamma = 1.8 时,匹配后处理效应的统计显著性仍可维持(p < .05);当 Gamma 提升至 2.0 时,p 值超过 .05 阈值。这表明,职业培训项目薪资效应的估计结论对中等程度的未观测混淆具有一定稳健性,但若存在使处理分配几率相差超过 80% 的未观测协变量,处理效应的统计显著性可能受到影响(Rosenbaum,2002)。结合研究情境,主要潜在的未观测混淆(求职意愿、家庭社会资本)的影响力估计不超过已纳入协变量的效应,本研究结论具有合理的外部稳健性。


五、方法章节完整写法模板

这是可直接套用进论文方法章节的完整段落:

本研究采用倾向得分匹配(PSM;Rosenbaum & Rubin,1983)控制选择偏差。
首先,以[处理变量]为因变量,纳入[协变量列表,如:年龄、性别、教育年限、
基线收入、地区]等 XX 个观测协变量,使用 logistic 回归估计每个个体的
倾向得分(模型 AUC = .XX)。

继而采用 1:1 最近邻匹配(caliper = .02,有放回 = 否),
为处理组中每个个体从对照组中匹配一名倾向得分最接近的个体。
匹配后以标准化均值差(SMD)评估协变量平衡性(Austin,2009),
SMD < .10 视为达到良好平衡。

匹配后对匹配样本进行[配对 t 检验/带固定效应的 OLS 回归]以估计
处理组的平均处理效应(ATT;Rubin,1974),标准误采用 Bootstrap
重抽样(R = 1,000 次)估计,以获得稳健的置信区间。

最后,采用 Rosenbaum bounds 方法(Rosenbaum,2002)进行敏感性分析,
评估未观测混淆变量对结论稳健性的潜在影响。所有分析使用 ChatSRS
(R 引擎,MatchIt 包 v4.x;rbounds 包)完成,显著性水平设为 alpha = .05。

六、在 ChatSRS 一句话获得规范 PSM 报告

打开 chatsrs.com,上传数据后输入:

"对我的数据做倾向得分匹配(PSM),处理变量为 treatment,结果变量为 income,协变量为 age、gender、edu_years、baseline_income;使用 1:1 最近邻匹配(卡钳值 0.02);输出:倾向得分 logistic 模型的 AUC、匹配前后各协变量的 SMD 平衡表、ATT 估计(含 95% CI 和 Cohen's d,Bootstrap SE)、Rosenbaum 敏感性分析 Gamma 值,以及符合 APA 7th 格式的完整方法与结果报告段落。"

ChatSRS 自动调用 R 的 MatchIt、rbounds 包,输出结果段落可直接复制进论文。


七、结果章节完整 APA 报告示例

以下是一个可直接参照的完整结果章节示例(填入真实数值后可直接使用):

倾向得分匹配结果

倾向得分模型(logistic 回归,纳入 8 个协变量)的 AUC 为 .784,描述了模型对处理组与对照组的区分能力(注:AUC 仅作为模型拟合的描述性报告,PSM 成功与否仍以匹配后各协变量的 SMD 为判断标准;AUC 过高反而可能意味着两组重叠区域极小,匹配质量下降,参见 Stuart, 2010;King & Nielsen, 2019)。匹配前,处理组(职业培训参与者,n = 312)与对照组(n = 730)在教育年限(SMD = 0.61)、基线收入(SMD = 0.47)、年龄(SMD = 0.43)等 6 个协变量上存在显著不平衡(SMD >= .20)。

经 1:1 最近邻倾向得分匹配(卡钳值 = 0.02,有放回 = 否),共为 283 名处理组成员匹配到对照组成员(匹配率 90.7%,共 566 名个体),29 名处理组成员因未找到满足卡钳值要求的对照而被排除(占处理组 9.3%)。匹配后,全部 8 个协变量的 SMD 均低于 .10(最大 SMD = 0.08,年龄;均见表 1),表明匹配后两组在已观测协变量上达到良好平衡。

对匹配后样本进行配对 t 检验,结果显示,参加职业培训项目对毕业后一年薪资具有显著正向效应(ATT = 1,248 元/月,Bootstrap SE = 187,95% CI [881, 1,615],p < .001,Cohen's d = 0.48,中效应)。

Rosenbaum 敏感性分析结果显示,当 Gamma = 1.8 时处理效应仍显著(p < .05),当 Gamma = 2.0 时结论受到威胁(p > .05),表明结论对中等程度的未观测混淆具有一定稳健性(Rosenbaum,2002)。


八、PSM 报告常见错误对照表

常见错误正确写法说明
只说"完成了 PSM 匹配"报告匹配策略、卡钳值、样本保留率可重复性要求
用 p 值判断平衡性(t 检验)用 SMD,阈值 < .10t 检验受样本量影响
SMD 表格只报告匹配后同时报告匹配前 SMD,才能体现改善需展示"前 vs. 后"对比
ATT 无置信区间ATT = XX,95% CI [XX, XX]APA 7th 推断统计必报 CI
p = .000p < .001.000 是舍入假值
无效应量Cohen's d = .XX([大/中/小]效应)APA 7th 要求报告效应量
未说明标准误来源"标准误采用 Bootstrap(R = 1,000)"Bootstrap 与解析式差异大
无敏感性分析Rosenbaum bounds,报告 Gamma 值排除未观测混淆威胁
只报告 ATT,未说明是 ATT vs. ATE明确写 ATT(处理组平均处理效应)ATE 与 ATT 含义不同
倾向得分模型未报告拟合优度报告 AUC / C 统计量评估模型区分能力

常见 FAQ

Q:PSM 报告中 SMD 的判断阈值用 .10 还是 .20?

A:主流文献的标准是 SMD < .10(Austin,2009;Normand et al.,2001),这是社会科学、医学、经济学领域最广泛接受的阈值。部分较宽松的期刊接受 SMD < .20。建议在方法章节明确说明所使用的阈值和引用文献,审稿人能追溯标准来源。如果个别协变量的匹配后 SMD 在 .10-.20 之间,应在讨论中说明其对结论的潜在影响,而不是悄悄略过。

Q:PSM 之后还需要回归控制协变量吗?

A:推荐这样做。PSM 后直接比较均值(配对 t 检验)是最简洁的估计方式,但在匹配样本上追加回归控制协变量("双重稳健估计")可以进一步减少残余混淆。报告格式上,如使用回归,需在方法章节说明"在匹配样本上进行 OLS 回归,纳入[协变量]作为额外控制",ATT 取回归模型中处理变量的系数,标准误需用 Cluster robust SE 或 Bootstrap SE。

Q:ATT 报告的置信区间用 Bootstrap 还是解析式?

A:Bootstrap(通常 R = 500~2,000 次重抽样)是更稳健的选择,尤其是 1:1 最近邻匹配(解析式 SE 在此情形下可能偏小,低估不确定性)。如果软件默认输出解析式 SE,建议在方法章节说明,并考虑补充 Bootstrap CI 作为稳健性检验。ChatSRS 默认使用 Bootstrap SE(R = 1,000),结果直接可用。

Q:Rosenbaum 敏感性分析的 Gamma 值报多少算"稳健"?

A:没有普适阈值,需结合研究情境解读。通常:Gamma >= 1.5 意味着处理分配的几率差异 >= 50% 时结论才会被推翻,被认为具有"中等稳健性";Gamma >= 2 以上被认为较为稳健。更重要的是,要在讨论中结合"最可能存在的未观测混淆变量"来评估——如果该变量对处理分配的影响预计小于当前 Gamma 所对应的水平,则结论稳健性有理论支撑。

Q:PSM 和 IPW(逆概率加权)有什么区别,报告格式一样吗?

A:PSM 和 IPW 都基于倾向得分,但估计策略不同。PSM 通过剔除不可匹配个体来构建平衡样本(适合估计 ATT,有样本损失);IPW 通过加权保留全部样本(适合估计 ATE,无样本损失但对极端权重敏感)。报告格式上,IPW 的平衡性检验仍使用 SMD(加权后),因果估计量需说明是 ATE 还是 ATT,标准误推荐 Sandwich robust SE。敏感性分析方面,IPW 不适用 Rosenbaum bounds——该方法依赖配对/匹配结构(Wilcoxon signed-rank 等统计量),对 IPW 的未配对加权样本不适用;IPW 的敏感性分析应优先使用 E-value(VanderWeele & Ding, 2017)或 Sensitivity Interval 方法,PSM 的配对样本才适合使用 Rosenbaum bounds。


快速参考:PSM 报告格式速查卡

[倾向得分模型]
logistic 回归;AUC = .XX;协变量:[列表]

[匹配策略]
1:1 最近邻匹配;卡钳值 = .02;有放回 = 否
匹配后:处理组 n = XX,对照组 n = XX(样本保留率 XX%)

[平衡性检验]
方法:SMD(Austin,2009);阈值 SMD < .10
结果:所有协变量 SMD < .10(最大 SMD = .XX,[变量名])
[附表 X:协变量平衡表,列出匹配前后 SMD]

[ATT 估计]
ATT = XX.XX [单位](Bootstrap SE = XX,95% CI [XX, XX],
p [= .XXX / < .001],Cohen's d = .XX,[大/中/小]效应)

[敏感性分析]
Rosenbaum bounds:当 Gamma = X.X 时仍显著(p < .05);
当 Gamma = X.X 时 p > .05(Rosenbaum,2002)
结论:对未观测混淆的[强/中等/有限]稳健性

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。