统计百科 ·

纵向研究的流失偏差(Attrition Bias)怎么处理?MCAR/MAR机制、敏感性分析与多重插补完全指南

统计百科:解析纵向研究中流失偏差的三种缺失机制(MCAR/MAR/MNAR),演示如何用Little检验、敏感性分析与多重插补(MI)识别并校正流失偏差,给出可直接套用的APA 7th报告段落与ChatSRS实操指令。

纵向研究最致命的威胁往往不是统计方法选错,而是"那些中途退出的被试"——他们离开的方式,决定了你的结论是否还能站住脚。本文从流失机制分类出发,介绍 Little's MCAR 检验、敏感性分析、多重插补三件套,并给出符合 APA 7th 的报告段落,配套 ChatSRS 一句话实操指令。


你的纵向数据有这些问题吗?

审稿人、答辩委员针对纵向研究中流失问题最常提出的质疑:

  • "文章完全没有分析流失样本与保留样本的基线差异,如何判断结果不受选择性退出影响?"
  • "作者直接删除缺失观测(完全案例分析),但如果退出者是病情较重的被试,估计结果必然偏低。"
  • "多重插补方法章节语焉不详,请说明插补模型的变量选择、链式方程迭代次数及汇合规则(Rubin's rules)。"
  • "文中结论依赖 MAR 假设,但没有提供任何敏感性分析检验 MNAR 情境下结论的稳健性。"

这些问题集中于缺失数据机制的识别与报告,却鲜有实操向的汇总指南。本文只讲一件事:纵向研究里的流失偏差,从识别到校正,从分析到报告,如何一步一步做对。


一、什么是流失偏差(Attrition Bias)

流失偏差(attrition bias,又称损耗偏差)是纵向研究(longitudinal study)或随机对照试验(RCT)中,由参与者在追踪期间选择性退出而引入的系统误差。

与横截面研究不同,纵向研究需要同一批被试在多个时间点提供数据。当退出本身与研究变量相关时——例如病情越重越容易失访,或者控制组被试更易脱落——保留下来的样本不再代表目标总体,后续统计估计因此出现偏差。

流失偏差的三个核心问题

  1. 流失率有多高? 国际期刊通行的警戒线通常为 20%(单次追踪);若超过 30%,无论分析多精细,结论可信度都会受到严重质疑。
  2. 谁在流失? 流失者在基线特征上是否系统性不同于保留者?
  3. 为什么流失? 流失的原因是否与结局变量有内在关联?

回答这三个问题,需要先理解缺失数据机制的分类框架。


二、三种缺失机制:MCAR、MAR、MNAR

Rubin(1976)提出的缺失机制分类框架是处理流失偏差的基础理论,APA 7th Chapter 3(Reporting Standards)及大多数方法学期刊均要求在方法章节中明确说明所采用的缺失机制假设。

完全随机缺失(MCAR,Missing Completely At Random)

定义:缺失的发生与任何观测到或未观测到的变量均无关。退出纯属随机事件(如搬家、联系方式丢失)。

判断方法

  • Little's MCAR 检验(Little, 1988):若 chi^2 检验不显著(p > .05),可初步接受 MCAR 假设。
  • 比较流失者与保留者在所有基线变量上的差异(t 检验或 chi^2 检验):若全部不显著,支持 MCAR。

后果:若 MCAR 成立,完全案例分析(Complete Case Analysis,CCA)不引入偏差,但会损失统计效力。

实际频率:MCAR 在行为科学、医学研究中极少成立,遇到务必谨慎核查。

随机缺失(MAR,Missing At Random)

定义:缺失的发生与已观测到的变量有关,但在控制这些变量后,与未观测变量无关

举例:老年被试更容易失访(缺失与"年龄"有关,年龄是已观测变量),但控制年龄后,失访概率与健康结局本身无关——此时为 MAR。

判断方法:无法直接用统计检验证明(因为"未观测变量"定义上不可获得),只能:

  • 比较保留者与流失者在基线所有已观测变量上的差异,无显著差异时 MAR 假设较合理;
  • 以失访/保留为因变量做逻辑回归,若模型中的变量显著预测失访,说明 MAR 比 MCAR 更合适;
  • 进行敏感性分析(见第四节),评估结论在 MAR 假设偏离时的稳健性。

后果:MAR 是多重插补(MI)和极大似然估计(FIML)等方法的核心假设。在 MAR 下,这些方法能产生无偏估计;但若实际为 MNAR,估计仍有偏差。

非随机缺失(MNAR,Missing Not At Random)

定义:缺失的发生与未观测到的变量本身有关,即使控制所有已观测变量,缺失仍与结局相关。

举例:抑郁症状越严重的被试越容易中途退出,而"退出时刻的抑郁症状"正是未被观测到的缺失值——缺失与缺失值本身直接相关,属于 MNAR。

判断方法:同样无法直接检验,只能通过:

  • 模式混合模型(Pattern-Mixture Models)
  • 选择模型(Selection Models)
  • 敏感性参数分析(tipping point analysis) 来评估 MNAR 情境下结论变化的幅度。

后果:MNAR 条件下,所有常规缺失数据方法(含 MI 和 FIML)均会产生有偏估计,必须结合敏感性分析报告。


三、识别流失偏差:基线比较分析

标准操作流程

第一步:描述流失情况

报告每个追踪时点的样本量与流失人数,计算累积流失率。若研究有多个追踪波次,绘制 CONSORT 流程图(RCT 场景)或追踪样本量变化表(观察性研究)。

第二步:流失者与保留者基线比较

对所有基线变量(人口学特征、主要结局变量基线值、关键协变量)进行独立样本 t 检验(连续变量)或卡方检验(类别变量)。

基线变量保留者 M (SD) 或 n (%)流失者 M (SD) 或 n (%)检验统计量p
年龄42.3 (11.8)38.7 (13.2)t(284) = 2.41.017
性别(女性)58.4%63.2%chi^2(1) = 0.87.351
基线抑郁总分18.4 (7.9)22.6 (8.5)t(284) = 4.12< .001

上表结果表明:流失者在基线时年龄更小、抑郁症状更重,缺失不符合 MCAR 假设,应采用 MAR 或 MNAR 框架。

第三步:Little's MCAR 检验

在 R 或 SPSS 中运行 Little's test,报告格式为:

Little's MCAR 检验结果显示,chi^2(df) = X.XX,p [值],表明缺失数据不满足完全随机缺失(MCAR)假设,需采用基于 MAR 假设的缺失数据处理方法。

第四步:缺失预测逻辑回归

以"是否为完整案例"(0/1)为因变量,纳入所有基线变量做二元逻辑回归,识别显著预测流失的变量,将其纳入插补模型。


四、敏感性分析:检验 MAR 假设的稳健性

敏感性分析(sensitivity analysis)是针对 MNAR 风险的核心对策,也是高质量期刊越来越明确要求的报告项目。

方法一:Tipping Point 分析

"临界点分析"回答一个问题:假设流失者的结局比保留者高(或低)多少个单位,主要结论会从显著变为不显著?

若需要一个极不合理的偏差量(如流失者结局需高于保留者 3 倍 SD)才能颠覆结论,说明结论对 MNAR 具有较强稳健性;反之则需谨慎。

APA 报告示例:

敏感性分析(tipping point analysis)显示,仅当流失者的后测抑郁评分系统性高于保留者 1.8 个 SD(δ = 1.80),干预效果才会丧失统计显著性(p > .05)。鉴于此偏差量在临床情境中极不可能发生,本研究结论在 MNAR 情境下具有较强稳健性(Ratitch & O'Kelly,2011)。

方法二:模式混合模型(Pattern-Mixture Model)

按缺失模式将被试分组(如"始终完整组""第二波流失组""中途退出组"),分组建立结局模型,加权汇合各组估计值(delta 调整法)。此方法计算较复杂,适合高影响因子期刊。

方法三:最优/最劣情境分析(Best/Worst Case Analysis)

将所有缺失值替换为可能的最大值(最优情境)或最小值(最劣情境),比较两种极端情境下的结论是否一致。适用于有明确量表范围的结局变量。


五、多重插补(Multiple Imputation):从理论到实操

为什么要用多重插补

完全案例分析(CCA)的问题

  • 假设 MCAR,实际往往不满足;
  • 丢失信息,降低统计功效;
  • 在样本量本就有限的纵向研究中,额外损失观测会放大标准误差。

多重插补(MI)(Rubin,1987)在 MAR 假设下提供无偏估计,且正确传播缺失不确定性:

  1. 插补阶段(Imputation):对缺失值多次(通常 M = 20~50)生成填充值,产生 M 个完整数据集;
  2. 分析阶段(Analysis):对 M 个数据集分别运行目标模型,得到 M 套参数估计;
  3. 汇合阶段(Pooling):按 Rubin's rules 汇合,组合估计量 = M 个估计的均值,标准误额外反映插补不确定性。

链式方程多重插补(MICE)实操要点

关键决策一:插补变量的选择

插补模型(imputation model)应包含:

  • 所有分析模型中的变量(自变量、因变量、协变量);
  • 与缺失显著相关的基线变量(来自第三节逻辑回归);
  • 辅助变量(auxiliary variables)——与缺失或缺失值相关但不在分析模型中的变量。

原则:宁多勿少。遗漏重要辅助变量会削弱插补模型的 MAR 假设合理性。

关键决策二:插补次数(M)的选择

历史上推荐 M = 5,但现代方法学建议(Graham et al.,2007):M 应大致等于缺失比例的百分数(此为近似启发式,严格做法应基于插补分数信息损失率 FMI 确定;FMI 较低时可适当减少 M)。例如缺失率 25%,推荐 M = 25~50。

关键决策三:变量类型匹配

变量类型MICE 推荐方法
连续变量(正态)预测均值匹配(PMM)
二分类变量逻辑回归(logreg)
有序类别变量比例优势逻辑回归(polr)
名义类别变量多项逻辑回归(polyreg)
计数变量泊松或负二项回归

Rubin's Rules 汇合公式

设 M 个数据集的参数估计为 $\hat{Q}_1, \hat{Q}_2, \ldots, \hat{Q}_M$,方差为 $U_1, U_2, \ldots, U_M$:

$\bar{Q} = \frac{1}{M}\sum_{m=1}^{M}\hat{Q}_m \quad (\text{点估计})$

$\bar{U} = \frac{1}{M}\sum_{m=1}^{M}U_m \quad (\text{组内方差均值})$

$B = \frac{1}{M-1}\sum_{m=1}^{M}(\hat{Q}_m - \bar{Q})^2 \quad (\text{组间方差})$

$T = \bar{U} + \left(1 + \frac{1}{M}\right)B \quad (\text{总方差})$

最终标准误 = $\sqrt{T}$,自由度用 Barnard-Rubin 公式(df 通常为小数,不取整)。


六、在 ChatSRS 完成流失偏差全套分析

打开 chatsrs.com,上传纵向数据后输入:

"这是一份三波次追踪数据,变量包括:被试ID、波次(T1/T2/T3)、年龄、性别、干预组别、主要结局(抑郁量表总分)及若干基线协变量。请完成以下分析:(1)描述各波次样本量与流失率;(2)比较流失者与保留者在所有T1基线变量的差异(t检验+卡方检验),输出APA格式表格;(3)运行Little's MCAR检验;(4)以是否为完整案例做逻辑回归,识别流失预测因子;(5)使用MICE(M=50次,预测均值匹配)对缺失数据做多重插补,纳入所有基线变量及辅助变量;(6)汇合后运行混合线性模型(time×group交互效应),按Rubin's rules报告估计量、SE及95%置信区间;(7)做tipping point敏感性分析,报告使主效应不显著所需的MNAR偏差量δ;(8)给出完整APA 7th格式的方法章节和结果章节报告段落。"

ChatSRS 调用 R(mice 包、nlme/lme4 包)完成上述全链路分析,输出结果可直接复制进论文。


七、APA 7th 报告模板:方法章节与结果章节

方法章节——缺失数据处理段落

本研究采用三波次纵向追踪设计,各波次样本量分别为
T1(N = XXX)、T2(n = XXX)、T3(n = XXX),累积流失率为 XX.X%。

缺失数据处理前,首先比较完整案例与流失样本在全部基线变量上的差异;
Little's MCAR 检验结果显示,chi^2(XX) = XX.XX,p [值],
不支持完全随机缺失(MCAR)假设。

因此,采用链式方程多重插补(MICE;van Buuren & Groothuis-Oudshoorn,2011)
处理缺失数据,共生成 M = XX 个插补数据集。
插补模型包含分析模型中的全部变量及 XX 个辅助变量;
连续变量采用预测均值匹配(PMM),类别变量采用对应的广义线性插补方法。
参数估计采用 Rubin's rules(1987)汇合跨插补数据集的结果。

结果章节——流失分析报告段落

基线比较结果显示,流失被试(n = XX)相比保留被试(n = XX)
在[变量A]上的得分显著更高(M_流失 = XX, SD = XX vs. M_保留 = XX, SD = XX;
t([df]) = X.XX, p = .XXX, d = .XX),在[变量B]上亦存在显著差异([格式相同]),
表明缺失数据不满足 MCAR 假设(Little's test: chi^2([df]) = XX.XX, p [值])。

多重插补后,混合线性模型(Linear Mixed Model)分析结果显示,
时间 × 干预组别交互效应显著,b = X.XX, SE = X.XX,
95% CI [X.XX, X.XX], t([df_Barnard-Rubin]) = X.XX, p [值]。

敏感性分析(tipping point analysis)显示,
仅当未观测的 MNAR 偏差量超过 δ = X.XX 个标准差时,
上述交互效应才会丧失统计显著性(p > .05),
表明研究结论在合理的 MNAR 情境下具有较好稳健性(Ratitch & O'Kelly,2011)。

八、常见错误对照表

常见错误正确做法违反的规范
直接删除缺失观测做完全案例分析(CCA),不加说明说明 MCAR 假设是否成立;若 MAR 更合理,改用 MI 或 FIML缺失数据机制须明确报告(APA 7th §3.6–3.7)
只用 M = 5 次插补,未说明依据根据缺失率选择 M(通常 M = 20~50),并引用 Graham 等(2007)插补次数不足会低估标准误差
插补模型不包含结局变量插补模型必须包含结局变量(否则插补值与结局独立,产生衰减偏差)插补模型规范(White et al.,2011)
多重插补后仅报告一个数据集的结果必须汇合全部 M 个数据集,按 Rubin's rules 计算总 SERubin(1987)汇合原则
无敏感性分析,直接声称结论不受流失影响提供 tipping point 分析或模式混合模型检验 MNAR 稳健性缺失机制无法直接检验,必须通过敏感性分析论证
方法章节只写"采用多重插补",无细节说明软件包、插补方法(PMM/logreg 等)、M 次数、插补变量、汇合规则可重复性要求(APA 7th §2.97)
流失率超过 30% 但只字不提正面承认高流失率,详细说明流失分析与处理策略,在讨论中作为局限性透明度与可信度原则

FAQ

Q:流失率低于 5%,还需要做这么复杂的分析吗?

A:流失率低(< 5%)时,无论缺失机制如何,对结果的影响通常可忽略不计(Graham,2009)。此时完全案例分析即可,但方法章节仍应注明流失率及处理决策。若高影响因子期刊有明确要求,可补充 Little's 检验结果。核心原则是:流失分析的深度应与流失率及研究结论的敏感性成正比

Q:FIML(全信息极大似然)和多重插补(MI)有什么区别,选哪个?

A:两者在 MAR 假设下渐近等价,均优于 CCA。主要区别在于:FIML 直接在缺失数据下最大化似然,不产生填充数据集;MI 生成多个完整数据集,更灵活(可在汇合前对每个数据集做任意后续分析)。实操选择:若目标模型可以在支持 FIML 的软件(如 Mplus、lavaan/sem)中直接运行,FIML 更简洁;若分析链路复杂(如多步骤分析、非标准模型),MI 灵活性更高。两者均可接受,方法章节说明选用理由即可。

Q:多重插补后,各插补数据集的模型结果差异很大,怎么办?

A:各插补数据集之间的估计差异由 Rubin's rules 中的"组间方差 B"捕捉,并被正确传播到最终标准误中——这恰恰是 MI 的优势,而非问题。若差异极大,通常意味着:(1)缺失率过高(> 50%),任何方法都难以充分恢复信息;(2)插补模型遗漏了重要预测变量;(3)实际缺失机制为 MNAR,插补本身存在偏差。此时应扩展插补模型,并做 MNAR 敏感性分析报告不确定性。

Q:可以在结果章节只报告多重插补结果,不报告完整案例分析结果吗?

A:可以,且是更推荐的做法。如果 MCAR 不成立,CCA 本身有偏,没必要将有偏结果与无偏结果并排呈现(容易让读者混淆)。常见做法是:主文呈现 MI 结果,在附录或补充材料中提供 CCA 结果作为稳健性参照,并说明两者是否一致。若结论实质性差异较大,需在讨论中正面解释原因。

Q:审稿人说"方法章节没有说明哪些变量进入了插补模型",应该怎么补充?

A:在方法章节增加一段专门描述插补模型,内容包括:(1)列出所有纳入插补模型的变量(或说明"包含分析模型全部变量及所有基线协变量");(2)是否纳入辅助变量及其依据;(3)各变量采用的插补方法(PMM/logreg 等);(4)M 次数及迭代次数;(5)所用软件和版本(如 R 的 mice 包 3.x)。若变量较多,可在附录提供完整列表,正文引用附录。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。