方法选择 ·
GEE 还是混合效应模型?总体平均效应与个体效应怎么选
GEE 与混合效应模型如何选择?本文从总体平均效应、条件效应、结局分布、相关结构和缺失处理给出直接答案,并核对 ChatSRS 当前稳健 SE、QIC 与随机截距输出。
直接决策答案
如果研究问题是“在目标人群层面,暴露或时间变化与平均结局如何关联”,优先考虑 GEE 的总体平均效应口径。如果研究问题是“给定个体的随机差异后,固定效应如何解释,并希望量化个体间方差或 ICC”,优先考虑混合效应模型。
这不是“稳健 GEE”和“更高级混合模型”的高低排序。二者目标参数不同,尤其在二元或计数结局中,总体平均系数与个体条件系数不能直接当成同一个效应比较。
先按研究问题而不是软件选
| 决策问题 | GEE | 混合效应模型 |
|---|---|---|
| 主要 estimand | 群体平均/边际效应 | 给定随机效应的条件效应 |
| 个体异质性 | 通过簇内相关和稳健协方差处理 | 直接估计随机效应方差 |
| 结局类型 | 当前支持 Gaussian、Binomial、Poisson | 当前实现为线性 Gaussian MixedLM |
| 相关结构 | Independence、Exchangeable、AR(1) | 当前仅随机截距,没有可选残差相关结构 |
| 拟合比较 | QIC/QICu | LL、AIC、BIC |
| 典型输出 | b、稳健 SE、z、p、95% CI | B、SE、z、p、随机方差、ICC |
线性 Gaussian 情形下,两类系数有时数值接近,但这不改变模型目标和推断框架。非线性链接下更不能直接等同。
样本量与聚类单位也会改变答案
GEE 的三明治方差依赖足够数量的独立 Subject;个体数很少时,即使观测行很多,稳健 SE 也可能表现不佳。混合模型则需要足够组数和组内重复观测来区分随机截距方差与残差方差。把医院当 Subject 与把患者当 Subject 会回答不同层级的问题。分析前应画出数据层级,确认真正独立的抽样单位、每个单位观测次数和时间排序,再决定 group_var,而不是把任意 ID 列交给模型。
ChatSRS 当前 GEE 的真实范围
gee_analysis 分析器要求因变量、Subject ID 和至少一个自变量。当前实现:
- 支持 Gaussian/Identity、Binomial/Logit、Poisson/Log;
- 支持独立、交换型和 AR(1) 工作相关结构;
- 按 Subject 聚类并使用 Robust/Sandwich 协方差;
- 直出 Subject 数、总观测数、每人观测范围、family、link、工作相关结构;
- 回归表直出 b、稳健 SE、z、精确 p 和 95% CI;
- 尝试比较三种工作相关结构的 QIC 与 QICu。
**边界:**当前实现对模型所需列做逐行完整案例处理,缺失不会被自动插补;稳健 SE 也不消除失访偏差。工作相关矩阵是分析设定,不是从数据中“证明”的真实结构。QIC 计算失败时会给出警告,不应虚构比较结果。
ChatSRS 当前混合效应模型的真实范围
mixed_effects 分析器使用线性 MixedLM、REML 和受试者随机截距。它直出固定效应 B、SE、z、精确 p,随机截距/残差方差、ICC、LL、AIC、BIC、N 与组数。
**边界:**当前没有二元或计数结局的广义混合模型选项,也没有随机斜率和用户可选的 AR(1) 残差结构。若研究问题需要个体时间斜率、非线性链接或更复杂层级,不能把当前随机截距线性模型写成这些扩展模型。
缺失数据与时间结构如何影响选择
GEE 与混合模型当前都会删除模型所需字段缺失的行。长表结构下,一个受试者只要还有其他完整行,就可能继续进入估计;但这不意味着失访机制不再重要。若缺失与未观测结局相关,两种方法都需要额外敏感性分析。
时间间隔也不能只靠模型名称解决。GEE 的 AR(1) 通常需要明确的测量顺序;混合模型若只放一个线性 time 固定效应,也隐含了特定变化形态。正式分析应说明 time 是连续、分类还是非线性,并核对排序与间隔。
可复核的一句话输入
GEE:
对 outcome 做 GEE,subject_id 是个体列,time、group 和基线值是自变量;结局为 [连续/二元/计数],选择对应 family 和 link。比较 Independence、Exchangeable、AR(1) 的 QIC,报告选定结构下 b、Robust SE、z、p、95% CI、Subject 数与总观测数,并明确解释为总体平均效应。
混合效应模型:
对连续 outcome 做线性混合效应模型,subject_id 为分组列,time、group 和预先构造的交互项为固定效应。采用 REML 随机截距模型,报告 B、SE、z、p、随机截距与残差方差、ICC、LL/AIC/BIC,并说明当前没有随机斜率。
如果交互项没有在数据中或调用链中明确建立,不应默认系统会自动创建。
输出解读与论文报告模板
GEE 结果模板:
采用 GEE 估计 [暴露] 与 [结局] 的总体平均关联,以 [subject_id]
为聚类单位,分布族为 [ ],链接函数为 [ ],工作相关结构为 [ ]。
[核心变量] 的 b = [ ],Robust SE = [ ],z = [ ],
p = [ ],95% CI [[ ], [ ]]。共纳入 [Subject数] 名受试者、
[观测数] 条完整观测。系数按群体平均效应解释。
混合效应模型模板:
采用 REML 线性随机截距模型估计 [结局]。固定效应 [X] 的
B = [ ],SE = [ ],z = [ ],p = [ ]。随机截距方差为 [ ],
残差方差为 [ ],ICC = [ ],N = [ ],组数 = [ ]。
该系数是在控制受试者随机截距后的条件效应;当前模型不含随机斜率。
报告时不要把 GEE 的 b 与混合模型的 B 直接做“哪个更大”的实质比较。若把二者作为敏感性分析,应说明 estimand 不同,并以方向、研究问题和预测/解释目标综合判断。
常见问题 FAQ
Q1:GEE 的稳健 SE 是否表示相关结构可以随便选?
不是。稳健协方差可降低工作相关结构误设的部分影响,但小簇数、缺失和均值模型错误仍会影响结果。
Q2:想报告 ICC 应选哪一个?
当前混合效应模型直接输出随机截距方差、残差方差和 ICC;GEE 主要报告工作相关结构与总体平均系数。
Q3:二元结局能直接用当前混合模型吗?
当前 mixed_effects 是线性 Gaussian 模型。二元结局需要广义混合模型;当前可用 GEE Binomial 处理总体平均问题,但 estimand 不同。
Q4:两种方法结果不一致,应该选更显著的吗?
不能。应先核对估计目标、family/link、时间形式、相关结构、缺失样本和模型收敛,再按研究问题报告。
相关阅读
明确总体平均或个体条件效应后,可打开 ChatSRS,提交对应纵向模型需求。最终报告需保留 family、相关结构、随机效应和缺失处理口径。