场景案例 ·

老年学研究数据分析 — AI 一句话完成纵向追踪与 APA 报告

老年学、老龄化研究必看:从混合效应模型、生存分析到潜变量增长曲线,ChatSRS AI 一句话完成老年队列纵向追踪全套分析,生成 APA 7th 格式纵向研究报告。

老年学、公共卫生、护理学毕业生的数据分析难关:老年纵向队列的脱落缺失怎么处理、混合效应模型和重复测量 ANOVA 该选哪个、生存分析的 Cox 模型如何报告、APA 纵向格式审稿人总打回……这篇文章把老年学研究最常见的纵向追踪分析场景逐步串通,每步给出 ChatSRS 可直接使用的一句话指令,以及可抄进论文的 APA 7th 报告句式。


老年学纵向数据分析为什么特别困难

老年学研究区别于横断面研究的核心特征,正是它的时间维度——追踪同一批老年人在数年甚至数十年间的认知功能、躯体健康、死亡风险的变化轨迹。这带来了一系列横断面方法完全无法处理的分析挑战:

  • 纵向随访必然存在脱落(attrition):因死亡、失访、拒绝而退出的参与者往往并非随机,脱落本身就是研究结果的一部分
  • 每位老人有多个时间点的重复测量,数据在个体内相关,普通回归的独立性假设根本不成立
  • 不同老人的基线水平不同、随时间变化的速率也不同,需要同时建模个体间差异和个体内轨迹
  • 生存事件(死亡、发病、护理院入住)是右删失时间-事件数据,不能直接用均值比较
  • APA 7th 对纵向报告格式有特定要求:固定效应表、随机效应方差分量、Kaplan-Meier 图描述均要规范

chatsrs.com 内置三引擎(SPSS + R + Stata),一句话就能运行混合效应模型、生存分析和潜变量增长曲线,并生成 APA 格式的纵向报告。以下按典型老年学研究流程逐步演示。


老年学纵向研究的三种典型数据结构

结构一:重复测量追踪数据(长格式)

最常见于认知老化、身体功能、抑郁症状的队列研究:

被试ID   时间(年)  认知评分   日常活动能力   简易抑郁量表   年龄   教育年限   性别
001      0           26          85              3              68     12         女
001      2           24          82              4              70     12         女
001      4           21          78              6              72     12         女
002      0           28          90              2              71     16         男
002      2           27          88              2              73     16         男
...

核心分析:线性混合效应模型(LMM)建模随时间的认知轨迹,检验时间效应、个体间差异及协变量影响。

结构二:时间-事件数据(生存数据)

用于死亡率、发病风险、功能丧失事件研究:

被试ID   追踪时间(月)  事件(1=发生,0=删失)  基线认知   慢性病数   体力活动   年龄
001      48              0                       26         2          低          68
002      36              1                       19         4          无          75
003      60              0                       29         1          高          70
...

核心分析:Kaplan-Meier 生存曲线 + Log-rank 检验 + Cox 比例风险回归。

结构三:潜变量增长曲线数据(LGM)

用于建模认知老化的个体异质性轨迹,检验初始水平与变化速率的预测因素:

被试ID   T1认知  T2认知  T3认知  T4认知  教育年限  体力活动  慢性病负担
001      26       24      21      18      12        低        中
002      28       27      26      25      16        高        低
003      22       20      18      15      9         无        高
...

核心分析:潜变量增长曲线模型(LGM),估计平均截距(初始水平)和平均斜率(变化速率),检验截距/斜率的预测变量。


全流程分析演示(老年认知追踪队列场景)

以"社区老年人 4 年认知功能追踪研究"为例:基线 n = 312,四年内每 2 年随访一次,三个时间点(T1/T2/T3),结局变量为简易精神状态检查(MMSE),协变量包括年龄、教育年限、体力活动、慢性病数量。

第一步:描述统计与脱落分析

打开 chatsrs.com,上传数据后输入:

"请对纵向追踪数据做基线描述统计,按性别分组输出年龄、教育年限、MMSE 各波次均值和标准差;并做脱落分析,比较完成全部三次随访的被试与中途脱落者在基线特征上的差异(独立 t 检验 / 卡方检验),生成 APA 格式基线特征三线表。"

ChatSRS 自动输出:

表 1  基线人口学与研究变量描述统计(M +- SD 或 n/%)

                          完访组 (n = 241)      脱落组 (n = 71)     统计检验
年龄(岁)               70.34 (5.21)          74.12 (6.08)        t(310) = 4.93, p < .001
教育年限(年)            9.87 (3.44)            8.21 (3.12)        t(310) = 3.24, p = .001
基线 MMSE 评分           25.82 (3.11)           23.47 (4.02)        t(310) = 4.62, p < .001
慢性病数量(个)          2.13 (1.32)            3.04 (1.58)        t(310) = 4.45, p < .001
性别(女性,%)          58.1%                  61.0%               chi2(1) = 0.23, p = .630

注:脱落原因:死亡 n = 38(53.5%),主动退出 n = 18(25.4%),失访 n = 15(21.1%)。

为什么脱落分析是纵向研究的必报项目:脱落组年龄更大、认知基线更低、慢性病更多,说明脱落不是随机的(MCAR 可排除),需要在混合效应模型中使用全信息极大似然估计(FIML)处理缺失,并在 Methods 中明确说明。


第二步:线性混合效应模型(LMM)— 建模认知轨迹

"以 MMSE 评分为因变量,时间(0/2/4 年)为固定效应预测变量,加入年龄、教育年限、体力活动、慢性病数量作为协变量,被试 ID 作为随机效应(随机截距 + 随机斜率),用 ML(REML=FALSE)估计线性混合效应模型以支持 FIML 缺失数据处理。输出固定效应系数表(含标准误、t 值、p 值、95% CI)、随机效应方差分量、模型拟合指数(AIC/BIC/对数似然),并检验时间效应是否显著。"

ChatSRS 输出(R 引擎,nlme/lme4):

表 2  认知功能纵向追踪线性混合效应模型固定效应(N = 312)

固定效应                   B        SE       t        p        95% CI
截距                     26.14     0.42    62.24    < .001   [25.31, 26.97]
时间(年)                -0.89     0.08   -11.12    < .001   [-1.05, -0.73]
年龄(岁)                -0.24     0.05    -4.80    < .001   [-0.34, -0.14]
教育年限(年)              0.31     0.06     5.17    < .001   [ 0.19,  0.43]
体力活动(有 vs 无)        1.42     0.38     3.74    < .001   [ 0.68,  2.16]
慢性病数量                 -0.47     0.11    -4.27    < .001   [-0.69, -0.25]

随机效应
截距方差 (sigma^2_u0):5.83    斜率方差 (sigma^2_u1):0.42    协方差:-0.31
残差方差 (sigma^2_e):2.14

模型拟合:AIC = 4312.7,BIC = 4368.2,LogLik = -2144.4

关键结论解读:时间效应 B = -0.89(p < .001),表示平均每年 MMSE 下降约 0.89 分;随机斜率方差 sigma^2_u1 = 0.42(> 0),说明个体间认知下降速率存在显著异质性,随机截距 + 斜率模型优于固定斜率模型。


第三步:生存分析 — 认知损害事件风险建模

对于将"MMSE 首次跌破 24 分"定义为认知损害事件的研究问题:

"以首次认知损害(MMSE < 24)为事件,追踪时间(月)为时间变量,删失代码为 0,先绘制全样本 Kaplan-Meier 生存曲线(含 95% CI 阴影区),按性别分层做 Log-rank 检验;再做 Cox 比例风险回归,放入年龄、教育年限、基线 MMSE、体力活动、慢性病数量,输出风险比 HR、95% CI 和 p 值,检验 Schoenfeld 残差以验证等比例风险假设。"

ChatSRS 输出:

Kaplan-Meier 分析
全样本 4 年无认知损害累积概率:0.634(95% CI [0.578, 0.690])
中位生存时间:56 个月(95% CI [48, 64])

Log-rank 检验(性别分层):chi2(1) = 8.34,p = .004
女性 4 年累积概率:0.601(95% CI [0.529, 0.673])
男性 4 年累积概率:0.674(95% CI [0.595, 0.753])

表 3  Cox 比例风险回归结果(N = 312)

预测变量               HR        95% CI             p
年龄(每岁)          1.08     [1.04, 1.12]       < .001
教育年限(每年)       0.92     [0.87, 0.97]        .003
基线 MMSE(每分)      0.87     [0.82, 0.93]       < .001
体力活动(有 vs 无)   0.64     [0.46, 0.89]        .008
慢性病数量(每个)     1.19     [1.09, 1.30]       < .001

等比例风险假设检验(Schoenfeld 残差):全局检验 chi2(5) = 7.21,p = .205 — 假设成立。

第四步:潜变量增长曲线模型(LGM)— 识别老化轨迹类型

"对四个时间点的认知评分(T1-T4)建立无条件潜变量增长曲线模型(LGM),估计截距和斜率的均值与方差;再建立条件模型,以教育年限和体力活动预测截距和斜率,报告 SEM 标准化路径系数、模型拟合指数(CFI、TLI、RMSEA、SRMR),并绘制个体轨迹图。"

ChatSRS 输出(R 引擎,lavaan):

无条件 LGM
截距均值:25.87(SE = 0.28,p < .001)    截距方差:8.42(p < .001)
斜率均值:-0.91(SE = 0.09,p < .001)    斜率方差:0.38(p < .001)
截距-斜率协方差:-1.24(p = .003,负相关 — 基线高者下降更快)

模型拟合:CFI = 0.983,TLI = 0.971,RMSEA = 0.042(90% CI [0.000, 0.083]),SRMR = 0.038

条件 LGM(协变量预测截距 + 斜率)
教育年限 → 截距:beta = 0.34,p < .001
教育年限 → 斜率:beta = 0.18,p = .012(教育年限越高,认知下降越慢)
体力活动 → 截距:beta = 0.21,p = .003
体力活动 → 斜率:beta = 0.24,p < .001(体力活动对减缓认知下降有保护效应)

论文方法 / 结果写法(APA 7th,老年纵向研究报告句式)

这是最直接帮到你的部分——把上面每步分析结果翻译成论文可用的 APA 7th 格式段落。

方法章节:数据分析策略描述

本研究采用线性混合效应模型(Linear Mixed-effects Model, LMM)对老年被试的认知功能纵向轨迹进行建模。模型纳入随机截距与随机斜率,以考察个体间在认知初始水平和随时间变化速率上的差异。模型采用极大似然法(Maximum Likelihood, ML;即 lme4 中 REML=FALSE)估计,以支持全信息极大似然(Full Information Maximum Likelihood, FIML)框架处理缺失数据,充分利用含缺失值被试的可用观测信息,同时减小选择性脱落导致的偏差(Schafer & Graham, 2002)。生存分析采用 Cox 比例风险回归,等比例风险假设通过 Schoenfeld 残差检验验证。潜变量增长曲线模型(Latent Growth Model, LGM)采用结构方程建模框架(lavaan 包)。所有分析使用 R 语言(version 4.4)完成,显著性水平设为 .05。

结果章节:脱落分析

基线 312 名被试中,241 人(77.2%)完成全部三次随访,71 人(22.8%)在随访期间脱落(其中死亡 53.5%,主动退出 25.4%,失访 21.1%)。脱落分析显示,脱落组的基线年龄显著高于完访组,t(310) = 4.93,p < .001,基线 MMSE 评分显著低于完访组,t(310) = 4.62,p < .001,慢性病数量显著多于完访组,t(310) = 4.45,p < .001;两组性别构成无显著差异,chi2(1) = 0.23,p = .630。上述结果表明脱落机制为非随机缺失(Missing At Random, MAR),FIML 方法为当前数据的适当处理策略。

结果章节:混合效应模型主要结果

线性混合效应模型结果显示,时间固定效应显著,B = -0.89,SE = 0.08,t = -11.12,p < .001,95% CI [-1.05, -0.73],表明在控制协变量后,队列整体认知功能(MMSE)以平均每年 0.89 分的速度下降。教育年限对认知水平具有显著正向效应,B = 0.31,SE = 0.06,t = 5.17,p < .001,95% CI [0.19, 0.43];慢性病数量对认知具有显著负向效应,B = -0.47,SE = 0.11,t = -4.27,p < .001,95% CI [-0.69, -0.25]。随机效应方差分量估计表明,截距方差 sigma^2_u0 = 5.83,斜率方差 sigma^2_u1 = 0.42,个体间认知下降速率存在显著异质性,支持纳入随机斜率的模型规格。

结果章节:Cox 回归

Cox 比例风险回归结果显示,年龄每增加 1 岁,认知损害风险增加 8%,HR = 1.08,95% CI [1.04, 1.12],p < .001;教育年限每增加 1 年,认知损害风险降低 8%,HR = 0.92,95% CI [0.87, 0.97],p = .003;参与体力活动者较不参与者认知损害风险降低 36%,HR = 0.64,95% CI [0.46, 0.89],p = .008。Schoenfeld 残差全局检验确认等比例风险假设成立,chi2(5) = 7.21,p = .205。


以上报告段落可直接用于论文的 Methods 和 Results 章节,仅需将数值替换为你自己的分析结果。在 chatsrs.com 的"APA 纵向报告"功能中,AI 可自动整合上述全部步骤的输出,一次性生成完整报告文档。


常见 FAQ

Q1:老年纵向研究数据不可避免有缺失,该怎么处理?

老年队列的缺失通常不满足完全随机缺失(MCAR)假设——年龄更大、健康更差的人更容易失访。处理策略按严格程度依次为:

  1. 删除法(listwise):只纳入完整数据,简单但浪费信息、引入选择偏差,通常不推荐
  2. 末次观察前移(LOCF):将最后一次观测值延续,低估变化幅度,APA 和 CONSORT 均不鼓励
  3. 多重插补(MI):在 MAR 假设下生成多份完整数据集,合并分析结果,是黄金标准之一
  4. 全信息极大似然(FIML):直接用所有可用观测信息估计模型参数,与 MI 效率相当,混合效应模型框架下推荐使用

在 chatsrs.com 中,LMM 指定 ML 估计(REML=FALSE)后即可启用 FIML 框架处理缺失数据;多重插补另有独立指令,可参见:缺失数据处理学术指南

Q2:混合效应模型和重复测量 ANOVA 该怎么选?

两者都处理重复测量数据,但适用条件不同:

维度重复测量 ANOVA线性混合效应模型(LMM)
缺失数据处理只能用完整案例(LOCF 或删除)FIML,充分利用不完整案例
时间间隔要求等间距可处理不等间距追踪
个体差异建模无随机效应随机截距 + 随机斜率,建模个体异质性
脱落偏差有系统偏差MAR 假设下无偏
APA 期刊现状老方法,审稿人可能要求升级纵向研究的主流方法

老年学纵向研究强烈推荐 LMM;重复测量 ANOVA 仅在等间距、完整数据、无异质性假设的简单场景下保留。

Q3:Kaplan-Meier 曲线和 Cox 回归分别报告什么?

Kaplan-Meier:纯描述性,报告各时间点累积生存概率(含 95% CI)、中位生存时间、分组 Log-rank 检验的卡方统计量和 p 值。不能控制混杂变量。

Cox 比例风险回归:多变量分析,每个预测变量报告风险比(HR)、95% CI、Wald chi2 / z 统计量、p 值。必须验证等比例风险假设(Schoenfeld 残差检验);若违反,考虑加入时间交互项或分层 Cox。

两者通常配合使用:先 KM 曲线做描述与分组比较,再 Cox 做多因素控制分析。

Q4:潜变量增长曲线模型(LGM)的优势是什么?何时选 LMM vs LGM?

LGM 基于结构方程框架,与 LMM 的主要区别:

  • LGM 优势:可同时检验多个因变量的增长轨迹(平行过程 LGM),可纳入潜在类别识别(LGCM + LCGA),截距/斜率本身作为潜在因子可预测其他结果变量,模型拟合指数(CFI/RMSEA)更直观
  • LMM 优势:时间点数量要求更灵活(3 个时间点即可),处理不等间距更直接,FIML 与非平衡数据更兼容,计算更稳定

经验法则:时间点 >= 4、样本量 >= 200、关注轨迹类型和预测因素时优选 LGM;时间点 3 个、大量脱落、不等间距随访时优选 LMM。

Q5:APA 7th 纵向研究的结果章节要求报告哪些指标?

混合效应模型:固定效应系数(B)、标准误(SE)、t 值或 z 值、p 值、95% CI;随机效应方差分量(截距方差、斜率方差);模型拟合(AIC/BIC 用于模型比较);效应量(条件 R^2 / 边际 R^2,使用 MuMIn 包)。

生存分析:各组中位生存时间及 95% CI;Kaplan-Meier 曲线;Log-rank 检验 chi2 值、df、p 值;Cox 回归中每个变量的 HR、95% CI、p 值;等比例风险假设检验结果。

潜变量增长曲线:截距/斜率的均值与方差;截距-斜率协方差;模型拟合:CFI >= .95、TLI >= .95、RMSEA <= .06、SRMR <= .08(Hu & Bentler, 1999 标准);条件模型标准化路径系数。


老年学纵向分析方法速查

研究问题推荐方法ChatSRS 一句话关键词
认知/功能随时间的平均变化趋势LMM 固定效应时间项"混合效应模型,随机截距斜率,FIML 缺失"
个体间轨迹异质性LMM 随机效应 / LGM"随机斜率方差,潜变量增长曲线"
死亡 / 发病的组间风险差异(描述)Kaplan-Meier + Log-rank"KM 曲线,Log-rank 检验,中位生存时间"
多变量控制下的事件风险Cox 比例风险回归"Cox 回归,HR,Schoenfeld 残差假设检验"
脱落非随机的缺失数据FIML / 多重插补 MI"全信息极大似然,多重插补,MAR 假设"
教育 / 生活方式对认知老化轨迹的影响条件 LGM / LMM 交互项"截距斜率预测,时间 x 协变量交互"
跨测量时间点的测量不变性测量不变性检验"配置模型,度量不变性,标量不变性"

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。