教程 ·
潜变量增长模型LGM与交叉滞后CLPM用AI一句话完成 — 纵向追踪数据分析
潜变量增长模型(LGM)与交叉滞后面板模型(CLPM)完整教程:用AI一句话完成截距斜率估计、增长轨迹拟合、双变量交叉滞后效应检验,自动输出APA格式报告与三线表。
纵向追踪数据,SPSS能做的很有限——重复测量ANOVA告诉你"有没有变化",却无法量化"变化的速率",也无法检验两个变量随时间的互相影响。这篇教程教你用AI一句话跑完LGM与CLPM全套流程:增长轨迹、截距斜率个体差异、双变量交叉滞后效应——60秒全齐。
纵向数据分析的真正痛点
追踪研究、干预研究、纵向队列研究的研究者,手里通常都有"同一批人测了3次以上"的数据。重复测量ANOVA可以回答"不同时点均值是否有差异",但它无法回答以下这些在纵向研究中真正重要的问题:
- 这批人的变化轨迹是什么样的?是线性增长、加速增长,还是递减趋于平台?
- 截距(起始水平)和斜率(变化速率)是否存在个体差异?
- 截距和斜率之间是否相关?(起点高的人,变化得是否也更快?)
- 变量A在时点T的水平,是否会预测变量B在时点T+1的变化?(交叉滞后因果逻辑)
- 这种双向影响是对称的,还是某一方向的效应更强?
前三个问题属于**潜变量增长曲线模型(Latent Growth Curve Model,LGM/LCM)的领域;后两个问题属于交叉滞后面板模型(Cross-Lagged Panel Model,CLPM)**的领域。两者都建立在结构方程模型(SEM)框架之上,在R(lavaan包)、Stata(sem命令)和专用SEM软件中都能实现,但参数设置繁琐,纵向数据的约束矩阵尤其容易出错。
ChatSRS把整个流程压到一句话。
方法一:潜变量增长曲线模型(LGM)
LGM的核心逻辑
LGM将纵向观测建模为两个潜在因子:
- 截距因子(Intercept Factor,I):代表个体的起始水平(在线性模型中通常是第一个时点的估计值);负荷全部固定为1
- 斜率因子(Slope Factor,S):代表个体随时间的变化速率;负荷按时间间隔固定,如0、1、2、3
截距和斜率都是潜变量,因此每个个体都有自己的截距和斜率估计值,可以研究个体差异。
I (截距) S (斜率)
负荷约束:
T1 → y1 1.0 0.0
T2 → y2 1.0 1.0
T3 → y3 1.0 2.0
T4 → y4 1.0 3.0
关键参数:
| 参数 | 符号 | 含义 |
|---|---|---|
| 截距均值 | mu_I | 全样本平均起始水平 |
| 斜率均值 | mu_S | 全样本平均变化速率(每单位时间) |
| 截距方差 | psi_II | 起始水平的个体差异程度 |
| 斜率方差 | psi_SS | 变化速率的个体差异程度 |
| 截距-斜率协方差 | psi_IS | 起点与速率的相关,正值=高起点者增长更快 |
| 测量误差方差 | theta | 每个时点的残差(通常允许等同约束) |
案例数据:中学生学业自我效能感四波追踪研究
某教育心理学研究追踪320名初中生从初一到初四,每年测量一次学业自我效能感量表(ASES,25-125分,分数越高效能感越强)。
变量名 含义
id 被试编号
ases_t1 初一测量(第1波)
ases_t2 初二测量(第2波)
ases_t3 初三测量(第3波)
ases_t4 初四测量(第4波)
gender 性别(0=男,1=女)
ses 家庭社会经济地位(1-5分)
研究问题:
- 学业自我效能感的纵向增长轨迹是线性的吗?
- 截距和斜率各自存在显著的个体差异吗?
- 家庭SES是否能预测截距(起始水平)和斜率(增长速率)?
用AI一句话完成LGM
在 chatsrs.com 上传数据后输入:
"对320名初中生四波追踪数据(ases_t1~ases_t4)建立线性潜变量增长曲线模型(LGM)。 请输出:
- 各时点描述统计(M、SD、偏度、峰度)及相邻时点相关矩阵
- 无条件线性LGM:截距均值、斜率均值、截距方差、斜率方差、截距-斜率协方差(含z检验和p值)
- 模型拟合指标:chi-squared、df、CFI、TLI、RMSEA(90% CI)、SRMR
- 有条件LGM:加入gender和ses作为截距和斜率的预测变量,输出路径系数(B、SE、beta、p)
- 三线表格式,APA 7th中文描述"
LGM输出结果怎么读
输出1:无条件LGM参数估计
表1 线性潜变量增长曲线模型参数估计(N = 320)
参数 估计值 SE z p 95% CI
截距均值 (mu_I) 87.42 1.08 80.94 <.001 *** [85.30, 89.54]
斜率均值 (mu_S) 4.63 0.34 13.62 <.001 *** [ 3.97, 5.29]
截距方差 (psi_II) 218.45 18.72 11.67 <.001 *** [181.76, 255.14]
斜率方差 (psi_SS) 12.84 1.94 6.62 <.001 *** [ 9.04, 16.64]
截距-斜率协方差 -18.63 4.21 -4.43 <.001 *** [-26.88, -10.38]
测量误差方差 34.21 3.18 10.76 <.001 *** [ 27.98, 40.44]
注:截距负荷固定为1;斜率负荷按等间隔约束(0、1、2、3);
测量误差方差跨时点设为等同约束。
逐行解读:
- 截距均值 87.42:初一时全样本学业自我效能感平均为87.42分,z检验显著,说明均值不为零(这通常是理所当然的,更重要的是截距的方差)
- 斜率均值 4.63(p < .001):平均每升一个年级,效能感增加4.63分——线性增长趋势显著
- 截距方差 218.45(p < .001):截距存在显著个体差异,不同学生的起始水平差异很大
- 斜率方差 12.84(p < .001):斜率存在显著个体差异,有人增长快有人增长慢(甚至有人下降)
- 截距-斜率协方差 -18.63(p < .001):负相关(标准化后r = -18.63 / sqrt(218.45 * 12.84) = -.35),说明起点越高的学生,增长速率越慢——天花板效应或均值回归
输出2:模型拟合指标
表2 LGM模型拟合指标
指标 值 解释
χ²(8) 8.74 p = .119,不显著
CFI .991 > .95,优秀
TLI .985 > .95,优秀
RMSEA .048 [.000, .092] 90% CI,< .06,良好
SRMR .031 < .08,良好
注:线性LGM(无条件模型,8个过约束df:14个观测矩 - 6个自由参数)拟合良好。
判断标准:CFI/TLI > .95,RMSEA < .06,SRMR < .08(Hu & Bentler, 1999)。
输出3:有条件LGM(加入协变量)
表3 有条件LGM路径系数(N = 320)
预测路径 B SE beta p
SES → 截距(起始水平) 5.84 0.92 .28 <.001 ***
SES → 斜率(增长速率) 0.67 0.21 .18 .001 **
Gender → 截距 -3.12 1.84 -.08 .090
Gender → 斜率 0.42 0.43 .06 .326
注:Beta为标准化路径系数;Gender:0=男,1=女(参照)。
** p < .01,*** p < .001。
解读:家庭SES对截距(beta = .28,p < .001)和斜率(beta = .18,p = .001)均有显著正向预测作用——SES越高的学生,初始自我效能感更高,且增长也更快。性别效应不显著。
方法二:交叉滞后面板模型(CLPM)
CLPM的核心逻辑
当研究者关心两个变量随时间的相互影响时,CLPM是经典选择。模型同时估计:
- 自回归路径(Autoregressive paths):变量在前一时点对自身下一时点的预测(稳定性系数)
- 交叉滞后路径(Cross-lagged paths):变量A的前一时点对变量B下一时点的预测(跨变量的时滞效应)
CLPM结构示意(两变量三时点):
X_T1 ─────────────→ X_T2 ─────────────→ X_T3
│ \(beta_XY) │ \(beta_XY) │
│ ↘ │ ↘ │
│ Y_T2 │ Y_T3 │
│ ↗ │ ↗ │
│ /(beta_YX) │ /(beta_YX)
Y_T1 ─────────────→ Y_T2 ─────────────→ Y_T3
beta_XX: X的自回归稳定性
beta_YY: Y的自回归稳定性
beta_XY: X → Y的交叉滞后(X对Y的滞后预测效应)
beta_YX: Y → X的交叉滞后(Y对X的滞后预测效应)
注意:经典CLPM受到近年方法学文献的批评(Hamaker et al., 2015),因为它混淆了稳定的个体间差异与真实的组内纵向变化。在条件允许时,**随机截距交叉滞后面板模型(RI-CLPM)**是更严格的替代方案——ChatSRS同样支持一句话完成RI-CLPM,只需在指令末尾加"同时输出RI-CLPM对比结果"。
案例数据:大学生手机使用与学业拖延的双向关系
某心理学研究追踪200名大学生三个学期(T1=大一上、T2=大一下、T3=大二上),每学期测量:
变量名 含义
phone_t1/t2/t3 手机日均使用时长(小时)
delay_t1/t2/t3 学业拖延量表得分(20-100分,越高越拖延)
研究问题:
- 手机使用是否会在随后一个学期预测更高的拖延(phone → delay)?
- 拖延是否会在随后一个学期预测更多的手机使用(delay → phone)?
- 哪个方向的效应更强?
用AI一句话完成CLPM
在 chatsrs.com 上传数据后输入:
"对200名大学生三时点数据(phone_t1
phone_t3,delay_t1delay_t3)建立双变量交叉滞后面板模型(CLPM)。 请输出:
- 描述统计 + 各时点间相关矩阵(Pearson r,含显著性标注)
- 完整CLPM:自回归路径(phone→phone,delay→delay)+ 交叉滞后路径(phone→delay,delay→phone)的路径系数(B、SE、beta、p)
- 模型拟合:chi-squared、CFI、TLI、RMSEA(90% CI)、SRMR
- 检验跨波段等同约束:自回归路径和交叉滞后路径是否在不同波段间稳定
- 三线表格式,APA 7th中文描述"
CLPM输出结果怎么读
输出1:CLPM路径系数
表4 交叉滞后面板模型路径系数(N = 200)
路径 B SE beta p
自回归路径
phone_t1 → phone_t2 0.52 0.06 .51 <.001 ***
phone_t2 → phone_t3 0.49 0.07 .47 <.001 ***
delay_t1 → delay_t2 0.58 0.07 .56 <.001 ***
delay_t2 → delay_t3 0.61 0.07 .59 <.001 ***
交叉滞后路径
phone_t1 → delay_t2 0.18 0.06 .16 .002 **
phone_t2 → delay_t3 0.21 0.07 .17 .003 **
delay_t1 → phone_t2 0.09 0.05 .09 .071
delay_t2 → phone_t3 0.11 0.06 .10 .063
注:Beta为标准化路径系数;同一方向的两个交叉滞后路径已做等同约束检验(不显著,
delta-CFI < .01,维持等同约束合理)。
** p < .01,*** p < .001。
核心发现解读:
- 手机使用 → 拖延(beta = .16~.17,p < .01):单向显著——控制前一时点拖延水平后,手机使用时长越长,下一学期拖延越严重
- 拖延 → 手机使用(beta = .09~.10,p > .05):不显著——拖延对随后手机使用无显著预测作用
- 两个自回归路径均显著(beta约.50-.60),说明两个变量均有中等稳定性
- 结论:手机使用是拖延的单向预测因子,反向路径不成立
输出2:模型拟合
表5 CLPM模型拟合指标
指标 值 解释
chi-squared(4) 5.42 p = .247,不显著
CFI .994 > .95,优秀
TLI .985 > .95,优秀
RMSEA .042 [.000, .098] 90% CI,< .06,良好
SRMR .028 < .08,良好
论文里怎么报告(APA 7th格式)
LGM APA报告句式
方法节(模型设定部分):
采用潜变量增长曲线模型(Latent Growth Curve Model,LGM)分析学业自我效能感的纵向变化轨迹(McArdle & Epstein, 1987)。截距因子负荷全部固定为1,斜率因子负荷按测量间隔固定为0、1、2、3,测量误差方差跨时点施加等同约束。模型由R 4.4中的lavaan包(v0.6-18,Rosseel, 2012)估计,采用全信息最大似然法(FIML)处理缺失数据。模型拟合以CFI > .95、RMSEA < .06、SRMR < .08为标准(Hu & Bentler, 1999)。
结果节(无条件LGM部分):
无条件线性LGM拟合良好,χ²(8) = 8.74, p = .119, CFI = .991, RMSEA = .048, 90% CI [.000, .092], SRMR = .031。截距均值显著不为零(M_I = 87.42, SE = 1.08, p < .001),斜率均值显著为正(M_S = 4.63, SE = 0.34, p < .001),表明学业自我效能感在初中四年间存在显著的线性增长趋势。截距方差(psi_II = 218.45, SE = 18.72, p < .001)和斜率方差(psi_SS = 12.84, SE = 1.94, p < .001)均显著,说明个体间在起始水平和增长速率上存在实质性差异。截距与斜率呈显著负相关(psi_IS = -18.63, SE = 4.21, p < .001, r = -.35),提示起始水平越高的学生,增长速率相对越慢。
结果节(有条件LGM,协变量效应):
有条件LGM结果显示,家庭社会经济地位(SES)对截距(B = 5.84, SE = 0.92, beta = .28, p < .001)和斜率(B = 0.67, SE = 0.21, beta = .18, p = .001)均有显著正向预测作用。性别对截距(B = -3.12, SE = 1.84, beta = -.08, p = .090)和斜率(B = 0.42, SE = 0.43, beta = .06, p = .326)的预测效应不显著。
CLPM APA报告句式
方法节(模型设定部分):
采用交叉滞后面板模型(Cross-Lagged Panel Model,CLPM;Kenny, 1975)检验手机使用与学业拖延之间的双向纵向关系。模型同时估计自回归路径(各变量自身跨时点的稳定性)和交叉滞后路径(两变量间的时滞预测效应),同时期残差跨时点自由估计,各时期内两变量残差间相关自由估计。采用卡方差异检验(delta-CFI)对等同约束模型进行检验。
结果节(CLPM路径系数部分):
CLPM拟合良好,χ²(4) = 5.42, p = .247, CFI = .994, RMSEA = .042, 90% CI [.000, .098], SRMR = .028。交叉滞后路径等同约束检验结果不显著(delta-CFI < .01),支持跨波段路径稳定性假设。
控制各变量在前一时点的自身水平后,手机使用时长对下一学期学业拖延的交叉滞后效应显著(beta = .16~.17, p < .01),而拖延对随后手机使用时长的交叉滞后效应不显著(beta = .09~.10, p > .05)。结果支持手机使用对学业拖延的单向预测效应,反向路径不成立。
APA报告格式规范对照表
| 要素 | LGM格式示例 | CLPM格式示例 |
|---|---|---|
| 截距/斜率均值 | M_I = 87.42, SE = 1.08, p < .001 | — |
| 方差(个体差异) | psi_SS = 12.84, SE = 1.94, p < .001 | — |
| 路径系数 | B = 5.84, SE = 0.92, beta = .28, p < .001 | beta = .16, p = .002 |
| 模型拟合 | χ²(8) = 8.74, CFI = .991, RMSEA = .048 | χ²(4) = 5.42, CFI = .994 |
| 效应量 | 标准化路径beta(小.10,中.30,大.50;Cohen, 1988相关系数r阈值,SEM路径系数借用参考,见Kline, 2016) | 同左 |
APA 7th细节提醒:p值小数点前不加0(写p = .001,不写p = 0.001);路径系数报告标准化值beta时,也不加0(写beta = .28);RMSEA必须报告90%置信区间而非95%。
常见问题 FAQ
Q1:LGM和重复测量ANOVA有什么本质区别?什么时候该选哪个?
A:两者都能描述"均值随时间的变化",但核心区别在于三点。第一,个体差异建模:重复测量ANOVA假设所有被试遵循同一条增长曲线,LGM允许每个个体有自己的截距和斜率,并将个体差异作为参数直接估计;第二,缺失数据处理:LGM在SEM框架下天然支持FIML(全信息最大似然),缺失数据无需删除,重复测量ANOVA默认完整案例;第三,协变量预测:LGM可以直接将人口学变量(如性别、SES)作为截距和斜率的预测变量,而重复测量ANOVA只能通过混合模型扩展实现类似功能。当研究者关心"谁变化得更快"以及"什么因素影响了增长速率"时,LGM是更合适的选择;如果只关心"总体上均值是否随时间变化",重复测量ANOVA够用且更简单。
Q2:CLPM和经典RI-CLPM有什么区别?一定要用RI-CLPM吗?
A:Hamaker等人(2015)的批评指出,经典CLPM的交叉滞后系数混合了个体间差异(stable trait-like differences between people)和组内纵向变化(within-person change over time),因此用于推断"个体层面的因果过程"时可能存在偏差。RI-CLPM通过加入随机截距因子剥离了稳定的个体间差异,使交叉滞后路径仅反映组内纵向关系,方法学上更严格。实践建议:如果研究目的是推断组内纵向因果逻辑,优先用RI-CLPM;如果样本量有限(< 200)或测量时点仅有3波,经典CLPM仍有报告价值,但需在局限性中说明。ChatSRS在同一次指令里可同时输出CLPM和RI-CLPM的对比结果。
Q3:LGM结果中斜率方差不显著,意味着什么?
A:斜率方差不显著(psi_SS = XX, p > .05)意味着个体间在增长速率上没有显著差异——虽然全样本均值斜率可能显著(即有显著的平均增长趋势),但每个人增长的速度大体一致,不存在"有人增长快有人增长慢"的实质性个体差异。在这种情况下:(1)不能再检验截距-斜率相关(因为斜率方差接近零,相关估计不稳定);(2)如果希望解释协变量对斜率的影响,统计功效很低,需谨慎解读;(3)可以考虑删去斜率方差参数(即固定为零),得到更简约的等增长速率模型。ChatSRS会在输出中自动提示斜率方差不显著时的处理建议。
Q4:样本量不够(< 200)能跑LGM或CLPM吗?
A:SEM系列模型对样本量有较高要求。经验标准:LGM建议每个自由参数至少10个被试,一个简单的线性LGM有5-6个自由参数,理论最低约50-60人,但稳健估计建议200人以上;CLPM的参数更多,三时点双变量模型建议至少150-200人。样本量不足时,标准误会偏大,参数估计不稳定,CFI/RMSEA等拟合指标也可能失真。如果样本量真的有限,可以考虑:(1)减少时点数(从4波压缩到3波);(2)用贝叶斯SEM(加入合理先验),对小样本更稳健;(3)结合Bootstrap置信区间报告,增加估计可信度。ChatSRS在检测到样本量偏小时会自动给出警示和替代建议。
Q5:LGM的测量误差方差应该设置等同约束还是自由估计?
A:这是LGM中一个实践争议点。等同约束(跨时点测量误差相等)是更简约的做法,减少了需要估计的参数,模型自由度更大,但如果不同时点的测量情境差异较大(如问卷改版、测量时间不同),等同约束可能不合适。自由估计则允许每个时点有不同的测量误差,模型更灵活,但参数更多,适合时点数较少(3-4波)的情况。实践建议:先拟合等同约束模型,再拟合自由估计模型,用LRT(似然比检验)或delta-CFI比较——若差异不显著(delta-CFI < .01),保留等同约束的简约模型。ChatSRS默认先跑等同约束版本,并在输出中附带自由估计版本的拟合对比。
小结
纵向追踪数据有两个不同层次的问题:增长轨迹建模(LGM)和双变量纵向因果(CLPM)。
- LGM:适合量化"均值增长速率"和"个体差异程度",并检验截距/斜率的影响因素;核心参数是截距均值、斜率均值、截距方差、斜率方差与截距-斜率协方差
- CLPM:适合检验两个变量随时间的相互影响(交叉滞后效应),区分谁是"原因"谁是"结果";关键指标是控制自回归后的标准化交叉滞后beta系数
两种方法都在SEM框架下运行,支持FIML缺失数据处理,并能输出符合APA 7th格式的三线表和文字描述。在 chatsrs.com 用一句自然语言指令,即可一次性获得从模型设定、拟合诊断到结果报告的全套输出,无需手写任何lavaan/Stata语法。
相关阅读
- 重复测量方差分析完整教程 — 多时点数据的入门方法,LGM的简化版
- 结构方程模型(SEM)用AI完成 — LGM和CLPM的方法论基础
- 线性混合模型用AI一句话完成 — 纵向数据的另一主流选择,灵活处理缺失值
本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。