统计百科 ·

SEM 模型拟合指标临界值一览 — CFI/RMSEA/SRMR 合格线、争议与小样本注意事项

统计百科:系统梳理结构方程模型六大拟合指标的临界值来源与争议——CFI/TLI>.95 vs .90、RMSEA<.06 vs .08、SRMR<.08、chi-square/df<3,解析小样本与复杂模型下的特殊注意事项,附可直接抄进论文的 APA 7th 报告句式。

结构方程模型(SEM)跑完之后,最让人纠结的一步往往不是建模,而是"拟合到底够不够好"。CFI = .93 算过吗?RMSEA = .07 审稿人会挑吗?小样本 chi-square 显著怎么办?这篇文章把六大拟合指标的临界值来源、争议和实际判断逻辑全部摆出来,并给出可直接抄进论文的 APA 7th 报告句式。


你的 SEM 拟合报告有这些困惑吗?

做 SEM 的研究者,十有八九遇到过这些问题:

  • "CFI = .93,是凑合能用,还是必须修正?"
  • "RMSEA < .06 还是 < .08,这两条线哪个算对?"
  • "chi-square 显著了,模型一定要推翻重来吗?"
  • "样本量才 150,拟合指标要用不一样的标准吗?"
  • "方法章节怎么写才能让审稿人不挑剔?"

这些问题没有一个绝对正确的答案,因为 SEM 拟合临界值的争议在计量心理学界延续了三十年。但争议不等于无章可循——下面把每个指标的来龙去脉、推荐阈值和常见场景的处理逻辑逐一梳理清楚。


一、为什么 SEM 需要多个拟合指标?

SEM 没有一个万能的"p 值通过/不通过"。原因在于:

  • chi-square 检验理论上是最直接的拟合检验,但它对样本量极度敏感——样本量越大,几乎所有模型都会被拒绝
  • 增量拟合指数(CFI/TLI)衡量模型相对于"完全无关模型"的改进程度,与样本量相关性较小
  • 绝对拟合指数(RMSEA/SRMR)衡量模型预测的协方差矩阵与观测矩阵之间的绝对偏差,更直观反映拟合误差大小

APA 7th Publication Manual 和多数顶刊要求同时报告多个拟合指标,通常不少于三类(chi-square + 增量拟合 + 绝对拟合),以便读者从不同维度评估模型。


二、六大拟合指标临界值完整一览

chi-square 检验(chi^2)

来源逻辑:若模型完美拟合总体,观测样本的 chi-square 在零假设下服从自由度为 df 的卡方分布。p > .05 表示无法拒绝"模型拟合完美"的零假设。

判断标准含义
p > .05理论上模型拟合良好(但大样本几乎不可能达到)
p < .05模型与数据存在显著偏差

核心问题:chi-square 与样本量线性相关。N = 500 时,chi-square = 2 × df 的模型就会显著;N = 100 时,同样的模型可能 p > .05。因此,单独依赖 chi-square 已被主流方法论者普遍反对(Kline,2023)。

实践处理:大样本(N > 300)中 chi-square 显著时,不必推翻模型,需配合 chi^2/df 比值和其他指标综合判断,并在论文中说明原因。


chi^2/df 比值(Normed Chi-Square, NC)

Wheaton 等(1977)提出用 chi^2 除以自由度来"中和"样本量影响。

临界值推荐出处
< 5Wheaton et al.(1977)宽松标准
< 3Kline(2023)常用推荐,多数期刊接受
< 2严格标准,通常见于小型精炼模型

争议:这一指标缺乏统一理论基础,临界值是约定俗成而非推导所得。chi^2/df = 2.8 并不比 3.1 有本质区别。现代方法论教材(Kline,2023;Hu & Bentler,1999)倾向于将其作为辅助参考,而非主要判断依据。


CFI — 比较拟合指数(Comparative Fit Index)

Bentler(1990)提出,比较目标模型与"独立模型"(所有变量无关)的拟合改善程度。

$CFI = 1 - \frac{\max(\chi^2_{model} - df_{model},\ 0)}{\max(\chi^2_{null} - df_{null},\ 0)}$

临界值评价推荐出处
>= .95良好拟合(Good fit)Hu & Bentler(1999)——当前最广引用标准
>= .90可接受(Acceptable)Bentler & Bonett(1980)——早期宽松标准
>= .95 + SRMR <= .08双重标准组合Hu & Bentler(1999)联合判断

争议:Hu & Bentler(1999)的 .95 临界值基于特定模型条件(样本量约 250,正态分布,无缺失)的模拟研究。McNeish 等(2018)指出,当模型复杂(测量指标多、因子多)时,CFI 往往偏低,.95 标准可能过于严苛。相反,在简单模型中 CFI 很容易超过 .95,并不说明模型理论上更优。

小样本注意:N < 200 时,CFI 估计不稳定,变异较大。此时建议同时报告 TLI,后者对样本量的敏感性略低于 CFI。


TLI — Tucker-Lewis 指数(Tucker-Lewis Index)

Tucker & Lewis(1973)提出,又称 NNFI(Non-Normed Fit Index)。

临界值评价
>= .95良好拟合
>= .90可接受

与 CFI 的区别:TLI 对模型复杂度有"惩罚"(分子分母均除以各自 df),理论上更倾向于简洁模型。当 CFI 和 TLI 的差异较大时(> .05),可能提示模型参数化过度(过多自由参数)或模型规格问题。

特殊性质:TLI 的值域不严格限于 [0, 1],极差拟合时可能出现负值,极好拟合时可能超过 1。报告时如实呈现,无需"修正"。


RMSEA — 近似误差均方根(Root Mean Square Error of Approximation)

Steiger & Lind(1980)提出,Browne & Cudeck(1992)系统推广。RMSEA 衡量每个自由度上的平均拟合偏差,并对模型复杂度有隐含惩罚。

$RMSEA = \sqrt{\frac{\max(\chi^2 - df,\ 0)}{df(N-1)}}$

临界值评价推荐出处
<= .05良好拟合(Close fit)Browne & Cudeck(1992)
<= .06良好(严格标准下限)Hu & Bentler(1999)
<= .08可接受(Reasonable fit)Browne & Cudeck(1992)
<= .10勉强可接受(Mediocre fit)MacCallum et al.(1996)
> .10不可接受

置信区间:报告 RMSEA 时必须同时报告 90% 置信区间(90% CI)。若 90% CI 上限超过 .08,则即使点估计 < .06,也说明拟合不确定性较高。格式:RMSEA = .054,90% CI [.038, .071]。

争议:RMSEA 随模型自由度增大而系统性降低——指标数量越多(观测变量 p 增大),df 随之增大,RMSEA 越容易达标。这导致一个悖论:指标更多的"大模型"反而比指标少的简洁模型 RMSEA 更小(注意:增加自由参数会减小 df,效果相反)。Marsh 等(2004)建议将 RMSEA 与 CFI 联合判断,不单独用 RMSEA 评价模型。

小样本注意:N < 200 时,RMSEA 的点估计偏高(容易"虚报"拟合差),90% CI 极宽,统计功效不足。此时应补充报告 p_close(p_close > .05 表示无法拒绝 close fit 假设,为好),同时关注 90% CI 上限是否超过 .08。


SRMR — 标准化残差均方根(Standardized Root Mean Square Residual)

临界值评价
<= .05良好拟合
<= .08可接受
> .10通常不可接受

计算原理:SRMR 是观测相关矩阵与模型隐含相关矩阵之间的平均绝对残差,直观反映"模型预测的协方差离数据有多远"。值为 0 表示完美拟合;每个残差相关平均偏差 .08 对应 SRMR = .08。

优点:SRMR 不受 chi-square 对样本量敏感性的影响,对局部规格错误(如遗漏某个路径)较敏感,是检测测量模型遗漏的有效辅助指标。

Hu & Bentler(1999)联合标准:CFI >= .95 + SRMR <= .08 的"双重标准"(Two-index strategy)是目前引用最广的组合判断准则,假阳性率和假阴性率均优于单一指标。


三、临界值争议的根源:Hu & Bentler(1999)的局限

当前几乎所有 SEM 临界值都源于 Hu & Bentler(1999)的蒙特卡洛模拟。但该研究的设计条件包括:

  • 样本量 N = 150 ~ 5,000(偏重大样本)
  • 模型为简单三因子结构(每因子 3-4 个指标)
  • 数据符合多元正态分布
  • 无缺失值

现实研究条件往往偏离上述假设,导致临界值的适用性存在争议:

  1. 模型复杂度:因子数量 > 5、指标数 > 20 时,CFI 系统性偏低,.95 标准过严(McNeish et al.,2018)
  2. 非正态数据:使用 MLM(Robust ML)或 WLSMV 估计时,拟合指标计算方式不同,标准不应直接套用
  3. 小样本:N < 200 时,所有拟合指标估计均不稳定,任何固定临界值都可靠性有限
  4. 跨文化/测量不变性研究:多组 SEM 中,各组分别报告拟合指标,全局指标意义有限

方法论建议(Kline,2023):将临界值视为"经验性参考范围"而非"通过/不通过"分界线。报告时如实呈现所有指标值,并在讨论中解释模型拟合的局限。


四、小样本(N < 200)的特殊注意事项

小样本 SEM 是最容易踩坑的场景,以下是逐指标的注意要点:

指标小样本表现应对建议
chi-square统计功效不足,容易 p > .05(虚假"拟合好")配合其他指标;报告功效分析
CFI/TLI估计不稳定,置信区间宽同时报告两者,差异 > .05 时需解释
RMSEA系统性偏高,90% CI 极宽重点报告 90% CI;关注 p_close
SRMR相对稳定,仍是小样本可信指标之一优先关注 SRMR
参数估计标准误偏大,路径系数不稳定考虑 Bootstrap(重抽样 5,000 次)

额外建议

  • N < 200 时,避免过复杂的模型(因子数 <= 3,每因子指标 4-6 个为宜)
  • 报告各因子的平均方差提取量(AVE >= .50)和组合信度(CR >= .70)作为测量质量的替代指标
  • 使用 Bootstrap 置信区间替代标准正态置信区间,对小样本更稳健
  • 在方法章节说明小样本对拟合指标解释的影响,避免审稿人误解

五、各指标组合判断逻辑

拟合评估不应孤立看单个指标。以下是实践中的组合判断框架:

理想情形(所有指标达标)

  • chi^2/df < 3,p 可能显著(大样本正常)
  • CFI >= .95,TLI >= .95
  • RMSEA <= .06,90% CI 上限 <= .08
  • SRMR <= .08

此时报告"模型拟合良好"无争议。

临界情形(部分指标边缘)

  • CFI = .92 ~ .94:报告"可接受拟合",解释为何不进一步修正(理论驱动或修正指数不支持)
  • RMSEA = .07 ~ .08,90% CI 上限 < .10:报告"合理拟合",同时列出 SRMR <= .08 作为支撑
  • CFI >= .95 但 SRMR > .10:提示局部规格问题,检查残差矩阵,考虑添加误差协方差

明显不佳(需要修正或解释)

  • CFI < .90 或 RMSEA > .10:模型拟合较差,建议在报告中明确承认,并讨论可能的理论或测量原因

修正时的注意事项:基于修正指数(Modification Indices, MI)进行后验修正时,每次只添加一个修正,且修正必须有实质理论依据,否则属于数据挖掘。修正过程需在论文中透明报告,避免审稿人质疑。


六、在 ChatSRS 一句话获得完整拟合指标报告

打开 chatsrs.com,上传数据后输入:

"对以下变量做验证性因子分析(CFA),输出 chi-square(含 df 和 p 值)、chi^2/df、CFI、TLI、RMSEA(含 90% CI 和 p_close)、SRMR,并给出符合 APA 7th 格式的模型拟合报告段落,说明各指标是否达到 Hu & Bentler(1999)标准;如有指标边缘,给出可能的修正建议。"

ChatSRS 使用 R lavaan 引擎(sem_path 指令,68 字内可触发),自动输出所有主流拟合指标,生成可直接复制进论文的报告段落,并标注每个指标的临界值判断结论。

无需手动查临界值表,无需逐个检查格式。


七、可直接抄进论文的 APA 7th 报告句式

测量模型(CFA)拟合报告——拟合良好版

验证性因子分析(CFA)结果显示,测量模型拟合指标均达到可接受标准:
chi-square(df) = XX.XX, p = .XXX; chi^2/df = X.XX; CFI = .XXX; TLI = .XXX;
RMSEA = .XXX(90% CI [.XXX, .XXX],p_close = .XXX); SRMR = .XXX。
各指标均满足 Hu 与 Bentler(1999)提出的良好拟合标准
(CFI >= .95,RMSEA <= .06,SRMR <= .08),表明测量模型对数据拟合良好。

填入数值的示例

验证性因子分析(CFA)结果显示,测量模型拟合指标均达到可接受标准:chi-square(48) = 87.34,p < .001;chi^2/df = 1.82;CFI = .962;TLI = .951;RMSEA = .047(90% CI [.029, .063],p_close = .712);SRMR = .058。各指标均满足 Hu 与 Bentler(1999)提出的良好拟合标准(CFI >= .95,RMSEA <= .06,SRMR <= .08),表明测量模型对数据拟合良好。


结构模型(SEM)拟合报告——拟合可接受版

结构方程模型整体拟合结果如下:chi-square(df) = XX.XX, p = .XXX;
chi^2/df = X.XX; CFI = .XXX; TLI = .XXX;
RMSEA = .XXX(90% CI [.XXX, .XXX]); SRMR = .XXX。
CFI 与 TLI 高于 .90 的可接受临界值(Bentler & Bonett,1980),
RMSEA 与 SRMR 均低于 .08(Browne & Cudeck,1992),
整体拟合达到可接受水平。

填入数值的示例

结构方程模型整体拟合结果如下:chi-square(124) = 378.56,p < .001;chi^2/df = 3.05;CFI = .921;TLI = .908;RMSEA = .074(90% CI [.063, .085]);SRMR = .076。CFI 与 TLI 高于 .90 的可接受临界值(Bentler & Bonett,1980),RMSEA 与 SRMR 均低于 .08(Browne & Cudeck,1992),整体拟合达到可接受水平。


小样本拟合说明段落(方法章节补充)

由于样本量(N = XXX)相对有限,本研究在解读拟合指标时参照
Kline(2023)建议,将各临界值作为经验性参考范围而非绝对分界。
RMSEA 在小样本条件下存在正向偏估,本研究同时报告 90% 置信区间
以反映估计不确定性;CFI 估计值在 N < 200 时变异较大,
结合 SRMR 共同评估拟合质量。

方法章节 SEM 分析说明(标准版)

本研究采用结构方程模型(SEM)检验假设路径,使用 R 软件 lavaan 包
(Rosseel,2012)进行参数估计,采用最大似然法(ML)。
模型拟合评估参照 Hu 与 Bentler(1999)的双重标准策略,
同时报告 chi-square 检验(含 p 值)、chi^2/df 比值、CFI、TLI、
RMSEA(含 90% 置信区间)及 SRMR。
以 CFI >= .95、RMSEA <= .06、SRMR <= .08 为良好拟合标准,
以 CFI >= .90、RMSEA <= .08 为可接受拟合标准。
统计分析使用 ChatSRS(R lavaan 引擎),显著性水平设为 alpha = .05。

八、常见拟合指标问题对照表

常见错误正确处理说明
只报告 chi-square p 值同时报告 CFI / RMSEA / SRMR单一指标不足以评估 SEM 拟合
RMSEA 无 90% CIRMSEA = .054(90% CI [.038, .071])APA 和主流期刊要求报告区间
大样本 chi^2 显著就说"拟合差"解释样本量影响,配合其他指标chi-square 对大样本过度敏感
用 .90 标准但说"良好".90 对应"可接受",.95 对应"良好"用词须与引用的临界值标准一致
CFI = 1.00 直接报告检查是否过度识别或数据问题CFI 超过 1 通常提示规格问题
修正后不说明修正过程报告 MI 值、理论依据和修正步骤后验修正须透明,否则被质疑
小样本套用大样本临界值报告 CI,说明小样本限制临界值模拟条件不适用小样本

常见 FAQ

Q:CFI = .94 到底算过还是没过?

A:取决于期刊和研究领域。Hu & Bentler(1999)的严格标准是 .95,但该标准基于简单三因子模型的模拟,在复杂模型或小样本中可能过于苛刻。社会科学主流期刊中,CFI = .93 ~ .94 配合 RMSEA <= .06 和 SRMR <= .08 通常被接受,但需在论文中主动说明"达到可接受拟合水平"而非"拟合良好",并引用 Bentler & Bonett(1980)的 .90 标准作为依据。如果审稿人特别追问,可以补充报告 chi^2/df < 3 和 SRMR <= .08 来强化论证。

Q:RMSEA 显著性检验(p_close)是什么,要报告吗?

A:p_close 检验的零假设是"总体 RMSEA <= .05"(即"模型紧密拟合")。p_close > .05 表示无法拒绝"模型与总体紧密拟合"的假设,是好事;p_close < .05 表示拒绝紧密拟合假设,但不等于模型无法接受(Browne & Cudeck,1992 的"合理拟合"标准 RMSEA <= .08 仍适用)。建议报告:在点估计 RMSEA 接近 .05 临界值时(如 .04 ~ .07),报告 p_close 有助于澄清拟合状态;其他情况下报告是加分项但非必须。

Q:修正指数(MI)达到多少才应该修正?

A:通常 MI > 10 视为值得关注(对应 chi-square 减少量约 10 点)。但 MI 是统计建议,不是理论依据。每次修正前必须确认两点:(1) 修正的参数在理论上有意义(如两个测量指标确实可能共享误差来源);(2) 每次只修正一个参数,重新估计后再评估。纯粹为了让 CFI 超过 .95 而不加选择地添加误差协方差,属于数据拟合而非理论驱动的 SEM,会被审稿人质疑。Kline(2023)明确指出,修正指数不应自动触发修正,必须有理论解释。

Q:多组 SEM(测量不变性检验)中,拟合指标怎么报告?

A:测量不变性检验通过比较嵌套模型的拟合差异来判断,主要看:(1) delta CFI < .01(Cheung & Rensvold,2002 提出的差异量标准,比 chi-square 差异检验对样本量更稳健);(2) delta RMSEA < .015(Chen,2007)。报告格式为:先报告配置模型(Configural)的基础拟合,再逐步报告因子载荷约束(Metric)、截距约束(Scalar)模型,列出每步的 delta CFI 和 delta chi-square。ChatSRS 的多组 SEM 输出(sem_path 指令)默认包含不变性检验的逐步拟合比较表。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。