统计百科 ·
SEM 模型拟合指标临界值一览 — CFI/RMSEA/SRMR 合格线、争议与小样本注意事项
统计百科:系统梳理结构方程模型六大拟合指标的临界值来源与争议——CFI/TLI>.95 vs .90、RMSEA<.06 vs .08、SRMR<.08、chi-square/df<3,解析小样本与复杂模型下的特殊注意事项,附可直接抄进论文的 APA 7th 报告句式。
结构方程模型(SEM)跑完之后,最让人纠结的一步往往不是建模,而是"拟合到底够不够好"。CFI = .93 算过吗?RMSEA = .07 审稿人会挑吗?小样本 chi-square 显著怎么办?这篇文章把六大拟合指标的临界值来源、争议和实际判断逻辑全部摆出来,并给出可直接抄进论文的 APA 7th 报告句式。
你的 SEM 拟合报告有这些困惑吗?
做 SEM 的研究者,十有八九遇到过这些问题:
- "CFI = .93,是凑合能用,还是必须修正?"
- "RMSEA < .06 还是 < .08,这两条线哪个算对?"
- "chi-square 显著了,模型一定要推翻重来吗?"
- "样本量才 150,拟合指标要用不一样的标准吗?"
- "方法章节怎么写才能让审稿人不挑剔?"
这些问题没有一个绝对正确的答案,因为 SEM 拟合临界值的争议在计量心理学界延续了三十年。但争议不等于无章可循——下面把每个指标的来龙去脉、推荐阈值和常见场景的处理逻辑逐一梳理清楚。
一、为什么 SEM 需要多个拟合指标?
SEM 没有一个万能的"p 值通过/不通过"。原因在于:
- chi-square 检验理论上是最直接的拟合检验,但它对样本量极度敏感——样本量越大,几乎所有模型都会被拒绝
- 增量拟合指数(CFI/TLI)衡量模型相对于"完全无关模型"的改进程度,与样本量相关性较小
- 绝对拟合指数(RMSEA/SRMR)衡量模型预测的协方差矩阵与观测矩阵之间的绝对偏差,更直观反映拟合误差大小
APA 7th Publication Manual 和多数顶刊要求同时报告多个拟合指标,通常不少于三类(chi-square + 增量拟合 + 绝对拟合),以便读者从不同维度评估模型。
二、六大拟合指标临界值完整一览
chi-square 检验(chi^2)
来源逻辑:若模型完美拟合总体,观测样本的 chi-square 在零假设下服从自由度为 df 的卡方分布。p > .05 表示无法拒绝"模型拟合完美"的零假设。
| 判断标准 | 含义 |
|---|---|
| p > .05 | 理论上模型拟合良好(但大样本几乎不可能达到) |
| p < .05 | 模型与数据存在显著偏差 |
核心问题:chi-square 与样本量线性相关。N = 500 时,chi-square = 2 × df 的模型就会显著;N = 100 时,同样的模型可能 p > .05。因此,单独依赖 chi-square 已被主流方法论者普遍反对(Kline,2023)。
实践处理:大样本(N > 300)中 chi-square 显著时,不必推翻模型,需配合 chi^2/df 比值和其他指标综合判断,并在论文中说明原因。
chi^2/df 比值(Normed Chi-Square, NC)
Wheaton 等(1977)提出用 chi^2 除以自由度来"中和"样本量影响。
| 临界值 | 推荐出处 |
|---|---|
| < 5 | Wheaton et al.(1977)宽松标准 |
| < 3 | Kline(2023)常用推荐,多数期刊接受 |
| < 2 | 严格标准,通常见于小型精炼模型 |
争议:这一指标缺乏统一理论基础,临界值是约定俗成而非推导所得。chi^2/df = 2.8 并不比 3.1 有本质区别。现代方法论教材(Kline,2023;Hu & Bentler,1999)倾向于将其作为辅助参考,而非主要判断依据。
CFI — 比较拟合指数(Comparative Fit Index)
Bentler(1990)提出,比较目标模型与"独立模型"(所有变量无关)的拟合改善程度。
$CFI = 1 - \frac{\max(\chi^2_{model} - df_{model},\ 0)}{\max(\chi^2_{null} - df_{null},\ 0)}$
| 临界值 | 评价 | 推荐出处 |
|---|---|---|
| >= .95 | 良好拟合(Good fit) | Hu & Bentler(1999)——当前最广引用标准 |
| >= .90 | 可接受(Acceptable) | Bentler & Bonett(1980)——早期宽松标准 |
| >= .95 + SRMR <= .08 | 双重标准组合 | Hu & Bentler(1999)联合判断 |
争议:Hu & Bentler(1999)的 .95 临界值基于特定模型条件(样本量约 250,正态分布,无缺失)的模拟研究。McNeish 等(2018)指出,当模型复杂(测量指标多、因子多)时,CFI 往往偏低,.95 标准可能过于严苛。相反,在简单模型中 CFI 很容易超过 .95,并不说明模型理论上更优。
小样本注意:N < 200 时,CFI 估计不稳定,变异较大。此时建议同时报告 TLI,后者对样本量的敏感性略低于 CFI。
TLI — Tucker-Lewis 指数(Tucker-Lewis Index)
Tucker & Lewis(1973)提出,又称 NNFI(Non-Normed Fit Index)。
| 临界值 | 评价 |
|---|---|
| >= .95 | 良好拟合 |
| >= .90 | 可接受 |
与 CFI 的区别:TLI 对模型复杂度有"惩罚"(分子分母均除以各自 df),理论上更倾向于简洁模型。当 CFI 和 TLI 的差异较大时(> .05),可能提示模型参数化过度(过多自由参数)或模型规格问题。
特殊性质:TLI 的值域不严格限于 [0, 1],极差拟合时可能出现负值,极好拟合时可能超过 1。报告时如实呈现,无需"修正"。
RMSEA — 近似误差均方根(Root Mean Square Error of Approximation)
Steiger & Lind(1980)提出,Browne & Cudeck(1992)系统推广。RMSEA 衡量每个自由度上的平均拟合偏差,并对模型复杂度有隐含惩罚。
$RMSEA = \sqrt{\frac{\max(\chi^2 - df,\ 0)}{df(N-1)}}$
| 临界值 | 评价 | 推荐出处 |
|---|---|---|
| <= .05 | 良好拟合(Close fit) | Browne & Cudeck(1992) |
| <= .06 | 良好(严格标准下限) | Hu & Bentler(1999) |
| <= .08 | 可接受(Reasonable fit) | Browne & Cudeck(1992) |
| <= .10 | 勉强可接受(Mediocre fit) | MacCallum et al.(1996) |
| > .10 | 不可接受 | — |
置信区间:报告 RMSEA 时必须同时报告 90% 置信区间(90% CI)。若 90% CI 上限超过 .08,则即使点估计 < .06,也说明拟合不确定性较高。格式:RMSEA = .054,90% CI [.038, .071]。
争议:RMSEA 随模型自由度增大而系统性降低——指标数量越多(观测变量 p 增大),df 随之增大,RMSEA 越容易达标。这导致一个悖论:指标更多的"大模型"反而比指标少的简洁模型 RMSEA 更小(注意:增加自由参数会减小 df,效果相反)。Marsh 等(2004)建议将 RMSEA 与 CFI 联合判断,不单独用 RMSEA 评价模型。
小样本注意:N < 200 时,RMSEA 的点估计偏高(容易"虚报"拟合差),90% CI 极宽,统计功效不足。此时应补充报告 p_close(p_close > .05 表示无法拒绝 close fit 假设,为好),同时关注 90% CI 上限是否超过 .08。
SRMR — 标准化残差均方根(Standardized Root Mean Square Residual)
| 临界值 | 评价 |
|---|---|
| <= .05 | 良好拟合 |
| <= .08 | 可接受 |
| > .10 | 通常不可接受 |
计算原理:SRMR 是观测相关矩阵与模型隐含相关矩阵之间的平均绝对残差,直观反映"模型预测的协方差离数据有多远"。值为 0 表示完美拟合;每个残差相关平均偏差 .08 对应 SRMR = .08。
优点:SRMR 不受 chi-square 对样本量敏感性的影响,对局部规格错误(如遗漏某个路径)较敏感,是检测测量模型遗漏的有效辅助指标。
Hu & Bentler(1999)联合标准:CFI >= .95 + SRMR <= .08 的"双重标准"(Two-index strategy)是目前引用最广的组合判断准则,假阳性率和假阴性率均优于单一指标。
三、临界值争议的根源:Hu & Bentler(1999)的局限
当前几乎所有 SEM 临界值都源于 Hu & Bentler(1999)的蒙特卡洛模拟。但该研究的设计条件包括:
- 样本量 N = 150 ~ 5,000(偏重大样本)
- 模型为简单三因子结构(每因子 3-4 个指标)
- 数据符合多元正态分布
- 无缺失值
现实研究条件往往偏离上述假设,导致临界值的适用性存在争议:
- 模型复杂度:因子数量 > 5、指标数 > 20 时,CFI 系统性偏低,.95 标准过严(McNeish et al.,2018)
- 非正态数据:使用 MLM(Robust ML)或 WLSMV 估计时,拟合指标计算方式不同,标准不应直接套用
- 小样本:N < 200 时,所有拟合指标估计均不稳定,任何固定临界值都可靠性有限
- 跨文化/测量不变性研究:多组 SEM 中,各组分别报告拟合指标,全局指标意义有限
方法论建议(Kline,2023):将临界值视为"经验性参考范围"而非"通过/不通过"分界线。报告时如实呈现所有指标值,并在讨论中解释模型拟合的局限。
四、小样本(N < 200)的特殊注意事项
小样本 SEM 是最容易踩坑的场景,以下是逐指标的注意要点:
| 指标 | 小样本表现 | 应对建议 |
|---|---|---|
| chi-square | 统计功效不足,容易 p > .05(虚假"拟合好") | 配合其他指标;报告功效分析 |
| CFI/TLI | 估计不稳定,置信区间宽 | 同时报告两者,差异 > .05 时需解释 |
| RMSEA | 系统性偏高,90% CI 极宽 | 重点报告 90% CI;关注 p_close |
| SRMR | 相对稳定,仍是小样本可信指标之一 | 优先关注 SRMR |
| 参数估计 | 标准误偏大,路径系数不稳定 | 考虑 Bootstrap(重抽样 5,000 次) |
额外建议:
- N < 200 时,避免过复杂的模型(因子数 <= 3,每因子指标 4-6 个为宜)
- 报告各因子的平均方差提取量(AVE >= .50)和组合信度(CR >= .70)作为测量质量的替代指标
- 使用 Bootstrap 置信区间替代标准正态置信区间,对小样本更稳健
- 在方法章节说明小样本对拟合指标解释的影响,避免审稿人误解
五、各指标组合判断逻辑
拟合评估不应孤立看单个指标。以下是实践中的组合判断框架:
理想情形(所有指标达标)
- chi^2/df < 3,p 可能显著(大样本正常)
- CFI >= .95,TLI >= .95
- RMSEA <= .06,90% CI 上限 <= .08
- SRMR <= .08
此时报告"模型拟合良好"无争议。
临界情形(部分指标边缘)
- CFI = .92 ~ .94:报告"可接受拟合",解释为何不进一步修正(理论驱动或修正指数不支持)
- RMSEA = .07 ~ .08,90% CI 上限 < .10:报告"合理拟合",同时列出 SRMR <= .08 作为支撑
- CFI >= .95 但 SRMR > .10:提示局部规格问题,检查残差矩阵,考虑添加误差协方差
明显不佳(需要修正或解释)
- CFI < .90 或 RMSEA > .10:模型拟合较差,建议在报告中明确承认,并讨论可能的理论或测量原因
修正时的注意事项:基于修正指数(Modification Indices, MI)进行后验修正时,每次只添加一个修正,且修正必须有实质理论依据,否则属于数据挖掘。修正过程需在论文中透明报告,避免审稿人质疑。
六、在 ChatSRS 一句话获得完整拟合指标报告
打开 chatsrs.com,上传数据后输入:
"对以下变量做验证性因子分析(CFA),输出 chi-square(含 df 和 p 值)、chi^2/df、CFI、TLI、RMSEA(含 90% CI 和 p_close)、SRMR,并给出符合 APA 7th 格式的模型拟合报告段落,说明各指标是否达到 Hu & Bentler(1999)标准;如有指标边缘,给出可能的修正建议。"
ChatSRS 使用 R lavaan 引擎(sem_path 指令,68 字内可触发),自动输出所有主流拟合指标,生成可直接复制进论文的报告段落,并标注每个指标的临界值判断结论。
无需手动查临界值表,无需逐个检查格式。
七、可直接抄进论文的 APA 7th 报告句式
测量模型(CFA)拟合报告——拟合良好版
验证性因子分析(CFA)结果显示,测量模型拟合指标均达到可接受标准:
chi-square(df) = XX.XX, p = .XXX; chi^2/df = X.XX; CFI = .XXX; TLI = .XXX;
RMSEA = .XXX(90% CI [.XXX, .XXX],p_close = .XXX); SRMR = .XXX。
各指标均满足 Hu 与 Bentler(1999)提出的良好拟合标准
(CFI >= .95,RMSEA <= .06,SRMR <= .08),表明测量模型对数据拟合良好。
填入数值的示例:
验证性因子分析(CFA)结果显示,测量模型拟合指标均达到可接受标准:chi-square(48) = 87.34,p < .001;chi^2/df = 1.82;CFI = .962;TLI = .951;RMSEA = .047(90% CI [.029, .063],p_close = .712);SRMR = .058。各指标均满足 Hu 与 Bentler(1999)提出的良好拟合标准(CFI >= .95,RMSEA <= .06,SRMR <= .08),表明测量模型对数据拟合良好。
结构模型(SEM)拟合报告——拟合可接受版
结构方程模型整体拟合结果如下:chi-square(df) = XX.XX, p = .XXX;
chi^2/df = X.XX; CFI = .XXX; TLI = .XXX;
RMSEA = .XXX(90% CI [.XXX, .XXX]); SRMR = .XXX。
CFI 与 TLI 高于 .90 的可接受临界值(Bentler & Bonett,1980),
RMSEA 与 SRMR 均低于 .08(Browne & Cudeck,1992),
整体拟合达到可接受水平。
填入数值的示例:
结构方程模型整体拟合结果如下:chi-square(124) = 378.56,p < .001;chi^2/df = 3.05;CFI = .921;TLI = .908;RMSEA = .074(90% CI [.063, .085]);SRMR = .076。CFI 与 TLI 高于 .90 的可接受临界值(Bentler & Bonett,1980),RMSEA 与 SRMR 均低于 .08(Browne & Cudeck,1992),整体拟合达到可接受水平。
小样本拟合说明段落(方法章节补充)
由于样本量(N = XXX)相对有限,本研究在解读拟合指标时参照
Kline(2023)建议,将各临界值作为经验性参考范围而非绝对分界。
RMSEA 在小样本条件下存在正向偏估,本研究同时报告 90% 置信区间
以反映估计不确定性;CFI 估计值在 N < 200 时变异较大,
结合 SRMR 共同评估拟合质量。
方法章节 SEM 分析说明(标准版)
本研究采用结构方程模型(SEM)检验假设路径,使用 R 软件 lavaan 包
(Rosseel,2012)进行参数估计,采用最大似然法(ML)。
模型拟合评估参照 Hu 与 Bentler(1999)的双重标准策略,
同时报告 chi-square 检验(含 p 值)、chi^2/df 比值、CFI、TLI、
RMSEA(含 90% 置信区间)及 SRMR。
以 CFI >= .95、RMSEA <= .06、SRMR <= .08 为良好拟合标准,
以 CFI >= .90、RMSEA <= .08 为可接受拟合标准。
统计分析使用 ChatSRS(R lavaan 引擎),显著性水平设为 alpha = .05。
八、常见拟合指标问题对照表
| 常见错误 | 正确处理 | 说明 |
|---|---|---|
| 只报告 chi-square p 值 | 同时报告 CFI / RMSEA / SRMR | 单一指标不足以评估 SEM 拟合 |
| RMSEA 无 90% CI | RMSEA = .054(90% CI [.038, .071]) | APA 和主流期刊要求报告区间 |
| 大样本 chi^2 显著就说"拟合差" | 解释样本量影响,配合其他指标 | chi-square 对大样本过度敏感 |
| 用 .90 标准但说"良好" | .90 对应"可接受",.95 对应"良好" | 用词须与引用的临界值标准一致 |
| CFI = 1.00 直接报告 | 检查是否过度识别或数据问题 | CFI 超过 1 通常提示规格问题 |
| 修正后不说明修正过程 | 报告 MI 值、理论依据和修正步骤 | 后验修正须透明,否则被质疑 |
| 小样本套用大样本临界值 | 报告 CI,说明小样本限制 | 临界值模拟条件不适用小样本 |
常见 FAQ
Q:CFI = .94 到底算过还是没过?
A:取决于期刊和研究领域。Hu & Bentler(1999)的严格标准是 .95,但该标准基于简单三因子模型的模拟,在复杂模型或小样本中可能过于苛刻。社会科学主流期刊中,CFI = .93 ~ .94 配合 RMSEA <= .06 和 SRMR <= .08 通常被接受,但需在论文中主动说明"达到可接受拟合水平"而非"拟合良好",并引用 Bentler & Bonett(1980)的 .90 标准作为依据。如果审稿人特别追问,可以补充报告 chi^2/df < 3 和 SRMR <= .08 来强化论证。
Q:RMSEA 显著性检验(p_close)是什么,要报告吗?
A:p_close 检验的零假设是"总体 RMSEA <= .05"(即"模型紧密拟合")。p_close > .05 表示无法拒绝"模型与总体紧密拟合"的假设,是好事;p_close < .05 表示拒绝紧密拟合假设,但不等于模型无法接受(Browne & Cudeck,1992 的"合理拟合"标准 RMSEA <= .08 仍适用)。建议报告:在点估计 RMSEA 接近 .05 临界值时(如 .04 ~ .07),报告 p_close 有助于澄清拟合状态;其他情况下报告是加分项但非必须。
Q:修正指数(MI)达到多少才应该修正?
A:通常 MI > 10 视为值得关注(对应 chi-square 减少量约 10 点)。但 MI 是统计建议,不是理论依据。每次修正前必须确认两点:(1) 修正的参数在理论上有意义(如两个测量指标确实可能共享误差来源);(2) 每次只修正一个参数,重新估计后再评估。纯粹为了让 CFI 超过 .95 而不加选择地添加误差协方差,属于数据拟合而非理论驱动的 SEM,会被审稿人质疑。Kline(2023)明确指出,修正指数不应自动触发修正,必须有理论解释。
Q:多组 SEM(测量不变性检验)中,拟合指标怎么报告?
A:测量不变性检验通过比较嵌套模型的拟合差异来判断,主要看:(1) delta CFI < .01(Cheung & Rensvold,2002 提出的差异量标准,比 chi-square 差异检验对样本量更稳健);(2) delta RMSEA < .015(Chen,2007)。报告格式为:先报告配置模型(Configural)的基础拟合,再逐步报告因子载荷约束(Metric)、截距约束(Scalar)模型,列出每步的 delta CFI 和 delta chi-square。ChatSRS 的多组 SEM 输出(sem_path 指令)默认包含不变性检验的逐步拟合比较表。
相关阅读
- SEM 拟合指标的 APA 报告怎么写?CFI/TLI/RMSEA/SRMR 标准与模板全解
- 结构方程模型 SEM 用 AI 一句话完成 — 路径系数 APA 报告全攻略
- SEM 间接效应 APA 报告 — Bootstrap 中介分析模板
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。