统计百科 ·

结构方程模型和回归分析有什么区别?潜变量、数据要求与选择指南

结构方程模型 SEM 与回归分析中文比较:从研究问题、观测变量与潜变量、测量误差、样本和识别、输出与模型拟合出发,判断什么时候用回归、什么时候用 SEM。

结构方程模型(SEM)和回归分析都能表达变量之间的关系,但它们解决的核心问题不同。普通回归通常直接对观测变量建模;SEM 可以把“指标如何测量潜变量”和“潜变量之间如何关联”放在同一模型里。

选择模型不看哪个名字更复杂,而看研究问题是否真的需要潜变量、测量误差和多条同时估计的关系。若普通回归已经足够回答问题,增加 SEM 只会增加假设、识别和样本负担。


一张表看懂 SEM 和回归的区别

维度普通回归结构方程模型(SEM)
典型研究问题一个观测结局与若干预测变量的条件关系潜变量如何被测量,以及多个变量间的结构关系
变量形式通常直接使用观测变量、量表总分或已构建指标可同时包含观测变量与潜变量
测量误差常把进入模型的变量视为已观测输入可在测量模型中显式表示指标误差
方程数量一个或若干分别设定的方程多个测量与结构方程可联合估计
识别要求需要设计矩阵、样本和估计条件成立还需潜变量尺度、指标和全模型参数可识别
常见输出B/β、SE、区间、p、F、R²、残差诊断载荷、因子相关、模型拟合、路径、直接/间接效应、不当解
主要风险遗漏变量、函数形式、共线性、误差结构上述风险之外,还包括测量失配、不识别、过度修模
复现重点数据、公式、标准误、诊断数据、测量与结构合同、估计方法、识别、完整输出

SEM 不会因为同时估计更多关系,就自动得到更接近因果的结论。两种模型的因果解释都依赖研究设计与识别假设。

研究问题:先看是否需要潜变量

适合从回归开始的问题

  • 因变量和主要自变量都是直接观测且定义清楚;
  • 目标是估计一个结局与若干预测变量的条件关联;
  • 量表总分的使用已有充分测量依据,研究不需要重新估计测量模型;
  • 重点是解释系数、预测或控制变量后的关系;
  • 一条清楚的模型公式就能表达主要假设。

例如,以实际考试成绩为因变量,用学习时长、出勤和年级预测成绩,普通多元回归通常是合理起点。

适合考虑 SEM 的问题

  • 核心构念不能直接观测,需要多个指标共同测量;
  • 测量误差本身是研究合同的一部分;
  • 需要先验证测量模型,再检验潜变量之间的路径;
  • 同时研究多个内生变量、直接效应与间接效应;
  • 需要比较竞争测量或结构模型,并能给出理论依据。

例如,“学习投入”由行为、情感和认知指标测量,研究还要检验学习动机经投入与成绩关联,此时 SEM 可能比把所有题目简单求和后做回归更贴近问题。

不应仅因以下理由改用 SEM

  • 希望模型看起来更高级;
  • 普通回归没有显著结果;
  • 想把横断面相关写成因果路径;
  • 认为拟合指数达到阈值就能证明理论;
  • 数据里有很多变量,但没有明确测量与结构假设。

模型应由问题决定,而不是由期望结果倒推。

数据、样本与识别要求

回归的数据合同

普通回归要说明样本、变量编码、函数形式、缺失、异常、误差结构、共线性和标准误。时间序列、面板、重复测量或聚类数据还需对应模型,不能视为普通独立观测。

SEM 的额外合同

除上述内容外,SEM 还需说明:

  • 每个潜变量由哪些指标测量;
  • 指标是连续、有序还是二分类;
  • 如何设定潜变量尺度;
  • 测量和结构路径哪些自由、哪些固定;
  • 估计方法为何适合数据;
  • 模型是否识别、是否收敛、有无不当解;
  • 事后修改如何记录和验证。

样本量没有通用答案

普通回归和 SEM 都没有“达到某个固定 N 就安全”的规则。样本需求与参数数量、效应或载荷、变量分布、缺失、聚类、估计方法和目标精度有关。

SEM 通常包含更多参数,因此在相同信号强度下可能需要更多信息,但这不是简单的“每个指标多少人”。设计阶段应依据方法文献、功效或模拟,报告中说明精度与限制。

什么是识别

识别指参数能否由观测信息唯一确定。普通回归也可能因完全共线等问题无法估计;SEM 还可能因指标不足、尺度未定、自由参数过多或反馈结构而不识别。

软件返回数字不代表识别合同正确。应检查警告、收敛、负方差、极端相关和异常标准误。

输出怎么读

回归输出

建议按以下顺序:

  1. 有效样本与变量编码;
  2. 线性、残差、共线性和影响点;
  3. 整体模型 F、R² 与 adjusted R²;
  4. 系数、SE、区间和精确 p 值;
  5. 与研究设计一致的结论边界。

详细路径见线性回归模型怎么看

SEM 输出

建议分层阅读:

  1. 识别与估计:模型是否收敛、有无不当解;
  2. 模型拟合:卡方、CFI/TLI、RMSEA 及区间、SRMR 等组合证据;
  3. 测量模型:载荷、因子相关、误差与构念覆盖;
  4. 结构路径:非标准化/标准化系数、SE、区间和 p 值;
  5. 直接与间接效应:定义、估计与重抽样设置;
  6. 确认与探索:所有事后修改和验证计划。

SEM 的模型拟合较好,不代表每条路径都显著;单条路径显著,也不能弥补测量模型或研究设计问题。完整诊断见结构方程模型怎么做


什么时候选回归,什么时候选 SEM

选择回归

当问题可由观测变量的一条清楚方程表达、测量模型不是研究重点、样本与设计支持相应回归时,优先用更简洁的模型。简洁能减少参数与假设,也更容易复现和解释。

选择 SEM

当潜变量与测量误差是核心、测量模型有理论依据、多个结构关系需要联合估计,并且数据、样本和识别足以支持时,考虑 SEM。

两者结合

有时可把回归作为描述或敏感性对照,把 SEM 作为预先设定的潜变量模型;也可以先建立测量模型,再按研究目标估计结构部分。主次关系要在查看结果前说明,不能事后选择更显著的模型。

一分钟决策清单

按顺序回答:

  1. 核心变量能直接观测吗?
  2. 测量误差需要在模型中显式表达吗?
  3. 是否已有明确、可识别的测量结构?
  4. 是否必须联合估计多个结构关系?
  5. 数据和样本能支持额外参数吗?
  6. 使用 SEM 会回答新问题,还是只让模型更复杂?

若前四题多数为“否”,通常先用回归;若潜变量与测量模型确实是核心,再进入 SEM 设计。


两个常见案例

案例一:回归更合适

研究者用实际销售额作为因变量,广告投入、门店数和价格作为预测变量。变量直接观测,目标是估计条件关联。普通回归通常更清楚,除非数据有时间、面板或其他结构需要专门处理。

案例二:SEM 更合适

研究者用多个题项测量品牌信任和忠诚,并检验信任经忠诚与购买意愿的关系。潜变量测量是核心,且路径结构预先有理论,SEM 可同时表示测量与结构部分。

即使在第二个案例中,横断面数据也不自动支持强因果措辞;箭头方向仍需时间顺序、设计和替代解释的证据。

工具使用边界

ChatSRS 当前有常见回归与 SEM 路径分析能力证据。可进入 ChatSRS 按决策清单整理模型合同,但平台不能替研究者决定潜变量、识别因果、接受事后修模或保证模型适配。

若任务依赖特定软件的界面、估计家族、默认设置或复现文件,应核对当次实际支持,并保留原生分析链。模型名称相同,不代表不同实现可以不经复核互换。


常见问题

Q1:有中介效应就必须用 SEM 吗?

不一定。观测变量的中介模型可用回归框架估计;若中介和其他构念需要潜变量测量,或要联合估计测量误差,SEM 才提供额外价值。

Q2:把量表总分放进回归,会不会一定比 SEM 差?

不一定。若量表结构已有充分证据且研究问题简单,总分回归可能更透明。SEM 能显式建模测量部分,但也增加假设和参数,需看是否回答了必要问题。

Q3:SEM 拟合好,能证明理论正确吗?

不能。多个模型可能产生相似拟合,拟合只说明特定模型与样本数据的相容程度。理论、测量、竞争模型、研究设计和新数据验证都不可缺。

Q4:回归不显著,换 SEM 会更容易显著吗?

不应以此为选择理由。换模型会改变假设和估计对象;若只是为了追显著,属于结果驱动分析。应先诊断研究设计、测量、样本精度与模型设定,并如实报告。


相关阅读


本文用于统计模型选择,不把模型复杂度当作证据等级。最终分析应结合学科规范、研究设计和原始输出。