统计百科 ·
结构方程模型和回归分析有什么区别?潜变量、数据要求与选择指南
结构方程模型 SEM 与回归分析中文比较:从研究问题、观测变量与潜变量、测量误差、样本和识别、输出与模型拟合出发,判断什么时候用回归、什么时候用 SEM。
结构方程模型(SEM)和回归分析都能表达变量之间的关系,但它们解决的核心问题不同。普通回归通常直接对观测变量建模;SEM 可以把“指标如何测量潜变量”和“潜变量之间如何关联”放在同一模型里。
选择模型不看哪个名字更复杂,而看研究问题是否真的需要潜变量、测量误差和多条同时估计的关系。若普通回归已经足够回答问题,增加 SEM 只会增加假设、识别和样本负担。
一张表看懂 SEM 和回归的区别
| 维度 | 普通回归 | 结构方程模型(SEM) |
|---|---|---|
| 典型研究问题 | 一个观测结局与若干预测变量的条件关系 | 潜变量如何被测量,以及多个变量间的结构关系 |
| 变量形式 | 通常直接使用观测变量、量表总分或已构建指标 | 可同时包含观测变量与潜变量 |
| 测量误差 | 常把进入模型的变量视为已观测输入 | 可在测量模型中显式表示指标误差 |
| 方程数量 | 一个或若干分别设定的方程 | 多个测量与结构方程可联合估计 |
| 识别要求 | 需要设计矩阵、样本和估计条件成立 | 还需潜变量尺度、指标和全模型参数可识别 |
| 常见输出 | B/β、SE、区间、p、F、R²、残差诊断 | 载荷、因子相关、模型拟合、路径、直接/间接效应、不当解 |
| 主要风险 | 遗漏变量、函数形式、共线性、误差结构 | 上述风险之外,还包括测量失配、不识别、过度修模 |
| 复现重点 | 数据、公式、标准误、诊断 | 数据、测量与结构合同、估计方法、识别、完整输出 |
SEM 不会因为同时估计更多关系,就自动得到更接近因果的结论。两种模型的因果解释都依赖研究设计与识别假设。
研究问题:先看是否需要潜变量
适合从回归开始的问题
- 因变量和主要自变量都是直接观测且定义清楚;
- 目标是估计一个结局与若干预测变量的条件关联;
- 量表总分的使用已有充分测量依据,研究不需要重新估计测量模型;
- 重点是解释系数、预测或控制变量后的关系;
- 一条清楚的模型公式就能表达主要假设。
例如,以实际考试成绩为因变量,用学习时长、出勤和年级预测成绩,普通多元回归通常是合理起点。
适合考虑 SEM 的问题
- 核心构念不能直接观测,需要多个指标共同测量;
- 测量误差本身是研究合同的一部分;
- 需要先验证测量模型,再检验潜变量之间的路径;
- 同时研究多个内生变量、直接效应与间接效应;
- 需要比较竞争测量或结构模型,并能给出理论依据。
例如,“学习投入”由行为、情感和认知指标测量,研究还要检验学习动机经投入与成绩关联,此时 SEM 可能比把所有题目简单求和后做回归更贴近问题。
不应仅因以下理由改用 SEM
- 希望模型看起来更高级;
- 普通回归没有显著结果;
- 想把横断面相关写成因果路径;
- 认为拟合指数达到阈值就能证明理论;
- 数据里有很多变量,但没有明确测量与结构假设。
模型应由问题决定,而不是由期望结果倒推。
数据、样本与识别要求
回归的数据合同
普通回归要说明样本、变量编码、函数形式、缺失、异常、误差结构、共线性和标准误。时间序列、面板、重复测量或聚类数据还需对应模型,不能视为普通独立观测。
SEM 的额外合同
除上述内容外,SEM 还需说明:
- 每个潜变量由哪些指标测量;
- 指标是连续、有序还是二分类;
- 如何设定潜变量尺度;
- 测量和结构路径哪些自由、哪些固定;
- 估计方法为何适合数据;
- 模型是否识别、是否收敛、有无不当解;
- 事后修改如何记录和验证。
样本量没有通用答案
普通回归和 SEM 都没有“达到某个固定 N 就安全”的规则。样本需求与参数数量、效应或载荷、变量分布、缺失、聚类、估计方法和目标精度有关。
SEM 通常包含更多参数,因此在相同信号强度下可能需要更多信息,但这不是简单的“每个指标多少人”。设计阶段应依据方法文献、功效或模拟,报告中说明精度与限制。
什么是识别
识别指参数能否由观测信息唯一确定。普通回归也可能因完全共线等问题无法估计;SEM 还可能因指标不足、尺度未定、自由参数过多或反馈结构而不识别。
软件返回数字不代表识别合同正确。应检查警告、收敛、负方差、极端相关和异常标准误。
输出怎么读
回归输出
建议按以下顺序:
- 有效样本与变量编码;
- 线性、残差、共线性和影响点;
- 整体模型 F、R² 与 adjusted R²;
- 系数、SE、区间和精确 p 值;
- 与研究设计一致的结论边界。
详细路径见线性回归模型怎么看。
SEM 输出
建议分层阅读:
- 识别与估计:模型是否收敛、有无不当解;
- 模型拟合:卡方、CFI/TLI、RMSEA 及区间、SRMR 等组合证据;
- 测量模型:载荷、因子相关、误差与构念覆盖;
- 结构路径:非标准化/标准化系数、SE、区间和 p 值;
- 直接与间接效应:定义、估计与重抽样设置;
- 确认与探索:所有事后修改和验证计划。
SEM 的模型拟合较好,不代表每条路径都显著;单条路径显著,也不能弥补测量模型或研究设计问题。完整诊断见结构方程模型怎么做。
什么时候选回归,什么时候选 SEM
选择回归
当问题可由观测变量的一条清楚方程表达、测量模型不是研究重点、样本与设计支持相应回归时,优先用更简洁的模型。简洁能减少参数与假设,也更容易复现和解释。
选择 SEM
当潜变量与测量误差是核心、测量模型有理论依据、多个结构关系需要联合估计,并且数据、样本和识别足以支持时,考虑 SEM。
两者结合
有时可把回归作为描述或敏感性对照,把 SEM 作为预先设定的潜变量模型;也可以先建立测量模型,再按研究目标估计结构部分。主次关系要在查看结果前说明,不能事后选择更显著的模型。
一分钟决策清单
按顺序回答:
- 核心变量能直接观测吗?
- 测量误差需要在模型中显式表达吗?
- 是否已有明确、可识别的测量结构?
- 是否必须联合估计多个结构关系?
- 数据和样本能支持额外参数吗?
- 使用 SEM 会回答新问题,还是只让模型更复杂?
若前四题多数为“否”,通常先用回归;若潜变量与测量模型确实是核心,再进入 SEM 设计。
两个常见案例
案例一:回归更合适
研究者用实际销售额作为因变量,广告投入、门店数和价格作为预测变量。变量直接观测,目标是估计条件关联。普通回归通常更清楚,除非数据有时间、面板或其他结构需要专门处理。
案例二:SEM 更合适
研究者用多个题项测量品牌信任和忠诚,并检验信任经忠诚与购买意愿的关系。潜变量测量是核心,且路径结构预先有理论,SEM 可同时表示测量与结构部分。
即使在第二个案例中,横断面数据也不自动支持强因果措辞;箭头方向仍需时间顺序、设计和替代解释的证据。
工具使用边界
ChatSRS 当前有常见回归与 SEM 路径分析能力证据。可进入 ChatSRS 按决策清单整理模型合同,但平台不能替研究者决定潜变量、识别因果、接受事后修模或保证模型适配。
若任务依赖特定软件的界面、估计家族、默认设置或复现文件,应核对当次实际支持,并保留原生分析链。模型名称相同,不代表不同实现可以不经复核互换。
常见问题
Q1:有中介效应就必须用 SEM 吗?
不一定。观测变量的中介模型可用回归框架估计;若中介和其他构念需要潜变量测量,或要联合估计测量误差,SEM 才提供额外价值。
Q2:把量表总分放进回归,会不会一定比 SEM 差?
不一定。若量表结构已有充分证据且研究问题简单,总分回归可能更透明。SEM 能显式建模测量部分,但也增加假设和参数,需看是否回答了必要问题。
Q3:SEM 拟合好,能证明理论正确吗?
不能。多个模型可能产生相似拟合,拟合只说明特定模型与样本数据的相容程度。理论、测量、竞争模型、研究设计和新数据验证都不可缺。
Q4:回归不显著,换 SEM 会更容易显著吗?
不应以此为选择理由。换模型会改变假设和估计对象;若只是为了追显著,属于结果驱动分析。应先诊断研究设计、测量、样本精度与模型设定,并如实报告。
相关阅读
本文用于统计模型选择,不把模型复杂度当作证据等级。最终分析应结合学科规范、研究设计和原始输出。