教程 ·
线性回归模型怎么看?从相关分析到系数、残差与共线性
线性回归模型中文教程:区分相关与回归,按变量编码、线性、残差、共线性、整体模型、系数和置信区间的顺序阅读结果,并给出论文报告框架。
线性回归不只是查看“哪个变量 p < .05”。一份可复核的结果至少要说明变量如何编码、关系是否近似线性、残差与方差结构是否合理、共线性是否影响精度,以及系数和置信区间支持多强的结论。
本文从相关分析与回归分析的区别开始,给出一条固定阅读路径。它适用于常见的横断面多元线性回归;时间序列、面板、重复测量或因果识别问题需要匹配的模型,不能直接套用。
回归分析和相关分析有什么区别
| 问题 | 相关分析 | 线性回归 |
|---|---|---|
| 主要目标 | 描述两个变量共同变化的方向与强度 | 估计因变量与一个或多个预测变量的条件关系 |
| 方向性 | Pearson 相关对 X、Y 对称 | 明确指定因变量与预测变量 |
| 控制其他变量 | 简单相关不控制;偏相关可控制指定变量 | 多元回归在模型内同时调整其他变量 |
| 典型输出 | r、区间、p 值 | B/β、SE、区间、整体 F、R² |
| 因果结论 | 不能由相关本身推出 | 也不能由普通观察性回归本身推出 |
相关矩阵适合做变量关系的初步描述,但不能替代回归诊断;回归系数也不等于相关系数。多元回归中的系数是在其他入模变量保持不变时的条件关联,解释依赖模型设定。
线性回归模型怎么看:六步阅读路径
- 先核对变量编码:确认因变量、自变量、分类变量参照组、反向题、缺失码和分析样本。编码或样本口径错了,后续数字没有解释价值。
- 再检查线性:结合研究机制、散点图和部分残差图判断连续预测变量与结局的函数形式。明显非线性时,应使用有依据的变换、样条或其他模型,而不是只看一个相关系数。
- 查看残差:检查残差与拟合值图、异常点、影响点和可能的相关结构。同方差、独立性等问题要与数据收集方式一起判断;正态性主要关系小样本下的推断,不是要求原始变量都正态。
- 评估共线性:结合 VIF、容忍度、条件指标和变量含义判断。共线性通常扩大标准误并使单个系数不稳定,但不能仅凭固定阈值机械删除理论变量。
- 阅读系数和区间:先看整体模型,再看 B 或 β 的方向、量级、SE、精确 p 值和 95% CI。宽区间表示估计不精确;标准化系数便于同一模型内比较,但不自动代表实际重要性。
- 最后如实报告:同时呈现样本、模型设定、整体 F、R²/adjusted R²、系数、区间和限制。显著与不显著结果都保留,不以反复换模型追逐 p 值。
这条路径的重点是先判断模型是否回答了研究问题,再解释统计结果,而不是从表格里挑最显著的一行。
第一步:把研究问题写成模型
以学业成绩为因变量,学习时长、睡眠和焦虑为预测变量,性别与年级为控制变量,可写成:
GPA = b0 + b1×学习时长 + b2×睡眠 + b3×焦虑 + b4×性别 + 年级虚拟变量 + 误差
模型公式只是统计关系。若数据来自横断面问卷,通常应使用“相关”“预测”或“在控制……后与……相关”,不能因为系数显著就写成“导致”。
数据字典至少包含
- 每个变量的定义、单位和允许范围;
- 分类变量的编码与参照组;
- 缺失值、异常值和排除规则;
- 分析样本与原始样本的差异;
- 控制变量、交互项和非线性项的理论理由。
第二步:先做描述与图形检查
连续变量报告均值、标准差,并在偏态明显时补充分位数或中位数;分类变量报告频数与百分比。散点图有助于发现非线性、离群点和取值范围受限。
Pearson 相关适合近似线性关系且变量尺度合理的情形。Spearman 相关基于秩,更适合单调但非线性的关系、明显异常值影响或有序数据。选择方法应依据数据结构,不是依据哪一种 p 值更小。
第三步:读整体模型
整体 F 检验比较当前模型与仅含截距的模型,回答这一组预测变量是否共同提供解释信息。R² 表示样本中由模型解释的方差比例,adjusted R² 对预测变量数量作调整。
需要注意:
- 高 R² 不等于因果识别正确,也不保证样本外预测好;
- 低 R² 不自动否定一个系数在理论或实际上的意义;
- 加入变量通常不会降低普通 R²,因此应结合 adjusted R²、验证结果与研究目的;
- 整体 F 显著不代表每个预测变量都显著,反之亦然。
第四步:读单个系数
| 指标 | 解释 |
|---|---|
| B | 其他入模变量不变时,X 增加一个原始单位对应 Y 的平均变化 |
| β | 标准化后的条件系数,适合辅助比较同一模型内不同量纲变量 |
| SE | 系数估计的不确定性 |
| 95% CI | 数据与模型下合理效应范围的表达 |
| p | 在零假设与模型假设成立时,观察到当前或更极端统计量的概率 |
不要把 p 值解释成“结论为真的概率”,也不要只报告星号。点估计与区间通常比“显著/不显著”二分更有信息。
结果报告示例
多元线性回归模型整体达到统计显著,F(5, 294) =〔填写〕,p =〔填写〕,R² =〔填写〕,adjusted R² =〔填写〕。在控制性别与年级后,学习时长与 GPA 呈正向关联,B =〔填写〕,SE =〔填写〕,95% CI〔填写〕,p =〔填写〕。该结果描述条件关联,不被解释为因果效应。
第五步:诊断不是“全部通过”打勾
模型诊断要回答具体风险:
- 残差图是否显示非线性或异方差;
- 是否存在对系数影响很大的观测;
- 数据是否有班级、学校、个体重复测量等相关结构;
- 共线性是否使关键系数不稳定;
- 模型是否遗漏了有理论依据的非线性或交互;
- 稳健标准误、重抽样或替代模型是否与问题匹配。
单个检验 p > .05 不能证明假设“已经成立”,也不存在适用于所有数据的“诊断全部通过”按钮。诊断结果应和图形、设计与敏感性分析共同报告。
可复用的回归分析请求
把研究问题、数据字典和需要的输出写清楚,例如:
以 GPA 为因变量,学习时长、睡眠和焦虑为预测变量,控制性别和年级。请先核对变量编码与缺失,再给出描述统计、相关矩阵、多元线性回归系数与 95% CI、整体 F、R²/adjusted R²,并检查线性、残差、影响点和共线性。任何模型调整都先说明依据,不自动删除观测或变量。
可进入 ChatSRS 按六步路径整理线性回归。生成结果后仍要对照数据字典和原始输出复核,研究者负责模型设定、异常处理与最终表述。
常见问题
Q1:线性回归要求所有变量都正态吗?
不要求。常规推断关注的是误差结构等模型条件,而不是每个原始变量都服从正态。样本量、异常点和估计方法也会影响判断。
Q2:VIF 超过某个数就必须删变量吗?
不是。阈值只是提示,应结合变量含义、相关结构、系数稳定性和研究目标。若变量是预先确定的重要混杂因素,机械删除可能引入更大偏倚。
Q3:回归不显著还能继续分析吗?
可以做有依据的模型检查和预设稳健性分析,但不能为了显著反复更换样本、结局或控制变量。应报告点估计、区间和精度限制。
Q4:相关显著但回归不显著,哪个结论对?
两者回答的问题不同。简单相关不控制其他变量,多元回归系数是在给定模型中的条件关系。应检查共线性、变量编码、样本和模型设定,而不是挑更显著的结果。
相关阅读
本文提供常见横断面线性回归的阅读框架;面板、时间序列、重复测量与因果推断需要另行选择模型。