教程 ·

线性回归模型怎么看?从相关分析到系数、残差与共线性

线性回归模型中文教程:区分相关与回归,按变量编码、线性、残差、共线性、整体模型、系数和置信区间的顺序阅读结果,并给出论文报告框架。

线性回归不只是查看“哪个变量 p < .05”。一份可复核的结果至少要说明变量如何编码、关系是否近似线性、残差与方差结构是否合理、共线性是否影响精度,以及系数和置信区间支持多强的结论。

本文从相关分析与回归分析的区别开始,给出一条固定阅读路径。它适用于常见的横断面多元线性回归;时间序列、面板、重复测量或因果识别问题需要匹配的模型,不能直接套用。


回归分析和相关分析有什么区别

问题相关分析线性回归
主要目标描述两个变量共同变化的方向与强度估计因变量与一个或多个预测变量的条件关系
方向性Pearson 相关对 X、Y 对称明确指定因变量与预测变量
控制其他变量简单相关不控制;偏相关可控制指定变量多元回归在模型内同时调整其他变量
典型输出r、区间、p 值B/β、SE、区间、整体 F、R²
因果结论不能由相关本身推出也不能由普通观察性回归本身推出

相关矩阵适合做变量关系的初步描述,但不能替代回归诊断;回归系数也不等于相关系数。多元回归中的系数是在其他入模变量保持不变时的条件关联,解释依赖模型设定。

线性回归模型怎么看:六步阅读路径

  1. 先核对变量编码:确认因变量、自变量、分类变量参照组、反向题、缺失码和分析样本。编码或样本口径错了,后续数字没有解释价值。
  2. 再检查线性:结合研究机制、散点图和部分残差图判断连续预测变量与结局的函数形式。明显非线性时,应使用有依据的变换、样条或其他模型,而不是只看一个相关系数。
  3. 查看残差:检查残差与拟合值图、异常点、影响点和可能的相关结构。同方差、独立性等问题要与数据收集方式一起判断;正态性主要关系小样本下的推断,不是要求原始变量都正态。
  4. 评估共线性:结合 VIF、容忍度、条件指标和变量含义判断。共线性通常扩大标准误并使单个系数不稳定,但不能仅凭固定阈值机械删除理论变量。
  5. 阅读系数和区间:先看整体模型,再看 B 或 β 的方向、量级、SE、精确 p 值和 95% CI。宽区间表示估计不精确;标准化系数便于同一模型内比较,但不自动代表实际重要性。
  6. 最后如实报告:同时呈现样本、模型设定、整体 F、R²/adjusted R²、系数、区间和限制。显著与不显著结果都保留,不以反复换模型追逐 p 值。

这条路径的重点是先判断模型是否回答了研究问题,再解释统计结果,而不是从表格里挑最显著的一行。


第一步:把研究问题写成模型

以学业成绩为因变量,学习时长、睡眠和焦虑为预测变量,性别与年级为控制变量,可写成:

GPA = b0 + b1×学习时长 + b2×睡眠 + b3×焦虑 + b4×性别 + 年级虚拟变量 + 误差

模型公式只是统计关系。若数据来自横断面问卷,通常应使用“相关”“预测”或“在控制……后与……相关”,不能因为系数显著就写成“导致”。

数据字典至少包含

  • 每个变量的定义、单位和允许范围;
  • 分类变量的编码与参照组;
  • 缺失值、异常值和排除规则;
  • 分析样本与原始样本的差异;
  • 控制变量、交互项和非线性项的理论理由。

第二步:先做描述与图形检查

连续变量报告均值、标准差,并在偏态明显时补充分位数或中位数;分类变量报告频数与百分比。散点图有助于发现非线性、离群点和取值范围受限。

Pearson 相关适合近似线性关系且变量尺度合理的情形。Spearman 相关基于秩,更适合单调但非线性的关系、明显异常值影响或有序数据。选择方法应依据数据结构,不是依据哪一种 p 值更小。

第三步:读整体模型

整体 F 检验比较当前模型与仅含截距的模型,回答这一组预测变量是否共同提供解释信息。R² 表示样本中由模型解释的方差比例,adjusted R² 对预测变量数量作调整。

需要注意:

  • 高 R² 不等于因果识别正确,也不保证样本外预测好;
  • 低 R² 不自动否定一个系数在理论或实际上的意义;
  • 加入变量通常不会降低普通 R²,因此应结合 adjusted R²、验证结果与研究目的;
  • 整体 F 显著不代表每个预测变量都显著,反之亦然。

第四步:读单个系数

指标解释
B其他入模变量不变时,X 增加一个原始单位对应 Y 的平均变化
β标准化后的条件系数,适合辅助比较同一模型内不同量纲变量
SE系数估计的不确定性
95% CI数据与模型下合理效应范围的表达
p在零假设与模型假设成立时,观察到当前或更极端统计量的概率

不要把 p 值解释成“结论为真的概率”,也不要只报告星号。点估计与区间通常比“显著/不显著”二分更有信息。

结果报告示例

多元线性回归模型整体达到统计显著,F(5, 294) =〔填写〕,p =〔填写〕,R² =〔填写〕,adjusted R² =〔填写〕。在控制性别与年级后,学习时长与 GPA 呈正向关联,B =〔填写〕,SE =〔填写〕,95% CI〔填写〕,p =〔填写〕。该结果描述条件关联,不被解释为因果效应。

第五步:诊断不是“全部通过”打勾

模型诊断要回答具体风险:

  • 残差图是否显示非线性或异方差;
  • 是否存在对系数影响很大的观测;
  • 数据是否有班级、学校、个体重复测量等相关结构;
  • 共线性是否使关键系数不稳定;
  • 模型是否遗漏了有理论依据的非线性或交互;
  • 稳健标准误、重抽样或替代模型是否与问题匹配。

单个检验 p > .05 不能证明假设“已经成立”,也不存在适用于所有数据的“诊断全部通过”按钮。诊断结果应和图形、设计与敏感性分析共同报告。


可复用的回归分析请求

把研究问题、数据字典和需要的输出写清楚,例如:

以 GPA 为因变量,学习时长、睡眠和焦虑为预测变量,控制性别和年级。请先核对变量编码与缺失,再给出描述统计、相关矩阵、多元线性回归系数与 95% CI、整体 F、R²/adjusted R²,并检查线性、残差、影响点和共线性。任何模型调整都先说明依据,不自动删除观测或变量。

进入 ChatSRS 按六步路径整理线性回归。生成结果后仍要对照数据字典和原始输出复核,研究者负责模型设定、异常处理与最终表述。


常见问题

Q1:线性回归要求所有变量都正态吗?

不要求。常规推断关注的是误差结构等模型条件,而不是每个原始变量都服从正态。样本量、异常点和估计方法也会影响判断。

Q2:VIF 超过某个数就必须删变量吗?

不是。阈值只是提示,应结合变量含义、相关结构、系数稳定性和研究目标。若变量是预先确定的重要混杂因素,机械删除可能引入更大偏倚。

Q3:回归不显著还能继续分析吗?

可以做有依据的模型检查和预设稳健性分析,但不能为了显著反复更换样本、结局或控制变量。应报告点估计、区间和精度限制。

Q4:相关显著但回归不显著,哪个结论对?

两者回答的问题不同。简单相关不控制其他变量,多元回归系数是在给定模型中的条件关系。应检查共线性、变量编码、样本和模型设定,而不是挑更显著的结果。


相关阅读


本文提供常见横断面线性回归的阅读框架;面板、时间序列、重复测量与因果推断需要另行选择模型。