教程 ·

有序 Logistic 回归用 AI 一句话完成 — 李克特/等级因变量、比例优势检验、OR 全攻略

有序 Logistic 回归完整教程:因变量是李克特量表或等级评分时如何用 AI 一句话完成建模,自动输出累积 logit、比例优势检验(平行线检验)、OR 值、APA 7th 报告句式。

问卷因变量是"非常不满意→非常满意"的五级量表?或者疼痛评级、严重程度分级?用线性回归会被审稿人打回,用二元 Logistic 又丢失了顺序信息。这篇教程专攻有序 Logistic 回归——从累积 logit 原理到比例优势检验,再到可直接贴进论文的 APA 报告句式,全套 60 秒用 AI 完成。


因变量是等级/顺序时,为什么普通回归不够用

社会学、心理学、医学研究中,大量因变量天生带有顺序但不能视为等距的连续量:

  • 李克特满意度(1 = 非常不满意,5 = 非常满意)
  • 疼痛强度评级(0 = 无痛,1 = 轻度,2 = 中度,3 = 重度)
  • 学业表现等级(不及格 / 及格 / 良好 / 优秀)
  • 肿瘤分期(I / II / III / IV 期)

面对这类数据,常见的两种错误做法是:

  1. 当连续变量做线性回归:假设等级间距相等("非常不满意"到"不满意"的距离 = "满意"到"非常满意"的距离),这一假设几乎总是不成立;残差非正态,预测值可能超出量表范围。
  2. 压缩为二分变量做二元 Logistic:把 5 级压成"满意 vs. 不满意",白白丢失了等级顺序的丰富信息,统计功效下降,也无法回答"从 3 级提升到 4 级的影响因素"这类问题。

有序 Logistic 回归(Ordinal Logistic Regression),又称比例优势模型(Proportional Odds Model),是专门处理这类因变量的统计方法。它保留了顺序信息,同时不要求等距假设。SPSS、R(MASS 包 polr())和 Stata(ologit)均原生支持,ChatSRS 三引擎全部集成。


有序 Logistic 回归的核心统计原理

累积 logit 与累积优势

有序 Logistic 回归对因变量 Y(取 K 个有序等级,k = 1, 2, …, K)的累积概率建模。设:

P(Y <= k | X) = 因变量取第 k 级及以下的概率(给定自变量 X)

对每个累积概率做 logit 变换,得到 K-1 个累积 logit 方程

Logit[P(Y <= k | X)] = alpha_k - (b1*X1 + b2*X2 + ... + bp*Xp)
    k = 1, 2, ..., K-1

其中:

  • alpha_k:第 k 个截距(阈值参数,threshold),反映在自变量全为 0 时,因变量取第 k 级及以下的背景优势
  • b1…bp:各自变量的回归系数(所有 K-1 个方程共享同一组系数,这就是"比例优势"假设的来源)
  • 方程前的负号是 SPSS / Stata 的惯例写法(保证系数为正时自变量增大使因变量取更高等级的概率增大)

注意:不同软件的参数化略有差异(R polr() 用正号写截距)。ChatSRS 统一输出时会标注软件来源并做对齐说明,避免符号混淆。

OR(优势比)的含义

将系数 b 做指数变换:

OR = exp(b)

解读:控制其他变量后,自变量每增加 1 个单位,因变量取"更高等级"(相对于"更低等级")的累积优势比为 OR 倍

  • OR > 1:自变量增大时,因变量更可能落在较高等级
  • OR < 1:自变量增大时,因变量更可能落在较低等级
  • OR = 1(或 95% CI 包含 1):无统计学关联

注意,这里的 OR 是累积优势比(cumulative odds ratio),与二元 Logistic 的 OR 含义相似但指向的是跨越某阈值("高于 k 等级 vs. k 及以下")的优势,不是HR(风险比),也不是RR(相对危险度),三者不能混用。

比例优势假设(平行线假设)

比例优势模型的核心约束是:所有 K-1 个累积 logit 方程的自变量系数相同——即每个自变量对每个累积截断点的效应大小一致,只是截距不同(各方程的"基准线"平行)。这被称为比例优势假设(Proportional Odds Assumption),或平行线检验(Test of Parallel Lines)

如果该假设成立:模型简洁,每个自变量只有一个 OR,报告和解读都方便。

如果该假设违反:自变量对不同等级截断点的效应大小不一致,此时应考虑:

  • 广义有序 Logistic 回归(Partial Proportional Odds Model):允许部分变量违反假设
  • 多分类(名义)Logistic 回归:完全放弃顺序约束,效应量解读更复杂

ChatSRS 会在输出时自动完成平行线检验并给出建议。


案例数据:护士工作满意度影响因素研究

研究背景

某三甲医院人力资源部门对 380 名在职护士开展问卷调查,研究影响工作满意度的因素。

因变量

工作满意度(5 级有序量表):

1 = 非常不满意
2 = 不满意
3 = 一般
4 = 满意
5 = 非常满意

自变量

years_exp     工龄(年,连续变量)
dept          科室类别(内科/外科/急诊/重症,参照组 = 内科)
night_shift   每月夜班次数(连续变量)
supervisor    上级支持感(0-10 分量表,连续变量)
burnout       职业倦怠(0-10 分量表,分数越高倦怠越重,连续变量)
edu_level     学历(大专 = 0,本科 = 1,硕士及以上 = 2)

研究问题:哪些因素是护士工作满意度的独立影响因素?各因素的 OR 是多少?比例优势假设是否成立?


用 AI 一句话完成有序 Logistic 回归

chatsrs.com 上传数据后输入:

"以工作满意度(5 级有序:1-非常不满意 至 5-非常满意)为因变量,以工龄、科室类别、每月夜班次数、上级支持感、职业倦怠、学历为自变量,做有序 Logistic 回归(比例优势模型)。 请输出:

  1. 各变量描述统计(连续变量 M±SD;因变量分布频率表)
  2. 有序 Logistic 回归三线表(B、SE、Wald、p、OR、95% CI)
  3. 平行线检验(比例优势假设检验)结果
  4. 模型整体拟合:-2LL、Cox & Snell R²、Nagelkerke R²
  5. APA 7th 格式中文文字描述(含比例优势检验报告句式)"

60 秒后,ChatSRS 完整输出以下各部分结果。


输出结果怎么读

输出 1:因变量分布与描述统计

表 1  护士工作满意度分布(N = 380)

满意度等级         频数       构成比
1 = 非常不满意     24         6.3%
2 = 不满意         68        17.9%
3 = 一般          112        29.5%
4 = 满意          132        34.7%
5 = 非常满意       44        11.6%

连续变量描述统计

变量              M        SD       最小值   最大值
工龄(年)        8.4      5.2       1        28
夜班次数(次/月) 6.8      2.9       0        14
上级支持感(0-10)6.2      1.8       1        10
职业倦怠(0-10)  5.7      1.9       1        10

输出 2:有序 Logistic 回归三线表

读表要点:

列名含义
B回归系数(正值 = 自变量增大时因变量倾向更高等级)
SE标准误
WaldWald 检验统计量,服从卡方分布
pWald 检验 p 值,< .05 表示统计显著
OR = exp(B)累积优势比,控制其他变量后的效应大小
95% CIOR 的 95% 置信区间,不含 1 则显著
表 2  护士工作满意度有序 Logistic 回归(N = 380)

变量                      B        SE      Wald     p           OR      95% CI
-- 阈值参数(截距)--
  满意度 <= 1            -3.482    0.421   68.43    <.001       —       —
  满意度 <= 2            -1.624    0.312   27.12    <.001       —       —
  满意度 <= 3             0.387    0.294    1.73    .188        —       —
  满意度 <= 4             2.841    0.368   59.63    <.001       —       —
-- 自变量系数 --
工龄(每岁)              0.068    0.021   10.48    .001 **     1.07    [1.03, 1.11]
科室(外科 vs 内科)     -0.312    0.248    1.58    .208        0.73    [0.45, 1.19]
科室(急诊 vs 内科)     -0.724    0.267    7.36    .007 **     0.48    [0.29, 0.82]
科室(重症 vs 内科)     -0.583    0.289    4.07    .044 *      0.56    [0.32, 0.98]
夜班次数(每次/月)      -0.124    0.038   10.65    .001 **     0.88    [0.82, 0.95]
上级支持感(每分)        0.342    0.063   29.47    <.001 ***   1.41    [1.25, 1.59]
职业倦怠(每分)         -0.287    0.058   24.47    <.001 ***   0.75    [0.67, 0.84]
学历(本科 vs 大专)      0.218    0.204    1.14    .286        1.24    [0.84, 1.85]
学历(硕士及以上 vs 大专)0.631    0.312    4.09    .043 *      1.88    [1.02, 3.46]

注:* p < .05,** p < .01,*** p < .001。参照类别:科室 = 内科,学历 = 大专。
   阈值参数为模型截距,不纳入效应量解释。

解读要点

  • 上级支持感(OR = 1.41):上级支持感每提升 1 分,护士工作满意度落在更高等级的累积优势增加 41%,是效应最大的保护性因素
  • 职业倦怠(OR = 0.75):倦怠感每增加 1 分,满意度更低等级的累积优势增加约 33%(=1/0.75),是最重要的风险因素
  • 急诊科室(OR = 0.48):相比内科,急诊护士满意度处于较高等级的累积优势降低约 52%
  • 夜班次数(OR = 0.88):每增加 1 次/月夜班,满意度下降优势扩大约 12%
  • 工龄越长的护士满意度倾向于更高等级(OR = 1.07),与职业适应性研究的文献结果一致
  • 外科与大专 vs 本科之间的差异未达统计显著

输出 3:平行线检验(比例优势假设)

这是有序 Logistic 回归中必须报告的前提检验,用于判断"所有 K-1 个累积 logit 方程共享同一组系数"的假设是否成立。

平行线检验(Test of Parallel Lines)

零假设(H0):比例优势假设成立(各截断点系数相同)
备择假设(H1):各截断点系数不同(需要广义有序 Logistic 回归)

一般模型  -2LL = 412.84
限制模型  -2LL = 427.62(比例优势模型)
  卡方差值  chi^2 = 14.78,df = 24,p = .930

结论:p > .05,无法拒绝零假设,比例优势假设成立,使用比例优势模型合适。

怎么看

场景判断处理方案
p > .05(如本例 p = .930)比例优势假设成立直接报告比例优势模型结果
p < .05比例优势假设违反考虑广义有序 Logistic 或名义 Logistic 回归

注意:平行线检验在大样本时功效过高,容易因微小偏离而显著。实践中建议结合散点图或分层 OR 估计进行辅助判断。告诉 ChatSRS "同时提供每个截断点的分层 OR 图"即可。

输出 4:模型拟合指标

表 3  模型整体拟合指标

指标                     值
初始 -2LL(仅截距)     588.43
最终 -2LL(含全部变量) 427.62
Chi^2 差值              160.81(df = 11,p < .001)
Cox & Snell R^2         0.346
Nagelkerke R^2          0.367

注:-2LL 下降显著,模型整体优于仅含截距的空模型。
   Nagelkerke R^2 = .367,表明模型解释了约 36.7% 的结局排序变异。

论文里怎么报告(APA 7th 格式)

有序 Logistic 回归的 APA 报告与二元 Logistic 类似,但有两个额外要求:报告平行线检验结果,以及明确说明阈值参数不解释效应大小。以下是可直接复制进论文的句式:


方法节(前提检验与模型选择)

采用有序 Logistic 回归(比例优势模型)分析护士工作满意度的影响因素。以工作满意度(5 级有序量表)为因变量,以工龄、科室类别、每月夜班次数、上级支持感、职业倦怠和学历为自变量。在建立比例优势模型前,进行平行线检验以验证比例优势假设;若假设不成立,将改用广义有序 Logistic 回归。统计分析使用 SPSS 26.0、R 4.4(MASS 包 polr 函数)及 Stata 18(ologit 命令)实施,检验水准 alpha = .05(双尾)。


方法节(平行线检验结果)

平行线检验结果显示,比例优势假设成立,chi^2(24) = 14.78, p = .930,因此采用比例优势模型进行后续分析。


结果节(模型整体与各变量效应)

有序 Logistic 回归分析结果显示,模型整体具有统计学意义,chi^2(11) = 160.81, p < .001,Nagelkerke R^2 = .367。平行线检验证实比例优势假设成立,chi^2(24) = 14.78, p = .930。

在控制其他协变量的条件下,上级支持感(OR = 1.41, 95% CI [1.25, 1.59], p < .001)是工作满意度的最显著正向预测因素;职业倦怠(OR = 0.75, 95% CI [0.67, 0.84], p < .001)和夜班次数(OR = 0.88, 95% CI [0.82, 0.95], p = .001)是负向预测因素。与内科相比,急诊科护士满意度处于较高等级的累积优势显著降低(OR = 0.48, 95% CI [0.29, 0.82], p = .007)。工龄(OR = 1.07, 95% CI [1.03, 1.11], p = .001)与满意度正向关联。科室(外科 vs. 内科)及本科学历(vs. 大专)的效应差异无统计学意义(ps > .05)。


APA 报告格式规范总结

要素格式示例
OR + 95% CIOR = 1.41, 95% CI [1.25, 1.59]
Wald p 值p < .001(小数点前不写 0)
模型卡方chi^2(11) = 160.81, p < .001
平行线检验chi^2(24) = 14.78, p = .930
伪 R^2Nagelkerke R^2 = .367
方程标注注明软件(SPSS/R polr/Stata ologit)及 MASS 包版本

APA 细节提醒:OR 的 95% CI 用方括号 [ ];p 值小数点前不加 0(写 p = .007,不写 p = 0.007);平行线检验必须在描述回归系数之前报告。


效应量参考标准

有序 Logistic 回归中,OR 的效应量参考 Chen et al.(2010)框架:

OR 值范围效应大小
1.22 -- 1.86小效应
2.34 -- 3.47中效应
>= 6.71大效应

注意:这些阈值适用于 OR > 1 的情况;当 OR < 1 时,取其倒数(1/OR)再对照上表。例如 OR = 0.75,倒数 = 1.33,属小效应。OR 解读仍需结合专业背景,统计显著不等于实质重要。


常见问题 FAQ

Q1:有序 Logistic 的 OR 和二元 Logistic 的 OR 含义一样吗?

A:两者都是优势比,但指向不同。二元 Logistic 的 OR 是"事件发生 vs. 不发生"的优势之比;有序 Logistic 的 OR 是累积优势比,描述"因变量落在第 k 级以上(更高等级)vs. 第 k 级及以下(更低等级)的优势之比",且这一比值在所有截断点 k 上相同(比例优势假设成立的前提下)。两者不能互换解读,更不能与 HR(风险比)或 RR(相对危险度)混用——三者在应用场景、计算方式和解读框架上完全不同。ChatSRS 在输出结果时会自动标注 OR 类型,避免歧义。

Q2:平行线检验 p < .05,意味着结果无效吗?

A:不是。平行线检验 p < .05 只说明"各截断点的系数不完全相同",并不意味着比例优势模型完全错误。实践中有两类处理方案:(1) 广义有序 Logistic 回归(Partial Proportional Odds):允许违反假设的变量在不同截断点有各自的系数,其余变量仍共享系数,在 Stata 中用 gologit2,在 R 中用 VGAM 包;(2) 名义多分类 Logistic 回归:完全放弃顺序约束,但解读更复杂,信息损失最多。另外,大样本(n > 500)时平行线检验功效极高,轻微偏离即显著,此时可结合分层 OR 图评估实质违反程度后再决定方案。在 ChatSRS 中输入"检验比例优势假设并绘制分层 OR 图"即可。

Q3:李克特量表用有序 Logistic 还是线性回归?争议在哪里?

A:这是方法学中长期存在的争论。严格来说,李克特量表是有序测量,不满足等距假设,有序 Logistic 回归在统计假设上更正确。但在实践中:当量表等级 >= 5、分布接近正态、样本量充足时,线性回归的结果往往与有序 Logistic 高度一致,且更易解读(系数直接是"每单位自变量对应因变量得分变化")。多数顶级期刊对两种方法均接受,关键是在方法节说清楚选择依据。若审稿人明确要求"因变量为有序类别数据,应使用有序回归",ChatSRS 可一句话切换并给出完整有序 Logistic 输出。

Q4:有序 Logistic 对样本量有什么要求?

A:一般原则是每个有序等级至少有 10-15 个观测(类比二元 Logistic 的 EPV >= 10 规则)。本例 5 个等级最少的"非常不满意"有 24 例,满足要求。若某等级频率极低(如 < 5%),建议合并相邻等级(如将"非常不满意"和"不满意"合并为"不满意"),再重新建模。ChatSRS 在检测到等级频率过低时会自动给出警告和合并建议。

Q5:多个李克特题目应该先加总成维度分再做回归,还是每题单独做?

A:这取决于研究问题。如果多个题目构成一个测量维度(如职业倦怠量表),通常先做探索性因子分析(EFA)或验证性因子分析(CFA)确认结构效度,再将维度得分(factor score 或简单加总)作为变量纳入回归,此时维度得分可视为连续变量,做线性或 Logistic 回归均合适。如果因变量本身是一道有序题目(如满意度单题),才需要有序 Logistic 回归。在 ChatSRS 中,可先用"先做 EFA/CFA 确认维度结构,再以维度得分为自变量做有序 Logistic 回归"一句话完成全套流程。


小结

有序 Logistic 回归是处理李克特量表、等级评分等有序因变量的标准方法。完整的分析流程需要:

  1. 确认变量类型:因变量必须是有序类别,而非连续或名义量表
  2. 检验比例优势假设:平行线检验是有序 Logistic 回归的必备前提诊断,必须在报告系数之前呈现
  3. 正确解读 OR:有序 Logistic 的 OR 是累积优势比,不要与二元 Logistic OR、HR(Cox 回归)或 RR 混用
  4. APA 报告有额外要求:需同时报告平行线检验结果、各截距参数和模型整体拟合指标
  5. 效应量用 Chen et al.(2010)框架:OR 的小/中/大效应阈值分别约为 1.22/2.34/6.71

chatsrs.com 用一句自然语言指令,即可获得:

  • 平行线检验自动诊断 + 违反时的替代建议
  • 四个截距参数 + 自变量系数三线表(OR + 95% CI)
  • Nagelkerke R^2 等模型拟合指标
  • 可直接粘贴进论文的 APA 7th 格式文字

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。