统计百科 ·

李克特量表(Likert)该用什么分析?定序还是定距的争议与实操指南

统计百科:深入辨析 Likert 单题定序 vs 总分定距之争,梳理参数/非参数方法选择逻辑,厘清均值是否可用、何时应跑 Mann-Whitney/Spearman,给出可直接套用于论文的 APA 7th 报告句式。

Likert 量表是问卷研究中使用最广泛的测量工具,但围绕它的方法论争议从未停歇:单个 5 级题该当定序变量还是定距变量处理?均值是否有意义?该跑 t 检验还是 Mann-Whitney 检验?这篇文章从测量理论出发,梳理学界主流立场,给出参数/非参数方法的决策逻辑,并附可直接用于论文的 APA 7th 报告句式。


一、问题的起点:Likert 量表到底是什么

两个常被混淆的概念

在开始讨论之前,必须先区分两个经常被混用的术语:

Likert 题(Likert item):单个使用有序数字标签(如 1=完全不同意、5=完全同意)评分的题目。这是一种**定序(ordinal)**测量——我们只知道 4 分高于 3 分,但无法确认 4 分和 3 分之间的间距与 3 分和 2 分之间的间距相等。

Likert 量表(Likert scale):由多个 Likert 题组成的复合测量工具,通常对多个相关题目求和或求均值,得到一个反映某一构念(如满意度、态度)的总分(composite score)。这才是 Likert(1932)原始论文所指的"量表"。

这一区分直接决定了你应该使用哪类统计方法。

争议的核心

定序变量与定距变量的区别在于等距性(equal-interval property)

测量层次等距性可计算均值可计算差值
定名(nominal)
定序(ordinal)无法保证理论上不可无意义
定距(interval)有意义
定比(ratio)有(含绝对零点)有意义

若 Likert 题是严格定序的,那么"均值"在数学上并没有严格意义——"平均 3.4 分"要求分间距相等,而这一点无法从量表本身得到保证。


二、学界的两大阵营

阵营一:严格定序派(Conservative Ordinal Position)

代表人物:Stevens(1946)、Siegel(1956)、Field(2013 非参数章节)

核心主张

  • Likert 单题是定序变量,不满足参数检验(t 检验、ANOVA、Pearson 相关)的测量层次要求
  • 应使用非参数方法:Mann-Whitney U、Wilcoxon 符号秩检验、Kruskal-Wallis 检验、Spearman 相关
  • 均值报告无意义,应报告中位数(Mdn)和四分位距(IQR)

适用场景

  • 单个 Likert 题作为因变量
  • 分布严重偏斜或样本量较小(n < 30/组)
  • 5 级量表且数据集中于一端
  • 审稿人或期刊对测量层次要求严格

阵营二:近似定距派(Pragmatic Interval Position)

代表人物:Norman(2010)、Carifio & Perla(2008)、Sullivan & Artino(2013)

核心主张

  • Likert 题的各选项在实践中被受访者"近似等距"地感知,当选项标签描述合理、级数足够(5 级以上)时,可近似作为定距变量
  • 参数检验对违反等距性的轻微偏差具有稳健性(robustness),结论与非参数方法高度一致
  • 多个 Likert 题构成的总分/均值在心理测量学上更接近定距变量,参数方法更合适
  • Norman(2010)综述了大量模拟研究,指出即使分布偏斜,t 检验结果通常与 Mann-Whitney U 高度吻合

适用场景

  • 多题组成的 Likert 量表总分作为因变量
  • 分布接近正态或样本量足够(n >= 30/组)
  • 7 级量表(比 5 级更接近连续变量)
  • 目标期刊和学科以参数方法为主流(心理学、教育学、管理学)

当前主流共识

2020 年代的统计方法学文献倾向于折中立场:单题用非参数,量表总分用参数,同时报告效应量以支持可重复性。APA 7th 本身并未禁止对 Likert 数据使用参数方法,但要求在方法章节说明测量假设。


三、决策树:参数 vs 非参数方法怎么选

你的 Likert 数据是…
│
├── 单个题目(5/7级单题)
│   ├── 分布极度偏斜 / n < 30        → 非参数(Mann-Whitney / Kruskal-Wallis / Spearman)
│   └── 分布较均匀 / n >= 30         → 可用参数,但需说明假设(报告中位数作为补充)
│
└── 多题总分/均值(Likert 量表)
    ├── 正态性通过(Shapiro-Wilk p > .05)→ 参数(t检验 / ANOVA / Pearson)
    ├── 正态性不通过 + n < 30          → 非参数
    └── 正态性不通过 + n >= 30         → 参数仍稳健(CLT),但可同时报告非参数结果作验证

实操关键问题

Q:5 级量表还是 7 级量表,方法选择有区别吗?

有区别。7 级量表(1-7)的分布更接近连续变量,参数方法的适用性更强。5 级量表在实践中常出现"堆积效应"(多数人选 3-4 分),此时非参数方法更保守、更严谨。

Q:量表总分做了几个分量表,每个分量表还是单题吗?

取决于每个分量表包含的题数。若一个维度只有 2-3 题,总分的离散性仍有限,需谨慎使用参数方法;若 5 题以上,总分的分布通常接近正态,参数方法的适用性较好。


四、各统计方法对照:场景、假设与报告要素

非参数方法组

Mann-Whitney U 检验(两组独立样本)

  • 适用:两组 Likert 单题比较(如男性 vs 女性对某题的评分差异)
  • 报告要素:U 统计量、z 分数(大样本)、p 值、效应量 r(= z/√N)
  • APA 报告句式
Mann-Whitney U 检验结果显示,[组1](Mdn = X)对[题目]的评分与[组2](Mdn = X)
存在显著差异,U = XXX, z = X.XX, p = .XXX, r = .XX([大小]效应)。

填入数值的示例

Mann-Whitney U 检验结果显示,本科生(Mdn = 4)对"AI 辅助统计分析有助于提升论文质量"的认同度显著高于高中生(Mdn = 3),U = 1842,z = 3.47,p < .001,r = .31,为中等效应(Cohen,1992)。

Wilcoxon 符号秩检验(两组配对样本)

  • 适用:同一被试前后测 Likert 单题比较,或同一被试对两个题目的评分比较
  • 报告要素:T 统计量(或 z 分数)、p 值、效应量 r
  • APA 报告句式
Wilcoxon 符号秩检验结果显示,[时间点1](Mdn = X)与[时间点2](Mdn = X)的
[题目]评分存在显著差异,z = X.XX, p = .XXX, r = .XX。

Kruskal-Wallis 检验(三组及以上独立样本)

  • 适用:三组或多组 Likert 单题比较(相当于单因素 ANOVA 的非参数版本)
  • 报告要素:H 统计量(或 chi-square)、自由度、p 值、效应量 epsilon^2(= (H - k + 1)/(n - k))
  • APA 报告句式
Kruskal-Wallis 检验结果显示,[自变量]对[题目]评分的影响显著,
H([df]) = X.XX, p = .XXX, epsilon^2 = .XX。
事后两两比较(Dunn 检验,Bonferroni 校正)显示,[组1](Mdn = X)与[组2](Mdn = X)
存在显著差异(p_adj = .XXX)。

填入数值的示例

Kruskal-Wallis 检验结果显示,学历对"统计焦虑"单题评分存在显著组间差异,H(2) = 14.83,p < .001,epsilon^2 = .12,为中效应。Dunn 事后检验(Bonferroni 校正)显示,博士生(Mdn = 2)评分显著低于本科生(Mdn = 4,p_adj = .002)和硕士生(Mdn = 3,p_adj = .018);本科生与硕士生之间差异未达显著(p_adj = .241)。

Spearman 秩相关(两个定序变量的相关)

  • 适用:Likert 单题与另一定序变量(或正态性不满足的定距变量)之间的相关
  • 报告要素:r_s(或 rho)、p 值、样本量
  • APA 报告句式
Spearman 秩相关分析结果显示,[变量1]与[变量2]之间呈显著[正/负]相关,
r_s([n-2]) = .XX, p = .XXX。

参数方法组(量表总分)

独立样本 t 检验

  • 适用:两组量表总分比较
  • 报告要素:t 统计量、自由度、p 值、Cohen's d
  • APA 报告句式
独立样本 t 检验结果显示,[组1](M = X.XX, SD = X.XX)的[量表]总分显著[高于/低于]
[组2](M = X.XX, SD = X.XX),t([df]) = X.XX, p = .XXX, d = .XX([大小]效应)。

单因素 ANOVA

Pearson 相关

  • 适用:量表总分与定距变量(或另一量表总分)之间的相关,须满足正态性
  • 报告要素:r、p 值、样本量

五、均值能不能用?这个问题的正确答案

这是被问得最多的问题。直接给答案:

单个 Likert 题:理论上不应报告均值,实操上仍可辅助报告,但中位数是主要描述统计量。

量表总分/均值:可以报告,参数方法适用,均值有意义。

为什么量表总分可以报均值

多个定序变量的总和在数学上不是定序变量——根据中心极限定理,当题目足够多(通常 5 题以上)时,总分的分布趋向正态,各相邻分值之间的间距也因为"加法平均效应"而趋于相等。这就是为什么心理学、教育学等领域使用多题 Likert 量表时,均值和参数方法是被广泛接受的。

方法章节如何表述

若使用参数方法分析量表总分,方法章节应加入以下说明:

本研究将各维度多题总分视为近似连续变量(Norman,2010),
采用参数方法进行分析;单题描述统计同时报告中位数作为补充。

若使用非参数方法分析单题,方法章节应写:

由于 Likert 单题属于定序测量,组间比较采用 Mann-Whitney U 检验(两组)
/ Kruskal-Wallis 检验(三组及以上),并以 Dunn 事后检验(Bonferroni 校正)
进行两两比较;相关分析采用 Spearman 秩相关系数。

六、在 ChatSRS 上完成 Likert 分析的真实指令

打开 chatsrs.com,上传数据后输入:

"我有一份问卷数据,第 3-7 题是关于学习动机的 Likert 5 级量表(1=完全不同意,5=完全同意),第 8-12 题是学习策略量表。请:(1) 分别计算两个维度的总分;(2) 以性别为分组变量,对两个量表总分做独立样本 t 检验,输出 t 值、自由度、p 值、Cohen's d 和 95% CI;(3) 对每个单题分别做 Mann-Whitney U 检验,输出 U、z、p 和 r 效应量;(4) 计算两个量表总分的 Pearson 相关和 Spearman 相关;(5) 所有结果按 APA 7th 格式输出,包含可直接粘贴进论文的报告段落。"

ChatSRS 同时运行 R 引擎(非参数、Pearson/Spearman)、SPSS 引擎(t 检验、描述统计)和 Stata 引擎,输出统一转换为 APA 格式,数值自动填入报告模板,可直接复制进论文方法/结果章节。


七、效应量对照表(参数 + 非参数)

方法效应量指标小效应中效应大效应
Mann-Whitney Ur = z/√N.10.30.50
Wilcoxon 符号秩r = z/√N.10.30.50
Kruskal-Wallisepsilon^2.01.06.14
独立样本 t 检验Cohen's d.20.50.80
配对 t 检验Cohen's d_z.20.50.80
单因素 ANOVAeta^2.01.06.14
Pearson / Spearman rr.10

参照 Cohen(1988, 1992)标准。APA 7th 要求在所有假设检验中报告效应量,无论结果是否显著。


八、完整方法章节模板(含参数+非参数混合设计)

以下模板适用于"量表总分用参数,单题用非参数"的混合报告策略:

本研究问卷包含[X]个维度,每个维度由[X]个 Likert 5 级题组成
(1=完全不同意,5=完全同意)。各维度总分由下属题目求和计算,
总分越高表示[维度含义]程度越强。

量表总分的组间比较采用独立样本 t 检验(两组)或单因素方差分析(三组及以上),
效应量分别报告 Cohen's d 和 eta 平方。对于单个 Likert 题的分析,
由于其属于定序测量,采用 Mann-Whitney U 检验(两组)和 Kruskal-Wallis 检验
(三组及以上),效应量报告 r(=z/√N)。量表间关联分析采用 Pearson 相关
(量表总分)和 Spearman 相关(单题或分布偏斜时),
参照 Cohen(1988)效应量标准(小=.10,中=.30,大=.50)。

正态性假设采用 Shapiro-Wilk 检验评估;所有检验的显著性水平设为 alpha = .05,
采用双尾检验。统计分析使用 ChatSRS(SPSS + R + Stata 三引擎)。

常见 FAQ

Q:我的量表只有 3 个题,总分能当定距变量用吗?

A:谨慎使用。3 题 Likert 量表总分的取值范围为 3-15 分(5 级)或 3-21 分(7 级),虽然是整数,但分布的等距性仍依赖于题目间的相互抵消。样本量足够大(n >= 50/组)时,参数方法通常仍有效;样本量较小时,建议同时报告非参数结果作为验证。关键是在方法章节说明你的选择理由并引用文献(如 Norman,2010)。

Q:Spearman 和 Pearson 相关的结果不一样,该用哪个?

A:两者的差异通常出现在分布偏斜或有极端值时。若量表总分通过正态性检验(Shapiro-Wilk p > .05),Pearson 相关在统计功效上更高;若分布偏斜,Spearman 相关更稳健。实践建议:两者都报告,若结论一致(均显著或均不显著),以 Pearson 为主结果;若结论不一致,以 Spearman 为主并在正文中说明原因。

Q:Mann-Whitney U 检验的效应量 r 怎么计算和解释?

A:公式为 r = z / √N,其中 z 为 Mann-Whitney U 转换后的标准化分数,N 为总样本量(不是单组)。效应大小标准与 Pearson r 相同:.10 小效应、.30 中效应、.50 大效应(Cohen,1992)。注意:r 在此处是效应量指标,含义为"两组秩次分布差异的标准化程度",与 Pearson 相关系数 r 的统计含义不同,但效应大小解释框架相同。

Q:审稿人要求我用参数方法,但我用了非参数,该怎么回应?

A:最稳妥的回应是"同时报告两种结果,说明结论一致"。在回复信中写:本研究最初对 Likert 单题采用非参数方法(Mann-Whitney U),与审稿人建议的独立样本 t 检验相比,两者结论完全一致(显著性方向和效应量大小基本吻合),这与 Norman(2010)关于参数方法对 Likert 数据具有稳健性的综述结论一致。如期刊要求,可改为报告 t 检验结果,同时将非参数结果置于附录供审稿参考。

Q:我的数据有 5 组,Kruskal-Wallis 之后怎么做事后检验?

A:使用 Dunn 检验(Dunn's test),并以 Bonferroni 方法或 Holm 方法校正多重比较。Bonferroni 较保守(校正后的 alpha = .05 / 比较对数),Holm 方法功效更高。报告格式:Dunn 事后检验(Bonferroni 校正)显示,[组 X](Mdn = X)与[组 Y](Mdn = X)存在显著差异(p_adj = .XXX)。ChatSRS 的 R 引擎(dunn.test 包)可自动输出所有两两比较结果,并生成 APA 格式报告段落。


快速参考:Likert 数据分析速查卡

[单个 Likert 题 — 组间比较]
两组独立:  Mann-Whitney U → 报告 U, z, p, r(=z/√N)
两组配对:  Wilcoxon 符号秩 → 报告 z, p, r
三组及以上: Kruskal-Wallis → 报告 H(df), p, epsilon^2
             事后: Dunn + Bonferroni/Holm → 报告 p_adj

[单个 Likert 题 — 相关分析]
Spearman r_s → 报告 r_s(n-2), p

[Likert 量表总分 — 组间比较]
两组独立:  独立样本 t → 报告 t(df), p, d, 95%CI
两组配对:  配对 t → 报告 t(df), p, d_z
三组及以上: ANOVA → 报告 F(df1,df2), p, eta^2
             事后: Tukey HSD (方差齐) / Games-Howell (方差不齐)

[Likert 量表总分 — 相关分析]
Pearson r → 报告 r(n-2), p
(分布偏斜时用 Spearman 替代或补充)

[描述统计]
单题:  Mdn (IQR) — 中位数和四分位距
总分:  M (SD) — 均值和标准差(通过正态性检验后)

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。