统计百科 ·
李克特量表(Likert)该用什么分析?定序还是定距的争议与实操指南
统计百科:深入辨析 Likert 单题定序 vs 总分定距之争,梳理参数/非参数方法选择逻辑,厘清均值是否可用、何时应跑 Mann-Whitney/Spearman,给出可直接套用于论文的 APA 7th 报告句式。
Likert 量表是问卷研究中使用最广泛的测量工具,但围绕它的方法论争议从未停歇:单个 5 级题该当定序变量还是定距变量处理?均值是否有意义?该跑 t 检验还是 Mann-Whitney 检验?这篇文章从测量理论出发,梳理学界主流立场,给出参数/非参数方法的决策逻辑,并附可直接用于论文的 APA 7th 报告句式。
一、问题的起点:Likert 量表到底是什么
两个常被混淆的概念
在开始讨论之前,必须先区分两个经常被混用的术语:
Likert 题(Likert item):单个使用有序数字标签(如 1=完全不同意、5=完全同意)评分的题目。这是一种**定序(ordinal)**测量——我们只知道 4 分高于 3 分,但无法确认 4 分和 3 分之间的间距与 3 分和 2 分之间的间距相等。
Likert 量表(Likert scale):由多个 Likert 题组成的复合测量工具,通常对多个相关题目求和或求均值,得到一个反映某一构念(如满意度、态度)的总分(composite score)。这才是 Likert(1932)原始论文所指的"量表"。
这一区分直接决定了你应该使用哪类统计方法。
争议的核心
定序变量与定距变量的区别在于等距性(equal-interval property):
| 测量层次 | 等距性 | 可计算均值 | 可计算差值 |
|---|---|---|---|
| 定名(nominal) | 无 | 否 | 否 |
| 定序(ordinal) | 无法保证 | 理论上不可 | 无意义 |
| 定距(interval) | 有 | 可 | 有意义 |
| 定比(ratio) | 有(含绝对零点) | 可 | 有意义 |
若 Likert 题是严格定序的,那么"均值"在数学上并没有严格意义——"平均 3.4 分"要求分间距相等,而这一点无法从量表本身得到保证。
二、学界的两大阵营
阵营一:严格定序派(Conservative Ordinal Position)
代表人物:Stevens(1946)、Siegel(1956)、Field(2013 非参数章节)
核心主张:
- Likert 单题是定序变量,不满足参数检验(t 检验、ANOVA、Pearson 相关)的测量层次要求
- 应使用非参数方法:Mann-Whitney U、Wilcoxon 符号秩检验、Kruskal-Wallis 检验、Spearman 相关
- 均值报告无意义,应报告中位数(Mdn)和四分位距(IQR)
适用场景:
- 单个 Likert 题作为因变量
- 分布严重偏斜或样本量较小(n < 30/组)
- 5 级量表且数据集中于一端
- 审稿人或期刊对测量层次要求严格
阵营二:近似定距派(Pragmatic Interval Position)
代表人物:Norman(2010)、Carifio & Perla(2008)、Sullivan & Artino(2013)
核心主张:
- Likert 题的各选项在实践中被受访者"近似等距"地感知,当选项标签描述合理、级数足够(5 级以上)时,可近似作为定距变量
- 参数检验对违反等距性的轻微偏差具有稳健性(robustness),结论与非参数方法高度一致
- 多个 Likert 题构成的总分/均值在心理测量学上更接近定距变量,参数方法更合适
- Norman(2010)综述了大量模拟研究,指出即使分布偏斜,t 检验结果通常与 Mann-Whitney U 高度吻合
适用场景:
- 多题组成的 Likert 量表总分作为因变量
- 分布接近正态或样本量足够(n >= 30/组)
- 7 级量表(比 5 级更接近连续变量)
- 目标期刊和学科以参数方法为主流(心理学、教育学、管理学)
当前主流共识
2020 年代的统计方法学文献倾向于折中立场:单题用非参数,量表总分用参数,同时报告效应量以支持可重复性。APA 7th 本身并未禁止对 Likert 数据使用参数方法,但要求在方法章节说明测量假设。
三、决策树:参数 vs 非参数方法怎么选
你的 Likert 数据是…
│
├── 单个题目(5/7级单题)
│ ├── 分布极度偏斜 / n < 30 → 非参数(Mann-Whitney / Kruskal-Wallis / Spearman)
│ └── 分布较均匀 / n >= 30 → 可用参数,但需说明假设(报告中位数作为补充)
│
└── 多题总分/均值(Likert 量表)
├── 正态性通过(Shapiro-Wilk p > .05)→ 参数(t检验 / ANOVA / Pearson)
├── 正态性不通过 + n < 30 → 非参数
└── 正态性不通过 + n >= 30 → 参数仍稳健(CLT),但可同时报告非参数结果作验证
实操关键问题
Q:5 级量表还是 7 级量表,方法选择有区别吗?
有区别。7 级量表(1-7)的分布更接近连续变量,参数方法的适用性更强。5 级量表在实践中常出现"堆积效应"(多数人选 3-4 分),此时非参数方法更保守、更严谨。
Q:量表总分做了几个分量表,每个分量表还是单题吗?
取决于每个分量表包含的题数。若一个维度只有 2-3 题,总分的离散性仍有限,需谨慎使用参数方法;若 5 题以上,总分的分布通常接近正态,参数方法的适用性较好。
四、各统计方法对照:场景、假设与报告要素
非参数方法组
Mann-Whitney U 检验(两组独立样本)
- 适用:两组 Likert 单题比较(如男性 vs 女性对某题的评分差异)
- 报告要素:U 统计量、z 分数(大样本)、p 值、效应量 r(= z/√N)
- APA 报告句式:
Mann-Whitney U 检验结果显示,[组1](Mdn = X)对[题目]的评分与[组2](Mdn = X)
存在显著差异,U = XXX, z = X.XX, p = .XXX, r = .XX([大小]效应)。
填入数值的示例:
Mann-Whitney U 检验结果显示,本科生(Mdn = 4)对"AI 辅助统计分析有助于提升论文质量"的认同度显著高于高中生(Mdn = 3),U = 1842,z = 3.47,p < .001,r = .31,为中等效应(Cohen,1992)。
Wilcoxon 符号秩检验(两组配对样本)
- 适用:同一被试前后测 Likert 单题比较,或同一被试对两个题目的评分比较
- 报告要素:T 统计量(或 z 分数)、p 值、效应量 r
- APA 报告句式:
Wilcoxon 符号秩检验结果显示,[时间点1](Mdn = X)与[时间点2](Mdn = X)的
[题目]评分存在显著差异,z = X.XX, p = .XXX, r = .XX。
Kruskal-Wallis 检验(三组及以上独立样本)
- 适用:三组或多组 Likert 单题比较(相当于单因素 ANOVA 的非参数版本)
- 报告要素:H 统计量(或 chi-square)、自由度、p 值、效应量 epsilon^2(= (H - k + 1)/(n - k))
- APA 报告句式:
Kruskal-Wallis 检验结果显示,[自变量]对[题目]评分的影响显著,
H([df]) = X.XX, p = .XXX, epsilon^2 = .XX。
事后两两比较(Dunn 检验,Bonferroni 校正)显示,[组1](Mdn = X)与[组2](Mdn = X)
存在显著差异(p_adj = .XXX)。
填入数值的示例:
Kruskal-Wallis 检验结果显示,学历对"统计焦虑"单题评分存在显著组间差异,H(2) = 14.83,p < .001,epsilon^2 = .12,为中效应。Dunn 事后检验(Bonferroni 校正)显示,博士生(Mdn = 2)评分显著低于本科生(Mdn = 4,p_adj = .002)和硕士生(Mdn = 3,p_adj = .018);本科生与硕士生之间差异未达显著(p_adj = .241)。
Spearman 秩相关(两个定序变量的相关)
- 适用:Likert 单题与另一定序变量(或正态性不满足的定距变量)之间的相关
- 报告要素:r_s(或 rho)、p 值、样本量
- APA 报告句式:
Spearman 秩相关分析结果显示,[变量1]与[变量2]之间呈显著[正/负]相关,
r_s([n-2]) = .XX, p = .XXX。
参数方法组(量表总分)
独立样本 t 检验
- 适用:两组量表总分比较
- 报告要素:t 统计量、自由度、p 值、Cohen's d
- APA 报告句式:
独立样本 t 检验结果显示,[组1](M = X.XX, SD = X.XX)的[量表]总分显著[高于/低于]
[组2](M = X.XX, SD = X.XX),t([df]) = X.XX, p = .XXX, d = .XX([大小]效应)。
单因素 ANOVA
- 适用:三组及以上量表总分比较,配合 Tukey HSD 事后检验
- 报告:参见 F 值的 APA 7th 报告写法 中的完整模板
Pearson 相关
- 适用:量表总分与定距变量(或另一量表总分)之间的相关,须满足正态性
- 报告要素:r、p 值、样本量
五、均值能不能用?这个问题的正确答案
这是被问得最多的问题。直接给答案:
单个 Likert 题:理论上不应报告均值,实操上仍可辅助报告,但中位数是主要描述统计量。
量表总分/均值:可以报告,参数方法适用,均值有意义。
为什么量表总分可以报均值
多个定序变量的总和在数学上不是定序变量——根据中心极限定理,当题目足够多(通常 5 题以上)时,总分的分布趋向正态,各相邻分值之间的间距也因为"加法平均效应"而趋于相等。这就是为什么心理学、教育学等领域使用多题 Likert 量表时,均值和参数方法是被广泛接受的。
方法章节如何表述
若使用参数方法分析量表总分,方法章节应加入以下说明:
本研究将各维度多题总分视为近似连续变量(Norman,2010),
采用参数方法进行分析;单题描述统计同时报告中位数作为补充。
若使用非参数方法分析单题,方法章节应写:
由于 Likert 单题属于定序测量,组间比较采用 Mann-Whitney U 检验(两组)
/ Kruskal-Wallis 检验(三组及以上),并以 Dunn 事后检验(Bonferroni 校正)
进行两两比较;相关分析采用 Spearman 秩相关系数。
六、在 ChatSRS 上完成 Likert 分析的真实指令
打开 chatsrs.com,上传数据后输入:
"我有一份问卷数据,第 3-7 题是关于学习动机的 Likert 5 级量表(1=完全不同意,5=完全同意),第 8-12 题是学习策略量表。请:(1) 分别计算两个维度的总分;(2) 以性别为分组变量,对两个量表总分做独立样本 t 检验,输出 t 值、自由度、p 值、Cohen's d 和 95% CI;(3) 对每个单题分别做 Mann-Whitney U 检验,输出 U、z、p 和 r 效应量;(4) 计算两个量表总分的 Pearson 相关和 Spearman 相关;(5) 所有结果按 APA 7th 格式输出,包含可直接粘贴进论文的报告段落。"
ChatSRS 同时运行 R 引擎(非参数、Pearson/Spearman)、SPSS 引擎(t 检验、描述统计)和 Stata 引擎,输出统一转换为 APA 格式,数值自动填入报告模板,可直接复制进论文方法/结果章节。
七、效应量对照表(参数 + 非参数)
| 方法 | 效应量指标 | 小效应 | 中效应 | 大效应 |
|---|---|---|---|---|
| Mann-Whitney U | r = z/√N | .10 | .30 | .50 |
| Wilcoxon 符号秩 | r = z/√N | .10 | .30 | .50 |
| Kruskal-Wallis | epsilon^2 | .01 | .06 | .14 |
| 独立样本 t 检验 | Cohen's d | .20 | .50 | .80 |
| 配对 t 检验 | Cohen's d_z | .20 | .50 | .80 |
| 单因素 ANOVA | eta^2 | .01 | .06 | .14 |
| Pearson / Spearman r | r | .10 |
参照 Cohen(1988, 1992)标准。APA 7th 要求在所有假设检验中报告效应量,无论结果是否显著。
八、完整方法章节模板(含参数+非参数混合设计)
以下模板适用于"量表总分用参数,单题用非参数"的混合报告策略:
本研究问卷包含[X]个维度,每个维度由[X]个 Likert 5 级题组成
(1=完全不同意,5=完全同意)。各维度总分由下属题目求和计算,
总分越高表示[维度含义]程度越强。
量表总分的组间比较采用独立样本 t 检验(两组)或单因素方差分析(三组及以上),
效应量分别报告 Cohen's d 和 eta 平方。对于单个 Likert 题的分析,
由于其属于定序测量,采用 Mann-Whitney U 检验(两组)和 Kruskal-Wallis 检验
(三组及以上),效应量报告 r(=z/√N)。量表间关联分析采用 Pearson 相关
(量表总分)和 Spearman 相关(单题或分布偏斜时),
参照 Cohen(1988)效应量标准(小=.10,中=.30,大=.50)。
正态性假设采用 Shapiro-Wilk 检验评估;所有检验的显著性水平设为 alpha = .05,
采用双尾检验。统计分析使用 ChatSRS(SPSS + R + Stata 三引擎)。
常见 FAQ
Q:我的量表只有 3 个题,总分能当定距变量用吗?
A:谨慎使用。3 题 Likert 量表总分的取值范围为 3-15 分(5 级)或 3-21 分(7 级),虽然是整数,但分布的等距性仍依赖于题目间的相互抵消。样本量足够大(n >= 50/组)时,参数方法通常仍有效;样本量较小时,建议同时报告非参数结果作为验证。关键是在方法章节说明你的选择理由并引用文献(如 Norman,2010)。
Q:Spearman 和 Pearson 相关的结果不一样,该用哪个?
A:两者的差异通常出现在分布偏斜或有极端值时。若量表总分通过正态性检验(Shapiro-Wilk p > .05),Pearson 相关在统计功效上更高;若分布偏斜,Spearman 相关更稳健。实践建议:两者都报告,若结论一致(均显著或均不显著),以 Pearson 为主结果;若结论不一致,以 Spearman 为主并在正文中说明原因。
Q:Mann-Whitney U 检验的效应量 r 怎么计算和解释?
A:公式为 r = z / √N,其中 z 为 Mann-Whitney U 转换后的标准化分数,N 为总样本量(不是单组)。效应大小标准与 Pearson r 相同:.10 小效应、.30 中效应、.50 大效应(Cohen,1992)。注意:r 在此处是效应量指标,含义为"两组秩次分布差异的标准化程度",与 Pearson 相关系数 r 的统计含义不同,但效应大小解释框架相同。
Q:审稿人要求我用参数方法,但我用了非参数,该怎么回应?
A:最稳妥的回应是"同时报告两种结果,说明结论一致"。在回复信中写:本研究最初对 Likert 单题采用非参数方法(Mann-Whitney U),与审稿人建议的独立样本 t 检验相比,两者结论完全一致(显著性方向和效应量大小基本吻合),这与 Norman(2010)关于参数方法对 Likert 数据具有稳健性的综述结论一致。如期刊要求,可改为报告 t 检验结果,同时将非参数结果置于附录供审稿参考。
Q:我的数据有 5 组,Kruskal-Wallis 之后怎么做事后检验?
A:使用 Dunn 检验(Dunn's test),并以 Bonferroni 方法或 Holm 方法校正多重比较。Bonferroni 较保守(校正后的 alpha = .05 / 比较对数),Holm 方法功效更高。报告格式:Dunn 事后检验(Bonferroni 校正)显示,[组 X](Mdn = X)与[组 Y](Mdn = X)存在显著差异(p_adj = .XXX)。ChatSRS 的 R 引擎(dunn.test 包)可自动输出所有两两比较结果,并生成 APA 格式报告段落。
快速参考:Likert 数据分析速查卡
[单个 Likert 题 — 组间比较]
两组独立: Mann-Whitney U → 报告 U, z, p, r(=z/√N)
两组配对: Wilcoxon 符号秩 → 报告 z, p, r
三组及以上: Kruskal-Wallis → 报告 H(df), p, epsilon^2
事后: Dunn + Bonferroni/Holm → 报告 p_adj
[单个 Likert 题 — 相关分析]
Spearman r_s → 报告 r_s(n-2), p
[Likert 量表总分 — 组间比较]
两组独立: 独立样本 t → 报告 t(df), p, d, 95%CI
两组配对: 配对 t → 报告 t(df), p, d_z
三组及以上: ANOVA → 报告 F(df1,df2), p, eta^2
事后: Tukey HSD (方差齐) / Games-Howell (方差不齐)
[Likert 量表总分 — 相关分析]
Pearson r → 报告 r(n-2), p
(分布偏斜时用 Spearman 替代或补充)
[描述统计]
单题: Mdn (IQR) — 中位数和四分位距
总分: M (SD) — 均值和标准差(通过正态性检验后)
相关阅读
- AI 非参数检验全教程 — Mann-Whitney、Kruskal-Wallis、Wilcoxon 实操
- Likert 量表 AI 分析实操 — 信效度、总分、组间比较一站完成
- 反向计分完全指南 — Likert 量表数据预处理必知
- AI 信度分析全教程 — Cronbach alpha 计算与报告
- 统计显著性与 P 值完全指南
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。