统计百科 ·

组内相关系数 ICC 有哪几种?该选哪个?ICC(1)/(2,k)/(3,k) 类型完全指南

统计百科:系统梳理 ICC 的六种模型(单向/双向 × 单次/均值 × 一致/绝对一致),说清 ICC(1)、ICC(2,1)、ICC(2,k)、ICC(3,1)、ICC(3,k) 的适用前提、公式差异与 APA 7th 报告写法,附可直接套用的论文句式和 ChatSRS 实操指令。

ICC(Intraclass Correlation Coefficient,组内相关系数)是评估测量一致性与可靠性的核心指标,广泛用于评分者间信度、重测信度、仪器校准等场景。但 ICC 并非一个单一指标,而是一个"6 格"模型族。不同选择直接影响 ICC 数值与可发表性——很多论文因为选错模型被审稿人退回。本文系统梳理 ICC 的六种形态,给出一张"三步选型决策树",并附可直接抄进论文的 APA 7th 格式句式。


你选对 ICC 了吗?

审稿人关于 ICC 最常见的批注:

  • "请说明使用的是哪种 ICC 模型(单向/双向随机/双向混合)"
  • "评分者是否可推广至总体?如不能,应使用双向混合效应而非双向随机效应"
  • "报告的 ICC 是单次测量还是平均测量?请与研究设计保持一致"
  • "一致性 ICC 和绝对一致性 ICC 含义不同,请说明选择依据"
  • "ICC 数值未报告置信区间,请补充 95% CI"

这些批注背后,是 Shrout & Fleiss(1979)经典分类框架和 Koo & Li(2016)操作指南——两篇加起来被引超 25000 次的文献中的核心区分。本文把这些内容拆解成可操作的决策步骤。


一、ICC 是什么:从"组间 vs 组内"到"一致性"

直觉含义

ICC 回答的问题是:在总变异中,有多大比例来自研究对象(被测者)之间的真实差异,而不是测量误差?

$\text{ICC} = \frac{\sigma^2_{\text{subjects}}}{\sigma^2_{\text{subjects}} + \sigma^2_{\text{error}}}$

  • ICC = 0:所有变异都来自测量误差,评分毫无价值
  • ICC = 1:所有变异都来自被测者的真实差异,测量完全可靠
  • ICC > 0.75:通常视为"好"的信度;> 0.90 视为"优秀"(Koo & Li, 2016)

为什么 ICC 有多种

问题的关键在于:"误差"包括什么?

不同研究设计下,"误差"的构成不同:

误差来源说明
评分者差异(系统偏差)某评分者普遍打分偏高/偏低
随机测量误差同一评分者不同次测量的随机波动
被测者×评分者交互某评分者对特定被测者特别严/松

把哪些误差纳入分母,就决定了你得到的是哪种 ICC。


二、Shrout & Fleiss 六格框架:三维度两两组合

ICC 由三个维度的选择决定,每个维度各两个选项:

维度 1:模型(效应结构)

模型描述代号
单向随机效应每个被测者由不同的随机抽样评分者评定,评分者不重复One-Way
双向随机效应所有被测者由相同的一组评分者评定,该组评分者是从更大总体中随机抽取的,结果可推广Two-Way Random
双向混合效应所有被测者由相同的一组评分者评定,该组评分者就是研究中特定的固定评分者,结果不推广至其他评分者Two-Way Mixed

关键判断:你的评分者(或测量时间点/仪器)是否可以推广至一个更大的评分者总体?

  • 可以 → 双向随机效应
  • 不可以(就是这几个特定的人/时间/仪器)→ 双向混合效应
  • 每个被测者由不同评分者评定 → 单向随机效应

维度 2:测量单元

测量单元描述代号
单次测量信度来自单次评分,ICC 反映单次测量的可靠性Single
均值测量信度来自 k 次测量均值,ICC 反映 k 次均值的可靠性(更高)Average(k次)

关键判断:你在实际研究中使用的是单次测量值,还是多次测量的平均值?

  • 用单次值 → 报告单次测量 ICC
  • 用均值 → 报告均值测量 ICC(通常更高,因均值削减了随机误差)

维度 3:一致性定义(仅双向模型适用)

一致性类型描述公式差异
一致性(Consistency)评分者之间的排名顺序是否一致,允许系统性偏差(一个人总打高分但排名一致)不把评分者系统偏差算入误差
绝对一致性(Absolute Agreement)评分值本身是否完全相同,不允许系统性偏差把评分者系统偏差算入误差

关键判断:你关心的是"评分者排名一致就行",还是"评分者给出的绝对数值必须吻合"?

  • 只要排名一致即可(如判断哪组患者病情更重)→ 一致性
  • 数值本身必须吻合(如仪器读数是否可互换、量表分数是否可跨评分者直接比较)→ 绝对一致性

三、六种 ICC 一览表

三维度两两组合,得到 2×2×(单/双)共六种 ICC(Shrout & Fleiss,1979,括号记法):

Shrout & Fleiss现代简写模型测量单元一致性类型
ICC(1,1)ICC(1)单向随机单次
ICC(1,k)ICC(1,k)单向随机k次均值
ICC(2,1)ICC(2)双向随机单次绝对一致性(亦有一致性变体)
ICC(2,k)ICC(2,k)双向随机k次均值绝对一致性(亦有一致性变体)
ICC(3,1)ICC(3)双向混合单次一致性
ICC(3,k)ICC(3,k)双向混合k次均值一致性

注:双向模型(ICC 2/3)还有"绝对一致性"变体,记为 ICC(2,1) agreement vs. consistency。现代统计软件(SPSS、R 的 irr/irrNA 包)通常分别输出 consistency 和 agreement 两个版本。


四、三步决策树:选哪种 ICC

Step 1 — 评分者设计
        |
        |-- A. 每个被测者由不同评分者评定(评分者不重复)
        |       --> 单向随机效应: ICC(1,1) 或 ICC(1,k)
        |
        |-- B. 所有被测者由同一组评分者评定
                |
                Step 2 — 评分者是否可推广?
                |
                |-- 可推广至更大总体(随机抽取的评分者)
                |       --> 双向随机效应: ICC(2,1) 或 ICC(2,k)
                |
                |-- 不可推广(特定固定评分者/固定时间点)
                        --> 双向混合效应: ICC(3,1) 或 ICC(3,k)
                                |
                                Step 3 — 一致性要求
                                |
                                |-- 只要排名一致(允许系统偏差)
                                |       --> Consistency: ICC(3,1)C 或 ICC(3,k)C
                                |
                                |-- 数值必须完全吻合(不允许系统偏差)
                                        --> Absolute Agreement: ICC(3,1)A 或 ICC(3,k)A
                                        (在 Step 2 双向随机中同样适用此区分)

最常见场景快速对应

研究场景推荐 ICC
两位评分者分别给同一批患者评分,要判断仪器是否可互换ICC(2,1) 绝对一致性
三位临床医生用固定量表评估同一批患者,关心排名是否一致ICC(3,1) 一致性
重测信度:同一受试者隔两周由同一仪器测量两次ICC(3,1) 绝对一致性
训练过的固定评分小组(5人)给所有样本评分,结果不推广ICC(3,k) 一致性
从评分者库中随机抽取评分者,结果需可推广ICC(2,1) 或 ICC(2,k)
每份作文由不同的一位随机评分者打分ICC(1,1)

五、公式剖析:误差分母的差异

以双向设计为例,理解三种 ICC 在分母上的差异:

设方差分解为:

  • $MS_{BMS}$:被测者间均方(Between Measurement Subject)
  • $MS_{WMS}$:被测者内均方
  • $MS_{BRS}$:评分者间均方(Between Raters)
  • $MS_{EMS}$:误差均方(Residual)
  • $n$:被测者数,$k$:评分者数

ICC(3,1) — 双向混合,单次,一致性

$\text{ICC}(3,1) = \frac{MS_{BMS} - MS_{EMS}}{MS_{BMS} + (k-1)MS_{EMS}}$

分母不含 $MS_{BRS}$(评分者系统偏差不算作误差),因此即使评分者有稳定的偏高/偏低倾向,ICC 仍可能很高。

ICC(2,1) 绝对一致性 — 双向随机,单次,绝对一致

$\text{ICC}(2,1){\text{agreement}} = \frac{MS{BMS} - MS_{EMS}}{MS_{BMS} + (k-1)MS_{EMS} + \frac{k}{n}(MS_{BRS} - MS_{EMS})}$

分母包含 $MS_{BRS}$(评分者系统偏差计入误差),只要评分者之间有系统性偏差,ICC 就会下降——即使排名完全一致。

ICC(2,1) 一致性 — 双向随机,单次,一致

$\text{ICC}(2,1){\text{consistency}} = \frac{MS{BMS} - MS_{EMS}}{MS_{BMS} + (k-1)MS_{EMS}}$

与 ICC(3,1) 公式相同——这正是 Shrout & Fleiss(1979)的重要发现:当只关心一致性(不关心系统偏差)时,双向随机和双向混合的 ICC 值完全相同。两者区别仅在于可推广性的理论解释,不影响数值。

ICC(X,k) 均值版——Spearman-Brown 推论

$k$ 次均值的 ICC 通过 Spearman-Brown 公式从单次 ICC 推导:

$\text{ICC}(X,k) = \frac{k \cdot \text{ICC}(X,1)}{1 + (k-1) \cdot \text{ICC}(X,1)}$

例:ICC(3,1) = 0.60,3 位评分者均值的 ICC(3,3) = (3 × 0.60) / (1 + 2 × 0.60) = 1.80 / 2.20 = 0.818。均值测量 ICC 始终高于单次测量 ICC,使用均值时必须报告均值版 ICC,不能用单次版凑数。


六、ICC 数值解读标准

Koo & Li(2016)在 Journal of Chiropractic Medicine 发表的操作指南给出当前最广泛引用的解读标准:

ICC 数值信度水平
< 0.50差(Poor)
0.50 – 0.75中等(Moderate)
0.75 – 0.90好(Good)
> 0.90优秀(Excellent)

重要提醒

  1. ICC 数值本身不够,必须报告 95% 置信区间(CI)。小样本下 ICC 点估计的 CI 极宽(例如 n = 20 时 ICC = 0.82,CI 可能低至 0.58),点估计毫无意义。
  2. 信度的实际意义还取决于研究目的:临床上用于个体诊断决策,ICC 通常需 > 0.90;用于组间比较的研究,0.70 有时可接受。
  3. 样本量计划:若研究目的是"验证 ICC > 0.70",使用专门的信度研究样本量公式(Walter, Eliasziw, & Donner, 1998),而非一般统计功效公式。

七、在 ChatSRS 一句话获得 ICC 分析与 APA 报告

打开 chatsrs.com,上传数据后输入:

"两位评分者对 50 份作文分别独立评分(数据在 rater1、rater2 列),评分者是固定的特定两人、结果不推广至其他评分者。我在报告中使用两人均值,但需要评分者在绝对数值上吻合(不只是排名一致)。请计算并报告对应的 ICC 类型、点估计值和 95% CI,输出符合 APA 7th 格式的完整结果句和方法章节描述。"

ChatSRS 会自动选型为 ICC(3,2) 绝对一致性,输出 SPSS 风格三线表 + APA 段落 + 置信区间,可直接复制进论文。

支持指定任意评分者数量、选择一致性/绝对一致性、输出单次或均值版 ICC,无需手动套公式。


八、APA 7th 完整报告模板

方法章节描述(双向混合,单次,绝对一致性)

采用组内相关系数(ICC)评估评分者间信度。
ICC 计算基于双向混合效应模型(two-way mixed-effects model),
以绝对一致性(absolute agreement)为一致性标准,
报告单次测量 ICC [即 ICC(3,1)]。
参照 Koo 与 Mae(2016)的解读标准:ICC < .50 为差,
.50–.75 为中等,.75–.90 为好,> .90 为优秀。

结果段落模板(单次,绝对一致性)

两位评分者对 [被测对象] 的评分显示出 [好/优秀] 的评分者间一致性,
ICC(3,1) = .XX,95% CI [.XX, .XX](Koo & Li, 2016)。
评分者 1(M = XX, SD = XX)与评分者 2(M = XX, SD = XX)
的均值差异未达显著,t([n-1]) = X.XX, p = .XXX,
表明两位评分者在绝对评分水平上亦保持一致。

填入数值的示例

两位评分者对 50 份作文的评分者间信度分析结果显示,评分者间一致性为优秀,ICC(3,1) = .924,95% CI [.872, .956](Koo & Li, 2016)。评分者 1(M = 74.3,SD = 11.2)与评分者 2(M = 73.8,SD = 11.6)的均值差异未达显著,t(49) = 0.63,p = .532,表明两位评分者在绝对评分水平上亦保持一致。

结果段落模板(均值,一致性)

三位评分者对 [被测对象] 的评分基于双向混合效应模型(一致性),
三人均值的组内相关系数 ICC(3,3) = .XX,95% CI [.XX, .XX],
信度水平为 [好/优秀](Koo & Li, 2016)。

填入数值的示例

三位评分者对患者步态的评分者间信度采用三人均值计算,ICC(3,3) = .891,95% CI [.832, .931],信度水平为好(Koo & Li, 2016)。

重测信度模板(双向混合,单次,绝对一致性)

重测信度通过间隔 [X] 周的两次测量计算,采用双向混合效应绝对一致性 ICC,
ICC(3,1) = .XX,95% CI [.XX, .XX],
两次测量均值差异为 X.XX(95% CI [X.XX, X.XX]),
标准测量误差(SEM)= X.XX,最小可检测差异(MDC)= X.XX(95% 置信水平)。

九、常见错误对照表

常见错误正确做法违反原则
只报告 ICC = .85,不说明类型说明 ICC(3,1)、双向混合、绝对一致性APA 7th 要求完整报告统计量规格
用 ICC(3,1) 数值声称"可推广到其他评分者"可推广须用双向随机效应 ICC(2,1)模型假设不符
评分者有明显偏高/偏低倾向,却用一致性 ICC需关心绝对数值时,须用绝对一致性 ICC误差定义不当,ICC 虚高
实际用三人均值,却报告单次 ICC(3,1)三人均值须报告 ICC(3,3)报告单元与研究设计不匹配
未报告 95% CI补充 95% CI点估计在小样本下不可信
Pearson r 当作 ICCICC 是类内相关,Pearson r 是类间相关,含义不同指标选用错误
n = 15,就声称 ICC 良好至少 n = 30 才有窄 CI;n < 20 需说明局限小样本 CI 极宽,结论不稳

常见 FAQ

Q:ICC 和 Pearson 相关系数有什么区别,不能用 Pearson r 替代吗?

A:不能替代。Pearson r 只检验两列数据的线性关联方向和强度,对系统性偏差完全不敏感——评分者 A 总给出比评分者 B 高 20 分的结果,Pearson r 仍然可能是 1.00,但 ICC(绝对一致性)会因系统偏差而显著下降。ICC 用于评估"测量值可互换"的程度,Pearson r 不具备这一属性。APA 及大多数信度研究规范要求在信度场景下使用 ICC,而非 Pearson r。

Q:双向随机(ICC 2)和双向混合(ICC 3)的一致性版本数值完全一样,区别到底在哪?

A:数值确实相同(见第五节公式),区别在于理论推广性声明。ICC(2) 允许你说"若换另一组从同一总体随机抽取的评分者,信度结论仍然成立";ICC(3) 只能说"就这组特定评分者而言,信度如此"。大多数临床研究中评分者是固定的特定人员,用 ICC(3) 更诚实;若评分者由培训认证机构认定可互换,则可考虑 ICC(2)。审稿人越来越关注这一区分。

Q:重测信度应该用哪种 ICC?

A:重测信度最常用 ICC(3,1) 绝对一致性:测量时间点是固定的(不推广至任意时间点),且两次测量值必须在绝对水平上吻合,而非仅排名一致。若两次测量由不同仪器/操作者执行且这些仪器/操作者可推广至更大总体,则改用 ICC(2,1) 绝对一致性。

Q:ICC 达到多少才能在论文中声称"信度良好"?

A:Koo & Li(2016)给出最广泛引用的标准:ICC > 0.75 为好,> 0.90 为优秀。但这只是经验参考值,必须同时报告 95% CI,若 CI 下限低于 0.75,就不能简单声称"信度良好"。此外,临床诊断场景通常要求 > 0.90,科研组比较场景可接受稍低的阈值。建议在方法章节明确说明选用的解读标准及其文献来源。

Q:ChatSRS 能自动判断应该用哪种 ICC 并解释选型理由吗?

A:可以。在 chatsrs.com 中描述你的研究设计(评分者是否固定、是否关心绝对一致性、使用单次还是均值),ChatSRS 会在输出结果前先列出选型推理链,说明选用某种 ICC 的依据,方便直接写进方法章节脚注或回复审稿人。


快速参考:ICC 选型速查卡

[步骤一] 评分者设计
  每个被测者 → 不同评分者(不重复) → ICC(1,1) 或 ICC(1,k)
  所有被测者 → 同一组评分者       → 进步骤二

[步骤二] 评分者可推广性
  评分者可推广至总体(随机抽取)   → 双向随机: ICC(2,?) → 进步骤三
  评分者固定、不可推广             → 双向混合: ICC(3,?) → 进步骤三

[步骤三] 一致性类型
  只要排名一致,允许系统偏差       → Consistency (一致性)
  数值必须完全吻合,不允许偏差     → Absolute Agreement (绝对一致性)

[步骤四] 测量单元
  实际用单次测量值                 → 单次: ICC(X,1)
  实际用 k 次均值                  → 均值: ICC(X,k)

[结果] APA 报告必须包含:
  ICC 类型 + 点估计(两位小数)+ 95% CI + 信度水平判断 + 文献依据
  例: ICC(3,1) = .924, 95% CI [.872, .956],信度优秀(Koo & Li, 2016)

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内「用户中心 -> 帮助与反馈」联系我们。