统计百科 ·
组内相关系数 ICC 有哪几种?该选哪个?ICC(1)/(2,k)/(3,k) 类型完全指南
统计百科:系统梳理 ICC 的六种模型(单向/双向 × 单次/均值 × 一致/绝对一致),说清 ICC(1)、ICC(2,1)、ICC(2,k)、ICC(3,1)、ICC(3,k) 的适用前提、公式差异与 APA 7th 报告写法,附可直接套用的论文句式和 ChatSRS 实操指令。
ICC(Intraclass Correlation Coefficient,组内相关系数)是评估测量一致性与可靠性的核心指标,广泛用于评分者间信度、重测信度、仪器校准等场景。但 ICC 并非一个单一指标,而是一个"6 格"模型族。不同选择直接影响 ICC 数值与可发表性——很多论文因为选错模型被审稿人退回。本文系统梳理 ICC 的六种形态,给出一张"三步选型决策树",并附可直接抄进论文的 APA 7th 格式句式。
你选对 ICC 了吗?
审稿人关于 ICC 最常见的批注:
- "请说明使用的是哪种 ICC 模型(单向/双向随机/双向混合)"
- "评分者是否可推广至总体?如不能,应使用双向混合效应而非双向随机效应"
- "报告的 ICC 是单次测量还是平均测量?请与研究设计保持一致"
- "一致性 ICC 和绝对一致性 ICC 含义不同,请说明选择依据"
- "ICC 数值未报告置信区间,请补充 95% CI"
这些批注背后,是 Shrout & Fleiss(1979)经典分类框架和 Koo & Li(2016)操作指南——两篇加起来被引超 25000 次的文献中的核心区分。本文把这些内容拆解成可操作的决策步骤。
一、ICC 是什么:从"组间 vs 组内"到"一致性"
直觉含义
ICC 回答的问题是:在总变异中,有多大比例来自研究对象(被测者)之间的真实差异,而不是测量误差?
$\text{ICC} = \frac{\sigma^2_{\text{subjects}}}{\sigma^2_{\text{subjects}} + \sigma^2_{\text{error}}}$
- ICC = 0:所有变异都来自测量误差,评分毫无价值
- ICC = 1:所有变异都来自被测者的真实差异,测量完全可靠
- ICC > 0.75:通常视为"好"的信度;> 0.90 视为"优秀"(Koo & Li, 2016)
为什么 ICC 有多种
问题的关键在于:"误差"包括什么?
不同研究设计下,"误差"的构成不同:
| 误差来源 | 说明 |
|---|---|
| 评分者差异(系统偏差) | 某评分者普遍打分偏高/偏低 |
| 随机测量误差 | 同一评分者不同次测量的随机波动 |
| 被测者×评分者交互 | 某评分者对特定被测者特别严/松 |
把哪些误差纳入分母,就决定了你得到的是哪种 ICC。
二、Shrout & Fleiss 六格框架:三维度两两组合
ICC 由三个维度的选择决定,每个维度各两个选项:
维度 1:模型(效应结构)
| 模型 | 描述 | 代号 |
|---|---|---|
| 单向随机效应 | 每个被测者由不同的随机抽样评分者评定,评分者不重复 | One-Way |
| 双向随机效应 | 所有被测者由相同的一组评分者评定,该组评分者是从更大总体中随机抽取的,结果可推广 | Two-Way Random |
| 双向混合效应 | 所有被测者由相同的一组评分者评定,该组评分者就是研究中特定的固定评分者,结果不推广至其他评分者 | Two-Way Mixed |
关键判断:你的评分者(或测量时间点/仪器)是否可以推广至一个更大的评分者总体?
- 可以 → 双向随机效应
- 不可以(就是这几个特定的人/时间/仪器)→ 双向混合效应
- 每个被测者由不同评分者评定 → 单向随机效应
维度 2:测量单元
| 测量单元 | 描述 | 代号 |
|---|---|---|
| 单次测量 | 信度来自单次评分,ICC 反映单次测量的可靠性 | Single |
| 均值测量 | 信度来自 k 次测量均值,ICC 反映 k 次均值的可靠性(更高) | Average(k次) |
关键判断:你在实际研究中使用的是单次测量值,还是多次测量的平均值?
- 用单次值 → 报告单次测量 ICC
- 用均值 → 报告均值测量 ICC(通常更高,因均值削减了随机误差)
维度 3:一致性定义(仅双向模型适用)
| 一致性类型 | 描述 | 公式差异 |
|---|---|---|
| 一致性(Consistency) | 评分者之间的排名顺序是否一致,允许系统性偏差(一个人总打高分但排名一致) | 不把评分者系统偏差算入误差 |
| 绝对一致性(Absolute Agreement) | 评分值本身是否完全相同,不允许系统性偏差 | 把评分者系统偏差算入误差 |
关键判断:你关心的是"评分者排名一致就行",还是"评分者给出的绝对数值必须吻合"?
- 只要排名一致即可(如判断哪组患者病情更重)→ 一致性
- 数值本身必须吻合(如仪器读数是否可互换、量表分数是否可跨评分者直接比较)→ 绝对一致性
三、六种 ICC 一览表
三维度两两组合,得到 2×2×(单/双)共六种 ICC(Shrout & Fleiss,1979,括号记法):
| Shrout & Fleiss | 现代简写 | 模型 | 测量单元 | 一致性类型 |
|---|---|---|---|---|
| ICC(1,1) | ICC(1) | 单向随机 | 单次 | — |
| ICC(1,k) | ICC(1,k) | 单向随机 | k次均值 | — |
| ICC(2,1) | ICC(2) | 双向随机 | 单次 | 绝对一致性(亦有一致性变体) |
| ICC(2,k) | ICC(2,k) | 双向随机 | k次均值 | 绝对一致性(亦有一致性变体) |
| ICC(3,1) | ICC(3) | 双向混合 | 单次 | 一致性 |
| ICC(3,k) | ICC(3,k) | 双向混合 | k次均值 | 一致性 |
注:双向模型(ICC 2/3)还有"绝对一致性"变体,记为 ICC(2,1) agreement vs. consistency。现代统计软件(SPSS、R 的 irr/irrNA 包)通常分别输出 consistency 和 agreement 两个版本。
四、三步决策树:选哪种 ICC
Step 1 — 评分者设计
|
|-- A. 每个被测者由不同评分者评定(评分者不重复)
| --> 单向随机效应: ICC(1,1) 或 ICC(1,k)
|
|-- B. 所有被测者由同一组评分者评定
|
Step 2 — 评分者是否可推广?
|
|-- 可推广至更大总体(随机抽取的评分者)
| --> 双向随机效应: ICC(2,1) 或 ICC(2,k)
|
|-- 不可推广(特定固定评分者/固定时间点)
--> 双向混合效应: ICC(3,1) 或 ICC(3,k)
|
Step 3 — 一致性要求
|
|-- 只要排名一致(允许系统偏差)
| --> Consistency: ICC(3,1)C 或 ICC(3,k)C
|
|-- 数值必须完全吻合(不允许系统偏差)
--> Absolute Agreement: ICC(3,1)A 或 ICC(3,k)A
(在 Step 2 双向随机中同样适用此区分)
最常见场景快速对应
| 研究场景 | 推荐 ICC |
|---|---|
| 两位评分者分别给同一批患者评分,要判断仪器是否可互换 | ICC(2,1) 绝对一致性 |
| 三位临床医生用固定量表评估同一批患者,关心排名是否一致 | ICC(3,1) 一致性 |
| 重测信度:同一受试者隔两周由同一仪器测量两次 | ICC(3,1) 绝对一致性 |
| 训练过的固定评分小组(5人)给所有样本评分,结果不推广 | ICC(3,k) 一致性 |
| 从评分者库中随机抽取评分者,结果需可推广 | ICC(2,1) 或 ICC(2,k) |
| 每份作文由不同的一位随机评分者打分 | ICC(1,1) |
五、公式剖析:误差分母的差异
以双向设计为例,理解三种 ICC 在分母上的差异:
设方差分解为:
- $MS_{BMS}$:被测者间均方(Between Measurement Subject)
- $MS_{WMS}$:被测者内均方
- $MS_{BRS}$:评分者间均方(Between Raters)
- $MS_{EMS}$:误差均方(Residual)
- $n$:被测者数,$k$:评分者数
ICC(3,1) — 双向混合,单次,一致性
$\text{ICC}(3,1) = \frac{MS_{BMS} - MS_{EMS}}{MS_{BMS} + (k-1)MS_{EMS}}$
分母不含 $MS_{BRS}$(评分者系统偏差不算作误差),因此即使评分者有稳定的偏高/偏低倾向,ICC 仍可能很高。
ICC(2,1) 绝对一致性 — 双向随机,单次,绝对一致
$\text{ICC}(2,1){\text{agreement}} = \frac{MS{BMS} - MS_{EMS}}{MS_{BMS} + (k-1)MS_{EMS} + \frac{k}{n}(MS_{BRS} - MS_{EMS})}$
分母包含 $MS_{BRS}$(评分者系统偏差计入误差),只要评分者之间有系统性偏差,ICC 就会下降——即使排名完全一致。
ICC(2,1) 一致性 — 双向随机,单次,一致
$\text{ICC}(2,1){\text{consistency}} = \frac{MS{BMS} - MS_{EMS}}{MS_{BMS} + (k-1)MS_{EMS}}$
与 ICC(3,1) 公式相同——这正是 Shrout & Fleiss(1979)的重要发现:当只关心一致性(不关心系统偏差)时,双向随机和双向混合的 ICC 值完全相同。两者区别仅在于可推广性的理论解释,不影响数值。
ICC(X,k) 均值版——Spearman-Brown 推论
$k$ 次均值的 ICC 通过 Spearman-Brown 公式从单次 ICC 推导:
$\text{ICC}(X,k) = \frac{k \cdot \text{ICC}(X,1)}{1 + (k-1) \cdot \text{ICC}(X,1)}$
例:ICC(3,1) = 0.60,3 位评分者均值的 ICC(3,3) = (3 × 0.60) / (1 + 2 × 0.60) = 1.80 / 2.20 = 0.818。均值测量 ICC 始终高于单次测量 ICC,使用均值时必须报告均值版 ICC,不能用单次版凑数。
六、ICC 数值解读标准
Koo & Li(2016)在 Journal of Chiropractic Medicine 发表的操作指南给出当前最广泛引用的解读标准:
| ICC 数值 | 信度水平 |
|---|---|
| < 0.50 | 差(Poor) |
| 0.50 – 0.75 | 中等(Moderate) |
| 0.75 – 0.90 | 好(Good) |
| > 0.90 | 优秀(Excellent) |
重要提醒:
- ICC 数值本身不够,必须报告 95% 置信区间(CI)。小样本下 ICC 点估计的 CI 极宽(例如 n = 20 时 ICC = 0.82,CI 可能低至 0.58),点估计毫无意义。
- 信度的实际意义还取决于研究目的:临床上用于个体诊断决策,ICC 通常需 > 0.90;用于组间比较的研究,0.70 有时可接受。
- 样本量计划:若研究目的是"验证 ICC > 0.70",使用专门的信度研究样本量公式(Walter, Eliasziw, & Donner, 1998),而非一般统计功效公式。
七、在 ChatSRS 一句话获得 ICC 分析与 APA 报告
打开 chatsrs.com,上传数据后输入:
"两位评分者对 50 份作文分别独立评分(数据在 rater1、rater2 列),评分者是固定的特定两人、结果不推广至其他评分者。我在报告中使用两人均值,但需要评分者在绝对数值上吻合(不只是排名一致)。请计算并报告对应的 ICC 类型、点估计值和 95% CI,输出符合 APA 7th 格式的完整结果句和方法章节描述。"
ChatSRS 会自动选型为 ICC(3,2) 绝对一致性,输出 SPSS 风格三线表 + APA 段落 + 置信区间,可直接复制进论文。
支持指定任意评分者数量、选择一致性/绝对一致性、输出单次或均值版 ICC,无需手动套公式。
八、APA 7th 完整报告模板
方法章节描述(双向混合,单次,绝对一致性)
采用组内相关系数(ICC)评估评分者间信度。
ICC 计算基于双向混合效应模型(two-way mixed-effects model),
以绝对一致性(absolute agreement)为一致性标准,
报告单次测量 ICC [即 ICC(3,1)]。
参照 Koo 与 Mae(2016)的解读标准:ICC < .50 为差,
.50–.75 为中等,.75–.90 为好,> .90 为优秀。
结果段落模板(单次,绝对一致性)
两位评分者对 [被测对象] 的评分显示出 [好/优秀] 的评分者间一致性,
ICC(3,1) = .XX,95% CI [.XX, .XX](Koo & Li, 2016)。
评分者 1(M = XX, SD = XX)与评分者 2(M = XX, SD = XX)
的均值差异未达显著,t([n-1]) = X.XX, p = .XXX,
表明两位评分者在绝对评分水平上亦保持一致。
填入数值的示例:
两位评分者对 50 份作文的评分者间信度分析结果显示,评分者间一致性为优秀,ICC(3,1) = .924,95% CI [.872, .956](Koo & Li, 2016)。评分者 1(M = 74.3,SD = 11.2)与评分者 2(M = 73.8,SD = 11.6)的均值差异未达显著,t(49) = 0.63,p = .532,表明两位评分者在绝对评分水平上亦保持一致。
结果段落模板(均值,一致性)
三位评分者对 [被测对象] 的评分基于双向混合效应模型(一致性),
三人均值的组内相关系数 ICC(3,3) = .XX,95% CI [.XX, .XX],
信度水平为 [好/优秀](Koo & Li, 2016)。
填入数值的示例:
三位评分者对患者步态的评分者间信度采用三人均值计算,ICC(3,3) = .891,95% CI [.832, .931],信度水平为好(Koo & Li, 2016)。
重测信度模板(双向混合,单次,绝对一致性)
重测信度通过间隔 [X] 周的两次测量计算,采用双向混合效应绝对一致性 ICC,
ICC(3,1) = .XX,95% CI [.XX, .XX],
两次测量均值差异为 X.XX(95% CI [X.XX, X.XX]),
标准测量误差(SEM)= X.XX,最小可检测差异(MDC)= X.XX(95% 置信水平)。
九、常见错误对照表
| 常见错误 | 正确做法 | 违反原则 |
|---|---|---|
| 只报告 ICC = .85,不说明类型 | 说明 ICC(3,1)、双向混合、绝对一致性 | APA 7th 要求完整报告统计量规格 |
| 用 ICC(3,1) 数值声称"可推广到其他评分者" | 可推广须用双向随机效应 ICC(2,1) | 模型假设不符 |
| 评分者有明显偏高/偏低倾向,却用一致性 ICC | 需关心绝对数值时,须用绝对一致性 ICC | 误差定义不当,ICC 虚高 |
| 实际用三人均值,却报告单次 ICC(3,1) | 三人均值须报告 ICC(3,3) | 报告单元与研究设计不匹配 |
| 未报告 95% CI | 补充 95% CI | 点估计在小样本下不可信 |
| Pearson r 当作 ICC | ICC 是类内相关,Pearson r 是类间相关,含义不同 | 指标选用错误 |
| n = 15,就声称 ICC 良好 | 至少 n = 30 才有窄 CI;n < 20 需说明局限 | 小样本 CI 极宽,结论不稳 |
常见 FAQ
Q:ICC 和 Pearson 相关系数有什么区别,不能用 Pearson r 替代吗?
A:不能替代。Pearson r 只检验两列数据的线性关联方向和强度,对系统性偏差完全不敏感——评分者 A 总给出比评分者 B 高 20 分的结果,Pearson r 仍然可能是 1.00,但 ICC(绝对一致性)会因系统偏差而显著下降。ICC 用于评估"测量值可互换"的程度,Pearson r 不具备这一属性。APA 及大多数信度研究规范要求在信度场景下使用 ICC,而非 Pearson r。
Q:双向随机(ICC 2)和双向混合(ICC 3)的一致性版本数值完全一样,区别到底在哪?
A:数值确实相同(见第五节公式),区别在于理论推广性声明。ICC(2) 允许你说"若换另一组从同一总体随机抽取的评分者,信度结论仍然成立";ICC(3) 只能说"就这组特定评分者而言,信度如此"。大多数临床研究中评分者是固定的特定人员,用 ICC(3) 更诚实;若评分者由培训认证机构认定可互换,则可考虑 ICC(2)。审稿人越来越关注这一区分。
Q:重测信度应该用哪种 ICC?
A:重测信度最常用 ICC(3,1) 绝对一致性:测量时间点是固定的(不推广至任意时间点),且两次测量值必须在绝对水平上吻合,而非仅排名一致。若两次测量由不同仪器/操作者执行且这些仪器/操作者可推广至更大总体,则改用 ICC(2,1) 绝对一致性。
Q:ICC 达到多少才能在论文中声称"信度良好"?
A:Koo & Li(2016)给出最广泛引用的标准:ICC > 0.75 为好,> 0.90 为优秀。但这只是经验参考值,必须同时报告 95% CI,若 CI 下限低于 0.75,就不能简单声称"信度良好"。此外,临床诊断场景通常要求 > 0.90,科研组比较场景可接受稍低的阈值。建议在方法章节明确说明选用的解读标准及其文献来源。
Q:ChatSRS 能自动判断应该用哪种 ICC 并解释选型理由吗?
A:可以。在 chatsrs.com 中描述你的研究设计(评分者是否固定、是否关心绝对一致性、使用单次还是均值),ChatSRS 会在输出结果前先列出选型推理链,说明选用某种 ICC 的依据,方便直接写进方法章节脚注或回复审稿人。
快速参考:ICC 选型速查卡
[步骤一] 评分者设计
每个被测者 → 不同评分者(不重复) → ICC(1,1) 或 ICC(1,k)
所有被测者 → 同一组评分者 → 进步骤二
[步骤二] 评分者可推广性
评分者可推广至总体(随机抽取) → 双向随机: ICC(2,?) → 进步骤三
评分者固定、不可推广 → 双向混合: ICC(3,?) → 进步骤三
[步骤三] 一致性类型
只要排名一致,允许系统偏差 → Consistency (一致性)
数值必须完全吻合,不允许偏差 → Absolute Agreement (绝对一致性)
[步骤四] 测量单元
实际用单次测量值 → 单次: ICC(X,1)
实际用 k 次均值 → 均值: ICC(X,k)
[结果] APA 报告必须包含:
ICC 类型 + 点估计(两位小数)+ 95% CI + 信度水平判断 + 文献依据
例: ICC(3,1) = .924, 95% CI [.872, .956],信度优秀(Koo & Li, 2016)
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内「用户中心 -> 帮助与反馈」联系我们。