统计百科 ·

ICC(2,k)评分者一致性的APA报告规范 — 多评分者聚合、95%CI与.68/.75/.90阈值完全解析

统计百科:ICC(2,k)多评分者聚合型信度的APA 7th完整报告规范——模型选择逻辑、k值对ICC的影响、95%CI必填格式、.68/.75/.90阈值的学术出处与正确使用场景,给出可直接套进论文的分情境报告句式。

ICC报告最常见的两类错误:一是把k=2时的ICC(2,1)和ICC(2,2)混用,二是援引".68合格"但说不清出处。本文专攻多评分者聚合场景的ICC(2,k)——当你有3位、4位甚至更多评分者,并以他们的均值作为最终数据时,该怎么选模型、怎么写报告、怎么正确引用阈值标准,给出可抄进论文的完整APA 7th句式。


你的ICC(2,k)报告有这些问题吗?

审稿人或导师关于多评分者ICC报告最常见的反馈:

  • "有3位评分者并取了均值,但报告的是ICC(2,1)——这两个指标含义不同,请核查"
  • "ICC(2,k)的k值没有说明,读者无法核实计算是否正确"
  • "引用'.68为可接受信度',但Koo & Li(2016)的阈值是.75,请核查文献来源"
  • "95%置信区间只写了点估计,没有CI,信度评估不完整"
  • "三位评分者的信度ICC(2,3) = .91,但评分者的背景、培训时长和分歧处理方式未说明"
  • "Consistency模型和Absolute Agreement模型的选择未做说明,两者结果差距可达.05-.10"

以上问题在涉及3位以上评分者的论文中尤为集中,原因是统计软件(SPSS/R)默认输出的是单测量者ICC(2,1),而多数研究实际使用的是平均分。软件输出和论文所用分数之间的这一错位,是ICC报告中最隐蔽也最常见的错误。


一、ICC(2,k)与ICC(2,1):核心区别

关键原则:你用的是哪种分数

ICC报告的基本逻辑只有一条:你在后续分析中实际使用的是哪种分数,就报哪种ICC。

实际使用的分数应报告的ICC含义
只用一位评分者的分数ICC(2,1)单一测量者信度
取2位评分者的均值ICC(2,2)双评分者均值信度
取3位评分者的均值ICC(2,3)三评分者均值信度
取k位评分者的均值ICC(2,k)k位评分者均值信度

Spearman-Brown预言公式描述了两者的关系:

$ICC(2,k) = \frac{k \cdot ICC(2,1)}{1 + (k-1) \cdot ICC(2,1)}$

这个公式有两个直接推论:

  1. ICC(2,k) > ICC(2,1)(k > 1时均成立)——多评分者取均值总是比单评分者更可靠
  2. 边际收益递减——从k=1到k=2的收益最大,从k=4到k=5的收益已很小
ICC(2,1)ICC(2,2)ICC(2,3)ICC(2,4)ICC(2,5)
.50.667.750.800.833
.60.750.818.857.882
.70.824.875.903.921
.75.857.900.923.938
.80.889.923.941.952

上表清晰显示:ICC(2,1) = .70时,取2位评分者均值即可达到ICC(2,2) = .824(良好水平);取3位均值达ICC(2,3) = .875。这也是为什么很多研究选择2-3位评分者——性价比最高的区间。


二、模型选择:为什么大多数研究用Two-Way Mixed

三种方差模型的本质差异

模型简称评分者来源假设适用情形
One-Way Random(ICC(1,k))OWR每个对象由不同的随机评分者独立评定多评委选秀,每轮评委不同;不常见
Two-Way Mixed(ICC(2,k))TWM评分者固定,被评对象是随机样本最常用:固定的研究员/编码员评全部样本
Two-Way Random(ICC(3,k))TWR评分者和对象均为随机样本需要将信度推广到其他评分者总体

为什么多数研究选ICC(2,k):

内容分析、临床测量、行为观察中,评分者通常是研究者本人或经过专项培训的固定成员,并不是从评分者总体中随机抽取的。"被评材料是随机样本,评分者是固定的"——这正是Two-Way Mixed模型的假设,因此ICC(2,k)是大多数社会科学、心理学、医学研究的默认选择。

一致性(Consistency)vs 绝对一致性(Absolute Agreement)

同一个ICC(2,k)模型还分两种子类型:

子类型公式分母中包含适用情形
Consistency评分者效应不进入误差允许评分者系统性偏高/偏低;只需趋势一致
Absolute Agreement评分者效应进入误差要求评分者给出接近的绝对数值

选择标准:

  • 行为观察、内容分析编码(如"情绪强度1-5分"):Consistency——评分者偏高偏低可以标准化,趋势一致即可
  • 临床量表、仪器比对(如血压、量角器测量):Absolute Agreement——数值必须吻合,系统偏差有实质影响
  • 不确定时:报告Absolute Agreement(更保守,审稿人更难挑剔)

注意:同一数据集,Consistency > Absolute Agreement,差距通常在.03-.08之间。必须在方法章节明确说明使用了哪种子类型。


三、APA 7th必报要素:ICC(2,k)完整清单

五要素框架

#要素格式示例
1ICC类型(含k值和一致性类型)ICC(模型, k),说明Consistency/Absolute AgreementICC(2,3),绝对一致性
2ICC点估计ICC = .XXX(三位小数,不加前导零)ICC = .883
395%置信区间95% CI [.XXX, .XXX]95% CI [.813, .929]
4信度水平解读阈值标准 + 分类描述语Good(Koo & Li,2016)
5样本量与评分者数n = XX个被评对象,k = XX位评分者n = 50,k = 3

精度要求

  • ICC值精确到三位小数:ICC = .883,不写.88或.8832
  • 95% CI上下限各精确到三位小数:95% CI [.813, .929]
  • 若CI包含.00或下限为负值,必须报告并解释样本量不足
  • 方法章节需说明:模型选择理由 + 一致性类型选择理由 + 阈值来源引用

四、.68、.75、.90阈值:学术出处完全梳理

这是ICC报告中引用最混乱的地方。".68为可接受信度"这一说法出处有限且存在误用风险,以下逐一说明。

主流阈值体系对照

来源< .50.50-.75.75-.90> .90
Koo & Li (2016) — 最常引用PoorModerateGoodExcellent
Cicchetti (1994) — 临床PoorFairGoodExcellent
Portney & Watkins (2009) — 物理治疗PoorModerateGoodExcellent

.68阈值的真实来源

".68"这一截断值在ICC文献中的出现背景较为特殊,有以下几种可追溯来源:

来源一:Landis & Koch (1977) 的 Kappa 体系

Landis & Koch(1977)针对 Cohen's Kappa(类别变量信度)提出了六级体系:< .00(差)/ .00-.20(轻微)/ .21-.40(一般)/ .41-.60(中等)/ .61-.80(实质性)/ .81-1.00(几乎完全一致)。.61的下限被部分研究者约近为".60-.68区间可接受",但该体系专为Kappa设计,不适用于ICC连续变量。直接将.68套用到ICC会造成标准误用。

来源二:部分教育测量文献的约定俗成

在早期教育测量和心理测量文献(1970-1990年代)中,"r ≥ .70"或"r ≥ .68"被用作相关系数的"可接受"临界值,某些作者将其延伸到ICC场景,但缺乏严格的理论推导。

来源三:特定领域的局部约定

少数神经科学和行为遗传学文献使用.68(即h² = .46的平方根近似)作为遗传力指标的约定,与ICC评分者信度场景无关。

实践建议

研究领域推荐阈值推荐引用
心理学、社会学、教育学Good: ≥ .75;Excellent: > .90Koo & Li (2016)
临床医学、康复临床可用: ≥ .90Portney & Watkins (2009)
内容分析、编码员信度≥ .75通常被接受Koo & Li (2016)
探索性研究(须说明局限)≥ .50(Moderate)可发表,须加讨论Koo & Li (2016)

若你的ICC落在.68-.75区间,不要引用Landis & Koch(1977)为ICC背书(该文献适用对象是Kappa)。正确做法是:引用Koo & Li(2016),如实报告为Moderate,在讨论章节说明信度局限对结论的影响,并分析是否可以增加评分者或样本量。


五、分情境完整APA报告模板

场景一:两位评分者,取均值,ICC(2,2)

情形:内容分析,2名编码员独立编码,最终取两人均值,共40个分析单元,绝对一致性模型。

报告模板:

两名编码员对[X]类别进行独立编码,最终取两位编码员的均值作为
后续分析数据,评分者信度采用双向混合模型平均评分者组内相关系数
[ICC(2,2),绝对一致性]评估(Koo & Li,2016)。结果显示
ICC(2,2) = .XXX(95% CI [.XXX, .XXX],n = XX),
依据Koo与Li(2016)的分类标准,属于[良好/优秀]信度水平。
编码分歧通过讨论协商解决,最终采用协商一致后的均值。

数值示例:

两名经过16小时培训的编码员对40篇媒体报道进行独立语调评分(1-7分),最终取两位编码员的均值作为后续分析数据。评分者信度采用双向混合模型平均评分者组内相关系数ICC(2,2),绝对一致性模型评估。结果显示ICC(2,2) = .912(95% CI [.837, .953],n = 40),依据Koo与Li(2016)的分类标准属于优秀信度水平。评分分歧(|差值| > 1分)占总样本5%,通过研究者协商解决。


场景二:三位评分者,取均值,ICC(2,3)

情形:行为观察研究,3位评分者对视频独立评分,取三人均值,共50段视频,绝对一致性模型。

报告模板:

三名评分者对[X]进行独立评定,最终取三位评分者的均值作为分析数据。
评分者信度采用双向混合模型平均评分者组内相关系数[ICC(2,3),绝对一致性]评估。
结果显示ICC(2,3) = .XXX(95% CI [.XXX, .XXX],n = XX),
依据Koo与Li(2016)的分类标准属于[良好/优秀]信度水平,
表明三位评分者的平均评分具有充分的一致性,可支持后续分析效度。

数值示例:

三名经过8小时培训的观察者对50段课堂互动视频进行独立编码(教师反馈质量1-4分),最终取三位观察者的均值。评分者信度采用ICC(2,3),绝对一致性模型。结果显示ICC(2,3) = .883(95% CI [.813, .929],n = 50),依据Koo与Li(2016)的分类标准属于良好信度水平。三位观察者评分分歧(同一片段分歧 > 1分)占总样本8%,通过三方协商解决。


场景三:四位及以上评分者,ICC(2,k)通用写法

情形:质量评估项目,k=4位专家评委,取均值,n=60个评估对象,一致性(Consistency)模型。

报告模板:

[k]位评委对[X]进行独立评分,最终取[k]位评委均值作为分析数据。
评分者信度采用双向混合模型平均评分者组内相关系数ICC(2,[k]),
一致性/绝对一致性模型评估。结果显示ICC(2,[k]) = .XXX
(95% CI [.XXX, .XXX],n = XX),依据Koo与Li(2016)属于[分类]信度水平。

数值示例(k=4,Consistency):

四位专家评委对60份创业计划书进行独立质量评分(1-10分),取四位评委均值作为最终分析数据。评分者信度采用ICC(2,4),一致性模型评估(允许评委之间存在宽严程度的系统差异)。结果显示ICC(2,4) = .941(95% CI [.912, .961],n = 60),依据Koo与Li(2016)的分类标准属于优秀信度水平,表明四位评委对创业计划书质量的相对判断高度一致。


场景四:ICC落在.68-.75区间,如何写讨论

这种情况审稿人最易挑战,需要在讨论章节主动说明:

本研究评分者信度ICC(2,k) = .XXX(95% CI [.XXX, .XXX]),
依据Koo与Li(2016)的分类标准属于中等水平(Moderate,.50-.75)。
造成信度未达良好(Good,≥ .75)的可能原因包括:[列举原因,如
评分维度主观性强、评分者背景差异、样本量有限导致CI宽等]。
本研究已在可行范围内尽量提高评分者一致性(培训X小时、联合评分X个校准样本);
后续研究建议增加评分者数量至k ≥ 3,以利用Spearman-Brown效应提升均值信度,
或进一步细化评分标准以降低评分者分歧。

六、在chatsrs.com一句话获得规范ICC(2,k)报告

打开 chatsrs.com,上传数据后输入:

"对3位评分者的评分数据做ICC信度评估,使用双向混合模型绝对一致性ICC(2,3)(因为后续分析使用三人均值);输出ICC点估计(三位小数)、95%置信区间、F值和p值;依据Koo & Li(2016)解读信度水平(< .50差/.50-.75中等/.75-.90良好/> .90优秀);给出符合APA 7th格式的完整报告段落,包含评分者数k=3、被评对象数n、一致性类型说明和方法章节描述。"

ChatSRS输出段落即为上文示例格式,ICC(2,k)中的k值和n值自动从你上传的数据中读取,可直接复制进论文。

若需ICC(2,1)与ICC(2,k)对比输出(帮助判断是否值得增加评分者),在指令中加一句"同时输出ICC(2,1)作为对比,并说明k位评分者取均值后信度的提升幅度"。


七、方法章节完整写法模板

ICC(2,k)标准方法章节描述

信度分析

[k]名[背景描述,如"经过XX小时培训的编码员/观察者/评委"]对[n]个
[被评对象描述]进行独立评分([评分维度及量表类型])。
正式评分前,[k]名评分者完成了[N小时/N项]培训,并对[n_cal]个校准样本
进行联合讨论以统一评分标准。正式评分阶段,[k]名评分者互相独立,
互不知晓对方结果。最终分析数据为[k]位评分者评分的均值。

评分者信度采用双向混合模型平均评分者组内相关系数[ICC(2,[k]),
绝对一致性/一致性]评估(Koo & Li,2016)。模型选择依据:
评分者为固定成员(非随机抽样),被评对象为随机样本,
符合Two-Way Mixed模型的假设;选用绝对一致性/一致性模型,
以[严格衡量评分者数值吻合程度/允许评分者宽严差异而只关注相对排序]。
信度水平判断依据Koo与Li(2016):ICC < .50为差,.50-.75为中等,
.75-.90为良好,> .90为优秀。统计分析使用ChatSRS(R引擎),
显著性水平设为alpha = .05。

八、常见错误对照表

常见错误正确写法说明
取了3人均值但报ICC(2,1)取均值应报ICC(2,3)k与实际使用的分数必须一致
"ICC(2,k)信度良好"不写k的具体数值ICC(2,3) = .883,k = 3k值影响ICC的大小,必须明确
只写ICC点估计,不写95%CIICC(2,3) = .883(95% CI [.813, .929])APA要求报告不确定性范围
援引Landis & Koch (1977) 为ICC背书引用Koo & Li (2016)Landis & Koch适用于Kappa,非ICC
"ICC > .68即可接受"无正式文献支持引用Koo & Li (2016)的.75阈值.68在ICC场景无公认文献来源
ICC = .88写成ICC = 0.88ICC = .880(三位小数,不加前导零)APA格式不加前导零
Consistency与Absolute Agreement不说明明确写出"一致性"或"绝对一致性"两者结果差异可达.05-.10
方法章节未说明评分者培训与分歧处理说明培训时长和分歧解决流程评分者信度的可重复性要求

FAQ

Q:ICC(2,k)中k的上限是多少,评分者越多越好吗?

A:理论上k越大ICC(2,k)越高,但边际收益递减。由Spearman-Brown公式可知,从k=4增加到k=5,ICC提升幅度通常不超过.01-.02。实践中推荐2-3位评分者(信度提升幅度最大、操作成本合理)。k>5在大多数社会科学研究中不常见,且在样本量有限时反而会减少每位评分者的评分数量,影响CI的精度。建议先用ICC(2,1)评估单评分者基准,再决定是否值得增加评分者。

Q:我有3位评分者,但只要求其中2位评分时再找第3位复核,ICC应该怎么选?

A:若后续分析使用的是两位评分者的均值(第三位只用于分歧裁决,未进入计算),则报ICC(2,2)。若三位评分者均参与了全部材料的评分并取三人均值,则报ICC(2,3)。如果第三位只评分了部分有争议材料,不能将其纳入ICC(2,3)的计算——因为ICC要求所有被评对象均有k位评分者的完整数据。在这种不完整设计中,建议对"两位评分者均有数据"的全部材料报ICC(2,2),并在方法中说明第三位评分者的作用仅为裁决分歧。

Q:ICC(2,k) = .75正好在Good的边界,审稿人会不会觉得不够?

A:.75恰好是Koo & Li(2016)Good等级的下限,属于"刚刚达标"。建议在报告中加上完整95%CI:若CI下限 ≥ .70,可以这样表述:"ICC(2,3) = .750(95% CI [.703, .809]),达到良好信度水平(Koo & Li,2016)。"若CI下限低于.70(如95% CI [.62, .84]),说明不确定性较高,审稿人可能要求增加样本量。在讨论章节主动说明ICC的局限性,并指出若增加样本量(从n=30到n=50),CI宽度预计缩窄至±.05,更能支持信度结论,这样的论文姿态通常会获得审稿人认可。

Q:SPSS和R输出的ICC是否相同,我该信哪个?

A:SPSS的Reliability(信度分析)模块输出ICC(2,1)和ICC(2,k),R的irr包、psych包均可输出ICC。两个软件在双向混合绝对一致性和一致性两个子类型上的计算公式完全相同,数值差异通常在小数点后第四位以下(舍入误差),可以互相验证。区别在于:SPSS默认输出两种类型(Consistency + Absolute Agreement),而R的irr::icc函数需要指定参数type和model。建议使用ChatSRS(R引擎)一键输出,并在方法章节注明分析工具。


快速参考:ICC(2,k)报告格式速查卡

[k位评分者,取均值,双向混合,绝对一致性]
ICC(2,k) = .XXX(95% CI [.XXX, .XXX],n = XX,k = X)
信度水平: [Moderate/Good/Excellent](Koo & Li, 2016)

[阈值参考 Koo & Li (2016)]
< .50 = Poor(差)
.50-.75 = Moderate(中等)——不应引用Landis & Koch为此背书
.75-.90 = Good(良好)——多数期刊最低合格线
> .90 = Excellent(优秀)——临床/仪器比对推荐水平

[Spearman-Brown预估:给定ICC(2,1)时k位评分者的ICC(2,k)]
ICC(2,k) = k * ICC(2,1) / [1 + (k-1) * ICC(2,1)]

[方法章节三要素]
1. ICC(2,k)完整型号(含一致性类型)
2. 模型选择理由(Two-Way Mixed / Consistency vs Absolute Agreement)
3. 信度阈值引文(Koo & Li, 2016)

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。