统计百科 ·

组内相关系数ICC的APA报告怎么写?ICC(2,k)、95%CI、评分者信度格式全解

统计百科:专攻ICC组内相关系数APA 7th报告格式——ICC(2,k)类型选择、95%置信区间、评分者一致性阈值(ICC≥.68/.75/.90),给出可直接套用论文的完整报告模板,并盘点审稿人最常挑的ICC格式错误。

论文里的评分者信度让人头疼,不在于跑统计,而在于格式细节:ICC要选哪种类型、(2,1)和(2,k)有什么区别、95%置信区间怎么报、信度阈值.68/.75/.90哪个标准算过关、方法章节怎么说明……这篇文章专攻"ICC到底怎么规范写进论文"这一具体格式点,给出APA 7th所有评分者信度场景的完整模板,并逐一盘点审稿人最常挑的格式错误。


你的ICC报告有这些问题吗?

审稿人或导师关于ICC报告最常见的反馈:

  • "ICC类型没有说明,是one-way还是two-way、一致性还是绝对一致?"
  • "单个评分者信度ICC(2,1)和平均评分者信度ICC(2,k)不一样,请说明你用的哪个"
  • "ICC值只报到两位小数,需要报告95%置信区间"
  • "信度阈值说'ICC > 0.7即可接受',但没有引用判断标准的文献"
  • "ICC = 0.82是好的信度,但样本量只有8人,可信区间极宽,请补充CI"
  • "评分者是随机抽样还是固定评分者?这决定ICC用Mixed还是Random模型"

这些错误集中在Koo & Li(2016)、Shrout & Fleiss(1979)以及APA Publication Manual第七版关于信度报告的多个章节,但专门针对ICC汇总的实操指南并不多。本文只讲一件事:ICC到底怎么规范写进论文的每一种场景

如果你还没看过姊妹篇 F值的APA 7th报告写法,建议先读那篇,本文默认你已了解p值不加前导零(.032而非0.032)等基础格式规则,不再重复。


一、ICC是什么,与Pearson r、Kappa有什么区别

ICC统计量的直觉含义

ICC(Intraclass Correlation Coefficient,组内相关系数)回答的问题是:不同评分者对同一对象的评分,有多少比例的变异来自对象本身(真实差异),而非评分者误差?

$ICC = \frac{\sigma^2_{subjects}}{\sigma^2_{subjects} + \sigma^2_{error}}$

  • ICC = 1 表示所有变异都来自被评对象,评分者完全一致
  • ICC = 0 表示被评对象之间毫无差异,所有变异都是评分者误差
  • ICC越接近1,评分者信度越高

ICC与Pearson r的关系:Pearson r测量的是两变量的线性关联,忽略均值差异。当评分者数量k=2时,ICC(2,1)一致性(consistency)模型等价于Pearson r;k>2时两者不等价。ICC(2,1)绝对一致性(absolute agreement)模型额外惩罚评分者均值的系统性偏差。这就是为什么ICC更严格,适合评估"两位评分者能否给出相同数值",而Pearson r只衡量"两者是否高度线性相关"。

ICC与Cohen's Kappa的关系:Kappa用于类别变量(分类型评分),ICC用于连续型或有序多分变量。等距量表、李克特量表、计量单位的评分者一致性,应选ICC,而非Kappa。

ICC用在哪些场景

场景ICC的含义
编码员信度(内容分析)两位及以上编码员的编码一致性
临床量表重测信度同一量表两次施测的稳定性
多评分者评定多位评委对同一受试者的打分一致性
仪器/设备重复测量同一仪器多次测量的再现性
观察者间信度行为观察编码的评分者一致性

二、ICC模型选择:(1,1)、(2,1)、(3,1)与(1,k)、(2,k)、(3,k)

这是ICC报告里最容易出错的地方,也是审稿人最常挑的问题。

三种方差分析模型

模型评分者来源适用情形
One-Way Random(单向随机,Model 1)每个对象由不同的随机评分者评定不同论文用不同审稿人;评分者随机抽样且不固定
Two-Way Mixed(双向混合,Model 2)评分者固定,但被评对象是随机样本固定的两位编码员评所有材料;研究者自己是评分者
Two-Way Random(双向随机,Model 3)评分者和对象均为随机样本目标是推广到其他评分者总体;评分者也是抽样来的

实践中最常用:Model 2(Two-Way Mixed),因为大多数研究都有固定评分者(研究者本人或受训编码员),被评材料才是随机样本。

(,1) vs (,k):单个评分者 vs 平均评分者

表达形式含义适用情形
ICC(2,1)单个评分者给一个对象评分的信度实际使用时只用1位评分者的分数
ICC(2,k)k位评分者平均分的信度实际使用时取多位评分者的平均分

关键原则:你在正式分析中用的是哪种分数,就报哪种ICC。若两位编码员各自独立评分后取平均,则信度报ICC(2,2);若实际用其中一位的分数,则报ICC(2,1)。

Spearman-Brown公式揭示了两者的关系:ICC(2,k) > ICC(2,1)。用k=2时,ICC(2,2)通常比ICC(2,1)高约20-30%。这不是"刷高信度",而是反映了"两个评分者取平均后误差更小"的客观事实。

一致性(Consistency)vs 绝对一致性(Absolute Agreement)

类型包含评分者偏差解读
Consistency不惩罚均值差异评分者打分趋势一致即可,允许系统性偏高/偏低
Absolute Agreement惩罚均值差异评分者必须给出接近的绝对数值

临床测量、仪器比对中通常需要Absolute Agreement(例如不同仪器测血压,0.90和0.92不是"差不多",而是有实质差异)。行为编码、内容分析中通常用Consistency。


三、评分者一致性阈值:ICC≥.68、.75、.90的出处与使用

主流阈值标准汇总

ICC范围Koo & Li (2016)Cicchetti (1994)解读
< .50Poor(差)Poor信度不可接受
.50 – .75Moderate(中等)Fair勉强可用,须谨慎解释
.75 – .90Good(良好)Good多数期刊接受的最低合格线
> .90Excellent(优秀)Excellent临床测量、仪器比对的推荐水平

关于.68阈值:部分教育测量和心理学文献(如Landis & Koch,1977)将.61-.80划为"Substantial",但需注意该阈值体系是针对Cohen's Kappa(类别变量信度)制定的,并非ICC连续量场景。在非参数或类别信度场景中,.68有时被用作"可接受"的最低线,但此阈值不应直接套用于ICC连续型评分,否则容易造成标准误用。更常见和被广泛认可的ICC临界值是Koo & Li(2016)的.75(Good)和.90(Excellent)

实践建议

  • 心理学、教育学、社会科学:引用Koo & Li(2016),ICC ≥ .75为Good,ICC ≥ .90为Excellent
  • 临床医学、康复科学:ICC ≥ .90作为"临床可用"的严格标准
  • 内容分析、编码员信度:ICC ≥ .75通常被期刊接受;部分期刊要求 ≥ .80

引用格式(APA 7th)

依据Koo与Li(2016)的分类标准,ICC < .50为差、.50-.75为中等、.75-.90为良好、> .90为优秀。


四、APA 7th格式规范:ICC报告必须包含的要素

必报要素清单

要素格式示例
ICC类型(完整规格)ICC(模型, k),说明一致性类型ICC(2,1),绝对一致性
ICC点估计ICC = .XX(两位小数)ICC = .847
95%置信区间95% CI [下限, 上限]95% CI [.712, .921]
显著性(可选)F(df1, df2) = XX, p < .001F(39, 39) = 12.38, p < .001
效应大小解读引用标准 + 描述语(良好/优秀)Good(Koo & Li,2016)
样本量n = XX(被评对象数)n = 40
评分者数k = XXk = 2

ICC值与置信区间的精度要求

  • ICC值精确到三位小数(如ICC = .847,不写.85或.8472)
  • 95% CI下限和上限各精确到三位小数:95% CI [.712, .921]
  • 当置信区间包含0或为负值时,必须报告并说明样本量不足
  • F值精确到两位小数,p值精确到三位小数(不加前导零)

五、各场景完整APA报告模板

场景一:两位编码员,固定评分者,取单人分数

情形:内容分析,2位编码员各自独立编码,最终使用其中一位的编码结果,共40个分析单元。

完整报告段落模板

两名编码员对[X]类别进行独立编码,评分者信度采用双向混合模型
组内相关系数[ICC(2,1),一致性/绝对一致性]评估。
结果显示 ICC(2,1) = .XX(95% CI [XX, XX]),
依据Koo与Li(2016)的分类标准,属于[良好/优秀]信度水平。
编码分歧通过研究者协商解决,最终采用协商一致后的编码。

填入数值的示例

两名经过培训的编码员对40篇社交媒体帖子进行独立编码,评分者信度采用双向混合模型组内相关系数[ICC(2,1),绝对一致性]评估。结果显示ICC(2,1) = .847(95% CI [.712, .921]),依据Koo与Li(2016)的分类标准,属于良好信度水平。编码分歧通过研究者协商解决,最终采用协商一致后的编码结果用于后续分析。

场景二:两位评分者,取平均分,ICC(2,2)

情形:写作质量评定,2位评委各自打分后取平均,共30份作文。

完整报告段落模板

两位评委对[X]进行独立评分,最终取两位评委的平均分作为分析数据。
评分者信度采用双向混合模型平均评分者ICC[ICC(2,2),一致性]评估。
结果显示ICC(2,2) = .XX(95% CI [XX, XX]),
表明两位评委的平均评分具有[良好/优秀]的评分者信度
(Koo & Li,2016)。

填入数值的示例

两位经过培训的评委分别对30份叙事写作样本进行独立评分(1-10分李克特量表),最终取两位评委的平均分作为分析数据。评分者信度采用双向混合模型平均评分者组内相关系数ICC(2,2),绝对一致性模型评估,结果显示ICC(2,2) = .912(95% CI [.832, .956]),依据Koo与Li(2016)的分类标准,属于优秀信度水平。

场景三:三位评分者,ICC(2,3),方法章节完整写法

情形:行为观察研究,3位评分者对视频编码,取三位评分者平均值,共50段视频。

方法章节完整报告模板

信度分析

三名观察者独立对[X]行为进行编码(1 = 无,2 = 轻度,3 = 中度,4 = 重度)。
在正式编码前,三名观察者完成了[N小时]培训,并对[n]个训练样本进行
联合讨论以统一标准。正式编码阶段,三名观察者两两独立,互不知晓对方结果。

评分者信度采用双向混合模型平均评分者ICC[ICC(2,3),绝对一致性]评估,
以反映最终分析中使用平均分的实际情形。结果显示ICC(2,3) = .XX
(95% CI [XX, XX]),依据Koo与Li(2016)的分类标准为[良好/优秀]信度,
表明三名观察者对[X]行为的编码具有充分的一致性,
可支持后续分析的效度。编码分歧(同一片段三者分歧超过1分)通过
三方协商解决,分歧片段占总样本的XX%。

填入数值的示例

三名经过8小时培训的观察者对50段课堂互动视频进行独立编码,评分类别为教师反馈质量(1-4分)。评分者信度采用ICC(2,3),绝对一致性模型评估,结果显示ICC(2,3) = .883(95% CI [.813, .929]),依据Koo与Li(2016)的分类标准属于良好信度水平。编码分歧片段(分歧>1分)占总样本的8%,均通过三方协商解决。

场景四:单一测量工具的重测信度(临床场景)

情形:量表两次施测的重测信度,1位测量者,30名被试,两次测量间隔2周。

完整报告段落模板

量表的重测信度采用双向混合模型单一测量者ICC[ICC(2,1),绝对一致性]评估,
两次测量间隔为[N]天/周,以避免记忆效应。结果显示ICC(2,1) = .XX
(95% CI [XX, XX]),依据Koo与Li(2016)的标准,
重测信度达到[良好/优秀]水平,表明该量表在[N]周内具有良好的时间稳定性。

填入数值的示例

量表的重测信度采用双向混合模型ICC(2,1)(绝对一致性)评估,间隔2周进行两次施测以避免记忆效应(n = 30)。结果显示ICC(2,1) = .934(95% CI [.870, .966]),依据Koo与Li(2016)的分类标准达到优秀水平,表明该量表在2周内具有良好的时间稳定性。


六、在ChatSRS一句话获得规范ICC报告

打开 chatsrs.com,上传数据后输入:

"对两位编码员的评分数据做ICC评估,使用双向混合模型绝对一致性ICC(2,1);输出ICC点估计(三位小数)、95%置信区间、F值和p值;依据Koo & Li(2016)解读信度水平;给出符合APA 7th格式的完整报告段落,包含评分者数、样本量和方法章节描述。"

ChatSRS的输出段落即为上文示例格式,数值自动填入,可直接复制进论文。

如需三位或更多评分者(如ICC(2,3))、重测信度或随机评分者模型(ICC(1,1)),在指令中说明设计类型,ChatSRS自动切换报告模板并说明所选模型的理由。


七、方法章节怎么说明ICC分析

标准方法章节描述(双向混合模型,两位评分者)

采用双向混合模型组内相关系数(ICC,Two-Way Mixed,Absolute Agreement)
评估两位编码员的评分者间信度(inter-rater reliability)。
ICC类型选择依据Koo与Li(2016)的建议:评分者固定,被评对象为随机样本,
使用绝对一致性模型以严格衡量评分者数值吻合程度。
最终分析使用单一评分者的分数(ICC(2,1))/ 两位评分者的平均分(ICC(2,2))。
信度水平判断依据Koo与Li(2016):< .50为差,.50-.75为中等,
.75-.90为良好,> .90为优秀。统计分析使用ChatSRS(R引擎),
显著性水平设为alpha = .05。

八、ICC报告常见错误对照表

常见错误正确写法违反的规则
"ICC = .85,信度良好"ICC(2,1) = .847(95% CI [.712, .921])必须说明ICC类型+CI
只报Pearson r代替ICCICC(2,1),绝对一致性Pearson r不惩罚均值偏差
ICC类型未说明明确写出ICC(模型, k)和一致性类型类型决定计算结果
信度阈值无引文引用Koo & Li(2016)阈值来源需文献支撑
ICC = .82写成"ICC = 0.82"ICC = .820(不加前导零,保留三位小数)APA格式不加前导零,且ICC值须精确到三位小数
两位编码员取均值却报ICC(2,1)取均值应报ICC(2,2)k应与实际使用分数一致
仅报ICC点估计无CI95% CI必须报告点估计缺乏不确定性量化
"ICC > 0.7即可接受"无来源明确引用判断标准文献需文献支撑阈值判断
随机评分者用双向混合模型随机评分者应用One-Way或Two-Way Random模型选择需匹配设计

常见FAQ

Q:ICC(2,1)和ICC(2,2)哪个值更高,为什么?

A:ICC(2,k)一定 ≥ ICC(2,1),因为多个评分者取平均后,随机误差相互抵消,平均分比单人评分更稳定。这一关系由Spearman-Brown公式保证,两者之间的差距取决于评分者数量k和ICC(2,1)的大小。例如:若ICC(2,1) = .70,则ICC(2,2)约为.82。选用哪个值取决于你实际使用哪种分数:用单人分数就报ICC(2,1),用平均分就报ICC(2,2)——不能为了"信度好看"故意报ICC(2,2)却用单人分数。

Q:为什么有的文章报ICC(3,1),有的报ICC(2,1),区别是什么?

A:ICC模型数字对应不同的方差成分假设。Model 2(ICC(2,x))假设评分者是固定的(Two-Way Mixed),适用于"本研究的这k位评分者是固定的,目标是推广到同类被评对象"。Model 3(ICC(3,x))假设评分者也是随机的(Two-Way Random),适合"评分者本身也是从更大总体中随机抽取的,结论要推广到其他可能的评分者"。实践中,大多数内容分析、临床测量研究的评分者是固定的研究者/编码员,应使用Model 2(ICC(2,1)或ICC(2,k))。

Q:ICC = .68算合格吗,可以发表吗?

A:取决于你引用的阈值标准和研究领域。依据Koo & Li(2016),ICC .68落在Moderate区间(.50-.75),不属于Good以上,大多数心理学和行为科学期刊对此会提出异议。但若是探索性研究、难以评定的复杂构念、或样本量小导致CI宽,部分期刊会接受并要求明确说明局限性。临床医学通常要求≥.90。建议:(1)如实报告CI,若CI下限高于.50,说明不排除Good的可能;(2)在讨论中说明信度局限对结论的影响;(3)若可能,增加样本量或增加评分者并重新计算ICC(2,k)以提升信度估计。

Q:样本量多少才能得到可靠的ICC估计?

A:这是ICC报告中最被忽视的问题。Koo & Li(2016)建议:若目标是95% CI宽度不超过±.10,至少需要30个被评对象(k=2时)。被评对象越少,置信区间越宽,点估计的不确定性越大——例如n=10时,ICC = .85但95% CI可能是[.42, .97],这个区间跨越了从"差"到"优秀"的全部范围,意义有限。建议在方法章节说明样本量的合理性,并报告完整CI让读者自行判断。

Q:ICC和Cohen's Kappa怎么选?

A:主要看评分变量的测量水平。评分为类别变量(如"有/无"、"A类/B类/C类")用Kappa;评分为连续型或有序多分变量(如李克特1-7分、百分制评分)用ICC。有时同一研究会同时报告两种信度:对类别层面(是否属于某主题)报Kappa,对频次/程度层面(某主题出现了多少次/多强烈)报ICC。


快速参考:ICC报告格式速查卡

[两位评分者,单人分数,双向混合,绝对一致性]
ICC(2,1) = .XXX (95% CI [.XXX, .XXX])
信度水平: [Moderate/Good/Excellent] (Koo & Li, 2016)

[两位评分者,取均值,双向混合,绝对一致性]
ICC(2,2) = .XXX (95% CI [.XXX, .XXX])
信度水平: [Good/Excellent] (Koo & Li, 2016)

[k位评分者,取均值,双向混合,一致性]
ICC(2,k) = .XXX (95% CI [.XXX, .XXX])
信度水平: [Good/Excellent] (Koo & Li, 2016)

[重测信度,双向混合,绝对一致性]
ICC(2,1) = .XXX (95% CI [.XXX, .XXX]),间隔X周
信度水平: [Good/Excellent]

[不确定评分者是否固定时,保守选择]
ICC(1,1) = .XXX (95% CI [.XXX, .XXX])
注: One-Way Random,更保守

ICC阈值参考 (Koo & Li, 2016):
< .50 = Poor | .50-.75 = Moderate | .75-.90 = Good | > .90 = Excellent

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。