教程 ·

组内相关系数ICC完整教程 — 评分者一致性与重测信度用AI一句话完成

ICC组内相关系数专项教程:ICC(2,1)/ICC(3,k)模型选择、信度阈值判断、医学量表评分者一致性与重测信度,附可直接套进论文的APA 7th报告句式,ChatSRS自动输出三线表。

两名医生对同一批X光片评分,结果一致吗?同一量表两周后重测,稳定性够吗?ICC(组内相关系数)是回答这两类问题的金标准——但选错模型,数值就会差一截。这篇教程教你选对ICC类型、读懂置信区间,并用AI一句话完成从数据到APA报告的全套流程。


你的信度问题是哪一类?

做量表研究、临床测量、观察性评分时,信度分析是绕不过的关卡。研究者常遇到两类信度问题:

评分者间信度(Inter-Rater Reliability):多名评分者对同一批对象独立评分,结果一致性如何?

  • 两名影像科医生对同一批CT图像评分(0-4分)
  • 三名心理咨询师对同一批访谈录像评定焦虑等级
  • 两位护士分别测量同一患者的关节活动度

重测信度(Test-Retest Reliability):同一工具在两个时间点对同一批对象测量,稳定性如何?

  • 某疼痛量表间隔两周由同一评分者重复评估
  • 某功能性活动能力测试在一周前后各做一次
  • 某认知筛查工具在门诊初诊与复诊时各施测一次

这两类问题都归到"ICC分析"的框架下,但使用的ICC模型不同——选错模型会让ICC值严重偏高或偏低,导致结论失真。


ICC是什么?与Cronbach's alpha的区别

基本定义

组内相关系数(Intraclass Correlation Coefficient,ICC)衡量的是:同一对象的多次测量值之间,有多大比例的变异来自对象本身(真实差异),而非来自测量误差

数学上,ICC是将"被试间方差"与"总方差"(被试间方差 + 误差方差)之比:

ICC = Var(被试间) / [Var(被试间) + Var(误差)]

ICC取值 0~1,越接近1说明测量越可靠,不同评分者或不同时间点的测量值越接近。

ICC vs Cronbach's alpha

维度ICCCronbach's alpha
适用场景评分者一致性、重测信度量表内部一致性(多个条目)
数据结构同一批对象被多个评分者/多次测量同一批对象在多个条目上的得分
是否考虑系统误差部分模型考虑(绝对一致性模型)不考虑系统误差,只考虑随机误差
输出ICC值 + 95% CIalpha系数(单一值)
医学/临床场景首选适合量表开发的内部一致性检验

一个常见误区:把alpha当作评分者一致性的指标。alpha衡量的是"多个条目测同一构念",而ICC衡量的是"多个评分者/多次测量对同一对象评估的一致程度"——两者不可互换。


ICC模型的选择:最容易出错的一步

ICC并非一个固定公式,而是一个模型族。不同研究设计对应不同模型,选错模型是ICC分析最常见的错误。

按照Shrout & Fleiss(1979)和Koo & Li(2016)推荐的分类框架,共有6种ICC:

第一维度:数据结构(单向 vs 双向)

单向随机效应模型(One-Way Random Effects)

  • 假设:每个对象由不同的评分者子集评分,评分者是从更大评分者总体中随机抽取的
  • 用于:无法假定所有对象都被同一批评分者评分的场景(少见)
  • ICC型号:ICC(1,1) 或 ICC(1,k)

双向随机效应模型(Two-Way Random Effects)

  • 假设:每个对象都被同一批评分者评分,评分者是从更大总体中随机抽取的
  • 用于:研究问题是"这批评分者能否代表评分者总体的一致性"
  • ICC型号:ICC(2,1) 或 ICC(2,k)

双向混合效应模型(Two-Way Mixed Effects)

  • 假设:每个对象都被同一批固定评分者评分,评分者本身就是研究关心的特定评分者(不是样本代表总体)
  • 用于:评分者就是将来实际使用工具的那几位特定人员
  • ICC型号:ICC(3,1) 或 ICC(3,k)

第二维度:一致性定义

绝对一致性(Absolute Agreement)

  • 关注不同评分者的评分值是否绝对一致(允许系统误差会降低ICC)
  • 更严格,临床和医学场景通常用此

相对一致性/一致性(Consistency)

  • 只关注评分的相对排序是否一致,允许存在系统性的高估或低估偏差
  • 相对宽松,适用于允许校正偏差的场景

第三维度:评分者数量

  • 单个评分者(Single Rater):将来每次只用1名评分者
  • 多个评分者均值(Average of k Raters):将来每次用多名评分者取平均

实践选择指南

研究场景推荐ICC模型
评估工具将由特定的2名医生使用(绝对一致性)ICC(3,1) — 双向混合,绝对一致性,单个评分者
评估工具推广给医院所有医生使用(需泛化到总体)ICC(2,1) — 双向随机,绝对一致性,单个评分者
将来3名评分者共同评分取均值ICC(2,k) 或 ICC(3,k),k=3
重测信度(同一评分者两次测量)ICC(3,1) — 绝对一致性
量表跨研究的泛化可靠性估计ICC(2,1) — 双向随机,绝对一致性

Koo & Li(2016)在Physical Therapy期刊的建议:临床研究的评分者间信度和重测信度,均优先选择双向绝对一致性模型(ICC(2,1)用于泛化,ICC(3,1)用于特定评分者)。


ICC信度阈值:多少才算够?

Koo & Li(2016)推荐标准

这是目前医学和康复领域引用最多的ICC信度判断标准:

ICC值信度等级
< 0.50差(Poor)
0.50 ~ 0.75中等(Moderate)
0.75 ~ 0.90良好(Good)
> 0.90极好(Excellent)

重要提示:看95% CI下界,不只看点估计

ICC的点估计值依赖样本量,波动较大。APA和大多数医学期刊要求同时报告95%置信区间,并以95% CI下界作为信度判断的保守参考:

  • ICC = 0.84,95% CI [0.71, 0.92]:CI下界0.71属于"中等"边缘,信度判断不能直接用0.84说"良好"
  • ICC = 0.84,95% CI [0.78, 0.89]:CI下界0.78在"良好"范围,信度可判定为良好

样本量要求:Koo & Li(2016)建议,计算ICC至少需要30名受试者,以使95% CI宽度控制在0.2以内;若需精确到0.1,需约100人。

Cohen效应量与ICC的关系

注意:ICC的信度阈值与Cohen效应量(d、f、eta^2等)属于不同体系,不能混用。Cohen标准用于均值差异和方差解释,ICC专用上述Koo & Li(2016)或Cicchetti(1994)标准。


案例数据:三名物理治疗师评分一致性研究

研究背景

某康复医学研究评估一项**改良Barthel日常生活活动能力指数(Modified Barthel Index,MBI)**的评分者间信度。三名经培训的物理治疗师对同一批40名脑卒中恢复期患者独立评分(0-100分)。

研究问题:三名物理治疗师的评分是否具有足够的一致性,以保证该量表在临床日常应用中的可靠性?

数据结构

患者ID    评分者_A    评分者_B    评分者_C
001       72          68          70
002       45          42          47
003       88          89          87
004       55          51          54
...(共 40 行)

每行1名患者,每列1名评分者,共3列评分。这是双向混合效应 + 绝对一致性的典型场景:三名特定的物理治疗师(固定,非从总体中随机抽样),关注的是他们的绝对评分一致性。


用AI一句话完成ICC分析

chatsrs.com上传数据后输入:

"数据包含40名患者由3名物理治疗师独立评定的MBI量表分数(变量名:rater_A、rater_B、rater_C)。 请进行ICC评分者间信度分析:

  1. 描述统计:3名评分者的M、SD、Min、Max
  2. ICC计算:双向混合效应模型,绝对一致性,分别报告单个评分者ICC(3,1)和3名评分者均值ICC(3,k),含95% CI和F检验
  3. 按Koo & Li(2016)标准解读信度等级
  4. 输出三线表,写APA 7th中文文字描述"

60秒后,ChatSRS完整输出以下四部分结果。


输出结果怎么读

输出1:描述统计

表1  三名物理治疗师MBI量表评分描述统计(N = 40名患者)

评分者      M        SD       Min      Max
评分者A     63.48    18.34    22       96
评分者B     61.85    18.12    19       95
评分者C     62.93    17.98    21       97
总体        62.75    18.07    19       97

注:MBI总分范围0-100分,分数越高功能越好。

三名评分者均值相差不超过2分,提示系统性偏差较小,但仍需ICC检验一致性。


输出2:ICC三线表

表2  评分者间信度ICC分析(双向混合效应,绝对一致性,N = 40)

                       ICC        95% CI          F(rater)    df1    df2      p
单个评分者 ICC(3,1)    0.87       [0.79, 0.93]    1.34        2      78      .267
k=3均值 ICC(3,k)       0.95       [0.92, 0.97]    1.34        2      78      .267

注:ICC(3,1)适用于将来单名评分者评分的场景;ICC(3,k)适用于将来3名评分者取均值的场景。
    F(rater)为评分者主效应检验(df1 = k-1 = 2),反映评分者间是否存在系统性差异;信度等级依据Koo & Li(2016)。

读表要点

指标含义
ICC点估计对象真实差异占总变异的比例,越高越可靠
95% CI下界保守信度估计,判断等级应以此为准
F检验检验各评分者均值是否存在系统性偏差(仅绝对一致性模型有意义)
ICC(3,k) vs ICC(3,1)Spearman-Brown预言公式的逻辑:k名评分者均值比单名评分者更可靠

输出3:信度等级解读

ICC信度解读(Koo & Li, 2016):

单个评分者 ICC(3,1) = 0.87,95% CI [0.79, 0.93]
  -> CI下界 = 0.79,属于"良好(Good)"(阈值:0.75-0.90)
  -> 若临床场景由单名治疗师评分,信度良好,可接受

3名评分者均值 ICC(3,k) = 0.95,95% CI [0.92, 0.97]
  -> CI下界 = 0.92,属于"极好(Excellent)"(阈值:> 0.90)
  -> 若临床场景由3名治疗师评分取均值,信度极好

建议:若条件允许,由至少2名评分者独立评分取均值,可将信度从良好提升至极好。

输出4:系统误差检验(Bland-Altman补充)

ChatSRS同时输出每对评分者的Bland-Altman一致性限,用于可视化检查系统偏差和随机误差的分布。当F检验显示评分者主效应显著(p < .05)时,说明存在系统性偏差,需在讨论节中解释其临床意义。


重测信度案例:PHQ-9抑郁量表两周间隔

研究背景

某心理科评估PHQ-9(患者健康问卷-9项)在抑郁门诊患者中的重测信度。共招募35名病情稳定的门诊患者,由同一名心理咨询师间隔14天分别施测一次。

数据结构

患者ID    t1(初测)    t2(重测)
001       14            13
002        8             9
003       19            18
...(共 35 行)

重测信度场景中,"评分者"等同于"时间点",适用ICC(3,1) — 双向混合,绝对一致性(同一评分者,固定时间间隔)。

ChatSRS指令

chatsrs.com上传数据后输入:

"数据包含35名患者在两个时间点(t1、t2,间隔14天)的PHQ-9得分。 请计算重测信度:ICC(3,1)双向混合绝对一致性模型,含95% CI、F检验; 按Koo & Li(2016)标准解读;同时输出Bland-Altman图和配对样本t检验(检验系统偏差); 写APA 7th格式中文报告句式。"

典型输出

表3  PHQ-9重测信度分析(双向混合,绝对一致性,N = 35)

              ICC        95% CI           F          df1     df2     p
ICC(3,1)     0.93        [0.88, 0.97]    27.86       34      34     < .001

配对t检验:t(34) = 1.24, p = .223(初测 M = 12.34, SD = 4.87 vs 重测 M = 12.09, SD = 4.92)
Bland-Altman:均值差 = 0.25,95%一致性限 [-3.12, 3.62]

信度等级:ICC(3,1) = 0.93,CI下界 = 0.88,属于"极好(Excellent)"。
配对t检验p = .223,两次测量均值无显著系统性偏差,重测信度极好。

论文里怎么报告(APA 7th格式)

APA 7th对ICC报告的要求:必须说明ICC模型类型、报告点估计 + 95% CI,并引用判断信度等级的标准


方法节(信度分析部分)

采用组内相关系数(ICC)评估三名评分者对MBI量表的评分者间信度。依据Koo与Li(2016)推荐,选用双向混合效应绝对一致性模型,分别计算单个评分者ICC(3,1)和3名评分者均值ICC(3,k),并报告95%置信区间。信度等级依据Koo与Li(2016)标准判定(ICC < .50为差,.50-.75为中等,.75-.90为良好,> .90为极好)。统计分析以R 4.4(psych包)及SPSS 29.0实施。


结果节(评分者间信度部分)

评分者间信度分析结果显示,单个评分者ICC(3,1) = .87,95% CI [.79, .93],信度等级为"良好";3名评分者均值ICC(3,k) = .95,95% CI [.92, .97],信度等级为"极好"(Koo & Li, 2016)。F检验结果表明评分者主效应不显著,F(2, 78) = 1.34, p = .267,三名评分者之间无显著系统性评分偏差(见表2)。


重测信度报告句式

PHQ-9量表两周重测信度分析结果显示,ICC(3,1) = .93,95% CI [.88, .97],信度等级为"极好"(Koo & Li, 2016)。配对样本t检验结果表明两次测量均值无显著差异,t(34) = 1.24, p = .223,提示该量表在病情稳定患者群体中具有良好的测量稳定性。


APA格式规范汇总

要素格式示例
ICC点估计 + 95% CIICC(3,1) = .87, 95% CI [.79, .93]
F检验F(2, 78) = 1.34, p = .267
信度等级良好(Koo & Li, 2016)
p值p = .267(小数点前不写0)
双向混合绝对一致性Two-way mixed effects, absolute agreement

特别提示:ICC值在APA格式中小数点前不写0(写 .87 而非 0.87),与相关系数r、p值写法一致。引用信度判断标准时必须注明来源(Koo & Li, 2016 或 Cicchetti, 1994),不可仅给出数值而不说明依据。


单向模型vs双向模型:不同引擎的计算细节

ChatSRS的SPSS、R、Stata三个引擎均支持全部ICC模型:

SPSS分析 → 标度 → 可靠性分析 → 组内相关系数,可选单向/双向、绝对一致性/相对一致性、单个评分者/均值。

R(psych包)ICC(data, missing=FALSE) 一次输出全部6种ICC及95% CI,是研究领域最常用的实现方式。

Stataicc 命令,支持 mixed absolutemixed consistency 选项,输出与SPSS高度一致。

三引擎的点估计结果在数值上应完全一致(ICC是封闭式公式),差异仅体现在极端情况下的置信区间计算方法(Bootstrap vs Fisher z变换)。ChatSRS默认输出三引擎对照表,审稿人指定哪个软件均可直接引用。


常见问题 FAQ

Q1:ICC(2,1)和ICC(3,1)的数值会差多少?该选哪个?

A:数值差异取决于评分者效应的大小。当所有评分者对每名对象的评分无系统偏差时,ICC(2,1)(双向随机,绝对一致性)与ICC(3,1)(双向混合,绝对一致性)的数值非常接近。若评分者之间存在系统性高估或低估,ICC(2,1)比ICC(3,1)更保守(数值更低)。选择原则:若评分者就是将来实际使用工具的那几位特定人员(不需要泛化),选ICC(3,1);若评估工具将推广给更多同类评分者使用(需要泛化性),选ICC(2,1)。

Q2:我的ICC只有0.62,信度"中等",还能发表吗?

A:可以,但需要正确处理。首先,0.62的95% CI下界决定信度等级——若CI为 [0.44, 0.76],下界仅0.44属于"差",结论需相应保守。其次,ICC偏低时应分析原因:是量表本身对评分者主观判断依赖过高,还是评分者培训不足,还是对象异质性太低(量程压缩效应)?信度中等若伴随充分讨论和改进建议,在方法学研究或量表发展研究中仍可接受。用ChatSRS输出Bland-Altman图可帮助定位误差来源。

Q3:样本量只有15人,ICC有参考价值吗?

A:15人样本的ICC置信区间会非常宽(宽度可能超过0.4),点估计参考价值有限。Koo & Li(2016)建议至少30人以保证CI宽度在合理范围。但若是预实验或可行性研究,15人的ICC仍可报告,只需在结果节注明"本研究样本量有限,ICC估计存在较大不确定性(95% CI较宽),结果需在更大样本中验证"。ChatSRS在输出时会自动计算当前样本量下的CI宽度,并给出样本量是否充分的提示。

Q4:我有5名评分者,对应k应该填5还是2?

A:k填入将来实际使用的评分者数量,而非研究中参与的评分者数量。若研究中5名评分者共同评分,但将来临床实际只用1名,应报告ICC(3,1)(k=1)而非ICC(3,5)(k=5)。若将来日常使用会由2名评分者共同评分取均值,则报告ICC(3,2)。两者均可在ChatSRS中一次性输出,供读者按实际情况参考。

Q5:ICC和Cohen's kappa有什么区别?ICC可以用于分类变量吗?

A:两者适用的测量尺度不同。ICC适用于连续型或有序量表型数据(如量表总分、关节活动度度数);Cohen's kappa(或加权kappa)适用于名义或有序分类变量(如病理分级:1/2/3级)。若你的评分结果是类别(如"正常/可疑/异常"三分类),应使用加权kappa而非ICC。ChatSRS在检测到变量为分类型时会自动建议使用kappa,避免误用。


小结

ICC是评分者间信度和重测信度分析的金标准,正确应用的关键在三处:

  1. 选对模型:双向混合还是双向随机,绝对一致性还是相对一致性——选错模型差距可达0.1以上
  2. 报告95% CI下界:点估计会因样本量波动,CI下界才是信度判断的保守基准
  3. 引用判断标准:Koo & Li(2016)是目前医学和康复领域的权威标准,必须在方法节明确引用

chatsrs.com用一句自然语言指令,即可获得:

  • SPSS+R+Stata三引擎对照输出
  • 全套ICC(1/2/3,1/k)一次性计算,含95% CI和F检验
  • Koo & Li(2016)信度等级自动解读
  • Bland-Altman图(可选)
  • 可直接粘贴进论文的APA 7th格式中文描述

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。