统计百科 ·

ROC曲线与AUC的APA报告怎么写?诊断准确性+敏感度特异度格式全解

统计百科:专攻ROC曲线与AUC如何规范写进论文——AUC值及其95%CI、最佳截断点、敏感度与特异度的APA 7th格式,给出可直接套用的诊断试验完整报告模板,并盘点审稿人最常挑的ROC报告格式错误。

跑完ROC分析,拿到AUC = 0.84之后,怎么把它规范地写进论文?AUC要不要加置信区间、最佳截断点怎么确定和报告、敏感度与特异度的格式是什么、与参照AUC(0.5或另一个模型)比较时用什么检验——这篇文章专攻"ROC曲线与AUC怎么规范写进论文"这一具体格式点,给出APA 7th所有ROC/AUC场景的完整模板,并逐一盘点审稿人最常挑的格式错误。


你的ROC/AUC报告有这些问题吗?

审稿人或导师关于ROC/AUC报告最常见的反馈:

  • "AUC要报告95%置信区间,请补充"
  • "最佳截断点的选取标准未说明,是Youden指数还是其他准则?"
  • "敏感度和特异度缺少置信区间"
  • "两条ROC曲线的比较应报告DeLong检验的z值或p值,不能只比较AUC点估计"
  • "AUC = 0.84,但没有说明是DeLong法、Hanley-McNeil法还是Bootstrap法计算的置信区间"
  • "阳性预测值(PPV)和阴性预测值(NPV)依赖样本患病率,请注明研究中的患病率"

这些错误集中在医学统计、心理测量和机器学习分类评估的报告规范,但专门针对AUC/ROC汇总的APA格式实操指南并不多。本文只讲一件事:ROC曲线分析结果到底怎么规范写进论文的每一种场景


一、ROC曲线与AUC的统计含义

ROC曲线的直觉含义

ROC曲线(Receiver Operating Characteristic curve,受试者工作特征曲线)回答的问题是:在所有可能的截断点上,诊断测试的敏感度(真阳性率)与1-特异度(假阳性率)如何权衡?

  • 横轴:1 - 特异度(False Positive Rate,FPR)
  • 纵轴:敏感度(True Positive Rate,Sensitivity)
  • 对角线(AUC = 0.5):随机猜测,无诊断价值
  • 曲线越靠近左上角,诊断性能越好

AUC(曲线下面积)的含义

$\text{AUC} = P(\hat{Y}{positive} > \hat{Y}{negative})$

AUC的直觉含义:随机取一名真阳性患者和一名真阴性患者,模型/检验给阳性患者打的分高于阴性患者的概率。

AUC范围诊断价值参考
0.50 – 0.60无诊断价值(接近随机)
0.60 – 0.70较差(Poor)
0.70 – 0.80尚可(Fair)
0.80 – 0.90良好(Good)
0.90 – 1.00优秀(Excellent)

注意:以上划分标准来自Hosmer & Lemeshow(2000),不同领域(影像诊断、生物标志物、心理量表)对"可接受AUC"的要求不同,方法章节需说明所用标准。

AUC用在哪些场景

场景AUC的含义
单一诊断测试该测试区分阳性/阴性患者的总体能力
两个测试比较DeLong检验比较两条ROC曲线(配对或独立)
回归/分类模型评估Logistic回归模型整体判别力
生物标志物筛选新标志物是否优于现有指标
量表截断点确定心理量表用于筛查时最优切分值

二、APA 7th格式规范:ROC/AUC报告必须包含的要素

必报要素清单

要素格式示例
AUC点估计AUC = X.XXAUC = 0.84
95%置信区间95% CI [X.XX, X.XX]95% CI [0.78, 0.90]
置信区间方法DeLong法 / Bootstrap法(正文或脚注注明)
p值(vs. AUC = 0.5)p = .XXX 或 p < .001p < .001
最佳截断点(阈值)截断值 = X.XX截断值 = 23.5
截断点选取准则Youden指数 / 敏感度优先等Youden指数最大化
敏感度(Sensitivity)X.XX(95% CI [X.XX, X.XX])0.82(95% CI [0.75, 0.88])
特异度(Specificity)X.XX(95% CI [X.XX, X.XX])0.79(95% CI [0.72, 0.85])
样本量及阳性/阴性例数N = XX(阳性 n1,阴性 n2)N = 320(阳性 n = 128,阴性 n = 192)

数值精度要求

  • AUC精确到两位小数:AUC = 0.84(不写0.8或0.843)
  • 敏感度/特异度精确到两位小数(如0.82),或百分比保留一位小数(82.3%),全文统一
  • p值精确到三位小数,不加前导零:p = .032(不写p = 0.032)
  • p = .000改写为p < .001
  • 置信区间上下限均精确到两位小数:95% CI [0.78, 0.90]

三、最佳截断点的确定与报告

常用截断点选取准则

准则公式适用场景
Youden指数(J)J = Sensitivity + Specificity - 1,最大化均等重视漏诊与误诊
敏感度优先在敏感度 ≥ 0.90约束下最大化特异度漏诊代价极高(如恶性肿瘤筛查)
特异度优先在特异度 ≥ 0.90约束下最大化敏感度误诊代价极高(如确诊性检验)
距左上角最近点最小化$\sqrt{(1-\text{Sens})^2 + (1-\text{Spec})^2}$图形化选取
成本效益比依据误诊/漏诊的相对代价权重卫生经济学研究

APA格式要求:截断点报告

截断点必须说明选取依据,不能只报告数值。正确写法示例:

采用Youden指数(J = Sensitivity + Specificity - 1)最大化原则确定最佳截断点,结果显示当量表得分 ≥ 24分时,Youden指数达最大值(J = 0.61),对应敏感度为0.82(95% CI [0.75, 0.88]),特异度为0.79(95% CI [0.72, 0.85])。


四、两条ROC曲线的比较:DeLong检验格式

当需要比较两个诊断测试(如新生物标志物 vs. 传统检验)的AUC时,应使用DeLong等(1988)提出的非参数法,而非简单比较点估计。

DeLong检验报告要素

要素格式
两个AUC及各自95% CIAUC1 = X.XX(95% CI [X.XX, X.XX]),AUC2 = X.XX(95% CI [X.XX, X.XX])
AUC差值及95% CIAUC差值 = X.XX(95% CI [X.XX, X.XX])
z统计量z = X.XX
p值p = .XXX 或 p < .001
检验方法说明DeLong法(配对)或 DeLong独立样本法

APA格式报告示例:采用DeLong法(配对样本)比较两条ROC曲线,新型标志物(AUC = 0.87,95% CI [0.82, 0.92])的诊断准确性显著优于传统指标(AUC = 0.74,95% CI [0.68, 0.80]),AUC差值 = 0.13(95% CI [0.06, 0.20]),z = 3.74,p < .001。


五、各场景完整APA报告模板

场景一:单一诊断测试ROC分析

情形:评估某量表(0-40分)对抑郁症的筛查能力,N = 320(抑郁组 n = 128,对照组 n = 192)。

完整报告段落模板

ROC曲线分析结果显示,[量表/检验名称]对[疾病/结局]的诊断准确性良好,
AUC = X.XX(95% CI [X.XX, X.XX]),显著优于随机水平(z = X.XX, p [值])。
采用[Youden指数/敏感度优先/特异度优先]准则确定最佳截断值为[X]分,
对应敏感度为X.XX(95% CI [X.XX, X.XX]),
特异度为X.XX(95% CI [X.XX, X.XX]),
阳性预测值(PPV)为X.XX,阴性预测值(NPV)为X.XX
(基于样本患病率X.XX%)。

填入数值的示例

ROC曲线分析结果显示,抑郁自评量表(SDS)对重度抑郁症的诊断准确性良好,AUC = 0.84(95% CI [0.78, 0.90]),显著优于随机水平(z = 10.24,p < .001)。采用Youden指数最大化准则确定最佳截断值为24分,对应敏感度为0.82(95% CI [0.75, 0.88]),特异度为0.79(95% CI [0.72, 0.85]),阳性预测值(PPV)= 0.74,阴性预测值(NPV)= 0.86(基于样本患病率40.0%)。置信区间采用DeLong法估计(N = 320,抑郁组 n = 128,对照组 n = 192)。

场景二:两个诊断测试的AUC比较

情形:比较新型血清标志物(Marker A)与现有指标(Marker B)对心肌梗死的诊断能力,配对设计,N = 200。

完整报告段落模板

采用DeLong法(配对样本)比较[Marker A]与[Marker B]的ROC曲线。
[Marker A]的AUC为X.XX(95% CI [X.XX, X.XX]),
[Marker B]的AUC为X.XX(95% CI [X.XX, X.XX])。
两条曲线的AUC差值为X.XX(95% CI [X.XX, X.XX]),
差异[显著/不显著],z = X.XX,p [值]。

填入数值的示例

采用DeLong法(配对样本)比较高敏肌钙蛋白T(hs-TnT)与传统肌钙蛋白I(TnI)对急性心肌梗死的诊断ROC曲线。hs-TnT的AUC为0.93(95% CI [0.89, 0.97]),TnI的AUC为0.81(95% CI [0.76, 0.86]),两条曲线的AUC差值为0.12(95% CI [0.05, 0.19]),差异显著,z = 3.41,p < .001,提示hs-TnT的诊断准确性显著优于TnI。

场景三:Logistic回归模型的AUC报告

情形:构建包含5个预测变量的Logistic回归模型,评估糖尿病风险,N = 500。

完整报告段落模板

以ROC曲线评估Logistic回归模型的整体判别能力,
模型AUC = X.XX(95% CI [X.XX, X.XX]),
Hosmer-Lemeshow拟合优度检验显示模型拟合良好,
chi^2([df]) = X.XX,p = .XXX。
当预测概率阈值设为X.XX时([选取准则]),
模型敏感度为X.XX(95% CI [X.XX, X.XX]),
特异度为X.XX(95% CI [X.XX, X.XX])。

填入数值的示例

以ROC曲线评估Logistic回归模型的整体判别能力,模型AUC = 0.88(95% CI [0.85, 0.91]),Hosmer-Lemeshow拟合优度检验显示模型拟合良好,chi^2(8) = 6.74,p = .563。当预测概率阈值设为0.42时(Youden指数最大化),模型敏感度为0.84(95% CI [0.79, 0.88]),特异度为0.82(95% CI [0.77, 0.86]),阳性预测值 = 0.78,阴性预测值 = 0.87。

场景四:多个生物标志物的AUC汇总表

当比较三个及以上标志物时,建议以表格形式汇总,文字仅描述整体规律和关键比较。

APA格式表格示例

表1

各诊断标志物ROC曲线分析结果(N = 240)

标志物AUC95% CIzp截断值敏感度特异度
hs-TnT0.93[0.89, 0.97]15.2< .00114 ng/L0.880.89
CK-MB0.81[0.76, 0.86]10.7< .0016.5 U/L0.760.81
Myoglobin0.74[0.68, 0.80]7.9< .00185 ng/mL0.720.73

注. 95% CI采用DeLong法估计;z值为各AUC与随机水平(0.5)比较的检验统计量;截断值采用Youden指数最大化准则确定。


六、在ChatSRS一句话获得规范ROC/AUC报告

打开 chatsrs.com,上传数据后输入:

"对变量'SDS总分'做ROC曲线分析,结局变量为'诊断'(1=抑郁,0=对照),用DeLong法计算AUC的95%置信区间,用Youden指数确定最佳截断点,同时输出该截断点的敏感度、特异度、PPV和NPV(含95% CI),输出符合APA 7th格式的完整报告段落和ROC曲线图。"

ChatSRS的输出段落即为上文示例格式,AUC、截断点、敏感度/特异度数值自动填入,可直接复制进论文。

如需比较两个标志物的AUC(DeLong检验),在指令中补充:

"同时与变量'TnI'的ROC曲线做DeLong配对比较,报告AUC差值及95% CI和p值。"


七、方法章节怎么说明ROC分析

标准方法章节描述(单一诊断测试)

采用ROC曲线分析评估[测试/量表名称]对[疾病/结局]的诊断准确性,
以曲线下面积(AUC)为主要诊断性能指标,
置信区间采用DeLong等(1988)非参数法估计。
最佳截断点依据Youden指数(J = Sensitivity + Specificity - 1)最大化原则确定;
敏感度与特异度的95%置信区间以Wilson评分法计算。
所有分析使用ChatSRS(R引擎,pROC包),显著性水平设为alpha = .05。

标准方法章节描述(两条ROC曲线比较)

采用DeLong等(1988)提出的非参数方法比较两条ROC曲线的AUC,
报告AUC差值及其95%置信区间与z检验p值。
检验为双尾,显著性水平alpha = .05。
分析使用ChatSRS(R引擎)。

八、ROC/AUC报告常见错误对照表

常见错误正确写法违反的规则
AUC = 0.84(无置信区间)AUC = 0.84(95% CI [0.78, 0.90])CI为必报要素
截断点无选取依据最佳截断点 = 24分(Youden指数 J = 0.61)须说明选取准则
两AUC只比较点估计DeLong法,z = 3.74,p < .001差异须经检验,非目视比较
p = .000p < .001.000是舍入假值
敏感度写百分比,特异度写小数统一用小数(0.82)或百分比(82%)全文格式不统一
PPV/NPV不注明患病率PPV = 0.74(基于样本患病率40.0%)PPV/NPV依赖患病率
未说明CI计算方法置信区间采用DeLong法估计方法须可重复
AUC写三位小数AUC = 0.84(不写0.843)APA精度规范

常见FAQ

Q:AUC一定要加95%置信区间吗,AUC = 0.84可以直接报告吗?

A:不行。单独报告AUC点估计违反APA 7th关于"所有效应量必须报告置信区间"的要求(Section 6.35)。AUC本质上是一个效应量估计,其不确定性由置信区间体现。95% CI [0.78, 0.90]告诉读者"真实诊断准确性有95%的概率落在这个范围",没有CI的AUC无法判断精度——小样本时AUC = 0.84的CI可能是[0.65, 1.00],完全没有说服力。ChatSRS默认同步输出AUC及DeLong法95% CI,无需额外操作。

Q:Youden指数是最佳截断点的唯一选取方法吗?

A:不是。Youden指数假设漏诊(假阴性)和误诊(假阳性)的代价相等,这在很多临床场景下并不成立。例如:恶性肿瘤筛查中漏诊代价远高于误诊,应优先保证高敏感度(如≥0.95);HIV确认检验则要求高特异度。方法章节必须说明选取准则及其依据,不能默认Youden指数而不加说明。APA 7th要求研究者对所有分析决策"提供充分的理由"(Section 2.18)。

Q:敏感度0.82和特异度0.79要不要各自的95% CI?

A:建议报告,顶刊和Cochrane系统综述的方法学要求越来越严格。敏感度和特异度的CI通常用Wilson评分法(又称Score法)或Clopper-Pearson精确法计算,其中Wilson法在中等样本(n > 30)时更准确。SPSS/SAS默认输出Wald法CI(有时会超出[0,1]范围),R的epiR包和pROC包均可输出Wilson法CI。ChatSRS在ROC报告中默认输出Wilson法敏感度/特异度CI。

Q:ROC分析结果在论文里放在结果部分的哪一段?

A:通常紧跟描述统计/人口学特征表之后,在回归分析或主要比较分析之前,独立成一个"诊断准确性"或"ROC曲线分析"小节。建议结构:①交代样本阳性/阴性分布 → ②报告整体AUC及CI → ③报告最佳截断点及其敏感度/特异度 → ④(如有)报告AUC组间比较结果 → ⑤插入ROC曲线图(标注最佳截断点)。


快速参考:ROC/AUC报告格式速查卡

[单一诊断测试]
AUC = X.XX, 95% CI [X.XX, X.XX], z = X.XX, p [= .XXX / < .001]
最佳截断值 = XX(Youden指数J = X.XX)
敏感度 = X.XX(95% CI [X.XX, X.XX]),特异度 = X.XX(95% CI [X.XX, X.XX])
PPV = X.XX,NPV = X.XX(患病率 = X.XX%)

[两条ROC曲线比较(DeLong法,配对)]
AUC1 = X.XX(95% CI [X.XX, X.XX])
AUC2 = X.XX(95% CI [X.XX, X.XX])
AUC差值 = X.XX(95% CI [X.XX, X.XX]),z = X.XX, p [值]

[Logistic回归模型整体判别力]
AUC = X.XX(95% CI [X.XX, X.XX])
Hosmer-Lemeshow: chi^2([df]) = X.XX, p = .XXX
预测概率阈值 = X.XX([选取准则])
敏感度 = X.XX,特异度 = X.XX

[精度规范]
AUC: 两位小数(0.84,不写0.843)
敏感度/特异度: 两位小数(0.82)或百分比一位小数(82.3%),全文统一
p值: 三位小数,不加前导零(p = .032,不写p = 0.032)
p = .000 → p < .001

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。