场景案例 ·

口腔正畸临床研究数据怎么用 AI 做统计分析?— 配对 t / ICC / Logistic 三引擎全流程

口腔正畸临床研究必备统计指南:疗效配对 t 检验、ICC 重测信度、二分类 Logistic 回归,ChatSRS 三引擎一句话指令,输出 APA 7th 论文级结果,附可直接引用的报告句式。

正畸科的毕业论文和临床研究有三大统计难关:治疗前后测量值的配对比较不知道怎么报效应量;两位医师的测量值差异到底用 Kappa 还是 ICC 从来搞不清楚;预测矫治成功与否该跑 Logistic 还是线性回归也是一头雾水。这篇文章把口腔正畸临床数据最高频的三条统计链逐步拆解,每步给出 ChatSRS 可直接使用的指令以及可抄进论文的 APA 7th 报告句式。


为什么正畸临床数据分析比一般医学统计更复杂

口腔正畸是高度依赖测量的学科——头影测量、模型分析、PAR 指数、软组织侧貌……每个研究都会产生大量连续型测量数据,而这些数据有三个特殊性:

  1. 配对结构:同一患者治疗前后的测量值,必须用配对设计才能正确估计干预效果;单纯做独立样本 t 检验会低估统计功效,结论更不可靠。
  2. 测量误差不可忽视:头影测量有重复测量误差,研究可重复性靠 ICC(组内相关系数)而非简单 Pearson r;很多导师和审稿人会专门盯这一点。
  3. 结局常是二分类:矫治成功/失败、拔牙/不拔牙、复发/稳定——这类结局变量无法用线性回归,必须用 Logistic 回归,且需报告 OR 值和 95% CI。

chatsrs.com 内置 SPSS、R、Stata 三个分析引擎,针对上述三种场景均有专项支持。下面按真实临床研究流程逐步演示。


典型数据结构:正畸临床研究的三类场景

场景一:治疗前后疗效比较(配对设计)

患者编号  治疗前ANB(°)  治疗后ANB(°)  治疗前覆盖(mm)  治疗后覆盖(mm)  年龄  性别
P001      5.2            2.8            7.4              2.1              13    女
P002      6.8            3.1            9.2              1.8              14    男
...       ...            ...            ...              ...              ...   ...

统计链:描述统计 → 正态性检验 → 配对 t 检验(或 Wilcoxon 符号秩) → Cohen's d → APA 报告

场景二:测量可重复性研究(ICC 重测信度)

测量编号  医师A第1次  医师A第2次  医师B第1次
M001       5.2          5.4          5.6
M002       6.8          6.9          7.1
...        ...          ...          ...

统计链:ICC(2,1) 双向随机模型 → 95% CI → Bland-Altman 图 → APA 报告

场景三:影响因素预测(二分类 Logistic 回归)

患者编号  拔牙(0/1)  年龄  ANB(°)  覆盖(mm)  拥挤度(mm)  IMPA(°)  性别
P001       1          13    5.2      7.4        8.6          108       0
P002       0          14    2.1      2.4        3.2           95       1
...        ...        ...   ...      ...        ...          ...      ...

统计链:单因素筛选 → 多因素 Logistic → OR/95% CI → Hosmer-Lemeshow 检验 → ROC 曲线 → APA 报告


全流程分析演示

以"固定矫治器治疗安氏 II 类 1 分类错颌的疗效分析"为例:共纳入 52 例患者,治疗前后各取头影测量数据,两位医师分别测量各 20 例以评估重测信度,同时分析拔牙决策的影响因素。

第一步:描述统计 + 正态性检验

打开 chatsrs.com,上传数据后输入:

"请对治疗前和治疗后的各头影测量指标(ANB、覆盖、覆合、U1-NA、L1-NB)分别输出均值、标准差、最小值、最大值、偏度和峰度,生成 APA 格式三线表;并对每个指标的差值(后测-前测)做 Shapiro-Wilk 正态性检验,标注是否满足配对 t 检验的正态性假设。"

ChatSRS 自动输出:

表 1  头影测量指标治疗前后描述统计(M +- SD,n = 52)

指标          治疗前                  治疗后
         M        SD         M        SD
ANB(°)   5.84     1.23       2.96     0.98
覆盖(mm)  8.27     2.14       1.83     0.76
覆合(mm)  4.61     1.45       2.34     0.88
U1-NA(°) 28.34    4.21      23.18     3.87
L1-NB(°) 32.41    5.03      30.12     4.66

Shapiro-Wilk 正态性检验(差值):
ANB 差值:W = 0.978, p = .441 -- 满足正态性
覆盖差值:W = 0.971, p = .302 -- 满足正态性
覆合差值:W = 0.964, p = .126 -- 满足正态性

为什么先检验差值的正态性:配对 t 检验的假设是差值服从正态分布,而不是原始测量值。Shapiro-Wilk 检验在 SPSS 中可用至 n = 2000,n = 52 完全在其适用范围内,可直接采用,无需额外声明限制。


第二步:配对样本 t 检验 — 检验治疗前后是否有显著变化

"对 ANB 角、覆盖、覆合、U1-NA、L1-NB 分别做配对样本 t 检验,比较治疗前后的差异,报告 t 值、自由度、p 值(双尾)、均值差、Cohen's d 效应量和 95% 置信区间;使用 Bonferroni 校正控制多重比较误差(5 个指标,alpha = .05/5 = .01)。"

ChatSRS 输出:

表 2  治疗前后配对 t 检验结果(Bonferroni 校正 alpha = .010)

指标       均值差(95% CI)              t(51)    p      Cohen's d
ANB(°)    -2.88(-3.21, -2.55)        -17.24   <.001     2.54
覆盖(mm)  -6.44(-6.92, -5.96)        -26.83   <.001     3.73
覆合(mm)  -2.27(-2.57, -1.97)        -15.18   <.001     2.11
U1-NA(°)  -5.16(-5.84, -4.48)        -15.24   <.001     2.12
L1-NB(°)  -2.29(-3.01, -1.57)         -6.39   <.001     0.89

注:均值差 = 治疗后 - 治疗前;负值表示治疗后减小;
所有指标 p 均 < .010(Bonferroni 校正阈值),差异显著。

第三步:ICC 重测信度 — 评估测量可重复性

这是正畸研究方法学论文的必报内容。ICC 与简单 Pearson 相关的区别:ICC 同时考虑系统误差(均值偏移)和随机误差;Pearson r 只考虑线性趋势,不能检测到一致性偏移

"请对 ANB 角的四组重复测量值(医师A第1次、医师A第2次、医师B第1次、医师B第2次)分别计算:(1) 医师A组内重测 ICC(2,1),评估同一测量者重复测量一致性;(2) 医师A vs 医师B 组间 ICC(2,1),评估不同测量者间一致性;报告 ICC 点估计和 95% CI,并给出 Koo TK & Li MY(2016)标准下的一致性评级。"

ChatSRS 输出:

ICC 重测信度分析(ANB 角,n = 20)

组内重测(医师A,两次测量):
  ICC(2,1) = 0.984,95% CI [0.961, 0.994]
  一致性评级:优秀(Excellent,ICC > 0.90)

组间一致性(医师A vs 医师B):
  ICC(2,1) = 0.971,95% CI [0.933, 0.988]
  一致性评级:优秀(Excellent,ICC > 0.90)

Bland-Altman 分析(组内重测):
  均值偏差(Bias)= 0.08°,95%一致性界限 = [-0.41, 0.57]°
  无比例偏差(r = 0.12,p = .612)

关于 ICC 模型选择:正畸研究中最常用 ICC(2,1)——双向随机效应、单次测量、绝对一致性。如果测量者是从更大总体中随机抽取,用 ICC(2,1);如果只关心这几位特定测量者,用 ICC(3,1)。在 ChatSRS 中明确说明"双向随机、绝对一致性",系统会自动选模型。


第四步:Logistic 回归 — 拔牙决策预测因素分析

先做单因素筛选,再进多因素模型:

"以是否拔牙(0=不拔牙,1=拔牙)为因变量,对年龄、ANB、覆盖、拥挤度、IMPA、性别先分别做单因素 Logistic 回归,筛选 p < .10 的变量;再将筛出的变量纳入多因素 Logistic 回归(Enter 法),报告各预测变量的 OR 值、95% CI、Wald chi 方值和 p 值;输出 Nagelkerke R 方和 Hosmer-Lemeshow 检验结果;同时生成 ROC 曲线,报告 AUC 和 95% CI。"

ChatSRS 输出:

单因素筛选结果(p < .10 纳入多因素):
  ANB(°):p = .024,纳入
  覆盖(mm):p = .001,纳入
  拥挤度(mm):p = .003,纳入
  IMPA(°):p = .067,纳入
  年龄、性别:p > .10,排除

多因素 Logistic 回归结果(n = 52):

变量          B      SE     Wald    p      OR     95% CI
ANB(°)       0.62   0.21   8.73   .003   1.86   [1.23, 2.81]
覆盖(mm)     0.54   0.18   9.12   .003   1.72   [1.21, 2.45]
拥挤度(mm)   0.71   0.22  10.41   .001   2.03   [1.32, 3.14]
IMPA(°)      0.08   0.04   4.27   .039   1.08   [1.00, 1.17]
常数项      -9.34   2.87  10.59   .001    --     --

模型拟合:
  Nagelkerke R^2 = 0.612
  Hosmer-Lemeshow: chi^2(8) = 5.82,p = .668(拟合良好)
  AUC = 0.891,95% CI [0.810, 0.972]

论文方法/结果写法(APA 7th,正畸临床报告句式)

以下段落可直接抄入论文,替换括号内的数值即可。

方法章节:统计方法描述

采用配对样本 t 检验比较治疗前后各头影测量指标的变化,正态性通过 Shapiro-Wilk 检验验证;多指标比较采用 Bonferroni 法校正显著性水平(alpha = .010)。效应量采用 Cohen's d 报告,参照 Cohen(1988)小(0.2)、中(0.5)、大(0.8)的分级标准。测量者组内及组间重复测量一致性采用双向随机效应组内相关系数 ICC(2,1) 评估,并辅以 Bland-Altman 分析;ICC 解释参照 Koo 和 Li(2016)的分级标准(< .50 = 差,.50–.75 = 中等,.75–.90 = 良好,> .90 = 优秀)。以是否拔牙为结局变量,采用二项 Logistic 回归分析影响因素,先行单因素筛选(入选标准 p < .10),再以 Enter 法建立多因素模型;模型拟合采用 Hosmer-Lemeshow 检验,区分能力采用受试者工作特征曲线(ROC)和曲线下面积(AUC)评估。所有统计分析采用 ChatSRS 完成(SPSS/R/Stata 三引擎,显著性水平设为 .05,双尾检验)。

结果章节:配对 t 检验

配对样本 t 检验结果(Bonferroni 校正 alpha = .010)显示,治疗后 ANB 角显著减小(M_前 = 5.84°,SD = 1.23;M_后 = 2.96°,SD = 0.98),均值差为 -2.88°(95% CI [-3.21, -2.55]),t(51) = -17.24,p < .001,Cohen's d = 2.54,属于很大效应量,表明固定矫治器治疗显著改善了矢状骨骼关系。

结果章节:ICC 重测信度

测量者组内重测 ICC(2,1) = 0.984,95% CI [0.961, 0.994];测量者间 ICC(2,1) = 0.971,95% CI [0.933, 0.988];依据 Koo 和 Li(2016)标准均达"优秀"水平。Bland-Altman 分析显示,组内重测均值偏差为 0.08°,95% 一致性界限为 [-0.41, 0.57]°,测量误差在临床可接受范围内。

结果章节:Logistic 回归

多因素 Logistic 回归分析结果显示,拥挤度(OR = 2.03,95% CI [1.32, 3.14],p = .001)、ANB 角(OR = 1.86,95% CI [1.23, 2.81],p = .003)和覆盖(OR = 1.72,95% CI [1.21, 2.45],p = .003)是拔牙矫治的独立预测因素。模型整体拟合良好(Hosmer-Lemeshow chi^2(8) = 5.82,p = .668,Nagelkerke R^2 = 0.612),ROC 曲线下面积 AUC = 0.891(95% CI [0.810, 0.972]),具有良好的区分能力。


上面三段可直接进论文 Results 章节,只需替换你自己的数值。ChatSRS 的"APA 报告"功能可自动生成对应段落,无需手动转写。


ChatSRS 三引擎在正畸临床研究中的优势

引擎正畸场景优势典型指令关键词
SPSS 引擎配对 t/独立 t,输出与 SPSS 完全对应,方便与导师核对"配对样本 t 检验,效应量 Cohen's d"
R 引擎ICC 精确到小数点后三位,支持 Bland-Altman 图,Bootstrap 置信区间"ICC(2,1),双向随机,Bland-Altman 分析"
Stata 引擎Logistic 回归、ROC 分析、Hosmer-Lemeshow,医学期刊最认可的格式"二项 Logistic 回归,OR 值,ROC 曲线,AUC"

三引擎同样的数据算出的结果在数值上完全一致(底层数学相同),可以用任意引擎互相验证,也可在 ChatSRS 中指定"请用 R 引擎"或"请用 Stata 格式输出"。


常见 FAQ

Q1: 正畸研究里 ICC 和 Kappa 什么时候用哪个?

核心区别在于变量类型

  • ICC(组内相关系数):适用于连续型测量值,如头影测量角度、距离、模型测量数值。ICC 同时评估随机误差和系统误差,是正畸测量一致性研究的标准选择。
  • Kappa:适用于分类变量的一致性,如两位医师对同一患者"需要/不需要拔牙"的判断是否一致。

如果用 Pearson r 来报告测量一致性,审稿人通常会要求补 ICC——因为 r 只反映线性趋势,两位医师都系统性地高估 2mm 时 r 依然接近 1.0,但 ICC 会检测到这个偏移。

Q2: 配对 t 检验的样本量多少才够?

正畸临床研究常见的配对 t 检验功效分析计算:

  • 预期效应量 Cohen's d = 0.5(中等),alpha = .05,功效 = 0.80
  • 需要样本量约 34 对

在 ChatSRS 中输入:

"请做配对 t 检验的功效分析(power analysis),预期效应量 d = 0.5,alpha = .05,功效 = 0.80,计算需要的最小样本量。"

系统会自动给出样本量,并附上功效曲线说明。如果已收集数据,ChatSRS 也能反向计算当前样本量对应的统计功效,这对已发表论文的局限性讨论非常有用。

Q3: Logistic 回归的样本量有什么要求?

最常引用的经验法则:每个预测变量至少需要 10-15 个结局事件(events per variable, EPV)。例如纳入 4 个预测变量、拔牙结局(少数类)有 28 人,EPV = 28/4 = 7,偏低但在文献中仍可见——此时建议报告 Firth 惩罚 Logistic 回归以减少小样本偏差。

在 ChatSRS 中说明"样本量偏小,请用 Firth 惩罚 Logistic 回归"即可切换方法。

Q4: Bland-Altman 图是什么,为什么比 ICC 更直观?

Bland-Altman 图是以两次测量的均值为 x 轴、差值为 y 轴的散点图,同时绘制均值偏差(bias)和 95% 一致性界限(LoA)。

它回答的问题是:在临床上,两次测量之间的差值有多大,是否在可接受范围内。ICC 是一个压缩的统计量,Bland-Altman 图让读者直观看到每对测量的离散程度和是否存在比例偏差(随均值增大差值也增大)。

正畸研究投稿 EJO、AJO-DO 等期刊时,编辑经常同时要求报告 ICC 和 Bland-Altman 图。在 ChatSRS 中加一句"并生成 Bland-Altman 图"即可。

Q5: 审稿人说"请报告 OR 的 95% CI",如何快速补充?

如果你已经用 ChatSRS 跑过 Logistic 回归,所有 OR 的 95% CI 在结果表里已经自动输出。如果最初没有指定,重新输入:

"请对已建立的 Logistic 回归模型,补充每个预测变量的 OR 值和 95% Wald 置信区间,以三线表格式输出。"

ChatSRS 直接从已有模型中提取,不需要重新上传数据或重跑分析。


正畸临床研究统计小结

研究问题推荐方法ChatSRS 关键指令
治疗前后是否有显著变化配对 t 检验 / Wilcoxon 符号秩"配对样本 t 检验,Cohen's d,95% CI"
多指标同时比较配对 t + Bonferroni 校正"Bonferroni 校正,5 个指标,alpha = .01"
测量者重测信度ICC(2,1) + Bland-Altman"ICC 双向随机绝对一致性,Bland-Altman 图"
测量者间一致性ICC(2,1)"测量者间 ICC,95% CI,Koo Li 评级"
拔牙/不拔牙预测因素二项 Logistic 回归"Logistic 回归,OR,Hosmer-Lemeshow,ROC,AUC"
模型区分能力ROC 曲线"ROC 曲线,AUC 和 95% CI,最佳截断值"

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。