场景案例 ·
口腔正畸临床研究数据怎么用 AI 做统计分析?— 配对 t / ICC / Logistic 三引擎全流程
口腔正畸临床研究必备统计指南:疗效配对 t 检验、ICC 重测信度、二分类 Logistic 回归,ChatSRS 三引擎一句话指令,输出 APA 7th 论文级结果,附可直接引用的报告句式。
正畸科的毕业论文和临床研究有三大统计难关:治疗前后测量值的配对比较不知道怎么报效应量;两位医师的测量值差异到底用 Kappa 还是 ICC 从来搞不清楚;预测矫治成功与否该跑 Logistic 还是线性回归也是一头雾水。这篇文章把口腔正畸临床数据最高频的三条统计链逐步拆解,每步给出 ChatSRS 可直接使用的指令以及可抄进论文的 APA 7th 报告句式。
为什么正畸临床数据分析比一般医学统计更复杂
口腔正畸是高度依赖测量的学科——头影测量、模型分析、PAR 指数、软组织侧貌……每个研究都会产生大量连续型测量数据,而这些数据有三个特殊性:
- 配对结构:同一患者治疗前后的测量值,必须用配对设计才能正确估计干预效果;单纯做独立样本 t 检验会低估统计功效,结论更不可靠。
- 测量误差不可忽视:头影测量有重复测量误差,研究可重复性靠 ICC(组内相关系数)而非简单 Pearson r;很多导师和审稿人会专门盯这一点。
- 结局常是二分类:矫治成功/失败、拔牙/不拔牙、复发/稳定——这类结局变量无法用线性回归,必须用 Logistic 回归,且需报告 OR 值和 95% CI。
chatsrs.com 内置 SPSS、R、Stata 三个分析引擎,针对上述三种场景均有专项支持。下面按真实临床研究流程逐步演示。
典型数据结构:正畸临床研究的三类场景
场景一:治疗前后疗效比较(配对设计)
患者编号 治疗前ANB(°) 治疗后ANB(°) 治疗前覆盖(mm) 治疗后覆盖(mm) 年龄 性别
P001 5.2 2.8 7.4 2.1 13 女
P002 6.8 3.1 9.2 1.8 14 男
... ... ... ... ... ... ...
统计链:描述统计 → 正态性检验 → 配对 t 检验(或 Wilcoxon 符号秩) → Cohen's d → APA 报告
场景二:测量可重复性研究(ICC 重测信度)
测量编号 医师A第1次 医师A第2次 医师B第1次
M001 5.2 5.4 5.6
M002 6.8 6.9 7.1
... ... ... ...
统计链:ICC(2,1) 双向随机模型 → 95% CI → Bland-Altman 图 → APA 报告
场景三:影响因素预测(二分类 Logistic 回归)
患者编号 拔牙(0/1) 年龄 ANB(°) 覆盖(mm) 拥挤度(mm) IMPA(°) 性别
P001 1 13 5.2 7.4 8.6 108 0
P002 0 14 2.1 2.4 3.2 95 1
... ... ... ... ... ... ... ...
统计链:单因素筛选 → 多因素 Logistic → OR/95% CI → Hosmer-Lemeshow 检验 → ROC 曲线 → APA 报告
全流程分析演示
以"固定矫治器治疗安氏 II 类 1 分类错颌的疗效分析"为例:共纳入 52 例患者,治疗前后各取头影测量数据,两位医师分别测量各 20 例以评估重测信度,同时分析拔牙决策的影响因素。
第一步:描述统计 + 正态性检验
打开 chatsrs.com,上传数据后输入:
"请对治疗前和治疗后的各头影测量指标(ANB、覆盖、覆合、U1-NA、L1-NB)分别输出均值、标准差、最小值、最大值、偏度和峰度,生成 APA 格式三线表;并对每个指标的差值(后测-前测)做 Shapiro-Wilk 正态性检验,标注是否满足配对 t 检验的正态性假设。"
ChatSRS 自动输出:
表 1 头影测量指标治疗前后描述统计(M +- SD,n = 52)
指标 治疗前 治疗后
M SD M SD
ANB(°) 5.84 1.23 2.96 0.98
覆盖(mm) 8.27 2.14 1.83 0.76
覆合(mm) 4.61 1.45 2.34 0.88
U1-NA(°) 28.34 4.21 23.18 3.87
L1-NB(°) 32.41 5.03 30.12 4.66
Shapiro-Wilk 正态性检验(差值):
ANB 差值:W = 0.978, p = .441 -- 满足正态性
覆盖差值:W = 0.971, p = .302 -- 满足正态性
覆合差值:W = 0.964, p = .126 -- 满足正态性
为什么先检验差值的正态性:配对 t 检验的假设是差值服从正态分布,而不是原始测量值。Shapiro-Wilk 检验在 SPSS 中可用至 n = 2000,n = 52 完全在其适用范围内,可直接采用,无需额外声明限制。
第二步:配对样本 t 检验 — 检验治疗前后是否有显著变化
"对 ANB 角、覆盖、覆合、U1-NA、L1-NB 分别做配对样本 t 检验,比较治疗前后的差异,报告 t 值、自由度、p 值(双尾)、均值差、Cohen's d 效应量和 95% 置信区间;使用 Bonferroni 校正控制多重比较误差(5 个指标,alpha = .05/5 = .01)。"
ChatSRS 输出:
表 2 治疗前后配对 t 检验结果(Bonferroni 校正 alpha = .010)
指标 均值差(95% CI) t(51) p Cohen's d
ANB(°) -2.88(-3.21, -2.55) -17.24 <.001 2.54
覆盖(mm) -6.44(-6.92, -5.96) -26.83 <.001 3.73
覆合(mm) -2.27(-2.57, -1.97) -15.18 <.001 2.11
U1-NA(°) -5.16(-5.84, -4.48) -15.24 <.001 2.12
L1-NB(°) -2.29(-3.01, -1.57) -6.39 <.001 0.89
注:均值差 = 治疗后 - 治疗前;负值表示治疗后减小;
所有指标 p 均 < .010(Bonferroni 校正阈值),差异显著。
第三步:ICC 重测信度 — 评估测量可重复性
这是正畸研究方法学论文的必报内容。ICC 与简单 Pearson 相关的区别:ICC 同时考虑系统误差(均值偏移)和随机误差;Pearson r 只考虑线性趋势,不能检测到一致性偏移。
"请对 ANB 角的四组重复测量值(医师A第1次、医师A第2次、医师B第1次、医师B第2次)分别计算:(1) 医师A组内重测 ICC(2,1),评估同一测量者重复测量一致性;(2) 医师A vs 医师B 组间 ICC(2,1),评估不同测量者间一致性;报告 ICC 点估计和 95% CI,并给出 Koo TK & Li MY(2016)标准下的一致性评级。"
ChatSRS 输出:
ICC 重测信度分析(ANB 角,n = 20)
组内重测(医师A,两次测量):
ICC(2,1) = 0.984,95% CI [0.961, 0.994]
一致性评级:优秀(Excellent,ICC > 0.90)
组间一致性(医师A vs 医师B):
ICC(2,1) = 0.971,95% CI [0.933, 0.988]
一致性评级:优秀(Excellent,ICC > 0.90)
Bland-Altman 分析(组内重测):
均值偏差(Bias)= 0.08°,95%一致性界限 = [-0.41, 0.57]°
无比例偏差(r = 0.12,p = .612)
关于 ICC 模型选择:正畸研究中最常用 ICC(2,1)——双向随机效应、单次测量、绝对一致性。如果测量者是从更大总体中随机抽取,用 ICC(2,1);如果只关心这几位特定测量者,用 ICC(3,1)。在 ChatSRS 中明确说明"双向随机、绝对一致性",系统会自动选模型。
第四步:Logistic 回归 — 拔牙决策预测因素分析
先做单因素筛选,再进多因素模型:
"以是否拔牙(0=不拔牙,1=拔牙)为因变量,对年龄、ANB、覆盖、拥挤度、IMPA、性别先分别做单因素 Logistic 回归,筛选 p < .10 的变量;再将筛出的变量纳入多因素 Logistic 回归(Enter 法),报告各预测变量的 OR 值、95% CI、Wald chi 方值和 p 值;输出 Nagelkerke R 方和 Hosmer-Lemeshow 检验结果;同时生成 ROC 曲线,报告 AUC 和 95% CI。"
ChatSRS 输出:
单因素筛选结果(p < .10 纳入多因素):
ANB(°):p = .024,纳入
覆盖(mm):p = .001,纳入
拥挤度(mm):p = .003,纳入
IMPA(°):p = .067,纳入
年龄、性别:p > .10,排除
多因素 Logistic 回归结果(n = 52):
变量 B SE Wald p OR 95% CI
ANB(°) 0.62 0.21 8.73 .003 1.86 [1.23, 2.81]
覆盖(mm) 0.54 0.18 9.12 .003 1.72 [1.21, 2.45]
拥挤度(mm) 0.71 0.22 10.41 .001 2.03 [1.32, 3.14]
IMPA(°) 0.08 0.04 4.27 .039 1.08 [1.00, 1.17]
常数项 -9.34 2.87 10.59 .001 -- --
模型拟合:
Nagelkerke R^2 = 0.612
Hosmer-Lemeshow: chi^2(8) = 5.82,p = .668(拟合良好)
AUC = 0.891,95% CI [0.810, 0.972]
论文方法/结果写法(APA 7th,正畸临床报告句式)
以下段落可直接抄入论文,替换括号内的数值即可。
方法章节:统计方法描述
采用配对样本 t 检验比较治疗前后各头影测量指标的变化,正态性通过 Shapiro-Wilk 检验验证;多指标比较采用 Bonferroni 法校正显著性水平(alpha = .010)。效应量采用 Cohen's d 报告,参照 Cohen(1988)小(0.2)、中(0.5)、大(0.8)的分级标准。测量者组内及组间重复测量一致性采用双向随机效应组内相关系数 ICC(2,1) 评估,并辅以 Bland-Altman 分析;ICC 解释参照 Koo 和 Li(2016)的分级标准(< .50 = 差,.50–.75 = 中等,.75–.90 = 良好,> .90 = 优秀)。以是否拔牙为结局变量,采用二项 Logistic 回归分析影响因素,先行单因素筛选(入选标准 p < .10),再以 Enter 法建立多因素模型;模型拟合采用 Hosmer-Lemeshow 检验,区分能力采用受试者工作特征曲线(ROC)和曲线下面积(AUC)评估。所有统计分析采用 ChatSRS 完成(SPSS/R/Stata 三引擎,显著性水平设为 .05,双尾检验)。
结果章节:配对 t 检验
配对样本 t 检验结果(Bonferroni 校正 alpha = .010)显示,治疗后 ANB 角显著减小(M_前 = 5.84°,SD = 1.23;M_后 = 2.96°,SD = 0.98),均值差为 -2.88°(95% CI [-3.21, -2.55]),t(51) = -17.24,p < .001,Cohen's d = 2.54,属于很大效应量,表明固定矫治器治疗显著改善了矢状骨骼关系。
结果章节:ICC 重测信度
测量者组内重测 ICC(2,1) = 0.984,95% CI [0.961, 0.994];测量者间 ICC(2,1) = 0.971,95% CI [0.933, 0.988];依据 Koo 和 Li(2016)标准均达"优秀"水平。Bland-Altman 分析显示,组内重测均值偏差为 0.08°,95% 一致性界限为 [-0.41, 0.57]°,测量误差在临床可接受范围内。
结果章节:Logistic 回归
多因素 Logistic 回归分析结果显示,拥挤度(OR = 2.03,95% CI [1.32, 3.14],p = .001)、ANB 角(OR = 1.86,95% CI [1.23, 2.81],p = .003)和覆盖(OR = 1.72,95% CI [1.21, 2.45],p = .003)是拔牙矫治的独立预测因素。模型整体拟合良好(Hosmer-Lemeshow chi^2(8) = 5.82,p = .668,Nagelkerke R^2 = 0.612),ROC 曲线下面积 AUC = 0.891(95% CI [0.810, 0.972]),具有良好的区分能力。
上面三段可直接进论文 Results 章节,只需替换你自己的数值。ChatSRS 的"APA 报告"功能可自动生成对应段落,无需手动转写。
ChatSRS 三引擎在正畸临床研究中的优势
| 引擎 | 正畸场景优势 | 典型指令关键词 |
|---|---|---|
| SPSS 引擎 | 配对 t/独立 t,输出与 SPSS 完全对应,方便与导师核对 | "配对样本 t 检验,效应量 Cohen's d" |
| R 引擎 | ICC 精确到小数点后三位,支持 Bland-Altman 图,Bootstrap 置信区间 | "ICC(2,1),双向随机,Bland-Altman 分析" |
| Stata 引擎 | Logistic 回归、ROC 分析、Hosmer-Lemeshow,医学期刊最认可的格式 | "二项 Logistic 回归,OR 值,ROC 曲线,AUC" |
三引擎同样的数据算出的结果在数值上完全一致(底层数学相同),可以用任意引擎互相验证,也可在 ChatSRS 中指定"请用 R 引擎"或"请用 Stata 格式输出"。
常见 FAQ
Q1: 正畸研究里 ICC 和 Kappa 什么时候用哪个?
核心区别在于变量类型:
- ICC(组内相关系数):适用于连续型测量值,如头影测量角度、距离、模型测量数值。ICC 同时评估随机误差和系统误差,是正畸测量一致性研究的标准选择。
- Kappa:适用于分类变量的一致性,如两位医师对同一患者"需要/不需要拔牙"的判断是否一致。
如果用 Pearson r 来报告测量一致性,审稿人通常会要求补 ICC——因为 r 只反映线性趋势,两位医师都系统性地高估 2mm 时 r 依然接近 1.0,但 ICC 会检测到这个偏移。
Q2: 配对 t 检验的样本量多少才够?
正畸临床研究常见的配对 t 检验功效分析计算:
- 预期效应量 Cohen's d = 0.5(中等),alpha = .05,功效 = 0.80
- 需要样本量约 34 对
在 ChatSRS 中输入:
"请做配对 t 检验的功效分析(power analysis),预期效应量 d = 0.5,alpha = .05,功效 = 0.80,计算需要的最小样本量。"
系统会自动给出样本量,并附上功效曲线说明。如果已收集数据,ChatSRS 也能反向计算当前样本量对应的统计功效,这对已发表论文的局限性讨论非常有用。
Q3: Logistic 回归的样本量有什么要求?
最常引用的经验法则:每个预测变量至少需要 10-15 个结局事件(events per variable, EPV)。例如纳入 4 个预测变量、拔牙结局(少数类)有 28 人,EPV = 28/4 = 7,偏低但在文献中仍可见——此时建议报告 Firth 惩罚 Logistic 回归以减少小样本偏差。
在 ChatSRS 中说明"样本量偏小,请用 Firth 惩罚 Logistic 回归"即可切换方法。
Q4: Bland-Altman 图是什么,为什么比 ICC 更直观?
Bland-Altman 图是以两次测量的均值为 x 轴、差值为 y 轴的散点图,同时绘制均值偏差(bias)和 95% 一致性界限(LoA)。
它回答的问题是:在临床上,两次测量之间的差值有多大,是否在可接受范围内。ICC 是一个压缩的统计量,Bland-Altman 图让读者直观看到每对测量的离散程度和是否存在比例偏差(随均值增大差值也增大)。
正畸研究投稿 EJO、AJO-DO 等期刊时,编辑经常同时要求报告 ICC 和 Bland-Altman 图。在 ChatSRS 中加一句"并生成 Bland-Altman 图"即可。
Q5: 审稿人说"请报告 OR 的 95% CI",如何快速补充?
如果你已经用 ChatSRS 跑过 Logistic 回归,所有 OR 的 95% CI 在结果表里已经自动输出。如果最初没有指定,重新输入:
"请对已建立的 Logistic 回归模型,补充每个预测变量的 OR 值和 95% Wald 置信区间,以三线表格式输出。"
ChatSRS 直接从已有模型中提取,不需要重新上传数据或重跑分析。
正畸临床研究统计小结
| 研究问题 | 推荐方法 | ChatSRS 关键指令 |
|---|---|---|
| 治疗前后是否有显著变化 | 配对 t 检验 / Wilcoxon 符号秩 | "配对样本 t 检验,Cohen's d,95% CI" |
| 多指标同时比较 | 配对 t + Bonferroni 校正 | "Bonferroni 校正,5 个指标,alpha = .01" |
| 测量者重测信度 | ICC(2,1) + Bland-Altman | "ICC 双向随机绝对一致性,Bland-Altman 图" |
| 测量者间一致性 | ICC(2,1) | "测量者间 ICC,95% CI,Koo Li 评级" |
| 拔牙/不拔牙预测因素 | 二项 Logistic 回归 | "Logistic 回归,OR,Hosmer-Lemeshow,ROC,AUC" |
| 模型区分能力 | ROC 曲线 | "ROC 曲线,AUC 和 95% CI,最佳截断值" |
相关阅读
- 配对样本 t 检验完整教程 — AI 一句话完成
- ICC 测量一致性分析完整教程
- Logistic 回归完整教程 — AI 一键完成二分类预测
- 口腔牙科临床数据 AI 统计分析指南
- 临床试验数据分析全流程 — AI 完成 RCT 统计
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。