统计百科 ·
等效性检验TOST是什么?如何用双单侧检验证明两组没有实质差异
统计百科:等效性检验(TOST)用双单侧t检验证明两组差异在等效界值内,是临床非劣效与仿制药研究的核心方法。本文解释TOST原理、等效界值设定、与传统零假设检验的区别,并给出可直接引用的APA 7th报告句式。
传统统计检验的逻辑是"找差异":p < .05 表示两组不同。但有时研究目标恰恰相反——需要证明两种干预、两种测量方法或两个版本之间在实践上没有实质差异。这时"不显著"并不等于"等效",需要换一套逻辑:等效性检验(Equivalence Testing),核心方法是 TOST(Two One-Sided Tests,双单侧检验)。本文从原理到 APA 格式报告一步步拆解。
一、为什么"p > .05"不能证明等效?
这是初学者最常犯的逻辑错误。
传统零假设显著性检验(NHST)的零假设是"两组均值相等",备择假设是"两组不等"。当 p > .05 时,我们只能说"无法拒绝零假设",不能说"证明了两组相等"。原因很简单:
- 样本量太小 → 检验功效不足 → 即使真有差异也可能检测不到
- p > .05 可能只是噪声掩盖了真实差异,而不是"差异不存在"
证明等效需要一套独立的检验框架,把"等效"作为备择假设,把"有实质差异"作为零假设来拒绝。
二、TOST 的核心思路:等效界值 + 双单侧检验
等效界值(Equivalence Bounds)
等效性检验的第一步是研究者事先确定一个等效界值 $\Delta$(delta),也写作 $[-\delta_L, \delta_U]$(允许非对称)。
等效界值的含义是:如果两组的真实差异落在此区间内,就认为差异在实践上可忽略。
例如,比较仿制药与原研药的血浆浓度(AUC),若差异在 ±20% 以内认为等效,则 $\Delta = 20%$。等效界值不由统计决定,由专业知识、临床意义或测量精度决定,需在方案阶段预先设定。
TOST 的逻辑
设两组均值差为 $\mu_1 - \mu_2$,TOST 同时检验两个单侧假设:
检验 1(下界): $H_{01}: \mu_1 - \mu_2 \leq -\delta \quad \text{vs} \quad H_{a1}: \mu_1 - \mu_2 > -\delta$
检验 2(上界): $H_{02}: \mu_1 - \mu_2 \geq +\delta \quad \text{vs} \quad H_{a2}: \mu_1 - \mu_2 < +\delta$
只有当两个单侧检验都显著(即两个 p 值均 < alpha),才拒绝"有实质差异"的零假设,得出等效性结论。
直觉理解:TOST 等价于检查观测差异的双侧置信区间是否完全落在等效界值 $[-\delta, +\delta]$ 内。
$\text{等效成立} \iff \text{CI}_{1-2\alpha}[\mu_1 - \mu_2] \subseteq [-\delta, +\delta]$
注意此处用的是 $(1-2\alpha)$ 置信区间(alpha = .05 时用 90% CI),不是常规的 95% CI。
三、TOST 与传统检验的对比
| 维度 | 传统 NHST(差异检验) | TOST(等效性检验) |
|---|---|---|
| 零假设 | 两组相等(差异 = 0) | 差异 >= 等效界值(存在实质差异) |
| 备择假设 | 两组存在任意差异 | 差异 < 等效界值(等效) |
| 目标 | 发现差异 | 证明等效 |
| 显著结论 | 两组不同 | 两组等效 |
| 不显著结论 | 不能证明等效 | 不能证明等效(统计功效不足) |
| 置信区间 | 95% CI 不含 0 → 显著 | 90% CI 完全含于 $[-\delta, +\delta]$ → 等效 |
| 样本量需求 | 取决于期望效应量 | 取决于等效界值与期望效应量 |
| 典型应用 | 实验效果验证、组间比较 | 仿制药、方法学验证、可重复性研究 |
四、等效界值如何设定?
等效界值的设定是 TOST 的最关键决策,必须在数据收集前预先确定,事后调整等效界值是一种 p-hacking。
常见设定方法
1. 基于临床/实践意义(最推荐)
由领域专家判断:差异小到什么程度在实践中无意义?
- 仿制药研究:FDA/EMA 规定 AUC 和 Cmax 的等效界值为 ±20%(即 0.80–1.25 倍)
- 心理测量:量表两种测量形式的相关性 > .90,均值差 < 0.5 个标准差
2. 基于效应量标准(Cohen,1988)
将"小效应"下限作为等效界值,常用 d = 0.2(0.5 个标准差的 40%)。
$\delta = 0.2 \times \sigma_{pooled}$
Cohen 的 d = 0.2 对应"可被研究者主观察觉但实践意义有限"的差异,是心理学与社会科学中最常见的等效界值基准。Lakens(2017)建议将 d = 0.5 的效应作为上界等效标准(half of a medium effect),即 $\Delta = \pm 0.5\sigma$。
3. 基于历史数据或参考区间
用既往测量误差或参考人群变异的某一分数位作为界值。
等效界值报告规范
方法章节必须:
- 明确报告等效界值数值(原始单位 + 标准化单位)
- 说明界值的来源和理由(理论依据/文献/专家共识)
- 说明使用了 TOST 还是单侧等效性检验(非劣效)
五、非劣效检验:等效性的单侧版本
等效性检验是双侧的(既不能太高也不能太低),而**非劣效检验(Non-inferiority Testing)**是单侧的:只要求新方法不比参照方法差超过一定界值。
$H_0: \mu_{new} - \mu_{ref} \leq -\delta \quad \text{vs} \quad H_a: \mu_{new} - \mu_{ref} > -\delta$
非劣效检验只检验一个方向,使用单侧 alpha(通常 .025)和对应的单侧置信区间(95% CI 下界 > $-\delta$)。
等效 vs 非劣效的选择:
- 等效性检验(TOST):不允许新方法既不能太差也不能太好(如仿制药不得过强)
- 非劣效检验:允许新方法更好,只要不明显更差(如新手术方式 vs 传统方式)
两者在临床试验中均受 ICH E9(R1) 和 FDA 指南规范,统计分析计划(SAP)中需预先说明。
六、样本量:TOST 需要多少数据?
TOST 的功效(power)依赖于四个参数:
- 等效界值 $\delta$(越严格,需要越大样本)
- 真实效应量(假设两组实际差异 = 0 或某个小值)
- 显著性水平 alpha(通常 .05,每个单侧检验独立以 alpha = .05 判断,对应 90% CI)
- 目标功效(通常 80% 或 90%)
直觉规律:等效性检验通常比差异检验需要更大样本,因为等效界值(如 d = 0.2)比典型差异效应量(d = 0.5)更小,信噪比更低。
使用 R 的 TOSTER 包可计算:
library(TOSTER)
power_t_TOST(alpha = .05, delta = 0, eqb = 0.2,
power = 0.80, type = "two.sample")
七、APA 7th 报告模板
方法章节描述模板
采用双单侧检验(TOST; Schuirmann,1987)评估[A组]与[B组]的等效性。
等效界值设定为 delta = [值]([单位];对应标准化效应量 d = [值]),
依据[来源(如 FDA 指南/Cohen 1988/专家共识)]。
采用独立样本 t 检验框架进行 TOST,每个单侧检验均以 alpha = .05 判断显著性,
等效性结论基于 90% 置信区间完全落于等效界值内。
结果报告模板(等效成立)
TOST 检验结果显示,[A组](M = X.XX,SD = X.XX)与[B组]
(M = X.XX,SD = X.XX)的均值差为 X.XX(95% CI [X.XX, X.XX];
90% CI [X.XX, X.XX]),两个单侧检验均显著:
t([df]) = X.XX, p = .XXX(下界);t([df]) = X.XX, p = .XXX(上界)。
90% 置信区间 [X.XX, X.XX] 完全落于预设等效界值 [-X.XX, +X.XX] 内,
达到统计等效性标准(Cohen's d = X.XX;dz = X.XX,alpha = .05)。
结果报告模板(等效不成立)
TOST 检验未能建立等效性:[A组]与[B组]均值差的 90% 置信区间
[X.XX, X.XX] 未完全落于等效界值 [-X.XX, +X.XX] 内
(下界 t([df]) = X.XX, p = .XXX;上界 t([df]) = X.XX, p = .XXX)。
现有数据不足以得出两组在[测量指标]上等效的结论。
完整填值示例
采用双单侧检验(TOST; Schuirmann,1987)评估治疗组与控制组在工作记忆得分上的等效性,等效界值预设为 $\delta = 3$ 分(对应 Cohen's d = 0.30),依据 Cohen(1988)小效应标准。治疗组(M = 52.4,SD = 10.1)与控制组(M = 51.1,SD = 9.9)均值差为 1.3 分,90% CI [−0.3, 2.9](n = 200/组,SE = 1.00)。两个单侧检验均显著:下界检验 t(398) = 4.30,p < .001;上界检验 t(398) = 1.70,p = .045。90% 置信区间 [−0.3, 2.9] 完全落于等效界值 [−3, +3] 内,两组在工作记忆得分上达到统计等效性标准,Cohen's d = 0.13(95% CI [−0.05, 0.31]),alpha = .05。
八、在 ChatSRS 一句话完成 TOST 等效性检验
打开 chatsrs.com,上传数据后输入:
对治疗组和控制组的工作记忆得分做等效性检验(TOST),等效界值设为 delta = 3 分(对应 Cohen's d = 0.20),显著性水平 alpha = .05;输出两个单侧检验的 t 值、p 值,以及 90% 置信区间,并说明等效性是否成立;给出可直接引用的 APA 7th 格式报告段落。
ChatSRS 调用 R 引擎(TOSTER 包)自动完成计算,输出等效界值图(置信区间 vs 等效带)和完整报告段落,含方法与结果两节,可直接复制进论文。
九、常见 FAQ
Q:TOST 和传统 t 检验能同时报告吗?
A:可以,而且有时必须同时报告。同时报告 NHST t 检验(检验是否有差异)和 TOST(检验是否等效)可以区分四种情况:(1) 有差异且不等效(NHST 显著,TOST 不显著);(2) 无实质差异且等效(NHST 不显著,TOST 显著);(3) 两者都不显著(样本量不足,结论不确定);(4) 两者都显著(差异显著但落在等效区间内,理论上罕见但可能发生于极大样本)。Lakens 等(2018)将这种双报告框架称为"two-tailed NHST + TOST",是现代可重复性研究的推荐实践。
Q:等效界值必须对称吗?
A:不必须。非对称等效界值 $[-\delta_L, +\delta_U]$ 在药代动力学(如 FDA 要求 AUC 等效界限为 0.80–1.25,原始比值尺度上 +25% vs −20% 并不对称,但对数变换后恰好完全对称:$\ln(1.25) = 0.2231$,$\ln(0.80) = -0.2231$,因为 $1.25 = 1/0.80$,区间变为完全对称的 $[-0.2231, +0.2231]$)和某些临床场景中很常见。TOSTER 包的 tost() 函数支持设定 low_eqbound 和 high_eqbound 为不同值。报告时需分别写明上下界数值。
Q:TOST 的置信区间为什么用 90% 而不是 95%?
A:TOST 使用 $(1-2\alpha)$ 置信区间,当 alpha = .05 时为 90% CI。原因是:等效性结论要求两个单侧检验(各 alpha = .05)同时显著,等价于观测效应的 $(1-2\alpha) = 90%$ CI 完全位于等效界值内。若使用 95% CI,等价于双侧 alpha = .025,检验更保守(更难得出等效结论)。仿制药研究中有时使用 alpha = .05(对应 90% CI),有时使用 alpha = .025(对应 95% CI),需遵循监管要求。
Q:等效性检验对样本量的要求比差异检验更高吗?
A:通常是的。当等效界值设为 $d = 0.20$(小效应)、目标功效 80% 时,独立样本 TOST 约需每组 $n \approx 198$ 人;而同等 alpha = .05、power = 80% 下,NHST 检验 d = 0.20 的差异需每组约 393 人(因差异检验是双侧,而 TOST 每个单侧检验已各用 alpha = .05)。即对于小效应量,等效性检验反而比差异检验需要更少样本——但当真实效应不为零(如真实 d = 0.10 而界值设为 d = 0.20)时,TOST 所需样本量会显著增加。建议使用 TOSTER::power_t_TOST() 或 G*Power 在方案阶段计算所需样本。
Q:仿制药研究的 80–125% 等效界值是怎么来的?
A:FDA(1992)和 EMA 指南规定,仿制药的 AUC 和 Cmax 几何均值比(仿制/原研)的 90% CI 必须落在 80%–125% 范围内,该数值经过对数变换后对应 $[-\ln(1.25), +\ln(1.25)] \approx [-0.223, +0.223]$。这一界值并非来自纯粹统计推导,而是基于监管机构对临床可接受差异的判断,历经数十年的临床实践验证。不同器官系统的药物、不同监管机构(FDA/EMA/PMDA)可能采用不同界值。
相关阅读
- t 值的 APA 7th 报告写法 — 自由度、效应量、独立/配对模板全解
- 统计显著性与 p 值完全指南
- 效应量完整指南 — Cohen's d、r、f、OR 选用与 APA 报告
- 贝叶斯 vs 频率派统计:社会科学研究者的选择指南
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。