统计百科 ·

等效性检验TOST是什么?如何用双单侧检验证明两组没有实质差异

统计百科:等效性检验(TOST)用双单侧t检验证明两组差异在等效界值内,是临床非劣效与仿制药研究的核心方法。本文解释TOST原理、等效界值设定、与传统零假设检验的区别,并给出可直接引用的APA 7th报告句式。

传统统计检验的逻辑是"找差异":p < .05 表示两组不同。但有时研究目标恰恰相反——需要证明两种干预、两种测量方法或两个版本之间在实践上没有实质差异。这时"不显著"并不等于"等效",需要换一套逻辑:等效性检验(Equivalence Testing),核心方法是 TOST(Two One-Sided Tests,双单侧检验)。本文从原理到 APA 格式报告一步步拆解。


一、为什么"p > .05"不能证明等效?

这是初学者最常犯的逻辑错误。

传统零假设显著性检验(NHST)的零假设是"两组均值相等",备择假设是"两组不等"。当 p > .05 时,我们只能说"无法拒绝零假设",不能说"证明了两组相等"。原因很简单:

  • 样本量太小 → 检验功效不足 → 即使真有差异也可能检测不到
  • p > .05 可能只是噪声掩盖了真实差异,而不是"差异不存在"

证明等效需要一套独立的检验框架,把"等效"作为备择假设,把"有实质差异"作为零假设来拒绝。


二、TOST 的核心思路:等效界值 + 双单侧检验

等效界值(Equivalence Bounds)

等效性检验的第一步是研究者事先确定一个等效界值 $\Delta$(delta),也写作 $[-\delta_L, \delta_U]$(允许非对称)。

等效界值的含义是:如果两组的真实差异落在此区间内,就认为差异在实践上可忽略。

例如,比较仿制药与原研药的血浆浓度(AUC),若差异在 ±20% 以内认为等效,则 $\Delta = 20%$。等效界值不由统计决定,由专业知识、临床意义或测量精度决定,需在方案阶段预先设定。

TOST 的逻辑

设两组均值差为 $\mu_1 - \mu_2$,TOST 同时检验两个单侧假设:

检验 1(下界): $H_{01}: \mu_1 - \mu_2 \leq -\delta \quad \text{vs} \quad H_{a1}: \mu_1 - \mu_2 > -\delta$

检验 2(上界): $H_{02}: \mu_1 - \mu_2 \geq +\delta \quad \text{vs} \quad H_{a2}: \mu_1 - \mu_2 < +\delta$

只有当两个单侧检验都显著(即两个 p 值均 < alpha),才拒绝"有实质差异"的零假设,得出等效性结论

直觉理解:TOST 等价于检查观测差异的双侧置信区间是否完全落在等效界值 $[-\delta, +\delta]$ 内

$\text{等效成立} \iff \text{CI}_{1-2\alpha}[\mu_1 - \mu_2] \subseteq [-\delta, +\delta]$

注意此处用的是 $(1-2\alpha)$ 置信区间(alpha = .05 时用 90% CI),不是常规的 95% CI。


三、TOST 与传统检验的对比

维度传统 NHST(差异检验)TOST(等效性检验)
零假设两组相等(差异 = 0)差异 >= 等效界值(存在实质差异)
备择假设两组存在任意差异差异 < 等效界值(等效)
目标发现差异证明等效
显著结论两组不同两组等效
不显著结论不能证明等效不能证明等效(统计功效不足)
置信区间95% CI 不含 0 → 显著90% CI 完全含于 $[-\delta, +\delta]$ → 等效
样本量需求取决于期望效应量取决于等效界值与期望效应量
典型应用实验效果验证、组间比较仿制药、方法学验证、可重复性研究

四、等效界值如何设定?

等效界值的设定是 TOST 的最关键决策,必须在数据收集前预先确定,事后调整等效界值是一种 p-hacking。

常见设定方法

1. 基于临床/实践意义(最推荐)

由领域专家判断:差异小到什么程度在实践中无意义?

  • 仿制药研究:FDA/EMA 规定 AUC 和 Cmax 的等效界值为 ±20%(即 0.80–1.25 倍)
  • 心理测量:量表两种测量形式的相关性 > .90,均值差 < 0.5 个标准差

2. 基于效应量标准(Cohen,1988)

将"小效应"下限作为等效界值,常用 d = 0.2(0.5 个标准差的 40%)。

$\delta = 0.2 \times \sigma_{pooled}$

Cohen 的 d = 0.2 对应"可被研究者主观察觉但实践意义有限"的差异,是心理学与社会科学中最常见的等效界值基准。Lakens(2017)建议将 d = 0.5 的效应作为上界等效标准(half of a medium effect),即 $\Delta = \pm 0.5\sigma$。

3. 基于历史数据或参考区间

用既往测量误差或参考人群变异的某一分数位作为界值。

等效界值报告规范

方法章节必须:

  1. 明确报告等效界值数值(原始单位 + 标准化单位)
  2. 说明界值的来源和理由(理论依据/文献/专家共识)
  3. 说明使用了 TOST 还是单侧等效性检验(非劣效)

五、非劣效检验:等效性的单侧版本

等效性检验是双侧的(既不能太高也不能太低),而**非劣效检验(Non-inferiority Testing)**是单侧的:只要求新方法不比参照方法差超过一定界值。

$H_0: \mu_{new} - \mu_{ref} \leq -\delta \quad \text{vs} \quad H_a: \mu_{new} - \mu_{ref} > -\delta$

非劣效检验只检验一个方向,使用单侧 alpha(通常 .025)和对应的单侧置信区间(95% CI 下界 > $-\delta$)。

等效 vs 非劣效的选择

  • 等效性检验(TOST):不允许新方法既不能太差也不能太好(如仿制药不得过强)
  • 非劣效检验:允许新方法更好,只要不明显更差(如新手术方式 vs 传统方式)

两者在临床试验中均受 ICH E9(R1) 和 FDA 指南规范,统计分析计划(SAP)中需预先说明。


六、样本量:TOST 需要多少数据?

TOST 的功效(power)依赖于四个参数:

  1. 等效界值 $\delta$(越严格,需要越大样本)
  2. 真实效应量(假设两组实际差异 = 0 或某个小值)
  3. 显著性水平 alpha(通常 .05,每个单侧检验独立以 alpha = .05 判断,对应 90% CI)
  4. 目标功效(通常 80% 或 90%)

直觉规律:等效性检验通常比差异检验需要更大样本,因为等效界值(如 d = 0.2)比典型差异效应量(d = 0.5)更小,信噪比更低。

使用 R 的 TOSTER 包可计算:

library(TOSTER)
power_t_TOST(alpha = .05, delta = 0, eqb = 0.2,
             power = 0.80, type = "two.sample")

七、APA 7th 报告模板

方法章节描述模板

采用双单侧检验(TOST; Schuirmann,1987)评估[A组]与[B组]的等效性。
等效界值设定为 delta = [值]([单位];对应标准化效应量 d = [值]),
依据[来源(如 FDA 指南/Cohen 1988/专家共识)]。
采用独立样本 t 检验框架进行 TOST,每个单侧检验均以 alpha = .05 判断显著性,
等效性结论基于 90% 置信区间完全落于等效界值内。

结果报告模板(等效成立)

TOST 检验结果显示,[A组](M = X.XX,SD = X.XX)与[B组]
(M = X.XX,SD = X.XX)的均值差为 X.XX(95% CI [X.XX, X.XX];
90% CI [X.XX, X.XX]),两个单侧检验均显著:
t([df]) = X.XX, p = .XXX(下界);t([df]) = X.XX, p = .XXX(上界)。
90% 置信区间 [X.XX, X.XX] 完全落于预设等效界值 [-X.XX, +X.XX] 内,
达到统计等效性标准(Cohen's d = X.XX;dz = X.XX,alpha = .05)。

结果报告模板(等效不成立)

TOST 检验未能建立等效性:[A组]与[B组]均值差的 90% 置信区间
[X.XX, X.XX] 未完全落于等效界值 [-X.XX, +X.XX] 内
(下界 t([df]) = X.XX, p = .XXX;上界 t([df]) = X.XX, p = .XXX)。
现有数据不足以得出两组在[测量指标]上等效的结论。

完整填值示例

采用双单侧检验(TOST; Schuirmann,1987)评估治疗组与控制组在工作记忆得分上的等效性,等效界值预设为 $\delta = 3$ 分(对应 Cohen's d = 0.30),依据 Cohen(1988)小效应标准。治疗组(M = 52.4,SD = 10.1)与控制组(M = 51.1,SD = 9.9)均值差为 1.3 分,90% CI [−0.3, 2.9](n = 200/组,SE = 1.00)。两个单侧检验均显著:下界检验 t(398) = 4.30,p < .001;上界检验 t(398) = 1.70,p = .045。90% 置信区间 [−0.3, 2.9] 完全落于等效界值 [−3, +3] 内,两组在工作记忆得分上达到统计等效性标准,Cohen's d = 0.13(95% CI [−0.05, 0.31]),alpha = .05。


八、在 ChatSRS 一句话完成 TOST 等效性检验

打开 chatsrs.com,上传数据后输入:

对治疗组和控制组的工作记忆得分做等效性检验(TOST),等效界值设为 delta = 3 分(对应 Cohen's d = 0.20),显著性水平 alpha = .05;输出两个单侧检验的 t 值、p 值,以及 90% 置信区间,并说明等效性是否成立;给出可直接引用的 APA 7th 格式报告段落。

ChatSRS 调用 R 引擎(TOSTER 包)自动完成计算,输出等效界值图(置信区间 vs 等效带)和完整报告段落,含方法与结果两节,可直接复制进论文。


九、常见 FAQ

Q:TOST 和传统 t 检验能同时报告吗?

A:可以,而且有时必须同时报告。同时报告 NHST t 检验(检验是否有差异)和 TOST(检验是否等效)可以区分四种情况:(1) 有差异且不等效(NHST 显著,TOST 不显著);(2) 无实质差异且等效(NHST 不显著,TOST 显著);(3) 两者都不显著(样本量不足,结论不确定);(4) 两者都显著(差异显著但落在等效区间内,理论上罕见但可能发生于极大样本)。Lakens 等(2018)将这种双报告框架称为"two-tailed NHST + TOST",是现代可重复性研究的推荐实践。

Q:等效界值必须对称吗?

A:不必须。非对称等效界值 $[-\delta_L, +\delta_U]$ 在药代动力学(如 FDA 要求 AUC 等效界限为 0.80–1.25,原始比值尺度上 +25% vs −20% 并不对称,但对数变换后恰好完全对称:$\ln(1.25) = 0.2231$,$\ln(0.80) = -0.2231$,因为 $1.25 = 1/0.80$,区间变为完全对称的 $[-0.2231, +0.2231]$)和某些临床场景中很常见。TOSTER 包的 tost() 函数支持设定 low_eqboundhigh_eqbound 为不同值。报告时需分别写明上下界数值。

Q:TOST 的置信区间为什么用 90% 而不是 95%?

A:TOST 使用 $(1-2\alpha)$ 置信区间,当 alpha = .05 时为 90% CI。原因是:等效性结论要求两个单侧检验(各 alpha = .05)同时显著,等价于观测效应的 $(1-2\alpha) = 90%$ CI 完全位于等效界值内。若使用 95% CI,等价于双侧 alpha = .025,检验更保守(更难得出等效结论)。仿制药研究中有时使用 alpha = .05(对应 90% CI),有时使用 alpha = .025(对应 95% CI),需遵循监管要求。

Q:等效性检验对样本量的要求比差异检验更高吗?

A:通常是的。当等效界值设为 $d = 0.20$(小效应)、目标功效 80% 时,独立样本 TOST 约需每组 $n \approx 198$ 人;而同等 alpha = .05、power = 80% 下,NHST 检验 d = 0.20 的差异需每组约 393 人(因差异检验是双侧,而 TOST 每个单侧检验已各用 alpha = .05)。即对于小效应量,等效性检验反而比差异检验需要更少样本——但当真实效应不为零(如真实 d = 0.10 而界值设为 d = 0.20)时,TOST 所需样本量会显著增加。建议使用 TOSTER::power_t_TOST()G*Power 在方案阶段计算所需样本。

Q:仿制药研究的 80–125% 等效界值是怎么来的?

A:FDA(1992)和 EMA 指南规定,仿制药的 AUC 和 Cmax 几何均值比(仿制/原研)的 90% CI 必须落在 80%–125% 范围内,该数值经过对数变换后对应 $[-\ln(1.25), +\ln(1.25)] \approx [-0.223, +0.223]$。这一界值并非来自纯粹统计推导,而是基于监管机构对临床可接受差异的判断,历经数十年的临床实践验证。不同器官系统的药物、不同监管机构(FDA/EMA/PMDA)可能采用不同界值。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。