审稿返修 ·

审稿人质疑样本量不足:功效分析怎么补、怎么回复才不夸大

审稿人质疑样本量或功效不足怎么办?本文区分事前功效、最小可检测效应与 observed power,并披露当前样本量入口的阻断与安全替代流程。

审稿人写“样本量是否足以支持结论”时,最糟糕的回应之一,是把本研究观察到的效应代回功效公式,得到一个 observed power,再用它为不显著结果辩护。对于固定的样本、显著性水平和检验,观察功效通常只是 p 值的变换,几乎不提供新的证据。更有信息量的回答是:研究原先如何规划、当前样本在合理效应下能检测什么、估计区间有多宽、哪些结论因精度不足需要降级。

先区分三类问题

事前功效分析在收集数据前,用外部效应量、显著性水平、目标功效和设计参数计算所需 N。敏感度分析在样本已固定时,计算当前设计可以可靠检测的最小效应量,也称 minimum detectable effect。精度分析则围绕置信区间宽度或允许误差规划样本。三者都比观察功效更直接,但输入必须与实际检验、组数、预测变量数、聚类和流失相匹配。

效应量应优先来自与研究对象、结局和设计相近的 Meta 分析,其次是高质量先行研究或独立预实验。Cohen 的小中大标准只能作缺乏证据时的透明假设,不能假装成该领域的真实效应。也不能从本样本显著结果反推效应量,再宣称样本规划充分,这会形成循环论证。

ChatSRS sample_size 当前处于阻断状态

仓库虽然注册了 sample_size,并在源码中列出独立 t、配对 t、ANOVA、回归、卡方和相关六种 test_type,但当前 live 入口不能安全执行,页面不得把这些名称写成已经可用的产品能力。第一个阻断发生在 CLI:--columns 被声明为必填,程序随后才尝试根据方法把它改为可选,因此不传列时会在预解析阶段直接退出。即使临时传入真实列,分析器又主动把 matched_columns 设为空,基类会抛出“所有列名均未匹配成功”。这不是输入技巧可以绕过的文案问题,而是共享代码需要修复并回归测试的问题。

此外,当前 ANOVA 分支把 FTestAnovaPower.solve_power 返回的总观测数误当作每组观测数,再乘以组数。例如 f=.25、alpha=.05、power=.80、4 组时,底层返回的总 N 约为 178.397,现有逻辑却会显示每组 179、总 N=716。相关分析分支使用两独立样本正态检验的 NormalIndPower,不是相关系数的 Fisher z 功效公式,并把其第一组样本量当作总 N。r=.30、双侧 alpha=.05、power=.80 时,现有调用显示约 175,而常用 Fisher z 近似总 N 约为 85;两者对应的不是同一设计。

卡方分支的构造器虽有 df_chi2,注册 CLI 没有 --df-chi2,也不会把该参数传入分析器,只能静默使用默认 df=1。因此,在共享代码修复、六条路径 live smoke、ANOVA/相关已知参考值测试及卡方 df>1 验收完成前,本页不提供任何 sample_size 可执行指令,不引用其结果,也不承诺 ChatSRS 能生成样本量。

**发布边界:**上述阻断不意味着功效分析本身不可做,而是当前注册入口不能作为证据来源。返修应转到经过验证、与设计匹配的外部统计工具或模拟流程。多层模型、GEE、SEM、DID、聚类随机试验和稀有事件 Logistic 尤其不能套用简单独立样本公式。

可复核的一句话分析规格

若计划两组独立样本 t 检验,并从 Meta 分析得到 d=0.35,应把下面这段作为提交给另行验证工具或统计人员的规格,而不是当前 ChatSRS sample_size 命令:

使用经验证的双侧独立样本 t 功效实现,以 d=0.35、alpha=0.05、power=0.80、1:1 分配计算每组和总样本量;保存工具名称、版本、公式口径和原始输出。以外部 Meta 分析作为效应量来源,另按预先设定的 15% 无效或失访率上调招募量,不计算 observed power。

若主分析是含 6 个预测变量的线性回归,规格可以写为:

在经过参考值验证的回归功效实现中,以 Cohen f²=0.10、alpha=0.05、power=0.80、预测参数数=6 计算规划总 N;同时报告 f²=0.05、0.10、0.15 三种情景。若模型还含交互、固定效应、聚类或重复测量,改用匹配设计的模拟,不把简单回归结果当终稿。

ANOVA 应核对工具返回的是总 N 还是每组 N,再按预定分配换算;相关分析必须使用相关系数对应的 Fisher z 或经验证等价公式;卡方必须把真实自由度作为显式输入并保存。任何结果都要与至少一个已知参考值或第二个可信实现交叉核验。同一论文最好给出情景表,而不是单一神奇数字,这样审稿人才能判断结论是否依赖乐观假设。

已有数据时怎么回应

假设实际 N=180,而以外部 d=0.35、80% 功效规划需要更多样本。不能补一个基于样本 d 的 observed power 来宣布“仍有 85% 功效”。应报告外部假设下的规划差距、当前效应估计及 95% CI,并计算或模拟当前 N 对应的最小可检测效应。如果当前只能可靠识别较大的效应,就把“小效应不存在”改成“数据未提供足够精度排除小效应”。

如果显著结果的区间仍很宽,也不能只凭 p<.05 宣称精确。相反,若不显著但区间已经排除领域关心的最小效应,可以更有力地讨论实质意义。精度和区间直接对应研究问题,观察功效没有这种增量价值。

对于回归,预测变量数不是唯一复杂度。交互项、非线性、分类变量的多个参数、固定效应和多重结局都会消耗信息。对于聚类数据,有效样本更接近群组数和组内相关共同决定的量;把总行数直接代入独立样本公式会过于乐观。返修时应逐项说明设计与简化公式的差异。

返修信模板

感谢审稿人关注样本量与估计精度。我们未使用基于本样本观察效应计算的observed power,
因为它不能为本次p值提供独立信息。修订稿以[Meta分析/预实验]的效应量[ ]、
alpha=[ ]、目标功效[ ]和实际设计参数[ ]进行事前/情景样本量估算。
当前ChatSRS sample_size注册入口因CLI列匹配阻断而不可执行,且ANOVA总N、
correlation公式及卡方df接线尚未通过参考值验收,因此未引用其任何结果。
样本量情景由[验证工具与版本/模拟]得到,输入与参考值复核为[ ]。
当前N=[ ],估计值及95%CI为[ ];当前设计下可检测的最小效应为[ ]。
因此我们将结论限定为[ ],并在限制中说明对较小效应的证据不足。

证据包应保存什么

保存原始样本量方案、效应量来源全文与抽取位置、检验方向、alpha、目标功效、分配比例、组数、预测参数数、流失或无效率、聚类设计效应、所有情景结果和实际纳入流程图。若用模拟,保存数据生成机制、随机种子、重复次数、收敛失败率和判定规则。不能只保留最终 N,而丢掉输入。

还应区分计划样本、招募样本、有效样本和进入主模型的完整案例。失访、排除和缺失会让实际分析 N 改变;若样本量计算针对总招募人数,却拿完整案例 N 比较,需明确上调和损耗关系。多重主要结局或多次中期分析还涉及 alpha 分配,不能沿用单检验的 0.05。

常见问题 FAQ

Q1:结果不显著,可以用 observed power 说明样本不足吗?

不建议。应报告效应估计与区间,并基于外部效应或最小有意义效应做敏感度/精度分析。

Q2:现在可以直接运行 ChatSRS sample_size 吗?

不可以。当前注册入口受 --columns 预解析和空列匹配双重阻断;在共享代码修复并完成六路径 live smoke 前,不应引用其结果。

Q3:ANOVA、相关或卡方路径可以暂时当近似用吗?

不可以。当前 ANOVA 混淆总 N 与每组 N,相关路径没有使用 Fisher z 公式,卡方自由度也未接入 CLI;修复和参考值验收前都不能作为规划证据。

Q4:多层模型能直接用普通回归的 N 吗?

不能直接。群组数、ICC、每组观测、随机效应和不平衡都影响功效,宜用匹配设计的模拟或专用方法。

相关阅读

准备好外部效应量来源和真实设计参数后,可打开 ChatSRS,整理审稿问题、分析规格与可复核证据清单。样本量数值必须来自另行验证的匹配工具;已有数据的结论以区间和敏感度分析为主,不用 observed power 辩护。