教程 ·

样本量只有 20-30 个,还能做统计分析吗?小样本研究方法全指南

小样本统计分析全指南:非参数检验替代方案、Fisher精确检验、效应量比p值更重要的原因、常见的过拟合和方法误用陷阱,以及如何在论文Limitations部分诚实说明样本量局限。

很多学生和研究者一看到自己只收集到 20-30 份数据就开始焦虑:是不是根本没法做统计分析、论文会不会被质疑。这篇文章想先厘清一个认知:小样本不是不能做统计,而是要换更合适的方法、更谨慎地解读结果。


先厘清认知:小样本是常态,不是缺陷

很多学科的研究本身样本量就小,这是研究对象和研究设计决定的,不是研究者能力不足:

  • 临床医学中的罕见病研究,患病人群本身就有限,能收集到 20-30 个病例已经是相当大的努力
  • 质性心理学、深度访谈类研究,样本量的价值不在"多"而在"深",几十个样本配合质性方法可能比几百份浅层问卷更有解释力
  • 试点研究(pilot study),本身目的就是为后续大样本研究探路,小样本是设计的一部分而非缺陷

真正的问题不是"样本小"本身,而是用了不适合小样本的方法,或者没有诚实报告小样本带来的局限


小样本适用方法清单

非参数检验优先

当样本量小、又不满足正态性假设时,非参数检验对分布形态的要求更宽松,是首选替代方案:

参数检验(原方法)非参数替代方法
独立样本 t 检验Mann-Whitney U 检验
配对样本 t 检验Wilcoxon 符号秩检验
单因素方差分析Kruskal-Wallis 检验

这些方法基于秩次(排序)而非原始数值计算,对极端值和分布形状不敏感,小样本下比参数检验更稳健。

精确检验替代卡方

卡方检验有一个常被忽视的前提:期望频数不应小于 5(且不能有超过 20% 的格子低于此标准)。小样本的分类数据经常不满足这一前提,此时应改用 Fisher 精确检验——它直接计算精确概率,不依赖大样本近似,是小样本分类数据比较的标准替代方法。

效应量比 p 值更重要

小样本下统计检验力(power)天然不足,这意味着即便真实效应存在,也可能测不出统计显著性(p > .05)。这种情况下,更应该重视效应量而非只看 p 值

  • 报告 Cohen's d(差异类比较)或相关系数 r(关联类分析),说明差异或关系的实际大小
  • 即便 p 值不显著,一个较大的效应量(如 d = 0.6)仍然值得在讨论部分提及,说明"可能存在有实践意义的效应,但当前样本量下统计功效不足以达到显著"

描述性统计与个案分析结合

当样本量极小(如 N 小于 10)时,硬套推断统计(各类检验和 p 值)意义有限,此时更适合以描述性统计(均值、标准差、分布范围)配合个案分析(详细描述具体案例的特征),把研究价值放在深度描述而非统计推断上。


常见错误

错误一:小样本硬用参数检验,掩盖问题。 明知道数据不满足正态性还坚持用 t 检验或 ANOVA,这样即使得到"显著"结果,结论的可信度也存疑,审稿人一旦追问正态性检验结果就会露馅。

错误二:样本量不够却用复杂多变量模型。 比如样本只有 30 人,却同时放 10 个自变量做回归分析,这会导致严重的过拟合——模型看起来解释力很强,但其实是在拟合样本中的随机噪声而非真实规律,换一批数据结果可能完全不同。经验法则是自变量个数不应超过样本量的十分之一到二十分之一(具体比例依方法和学科惯例而定)。


论文里怎么写

面对小样本,诚实比回避更能获得审稿人和答辩老师的认可:

  1. 在 Limitations(研究局限)部分明确说明样本量,不要试图掩盖或含糊带过
  2. 说明为什么样本量是这个规模(如研究对象稀有、经费/时间限制、试点研究性质)
  3. 补充说明选择非参数方法的原因(如"由于样本量较小且 Shapiro-Wilk 检验显示数据不服从正态分布,故采用 Mann-Whitney U 检验替代独立样本 t 检验")
  4. 如果条件允许,可以补充**统计功效分析(power analysis)**说明当前样本量能检测到的最小效应量

审稿人和导师更认可"知道自己的限制在哪、并且合理应对"的研究,而不是回避不谈、假装样本量没有问题。


用 ChatSRS 辅助判断

不确定自己的数据该用参数检验还是非参数检验时,可以直接让 AI 先做前提检验:

"帮我检查这份数据是否满足正态性和方差齐性假设,如果不满足,给出对应的非参数检验建议。"

ChatSRS 会自动跑 Shapiro-Wilk 正态性检验和 Levene 方差齐性检验,根据结果判断是否满足参数检验前提,不满足时直接给出对应的非参数检验方法并执行,省去自己逐条对照决策规则的过程。


常见 FAQ

Q:小样本能做回归分析吗?

A:可以,但要严格控制自变量个数。经验法则是每个自变量至少需要 10-20 个观测值支撑(具体比例依方法和学科惯例有所不同),比如样本量 30,放 2-3 个自变量的回归模型通常还算稳妥,放 8-10 个就明显过多,容易过拟合。如果研究问题确实需要控制多个变量但样本量有限,可以考虑先做相关分析筛选出关键变量,或参考更保守的简约模型。

Q:多小才算"小样本",有没有明确的数字标准?

A:没有绝对统一的标准,不同学科和方法对"小样本"的定义不同。一个常见的经验参考是:每组样本量低于 30 时,中心极限定理不能完全保证抽样分布趋近正态,此时正态性假设需要额外验证;而 N 小于 10 时通常认为已经进入需要谨慎使用推断统计、更依赖描述性方法的范围。具体判断还是要结合正态性检验结果和研究设计一起看。

Q:非参数检验的结果,效应量该怎么报告?

A:非参数检验对应的效应量指标和参数检验不同,比如 Mann-Whitney U 检验常用 r(基于 Z 值换算,r = Z / sqrt(N))或 rank-biserial correlation 作为效应量;Kruskal-Wallis 检验常用 epsilon-squared 或 eta-squared(H)。报告时同样应遵循"仅有检验统计量和 p 值不够,效应量同样需要报告"的原则。


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内【用户中心 -> 帮助与反馈】联系我们。