统计百科 ·

贝叶斯 vs 频率派统计 — 社科研究者应了解的本质差异

统计百科:从哲学根基到实操细节,系统比较频率派(p值/置信区间)与贝叶斯派(后验分布/可信区间/先验)的核心差异,帮助社科研究者判断各自适用场景,给出可直接套用的论文报告句式。

论文里写 p = .032,到底在说什么?能不能说"假设成立的概率是 96.8%"?答案是不能——这是几乎所有社科研究者都踩过的经典误区,而这个误区正是贝叶斯与频率派统计哲学差异的缩影。本文从两派的根本分歧出发,厘清 p 值、置信区间、后验分布、可信区间、先验这些核心概念的准确含义,并给出社科研究者选择分析框架的实操建议。


一、两派的哲学根基:概率到底是什么

频率派(Frequentist):概率是长期频率

频率派将概率定义为在假想的无限次重复实验中,某事件发生的相对频率

这个定义有两个关键推论:

  1. 概率只能附着于可重复事件,不能附着于单个假设或参数(参数要么是真实值,要么不是,没有"概率")
  2. 数据是随机的(每次实验会得到不同数据),参数是固定未知的

因此,频率派统计回答的问题是:"如果零假设为真,我观察到这组数据(或更极端数据)的概率是多少?" 这就是 p 值的完整定义。

贝叶斯派(Bayesian):概率是信念的度量

贝叶斯派将概率定义为对命题不确定性的主观信念程度,可以附着于任何命题,包括参数的取值。

这带来了一个根本性的差异:

  1. 参数本身可以有概率分布(先验分布,反映分析前的知识或信念)
  2. 观察到数据后,通过贝叶斯定理更新信念,得到后验分布
  3. 数据是固定的(已观测),参数是随机的(有不确定性分布)

贝叶斯派统计回答的问题是:"看到这组数据后,我对参数值的信念应该如何更新?"


二、核心概念对比:四组关键差异

2.1 p 值 vs 后验概率

这是两派最被混淆的一对概念。

频率派 p 值

$p = P(\text{数据} \geq \text{观测值} \mid H_0 \text{ 为真})$

  • p 值是以零假设为真为条件,观测到当前及更极端数据的概率
  • p 值不是"零假设成立的概率"
  • p 值不是"研究结论错误的概率"
  • p < .05 只意味着:如果 H0 为真,这种数据出现的概率低于 5%

常见误读(必须避免)

错误表述正确理解
"p = .032,所以假设成立的概率是 96.8%"p 值不能告诉你假设成立的概率
"p < .05,所以结论是对的"结论可能因效应量极小而毫无实际意义
"p = .06,刚刚错过显著"p 值不是连续证据量,.049 和 .051 在证据上几乎没有区别
"p 越小,效应越大"p 值受样本量影响极大,N=10000 时微小效应也能 p < .001

贝叶斯后验概率

$P(\theta \mid \text{数据}) \propto P(\text{数据} \mid \theta) \times P(\theta)$

  • 后验概率直接表达参数在某区间内的概率
  • "参数 theta 有 95% 的概率落在 [a, b] 之间"——这句话在贝叶斯框架下是准确的
  • 后验分布会随样本量增加而收窄,反映证据积累后不确定性降低

2.2 置信区间 vs 可信区间

频率派置信区间(Confidence Interval, CI)

95% 置信区间的准确解释:如果用相同方法反复采样并构建区间,长期来看有 95% 的区间会包含真实参数值

注意:这不是说"真实参数有 95% 的概率在这个区间里"——对于某一个具体的置信区间,真实参数要么在里面(概率=1),要么不在(概率=0)。

贝叶斯可信区间(Credible Interval, CrI)

95% 可信区间的准确解释:给定观测数据,参数落在该区间内的(后验)概率为 95%

这正是多数人"直觉上"希望置信区间告诉他们的东西——贝叶斯可信区间允许直接说"参数有 95% 的概率在此区间内"。

两者的数值比较:当先验是无信息先验(flat prior)且样本量足够大时,95% 置信区间与 95% 可信区间在数值上通常非常接近,但含义根本不同。

2.3 先验分布(Prior)

先验分布是贝叶斯分析的核心要素,也是其最受争议之处。

先验的来源

先验类型定义适用情形
无信息先验(Diffuse/Flat Prior)对参数几乎不施加约束,让数据主导领域知识极少;想让结果接近频率派
弱先验(Weakly Informative)施加宽泛的合理约束(如"效应量不超过 10")有基本领域常识;防止模型发散
信息性先验(Informative Prior)基于既有研究或专家判断有文献积累的成熟领域;元分析背景
共轭先验(Conjugate Prior)后验与先验同属同一分布族计算方便;部分简单模型

先验的争议:频率派批评者认为先验的主观性会让结论随研究者偏好变化。贝叶斯支持者则指出:频率派对显著性阈值(如 alpha = .05)的选择同样主观,且先验可以透明地报告和被他人检验,而频率派的"客观性"在大量研究中也是假象(如 p 值操纵、选择性报告)。

2.4 假设检验 vs 贝叶斯因子

频率派假设检验(NHST)

  • 设定零假设 H0 和备择假设 H1
  • 计算 p 值,与 alpha 比较
  • 只有两种结论:拒绝 H0 / 无法拒绝 H0
  • 无法直接支持 H0(无法证明"没有效应")

贝叶斯因子(Bayes Factor, BF)

$BF_{10} = \frac{P(\text{数据} \mid H_1)}{P(\text{数据} \mid H_0)}$

  • 量化数据对 H1 相对于 H0 的支持程度
  • BF10 = 10 意味着数据在 H1 下出现的可能性是 H0 下的 10 倍
  • 双向支持:BF10 < 1 时(如 BF10 = 0.1,即 BF01 = 10),数据支持 H0,可以主动支持"无效应"结论
  • Jeffreys(1961)分类标准(常用参考):
BF10 值对 H1 的证据强度
1 – 3不值一提(anecdotal)
3 – 10中等(moderate)
10 – 30强(strong)
30 – 100非常强(very strong)
> 100极强(extreme)

三、社科研究中的适用场景分析

频率派更适合的场景

  1. 期刊审稿要求:绝大多数社科期刊(心理学、教育学、社会学、管理学)默认频率派框架,审稿人熟悉 p 值和 95% CI
  2. 探索性研究:没有明确的先验信息,需要"让数据说话"
  3. 大样本调查数据:样本量充足时,频率派检验功效有保障,先验对后验影响微弱
  4. 标准化考核场景:政策评估、临床试验注册等需要事先确定alpha阈值的场景

贝叶斯更适合的场景

  1. 小样本研究:N < 50 的实验,贝叶斯方法通过先验借助既有知识弥补样本不足,频率派在此时功效极低
  2. 需要量化"无效应"的研究:证明 H0 成立(如等效性检验)时,贝叶斯因子可以提供对 H0 的直接证据
  3. 纵向/序贯数据:贝叶斯框架允许在收集数据过程中持续更新推断,无需预先确定样本量
  4. 元分析与证据综合:将既有研究结果作为先验,系统地整合跨研究证据
  5. 复杂多层模型:混合效应模型、结构方程模型的贝叶斯扩展更灵活,特别适合嵌套数据(学生嵌套于班级,班级嵌套于学校)
  6. 认知/心理测量模型:项目反应理论(IRT)、信号检测论等与贝叶斯天然契合

两者都可用的场景

大多数常规量化研究(问卷调查、实验设计、回归分析)可以同时报告频率派和贝叶斯结果,互相佐证。顶刊越来越鼓励"双报告"策略——先报频率派(满足审稿人预期),再补贝叶斯因子(提供额外证据量化)。


四、APA 7th 报告句式:可直接套用的模板

频率派标准报告(APA 7th)

t 检验示例

独立样本 t 检验结果显示,实验组(M = 78.4,SD = 9.2)显著高于对照组
(M = 71.3,SD = 8.8),t(118) = 4.23,p < .001,d = 0.78,95% CI [3.73, 10.52],
为接近大效应的中等偏大效应(d = 0.78,接近 Cohen 大效应阈值 0.80;Cohen,1988)。

关键格式细节

  • p 值精确至三位小数,不加前导零:p = .032(非 p = 0.032)
  • p = .000 改写为 p < .001
  • 置信区间用方括号:95% CI [下限, 上限]
  • 效应量与 CI 并列报告

贝叶斯报告句式

贝叶斯 t 检验示例

贝叶斯独立样本 t 检验(采用 Cauchy 先验,scale = 0.707)显示,
BF10 = 18.4,表明数据对 H1(存在组间差异)的支持为强证据(Jeffreys,1961)。
后验均值差的 95% 可信区间为 [3.41, 10.82],参数在该区间内的后验概率为 95%。

关键格式细节

  • 必须说明先验类型和参数(让读者可重现)
  • 贝叶斯因子精确到一位小数:BF10 = 18.4
  • 可信区间(Credible Interval)不可与置信区间(Confidence Interval)混用
  • 说明 BF 所对应的证据分类标准来源(Jeffreys 1961 / Kass & Raftery 1995 等)

方法章节说明贝叶斯分析

本研究采用贝叶斯推断对主要假设进行检验,以贝叶斯因子(BF10)量化数据
对备择假设相对于零假设的支持程度(Jeffreys,1961;Rouder et al.,2009)。
所有贝叶斯 t 检验采用默认 Cauchy 先验(scale = 0.707),贝叶斯相关分析
采用 beta(1,1) 先验,均通过 JASP(Version 0.19;JASP Team,2024)完成。
显著性水平设为 alpha = .05;贝叶斯因子证据强度参照 Jeffreys(1961)分类。

五、在 ChatSRS 一键运行贝叶斯与频率派对比分析

打开 chatsrs.com,上传数据后输入:

"对实验组和对照组的前后测成绩差值做独立样本 t 检验,同时输出贝叶斯 t 检验结果(Cauchy 先验,scale=0.707);报告 t 值、自由度、p 值、Cohen's d、95% 置信区间、BF10 及 95% 贝叶斯可信区间,给出符合 APA 7th 格式的完整比较表格和报告段落。"

ChatSRS 的 R 引擎(调用 BayesFactor 包)会同时输出频率派和贝叶斯结果,并自动判断 BF 的证据分类,报告段落可直接复制进论文方法/结果章节。(注:贝叶斯分析依赖 R 生态的 BayesFactor / brms 包,本节所述功能均由 R 引擎提供,SPSS 引擎不支持原生贝叶斯因子计算。)

若需要贝叶斯回归或贝叶斯层次模型,在指令中说明模型结构(如"多层线性模型,学生嵌套于班级,添加贝叶斯先验"),ChatSRS 自动切换至 brms 引擎并报告后验分布摘要。


六、常见误区速查:频率派与贝叶斯都会犯的错

误区所属框架正确做法
"p = .032 意味着假设成立概率 96.8%"频率派误读p 值是数据极端程度,不是假设概率
"95% CI 内参数以 95% 的概率存在"频率派 CI 误读CI 是长期覆盖率,对单个区间无概率解释
"p > .05 证明 H0 成立"频率派误用无法拒绝 H0 不等于证明 H0;用 BF 或等效性检验
"BF = 2 说明 H1 成立"贝叶斯误读BF < 3 属于无充分证据,不可下结论
"先验选弱信息就是客观"贝叶斯误用弱信息先验同样是主观选择,需在方法章节说明并做敏感性分析
"贝叶斯方法样本量越小越好"贝叶斯误用小样本时后验高度依赖先验,需透明报告先验并做稳健性检验
"两者 CI 数值相近所以含义相同"混淆概念频率 CI 与贝叶斯 CrI 含义根本不同,不可互换表述

常见 FAQ

Q:我的社科论文能直接换成贝叶斯统计吗?

A:完全可以,但需要注意几点:(1)目标期刊是否接受贝叶斯报告——顶刊如 Psychological ScienceJournal of Experimental Psychology 已明确欢迎;传统教育学/社会学期刊有时审稿人不熟悉,可并排报告频率派结果;(2)方法章节必须明确说明所用先验及其依据;(3)软件工具首选 JASP(界面友好,与 SPSS 类似)或通过 ChatSRS 的 R 引擎(brms/BayesFactor)。切换成本低于想象,JASP 的 Bayesian t-test 只需一个界面选项即可。

Q:p = .051 和 p = .049 实质区别有多大?

A:从统计证据的角度几乎没有区别——两者提供的证据量极为接近,但一个"显著"一个"不显著"。这正是频率派 NHST 框架的核心批评之一。贝叶斯因子在这一点上更连续、更合理:BF10 = 2.8(弱证据)和 BF10 = 3.1(中等证据)的区别,远比 p = .049 vs p = .051 的区别更清晰地反映实际证据量的差异。APA 7th 也因此建议始终报告精确 p 值而非仅报告"是否 < .05",以避免二元化思维。

Q:贝叶斯方法需要会编程吗?

A:不一定。JASP 是免费的图形界面软件,操作逻辑与 SPSS 几乎相同,涵盖贝叶斯 t 检验、贝叶斯 ANOVA、贝叶斯回归,适合不会编程的社科研究者。ChatSRS 的 R 引擎可通过自然语言指令(无需写代码)运行 BayesFactor 包和 brms 包,直接输出 APA 格式报告。需要高度定制化先验或复杂层次模型时,才需要直接使用 R(brms)或 Python(PyMC)。

Q:贝叶斯因子和 p 值能同时报告吗?

A:不仅可以,而且推荐。两者回答不同问题,互补而非竞争:p 值回答"如果 H0 为真,这组数据有多极端";BF 回答"数据对哪个假设更支持、支持多少倍"。联合报告策略:先用频率派检验满足期刊基本要求,再用贝叶斯因子提供更丰富的证据量化。当两者结论一致时(如 p < .001 且 BF10 > 100),结论的可信度大幅提升;当两者分歧时(如 p = .04 但 BF10 = 2),则提示证据尚弱,需要更大样本量。

Q:置信区间和可信区间数值很接近,可以用频率派的 CI 但写成"参数有 95% 概率落在此区间"吗?

A:不可以。这是最常见的混淆,即使数值相同,含义也根本不同。频率派 CI 的概率含义附着于"采样程序"(长期 95% 覆盖率),而非"参数落在某个具体区间的概率"。若想写"参数以 95% 概率落在 [a, b]",必须在贝叶斯框架下计算可信区间(CrI),并在方法章节注明使用了贝叶斯推断。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。