教程 ·

稳健性检验完整教程 — 换样本/换方法/换指标,经济学论文必做

经济学与社科论文必做的稳健性检验:替换核心变量、子样本分析、安慰剂检验、缩尾处理,用 AI 一句话全部完成,并给出可直接套进论文的 APA 7th 格式报告句式。

审稿人最爱的一句话:"请补充稳健性检验。" 这篇教程把经济学/社科论文里最常用的四类稳健性检验——替换核心变量、子样本分析、安慰剂检验、缩尾处理——全部拆开讲清楚,并给出可直接复制进论文的 APA 7th 报告句式。


为什么稳健性检验是论文的"第二道防线"

在经济学、管理学、社会学论文中,你的核心回归结论能否被接受,往往取决于两件事:

  1. 基准回归(Baseline Regression)——在原始样本、原始变量、原始模型设定下,结果是否显著
  2. 稳健性检验(Robustness Check)——当你改变样本范围、换用替代变量、调整模型设定或处理异常值时,结论是否依然成立

如果基准回归显著,但改换任何一个细节后系数就消失或方向翻转,审稿人有充分理由质疑你的发现是"偶然的"——是数据偶然性或模型特化所致,而非真实的因果/相关关系。

稳健性检验的本质:用多种合理的替代方案重复核心分析,验证结论的一致性和可重复性。这并不是为了"凑字数",而是科学诚信的内在要求。


四类最常用稳健性检验方法

方法一:替换核心变量(Variable Substitution)

逻辑:如果你的核心自变量或因变量存在多种合理的测量方式,换一种测量方式后结论仍稳健,说明结论不依赖于特定的变量定义。

典型操作

  • 用变量的 滞后一期值(lagged variable) 替换当期值,缓解内生性担忧
  • 将连续变量替换为分位数虚拟变量(如高/低分组的 0/1 变量)
  • 行业均值去中心化后的变量替换原始变量
  • 换用同一概念的替代指标(如将"公司规模"从总资产对数换为员工数对数)

何时必做

  • 核心变量的测量方案在文献中存在争议
  • 变量定义存在主观判断
  • 基准回归结果的系数在替换指标后变化超过 10%,应在论文中加以说明

方法二:子样本分析(Subsample Analysis)

逻辑:如果结论在特定子群体中依然成立,则说明结论不依赖于某一特殊群体的特征,排除了异质性驱动假阳性的可能。

典型分法

  • 按中位数将样本分为高组/低组(如高市值/低市值,高教育/低教育)
  • 剔除极端值样本(如规模最大的 1% 企业)
  • 剔除特殊时期(如金融危机年份 2008-2009,新冠疫情年份 2020)
  • 按地区、行业或时间段做分层检验

核心关切:如果结论仅在某个子样本中成立而在另一个子样本中消失,需要解释异质性来源,而不能直接宣称结论稳健。


方法三:安慰剂检验(Placebo Test)

逻辑:安慰剂检验是稳健性检验中最有说服力的一类。其思路来自医学随机对照试验:如果你给"对照组"施加与"处理组"同样的分析,结果不应该显著——如果不显著,则反向证明真实处理效应的显著性不是偶然的。

常用形式

  • 随机打乱处理变量:将核心自变量的取值随机置换(permutation),重复回归 1000 次,得到系数的经验分布。若真实系数落在 5% 尾部以外,说明真实效应不是随机噪音产生的。
  • 替换为"假处理"时间点:在政策评估(DID 设计)中,把真实政策实施时间向前移动 2-3 年,若虚假事件窗口的系数不显著,说明真实效应不是趋势混淆所致。
  • 用不相关的因变量重复回归:以理论上不应受影响的结果变量做因变量,若回归系数不显著,说明核心自变量不存在"广谱"的影响效应。

统计口径提示:安慰剂检验中,随机置换回归的系数分布用来构造经验 p 值,与传统回归的理论 p 值计算路径不同,不可混用。报告时应明确说明使用"经验 p 值(empirical p-value,基于 1000 次随机置换)"。


方法四:缩尾处理(Winsorization)

逻辑:计量回归对极端值(outliers)高度敏感。缩尾处理通过把分布两端超出阈值的极端值"截断到"阈值水平,减小极端值对系数估计的扭曲,而不是删除这些观测(与截尾/truncation 不同)。

常用阈值

  • 1%/99% 双侧缩尾:将低于 1st percentile 的值替换为 1st percentile 值,将高于 99th percentile 的值替换为 99th percentile 值。最常用。
  • 5%/95% 双侧缩尾:更激进,适用于分布高度偏斜或样本量较小的情形。
  • 仅对因变量缩尾 vs 对所有连续变量缩尾:前者更保守,后者处理更彻底,选择依据在于哪类变量存在明显的极端值影响。

统计口径提示:缩尾(Winsorization)与截尾(Truncation)不同。缩尾保留全部观测,仅修改极端值的取值;截尾直接删除极端值观测。两者对样本量和系数估计的影响不同,论文中必须明确说明使用的是哪种处理方式。


案例数据:企业 ESG 表现对股权融资成本的影响

假设基准回归研究"企业 ESG 评分是否显著降低股权融资成本",样本为 A 股上市公司 2015-2022 年平衡面板数据,共 3,840 个企业-年观测。

cost_of_equity    股权融资成本(%,因变量)
esg_score         ESG 综合评分(0-100,核心自变量)
size              公司规模(总资产对数)
lev               资产负债率
roa               资产收益率
growth            营业收入增长率
board_size        董事会规模
year_fe           年份固定效应(虚拟变量组)
ind_fe            行业固定效应(虚拟变量组)

基准回归结论:ESG 评分对股权融资成本有显著负向影响,b = -0.042,SE = 0.011,p < .001,即 ESG 评分每提高 1 分,股权融资成本平均降低约 0.042 个百分点(控制年份和行业固定效应)。注:此处报告非标准化系数 b,APA 7th 规范下非标准化系数用 b 表示,标准化系数才用 β。


用 AI 一句话完成四类稳健性检验

chatsrs.com 上传数据后输入:

"基准回归:以 cost_of_equity 为因变量,esg_score 为核心自变量,size、lev、roa、growth、board_size 为控制变量,加入年份和行业固定效应,做 OLS 面板回归。

请依次做以下四类稳健性检验:

  1. 替换变量:将 esg_score 替换为其环境子维度评分 esg_env,重跑回归,比较系数变化
  2. 子样本分析:分别在高市值组(market_cap 中位数以上)和低市值组做回归,比较两组系数
  3. 安慰剂检验:对 esg_score 做 1000 次随机置换,输出系数分布直方图和经验 p 值
  4. 缩尾处理:对 cost_of_equity 和所有连续控制变量在 1%/99% 分位数做双侧缩尾后重跑回归

每类检验输出三线表格式,写 APA 7th 中文报告句式,与基准回归对比系数和显著性"


输出结果怎么读

输出 1: 替换变量稳健性

表 1  替换核心变量稳健性检验(因变量:stock_equity_cost)

                  基准回归              替换变量
                  esg_score             esg_env
                  beta     SE   p        beta     SE   p
ESG 指标         -0.042   0.011 <.001   -0.038   0.013 .004
size             -0.312   0.048 <.001   -0.308   0.049 <.001
lev               0.521   0.073 <.001    0.518   0.074 <.001
roa              -1.243   0.187 <.001   -1.251   0.189 <.001
growth           -0.018   0.022  .415   -0.019   0.023  .407
board_size       -0.021   0.034  .538   -0.020   0.035  .568
年份/行业 FE      是                     是
N                 3,840                  3,840
R^2               0.423                  0.418

注:括号内为稳健标准误(HC1);* p < .05,** p < .01,*** p < .001。

解读要点:ESG 环境子维度评分(esg_env)系数为 -0.038(p = .004),与基准系数 -0.042 方向一致、量级相近,R^2 基本持平,说明核心结论不依赖于特定的 ESG 综合评分指标。


输出 2: 子样本分析

表 2  子样本稳健性检验(按公司市值中位数分组)

                  高市值子样本(n=1,920)    低市值子样本(n=1,920)
                  beta     SE     p           beta     SE     p
esg_score        -0.051   0.015  <.001        -0.033   0.016  .040
控制变量          是                           是
年份/行业 FE      是                           是
R^2               0.441                        0.398

注:高市值组为 market_cap >= 样本中位数,低市值组为 market_cap < 中位数。

解读要点:两个子样本中 ESG 系数均显著为负,高市值组效应(-0.051)略大于低市值组(-0.033),方向一致性满足稳健性要求。两组系数差异提示存在规模异质性,可在异质性分析部分进一步讨论。


输出 3: 安慰剂检验

安慰剂检验结果(1000 次随机置换)

真实系数                 beta = -0.042
置换系数均值             beta_mean = -0.001(95% CI: [-0.021, 0.019])
真实系数的经验百分位数   < 1st percentile
经验 p 值                p < .001(双尾,基于 1000 次置换)

直方图说明:置换系数分布集中于 0 附近,真实系数 -0.042 远落于左尾 1% 临界值外。

解读要点:1000 次随机置换后系数均值接近 0,真实系数 -0.042 的经验 p 值 < .001,说明基准回归中的显著效应不是随机噪音产生的偶然结果。


输出 4: 缩尾处理后回归

表 3  缩尾处理稳健性检验(1%/99% 双侧缩尾)

                  基准回归(未缩尾)    缩尾处理后(1%/99%)
esg_score        -0.042 (0.011) ***    -0.039 (0.010) ***
size             -0.312 (0.048) ***    -0.305 (0.047) ***
lev               0.521 (0.073) ***     0.513 (0.071) ***
roa              -1.243 (0.187) ***    -1.198 (0.181) ***
growth           -0.018 (0.022)        -0.017 (0.021)
board_size       -0.021 (0.034)        -0.022 (0.033)
N                 3,840                 3,840
R^2               0.423                 0.431

注:括号内为稳健标准误;*** p < .001。对 cost_of_equity 及所有连续控制变量做 1%/99% 双侧缩尾。

解读要点:对因变量和连续控制变量缩尾处理后,ESG 系数由 -0.042 变为 -0.039,变动幅度约 7%,方向和显著性完全不变,R^2 略有提升(0.423 -> 0.431),说明基准结论不受极端值驱动。


论文里怎么报告(APA 7th 格式)

APA 7th 对稳健性检验的报告要求:明确说明检验类型和操作方式,报告关键系数及其变化范围,明确结论是否成立。


稳健性检验方法节写法

为验证基准回归结论的稳健性,本文从以下四个维度进行稳健性检验:(1)变量替换,以 ESG 环境子维度评分替换综合评分重新估计;(2)子样本分析,按公司市值中位数将样本分为高市值组与低市值组分别回归;(3)安慰剂检验,对核心自变量 ESG 评分进行 1000 次随机置换,构造系数经验分布并计算经验 p 值;(4)缩尾处理,对因变量及所有连续控制变量在 1% 和 99% 分位数处进行双侧缩尾后重新估计。


稳健性检验结果节写法

稳健性检验结果如表 4 所示。替换变量检验表明,以 ESG 环境子维度评分为核心自变量时,系数为 -0.038(SE = 0.013, p = .004),与基准系数 -0.042(SE = 0.011, p < .001)方向一致,量级相近,变化幅度约 9.5%。子样本分析显示,ESG 评分的负向效应在高市值组(beta = -0.051, SE = 0.015, p < .001)和低市值组(beta = -0.033, SE = 0.016, p = .040)中均显著成立。安慰剂检验结果表明,1000 次随机置换后系数均值接近零(M = -0.001, 95% CI [-0.021, 0.019]),真实系数的经验 p 值 < .001,排除了随机噪音的解释。对连续变量进行 1%/99% 双侧缩尾处理后,ESG 系数为 -0.039(SE = 0.010, p < .001),结论保持不变。综合四类稳健性检验结果,本文核心结论具有良好的稳健性。


APA 7th 格式规范总结(稳健性检验专项)

报告要素APA 格式示例
替换变量系数beta = -0.038, SE = 0.013, p = .004
子样本系数对比beta_high = -0.051, p < .001; beta_low = -0.033, p = .040
安慰剂经验 p 值empirical p < .001(基于 1000 次随机置换,双尾)
缩尾后系数beta = -0.039, SE = 0.010, p < .001(1%/99% 双侧缩尾)
系数变化幅度系数变化幅度约 X%(=(原系数-稳健系数)/原系数 x 100%)

特别提示:报告系数时统一使用 beta(标准化/非标准化需注明),SE 为稳健标准误时须注明(如"括号内为 HC1 稳健标准误")。p 值小数点前不加 0(写 p = .004,不写 p = 0.004)。


可直接套进论文的报告句式模板

基准结论句(方法节)

以 [因变量] 为被解释变量,[核心自变量] 为核心解释变量,
加入 [控制变量列表] 以及年份/行业固定效应,
采用 OLS 回归(稳健标准误)估计基准方程(1)。

替换变量稳健性句(结果节)

将 [原变量] 替换为 [替代变量] 后重新估计,核心系数为 
beta = XX, SE = XX, p [值],与基准系数 beta = XX 方向一致,
系数变化幅度约 X%,结论保持稳健。

子样本稳健性句(结果节)

按 [分组依据] 将样本划分为 [组 A](n = XX)和 [组 B](n = XX):
[组 A] 中核心系数为 beta = XX(SE = XX, p [值]),
[组 B] 中为 beta = XX(SE = XX, p [值]),两组方向一致,
表明结论不依赖于特定的 [分组特征] 水平。

安慰剂检验句(结果节)

对 [核心自变量] 进行 1000 次随机置换,
置换系数均值为 M = XX(95% CI [XX, XX]),
真实系数经验百分位数低于第 [X] 百分位,
经验 p 值为 p < [值](双尾),
排除了随机噪音对核心结论的替代解释。

缩尾处理句(结果节)

对 [变量列表] 进行 1%/99% 双侧缩尾处理后重新估计,
核心系数为 beta = XX(SE = XX, p [值]),
与未缩尾基准系数一致,说明结论不受极端值影响。

常见问题 FAQ

Q1:稳健性检验做几类才够?顺序有讲究吗?

A:没有固定的"最低要求",但期刊审稿实践中以下三类组合最受认可:(1)替换核心变量,(2)子样本分析,(3)安慰剂检验或缩尾处理——三类合在一起能覆盖"变量定义不同""样本特殊"和"随机噪音"三大质疑来源。顺序上通常在论文结果节靠后的"稳健性检验"小节集中呈现,每类检验配一张对比表,并在文字中对比基准系数的变化幅度。如果篇幅受限,也可以将稳健性表格放入附录,正文只写一段结论性陈述。

Q2:替换变量后系数方向不变但显著性消失(如 p = .08),结论还稳健吗?

A:这是稳健性检验中最常见的"灰色地带"。严格来说,显著性消失意味着稳健性存疑,但评估时需要看:(1)替代变量与原变量的测量一致性有多高(相关系数是否 > 0.9);(2)系数的置信区间是否与基准系数的置信区间大量重叠;(3)效应量(回归语境下用 f² 或标准化系数 β 的量级,而非适用于两组均值比较的 Cohen's d)是否仍然在同一数量级。若上述三点均成立,可以在论文中写"虽然统计显著性略有下降(p = .08),但系数方向和量级与基准回归高度一致(b 变化幅度 < 10%),两者置信区间大量重叠,结论基本稳健"。若显著性消失且置信区间与 0 高度重叠,应诚实报告并讨论可能的原因。

Q3:安慰剂检验和 Bootstrap 检验是什么关系?

A:两者都是基于重抽样的推断方法,但目的不同。Bootstrap 是通过有放回重抽样来估计统计量的抽样分布,用于获得更可靠的标准误和置信区间,适用于样本量较小或分布假设难以满足的情形。安慰剂检验的置换(permutation)是在保持数据结构不变的情况下打乱处理变量的配对关系,用于检验"零效应"假设下的系数分布,属于假设检验工具。两者可以并行使用:先用 Bootstrap 稳健化标准误,再用安慰剂检验排除随机噪音解释。在 ChatSRS 中可以同时请求两类输出。

Q4:缩尾处理用 1%/99% 还是 5%/95%?文献里说法不一。

A:选择阈值的原则是"与研究问题的保守程度相匹配",没有绝对标准,但以下经验规则适用于大多数情形:在样本量 n > 500 的研究中,1%/99% 是最常见且被广泛接受的默认阈值(经济学顶刊多用此设定)。若变量分布的偏度(skewness)绝对值 > 3 或峰度 > 10,可以考虑用 5%/95% 并在稳健性表格中同时报告两种缩尾结果以供对比。注意:所有缩尾操作必须在方法节明确说明哪些变量进行了缩尾、采用何种阈值,不可隐瞒。ChatSRS 在缩尾处理后会自动在输出注释中标明处理细节。


小结

稳健性检验是经济学与社科论文从"可发表"到"被接受"的关键一步。四类方法各有侧重:

方法核心问题推荐场景
替换变量结论是否依赖于特定的变量定义?核心变量有多种测量方案时必做
子样本分析结论是否仅存在于特定子群体?存在分组异质性假设时优先做
安慰剂检验显著效应是否只是随机噪音?政策评估、DID、准实验设计时强烈推荐
缩尾处理结论是否由极端值驱动?包含财务/经济数据(高偏度变量)时必做

chatsrs.com 用一句自然语言指令,即可获得:

  • 四类稳健性检验的完整三线表输出
  • 基准回归与稳健性回归的系数对比与变化幅度计算
  • 安慰剂检验经验 p 值与置换系数分布图
  • 缩尾处理前后系数对比
  • 可直接粘贴进论文的 APA 7th 格式中文报告句式

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。