统计百科 ·

双重差分DID的APA报告怎么写?交互项系数、平行趋势检验与稳健性格式全解

统计百科:专攻"DID结果怎么写进论文"这一格式难点——交互项DiD系数报告、平行趋势检验结果呈现、稳健性检验写法,给出可直接套用的APA 7th完整模板,并盘点期刊审稿中最常被指出的DID报告格式错误。

DID(Difference-in-Differences,双重差分)是政策评估和因果推断中最常用的准实验方法。但跑完回归,论文里到底怎么报告那个关键的交互项?平行趋势检验结果写在哪、怎么写?稳健性检验要说明哪些内容?这篇文章专攻"DID结果怎么规范写进论文"这一格式难点,给出APA 7th的完整报告模板。


你的DID报告有这些问题吗?

审稿人和导师对DID报告最常见的反馈:

  • "交互项系数是核心估计量,需要报告系数、标准误、t值和p值,不能只写'显著'"
  • "平行趋势检验(parallel trends test)没有在正文中报告,只放了图"
  • "标准误类型不明确,面板数据建议聚类标准误,请注明cluster level"
  • "缺少稳健性检验,能否尝试安慰剂检验(placebo test)或变更控制变量集"
  • "处理效应量(ATT)要给出95%置信区间"
  • "固定效应的设置需要在方法章节说明,不能只在表注里提"

这些问题集中在APA 7th关于回归分析报告的规范,加上DID方法本身对因果推断的特殊要求。本文只讲一件事:DID结果到底怎么规范写进论文的每一个环节

本文假设你已了解回归系数基本的APA格式(如p值不加前导零等),如需回顾,参见姊妹篇 F值的APA 7th报告写法。DID方法本身的原理与操作,参见 AI辅助双重差分DID分析完整教程


一、DID的核心逻辑与报告框架

DID估计量是什么

DID方法通过比较"处理组"与"控制组"在政策(或事件)前后的变化差异,来识别政策的因果效应。最简洁的DID模型为:

$Y_{it} = \alpha + \beta_1 \cdot Treat_i + \beta_2 \cdot Post_t + \beta_3 \cdot (Treat_i \times Post_t) + \varepsilon_{it}$

其中:

变量含义
$Treat_i$处理组虚拟变量(处理组=1,控制组=0)
$Post_t$政策后虚拟变量(政策实施后=1,之前=0)
$Treat_i \times Post_t$DID交互项,系数 $\beta_3$ 即为核心估计量
$\beta_3$平均处理效应(ATT,Average Treatment Effect on the Treated)

报告框架三层结构

DID论文的结果报告通常包含三个层次:

  1. 基准回归:汇报核心交互项系数 $\beta_3$ 及其统计推断
  2. 平行趋势检验:验证"政策实施前,处理组与控制组趋势平行"的核心假设
  3. 稳健性检验:安慰剂检验、变更样本、变更控制变量集等

二、交互项系数的APA报告格式

必须报告的要素

DID交互项(即处理效应ATT)是整个分析的核心,APA 7th格式要求报告以下要素:

要素格式要求示例
系数(b或beta)两位小数,标明是非标准化系数b = 0.23
标准误SE,两位小数,注明类型SE = 0.07
t统计量t(df),两位小数t(2847) = 3.28
p值三位小数,不加前导零p = .001
置信区间95% CI [下界, 上界]95% CI [0.09, 0.37]
效应方向明确正向/负向,以及实质含义"政策使处理组产出提高了23%"

标准误类型说明(面板数据关键)

面板数据的DID回归必须在方法章节说明标准误的处理方式,这是审稿人最常要求补充的内容:

本研究采用聚类稳健标准误(clustered robust standard errors),
聚类层级为[省份/个体/行业],以控制组内相关性(within-cluster correlation)。

常见选项对照:

标准误类型适用场景APA描述
普通OLS标准误截面数据"采用常规标准误(conventional standard errors)"
稳健标准误(HC3)异方差"采用异方差稳健标准误(heteroskedasticity-robust standard errors)"
聚类稳健标准误面板/DID"采用聚类至[单位]层级的聚类标准误(standard errors clustered at the [unit] level)"
双向聚类标准误多维聚类"采用双向聚类标准误,同时聚类至[个体]和[时间]层级"

三、基准回归APA报告模板

场景设定

研究情景:评估某省2019年最低工资提高政策对企业雇员人数的影响,数据为2016-2022年面板数据(N=3,200个企业,T=7年),处理组为政策省份企业,控制组为未调整省份企业。

方法章节写法

本研究采用双重差分(Difference-in-Differences,DID)方法评估最低工资
政策对企业雇员规模的影响。基准模型设定如下:

ln(Emp)_it = alpha + beta * (Treat_i x Post_t) + gamma * X_it
             + delta_i + lambda_t + epsilon_it

其中 delta_i 为企业个体固定效应,lambda_t 为年份固定效应,
X_it 为时变控制变量集(企业规模、资产负债率、行业虚拟变量)。
核心估计量为DID交互项系数 beta,代表政策对处理组企业
平均处理效应(ATT)。标准误聚类至企业层级。
显著性水平设为 alpha = .05。

结果段落模板(基准回归)

表[X]报告了DID基准回归结果。核心交互项Treat x Post的系数估计值
为 b = X.XX(SE = X.XX),95% CI [X.XX, X.XX],t([df]) = X.XX,p [值],
表明[政策/事件]使处理组[因变量]平均[增加/减少]了XX%(或XX单位),
[方向]向影响[显著/不显著]。

模型控制了[控制变量列表],并加入企业个体固定效应和年份固定效应,
以吸收不随时间变化的个体异质性和共同时间趋势。
整体模型 F([df1], [df2]) = X.XX,p < .001,
组内 R² = .XX,表明模型对[因变量]组内变异具有一定解释力。

填入数值的示例

表3报告了DID基准回归结果。核心交互项(Treat × Post)系数估计值为 b = 0.23(SE = 0.07),95% CI [0.09, 0.37],t(2847) = 3.28,p = .001,表明最低工资上调政策使处理组企业雇员规模(对数值)平均提高了23%,政策效应在统计上显著为正。

模型纳入企业规模(对数资产)、资产负债率、行业类型等时变控制变量,并加入企业个体固定效应和年份固定效应,以控制不随时间变化的企业异质性与宏观共同趋势。整体模型 F(8, 2847) = 42.16,p < .001,组内 R² = .218,说明模型对企业层面雇员规模变动具有合理的解释力。


四、平行趋势检验的APA报告格式

为什么平行趋势检验必须报告

DID方法的核心识别假设(parallel trends assumption)是:若不存在政策冲击,处理组与控制组的[因变量]在政策实施前应保持平行趋势。这一假设不可直接检验,但可通过**事件研究法(event study)**间接验证。

审稿人通常会要求:在正文(而非仅在附录或图注)明确报告平行趋势检验结果,并说明政策后效应的动态模式。

事件研究法模型

将DID扩展为以政策实施年份(t=0)为基准的动态模型:

$Y_{it} = \alpha + \sum_{k \neq -1} \beta_k \cdot (Treat_i \times \mathbf{1}[t-t_0=k]) + \gamma X_{it} + \delta_i + \lambda_t + \varepsilon_{it}$

  • 基准期通常设为政策实施前一年(k = -1)
  • 政策前各期系数(k < -1)应不显著,说明平行趋势成立
  • 政策后各期系数(k >= 0)反映处理效应的动态演变

平行趋势检验报告模板

事件研究法(event study)结果(图[X]及表[Y])显示:
政策实施前各期(k = -[最早期], ..., k = -2),处理组与控制组之间
的系数估计值均未达统计显著水平(所有 p > .05;
具体而言,k = -2 期:b = X.XX,SE = X.XX,p = .XXX;
k = -[n] 期:b = X.XX,SE = X.XX,p = .XXX),
支持平行趋势假设成立。

政策实施后,处理效应在 k = 0 期出现[正/负]向转变
(b = X.XX,SE = X.XX,p [值]),并在随后各期持续[增大/平稳],
表明政策效应具有[即时性/渐进性]。

填入数值的示例

事件研究法结果(图2及表A1)显示,政策实施前各期系数均不显著(k = -3 期:b = 0.02,SE = 0.05,p = .652;k = -2 期:b = -0.01,SE = 0.04,p = .813),支持处理组与控制组在政策前具有平行趋势的核心识别假设。政策实施后,处理效应在 k = 0 期出现显著正向转变(b = 0.18,SE = 0.06,p = .003),并在 k = 1、k = 2 期进一步增大(b = 0.23 和 b = 0.26,均 p < .01),表明最低工资政策的雇员效应具有渐进递增的动态特征。

仅使用联合F检验时的简化写法

若未做完整的事件研究,仅汇报政策前趋势的联合F检验:

对政策实施前各期交互项的联合显著性F检验结果不显著,
F([df1], [df2]) = X.XX,p = .XXX,
说明处理组与控制组在政策前不存在系统性差异趋势,
平行趋势假设具有合理的经验支撑。

五、稳健性检验的APA报告格式

常见稳健性检验类型

检验类型目的关键报告内容
安慰剂检验(时间安慰剂)验证效应非偶然虚假政策时点下交互项不显著
安慰剂检验(处理组安慰剂)排除选择偏误虚假处理组下交互项不显著
变更控制变量集系数稳定性系数方向和量级未实质变化
排除干扰事件同期事件污染排除后系数仍显著
变更标准误类型推断稳健性不同SE下统计显著性维持
PSM-DID控制选择偏误匹配后DID系数与基准一致

稳健性检验报告模板

安慰剂检验(虚假政策时点)

为排除结果由偶然因素驱动的可能性,本研究将政策实施时间
人为提前[N]年(即以[年份]作为虚假政策冲击时点),重新估计DID模型。
虚假冲击时点下,交互项系数不显著(b = X.XX,SE = X.XX,p = .XXX),
与基准结果的显著效应(p < .05)形成对比,表明基准结果并非偶然。

变更控制变量集

为考察基准结果对控制变量选取的稳健性,本研究分别估计了
(1)不含控制变量的简化模型(b = X.XX,p [值]);
(2)基准模型(含X_it控制变量集,b = X.XX,p [值]);
(3)扩展模型(进一步加入[额外控制变量],b = X.XX,p [值])。
三个模型中,DID交互项系数的方向、量级和显著性基本一致,
表明核心估计量对控制变量选取不敏感。

PSM-DID稳健性

为控制处理组与控制组在可观测变量上的系统差异,本研究
采用倾向得分匹配(PSM)对样本进行1:1最近邻匹配,
平衡处理前特征后重新估计DID模型。
PSM-DID核心估计量为 b = X.XX(SE = X.XX,p [值]),
与基准结果(b = X.XX)高度一致,验证了基准结论的稳健性。

六、在ChatSRS一句话生成规范DID报告

打开 chatsrs.com,上传面板数据后输入:

"对我的面板数据做双重差分DID分析,因变量是企业雇员规模(对数),处理组变量是Treat,政策时点为2019年,控制变量包含企业规模和资产负债率;加入企业和年份双向固定效应;标准误聚类至企业层级;同时输出:(1)基准回归结果(含交互项系数、SE、t值、p值、95%CI);(2)事件研究法图及政策前各期系数表;(3)安慰剂检验(提前3年);(4)符合APA 7th格式的完整结果段落,可直接复制进论文。"

ChatSRS会同时调用R的fixest包或Stata风格的面板回归引擎,输出带聚类SE的回归表、事件研究图、安慰剂检验,并自动生成APA格式的文字报告段落。


七、方法章节标准写法(可直接修改套用)

完整方法章节模板

本研究采用双重差分(DID)方法识别[政策/事件]对[因变量]的因果效应。
数据为[起止年份]年的[省级/企业/个体]层面非平衡/平衡面板数据,
共包含[N]个[单位]、[T]个时间期,观测值[总计]个。

基准模型为:
Y_it = alpha + beta*(Treat_i x Post_t) + gamma*X_it + delta_i + lambda_t + epsilon_it

其中 delta_i 为[单位]个体固定效应,lambda_t 为年份固定效应,
X_it 包含[控制变量列表]。核心系数 beta 代表政策实施后
处理组相对于控制组的平均处理效应(ATT)。
标准误聚类至[单位]层级,以处理组内序列相关。

核心识别假设的检验:本研究采用事件研究法(event study)对
平行趋势假设进行检验,以政策实施前一年([年份])为基准期,
估计政策前后各期的动态处理效应。若政策前各期系数均不显著,
则支持平行趋势假设成立。

此外,本研究报告以下稳健性检验:(1)时间安慰剂检验;
(2)变更控制变量集;(3)PSM-DID。
所有分析使用ChatSRS(R fixest引擎)完成,显著性水平设为 alpha = .05。

八、DID报告常见错误对照表

常见错误正确写法关键点
只报告"交互项显著"报告 b、SE、t(df)、p值和95% CI完整统计量缺一不可
未说明标准误类型明确说明聚类层级面板数据必须用聚类SE
平行趋势仅放图在正文文字中报告前期系数审稿人要求文字呈现
政策前只说"不显著"报告每期系数和具体p值联合检验也要报告F和p
固定效应只在表注说明方法章节明确说明固定效应设置方法透明度要求
未报告稳健性检验至少1种安慰剂+1种变更规格因果推断可信度要求
R²用总体R²(overall R²)面板DID报告组内R²(within R²)固定效应模型用within R²
ATT混淆为ATEDID识别的是ATT,非全样本ATE概念准确性

常见FAQ

Q:DID的交互项系数要不要报告标准化系数(beta)?

A:通常不报告。DID的核心估计量是非标准化系数(unstandardized coefficient, b),因为它代表政策效应的"实际量级"(如雇员增加了多少人、工资提高了多少元),标准化系数会失去这一直觉含义。方法章节应明确说明报告的是非标准化系数。若因变量是对数形式,系数可近似解释为百分比变化(如 b = 0.08 ≈ 8%;精确计算为 e^0.08 − 1 ≈ 8.3%,误差约 0.3ppt,在小系数情形下近似可接受),在结果段落中应加此注释。若系数较大(如 b = 0.23),精确计算 e^0.23 − 1 ≈ 25.9%,与近似值 23% 相差约 2.9ppt,建议直接报告精确值。

Q:双向固定效应模型(TWFE)的F检验怎么写?

A:双向固定效应模型(Two-Way Fixed Effects)整体显著性检验的写法与普通回归相同:F(df1, df2) = X.XX, p < .001。但需注意,此处的df1为模型自由度(包含所有解释变量,不含固定效应),df2为残差自由度。在论文中通常还要补充组内R²(within R²),以反映模型在个体内变异上的解释力,而非总体R²。

Q:平行趋势检验图(event study plot)需要在正文还是附录?

A:主流期刊的惯例是将事件研究图放在正文结果部分(而非附录),因为它是DID可信度的核心证据。图的横轴为相对时间(以政策年前一期为基准),纵轴为系数估计值,需绘制95%置信区间。关键要求:政策前各期的置信区间应跨越零(即不显著),政策后各期如出现持续偏离则进一步支持因果解读。正文中的文字描述须明确说明前期系数不显著(给出具体p值)。

Q:如果平行趋势检验没有完全通过,怎么办?

A:若个别政策前期系数在边界上显著(如 p = .048),需在论文中如实报告并讨论。常见的处理方式有:(1)加入协变量交互项(controls × time dummies)以吸收趋势差异;(2)采用倾向得分匹配(PSM)预先平衡协变量后再做DID;(3)改用合成控制法(Synthetic Control)作为替代方法;(4)在局限性章节如实说明,并讨论对结论的影响程度。不应在报告中故意略去不显著的前期系数,审稿人会要求完整报告。


快速参考:DID报告格式速查卡

[基准回归——核心交互项]
b = X.XX (SE = X.XX), 95% CI [X.XX, X.XX], t([df]) = X.XX, p [= .XXX / < .001]
注:说明标准误类型(聚类层级);因变量为对数时注释百分比含义

[平行趋势——事件研究前期系数(每期分别报告)]
k = -[n]: b = X.XX, SE = X.XX, p = .XXX(不显著,支持平行趋势)
...
联合F检验: F([df1], [df2]) = X.XX, p = .XXX

[平行趋势——政策后动态效应]
k = 0: b = X.XX, SE = X.XX, p [值]
k = 1: b = X.XX, SE = X.XX, p [值]
...

[稳健性——安慰剂检验]
虚假时点交互项: b = X.XX, SE = X.XX, p = .XXX(不显著,与基准形成对比)

[固定效应与拟合]
个体FE + 时间FE; within R^2 = .XX; N = [个体数] x T = [期数]

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。