方法选择 ·
门槛回归还是分位数回归?非线性与异质效应怎么选
面板门槛回归与分位数回归怎么选?本文区分区制变化和因变量条件分布异质性,并说明 ChatSRS 当前单门槛点估计与 pooled QuantReg 的真实输出边界。
直接决策答案
如果理论问题是“当某个门槛变量超过特定值后,X 与 Y 的关系是否切换到另一个区制”,选择门槛回归。
如果理论问题是“在 Y 条件分布的较低、中间和较高位置,X 的关系是否呈现不同模式”,选择分位数回归。
两者都能展示异质性,但异质性的坐标不同:门槛回归沿门槛变量 Q 切分区制;分位数回归沿 Y 的条件分布估计不同分位。不能因为其中一个结果有星号就改选模型。
用研究问题快速区分
| 研究表述 | 更匹配的方法 |
|---|---|
| “企业规模超过某值后,数字化系数是否改变?” | 门槛回归 |
| “低绩效与高绩效企业中,数字化系数是否不同?” | 分位数回归 |
| “政策强度存在一个制度临界点吗?” | 有理论阈值时考虑门槛回归 |
| “X 对 Y 分布尾部是否更强?” | 分位数回归 |
| “哪个模型更显著?” | 不是合法选择标准 |
门槛变量可以是 X 自身或另一变量,但必须有理论意义。分位点也应事先规定,不能分析后只保留最显著的列。
两种方法可以互补,但不能互相验证
同一研究可以先用门槛模型考察某个理论临界点,再用分位数回归描述 Y 条件分布上的异质模式;也可以反过来把两者作为不同问题的补充。但若二者都得到相似方向,仍不能写成“相互验证因果”。它们使用不同样本处理、不同估计对象和不同推断口径。
更稳妥的做法是为每个模型写一条独立研究问题:门槛模型对应“Q 是否划分 X 的区制”,分位数模型对应“X 在 Y 的哪些条件分位呈现何种关系”。如果论文只有一个笼统的“存在异质性”假设,先把理论机制拆清楚,再决定是否真的需要两种方法,避免分析堆叠。
ChatSRS 当前门槛回归的真实范围
panel_threshold 要求 Y、核心 X、门槛变量、个体列和时间列,可加入控制变量。当前实现:
- 按个体组内均值处理数值缺失,再保留满期个体形成平衡面板;
- 在修剪后的候选网格搜索单一最优门槛;
- 仅按个体 entity 做 within 去均值;
- 直出门槛值、低区制与高区制的 X 系数点估计、SSR、平衡面板 N 和个体数。
**门槛边界:**当前 within 变换只按 entity 去均值,吸收个体固定效应;time_col 用于判断总期数并筛选满期个体,不会自动按年份去均值或吸收年份固定效应。当前低/高区制系数只有点估计,不直出 SE、p 或 CI,也没有 Bootstrap LR 门槛显著性与门槛值置信区间;只支持单门槛。不能把两个点估计不同写成“门槛效应显著”,也不能包装为完整 Hansen 推断。
ChatSRS 当前分位数回归的真实范围
panel_quantile 使用 statsmodels QuantReg,默认估计 Q25、Q50、Q75,也可指定其他分位。直出 X 和控制变量的 b、SE、显著性星号、估计方法与 N。
**分位数边界:**当前是 pooled QuantReg,没有吸收个体或时间固定效应。内部 p 只转为星号,精确 p 不显示在 Markdown 直出中;如需精确 p 必须另行取得并验证。当前也没有跨分位系数相等检验,不能用“Q25 显著、Q75 不显著”证明两列系数不同。
数据与输入示例
假设面板长表包含 firm_id、year、roa、digital、size、lev。
门槛回归:
对 roa 做单门槛面板回归,digital 是 X,size 是门槛变量,控制 lev,firm_id 和 year 是面板索引。报告门槛点、低/高 size 区制的 digital 点估计、SSR、平衡面板 N;明确当前只按 firm_id 去均值,year 仅用于满期筛选,不自动吸收年份固定效应;同时说明当前无 SE、p、CI 和 Bootstrap LR,不宣称门槛显著。
分位数回归:
对 roa 做 pooled 分位数回归,digital 是 X,控制 size 和 lev,报告 Q25/Q50/Q75 的 b、SE、星号与 N。明确不控制个体固定效应、不直出精确 p、没有跨分位差异检验。
这两个输入使用同一数据并不意味着估计对象相同。门槛回归会形成平衡子样本,分位数回归则对所需数值列做完整案例处理,样本也可能不同。
输出结果怎么解释
门槛值回答“当前网格下在哪个 Q 点切分拟合最好”;低/高区制系数描述 Q≤γ 与 Q>γ 时 X 的点估计。它不回答 Y 分布尾部效应。
Q25/Q50/Q75 系数回答在 Y 的不同条件分位位置,X 与 Y 的关系。Q25 不是简单把 Y 最低 25% 样本切出来再回归,Q75 也不是同一人从低分位移动到高分位后的变化。
若两个方法结论看似不一致,先核对理论问题、样本、控制变量和估计器边界,而不是挑更符合预期的一个。
论文报告模板
[门槛回归]
基于 [Q] 的单门槛网格搜索得到 γ=[ ]。Q≤γ 时 X 的点估计
为 [ ],Q>γ 时为 [ ],平衡面板 N=[ ]。当前输出未提供
区制系数 SE/p、Bootstrap LR 或门槛 CI;估计仅按 entity 去均值,
未自动吸收年份固定效应。故只描述点估计,不宣称存在统计显著门槛。
[分位数回归]
pooled QuantReg 中,X 在 Q25、Q50、Q75 的 b 分别为 [ ]、
[ ]、[ ],对应 SE 与星号见表 [ ]。当前模型不含个体固定效应,
精确 p 未直出,且未做跨分位系数检验,因此只描述分位模式。
如果论文真正需要固定效应分位数估计或完整门槛推断,应使用相应专门估计器另行完成,而不是修改方法名称。
选择前检查清单
- 异质性是沿 Q 的区制,还是沿 Y 的条件分布?
- 门槛或分位点是否有事前理论依据?
- 是否需要个体固定效应或年份固定效应?当前门槛实现只吸收前者;
- 是否需要正式的区制或跨分位差异检验?
- 当前产品输出能否支持计划中的推断句子?
常见问题 FAQ
Q1:门槛变量可以就是核心 X 吗?
可以,但要说明理论含义,并检查切分后的有效变异与模型识别。
Q2:Q25 显著、Q75 不显著,能说低分位更强吗?
不能。需要正式的跨分位系数差异检验,当前直出没有。
Q3:门槛值找到后就证明存在非线性吗?
不能。当前只是最优切分点估计,缺少 Bootstrap LR 和置信区间。
Q4:面板数据一定要选门槛回归吗?
不是。方法由研究问题决定;当前分位数实现虽接收面板来源数据,实际是 pooled QuantReg。
相关阅读
明确异质性发生在哪个维度后,可打开 ChatSRS,提交门槛或分位数分析需求。最终报告须与实际估计器和直出字段一致。