外观
稳健性检验教程
说明 STATAU 条件回归、缩尾样本回归和交互固定效应回归的配置、透明度信息、Stata 对照代码与谨慎解读方式。
常用 Stata 命令
reg y x controls if condition
winsor2 y x controls, cuts(1 99) replace
reghdfe y x controls, absorb(industry#year) 在 STATAU 中打开此功能
稳健性检验缩尾回归条件回归交互固定效应winsor2reghdfe
这个页面解决什么问题
稳健性检验用来回答“当前结果是否高度依赖某一种样本口径或固定效应设定”。STATAU 在侧栏中提供独立的“稳健性检验”区域,下设条件回归、缩尾样本回归和交互固定效应回归三个独立方法。每次运行只生成当前规格的一列结果,不会自动附加基准回归。
方法原理
三种检验都复用你选择的基础模型,只改变本次估计副本:条件回归先筛选样本;缩尾回归把选定数值变量压到指定分位点边界;交互固定效应把两个或更多维度的取值组合成无碰撞类别并加以控制。上传数据和数据处理状态不会被改写。
核心公式
稳健性规格的一般写法
上标
适用数据与前提
先准备好因变量、自变量和控制变量。条件回归还需要能明确表达的筛选规则;缩尾变量必须是数值变量;交互固定效应至少选择两个维度。若基础模型选 RE 或 Pooled,还必须设置个体 ID 与时间 ID。Logit/Probit 的因变量必须是 0/1。
STATAU 页面中每个位置应该放什么变量
| 网站位置 | 应放入的变量 | 说明 |
|---|---|---|
| 因变量 (Y) / 自变量 (X) / 控制变量 | 公共回归变量 | 三个独立方法均复用同一套变量配置方式。 |
| 基础模型 | OLS / FE / RE / Pooled / Logit / Probit | 决定当前稳健性规格使用哪一种现有估计器。 |
| 条件回归 | AND/OR 与多条扁平条件 | 支持比较、区间、集合、文本匹配和缺失值条件。 |
| 缩尾样本回归 | 缩尾变量与上下分位点 | 默认按 1%–99% 处理 Y、X、控制变量中的数值变量。 |
| 交互固定效应回归 | 两个或更多交互维度 | 例如行业×年份、地区×年份。 |
| 标准误 / 边际效应 / 输出设置 | 公共输出配置 | 沿用普通回归;Logit/Probit 可继续输出边际效应。 |
Stata 等效代码
* 1. 条件回归
reg [被解释变量] [解释变量] [控制变量] if [筛选条件], vce(robust)
* 2. 1%–99% 缩尾后回归
winsor2 [被解释变量] [解释变量] [控制变量], cuts(1 99) replace
reg [被解释变量] [解释变量] [控制变量], vce(robust)
* 3. 交互固定效应回归
reghdfe [被解释变量] [解释变量] [控制变量], ///
absorb([维度1]#[维度2]) vce(cluster [聚类变量])| Stata 代码位置 | STATAU 网站对应位置 | 应放入什么 |
|---|---|---|
if [筛选条件] | 条件回归 | AND/OR 条件只作用于本次估计样本。 |
winsor2 ..., cuts(1 99) | 缩尾样本回归 | 页面会记录每个变量的实际上下界和受影响观测数。 |
absorb([维度1]#[维度2]) | 交互固定效应回归 | 两个以上维度会按联合取值形成交互类别。 |
vce(cluster [聚类变量]) | 聚类标准误 | 选择 Cluster 时沿用公共聚类设置。 |
可删除代码段提示
- 只运行其中一个板块时,删除另外两段 Stata 示例代码。
- 基础模型不是固定效应时,应按页面选择改成 `reg`、`xtreg, re`、`logit` 或 `probit` 等对应命令。
- 不使用聚类标准误时,删除 `vce(cluster ...)`。
三个方法怎么选
条件回归
当你担心结论只由某类样本驱动时使用。多条条件可以选择全部满足(AND)或任一满足(OR),但首版不支持嵌套条件组。
缩尾样本回归
当连续变量存在极端值、但又不希望直接删除观测时使用。分位点按本次估计副本中的全样本有效值计算,原始上传数据不会变化。
交互固定效应回归
当你希望控制“行业×年份”“地区×年份”等共同冲击时使用。OLS、FE、Logit 和 Probit 采用吸收式高维固定效应;RE/Pooled 会展开去除基准类别后的虚拟变量,类别过多或自由度不足时页面会建议改用 FE。
在 STATAU 中操作步骤
- 先在侧栏“稳健性检验”区域选择条件回归、缩尾样本回归或交互固定效应回归。
- 在当前独立方法页选择 Y、X、控制变量和基础模型,再设置固定效应、标准误及边际效应。
- 填写当前方法专属的筛选条件、缩尾范围或交互维度,然后点击“运行”或“追加”;系统只估计当前稳健性规格。
- 结果出来后先核对实际样本量、筛选条件、缩尾边界或交互类别数,再比较核心系数。
结果怎么看
- 先看“实际样本量”。条件筛选、缺失值清洗和固定效应 singleton 处理都可能让它小于原始行数。
- 条件回归要核对筛选表达式是否符合研究设计;缩尾回归要核对实际边界和受影响观测数;交互固定效应要核对维度与类别数。
- 当前页面只提供当前稳健性规格。只有把它与同口径的基准结果比较后,才能判断方向、量级和显著性是否稳定。
- Logit/Probit 若输出边际效应,应优先用边际效应解释概率变化。
论文表述示例
- 可以写成:“在限定样本、对连续变量进行 1%–99% 缩尾并进一步控制行业×年份固定效应后,核心变量系数方向与量级未发生实质变化。”但只有实际对照基准结果后才能使用这类表述。
常见使用误区
- 只看到当前规格显著,不能单独声称“结论稳健”;必须与基准结果比较。
- 缩尾不是删除异常值,也不能替代对数据生成过程和录入错误的检查。
- 交互类别过细会消耗大量自由度;RE/Pooled 还可能产生很大的虚拟变量矩阵。
- 为了得到显著结果而反复调整筛选条件或分位点,会放大选择性报告风险。