外观
缩尾样本回归教程
说明 STATAU 缩尾样本回归的分位点设置、变量选择、Stata winsor2 对照代码与结果解读。
常用 Stata 命令
winsor2 y x controls, cuts(1 99) replace
reg y x controls, vce(robust) 在 STATAU 中打开此功能
缩尾样本回归缩尾回归winsor21% 99% 缩尾稳健性检验
这个页面解决什么问题
缩尾样本回归用来检查回归结果是否过度受连续变量极端值影响。系统把低于下分位点的数值压到下边界,把高于上分位点的数值压到上边界,然后用处理后的估计副本回归;原始上传数据不会被改写。
方法原理
缩尾不删除观测,而是替换超出边界的数值。例如 1%–99% 缩尾会将变量最低约 1% 的值设为第 1 百分位数,将最高约 1% 的值设为第 99 百分位数。因此样本行数通常不因缩尾本身减少,但变量分布和系数可能改变。
核心公式
双侧缩尾变换
适用数据与前提
缩尾只适用于数值变量。建议先检查极端值是真实经济现象还是录入、单位或合并错误;后三者应修正数据,不应用缩尾掩盖。分位点应在看结果前按研究惯例或预先规则确定。
STATAU 页面中每个位置应该放什么变量
| 网站位置 | 应放入的变量 | 说明 |
|---|---|---|
| 因变量 (Y) / 自变量 (X) / 控制变量 | 回归变量 | 应与基准回归保持一致。 |
| 缩尾变量(多选) | 需要处理的连续数值变量 | 未勾选时,系统自动使用 Y、X 和控制变量中的数值列。 |
| 下分位点 / 上分位点 | 例如 1 和 99 | 必须满足 0 ≤ 下分位点 < 上分位点 ≤ 100。 |
| 基础模型与标准误 | OLS / FE / RE / Pooled / Logit / Probit | 为便于对照,应与基准规格一致。 |
Stata 等效代码
* 复制数据后对指定变量做 1%–99% 缩尾
preserve
winsor2 [被解释变量] [解释变量] [控制变量], cuts(1 99) replace
reg [被解释变量] [解释变量] [控制变量], vce(robust)
restore| Stata 代码位置 | STATAU 网站对应位置 | 应放入什么 |
|---|---|---|
winsor2 [变量], cuts(1 99) replace | 缩尾变量、下/上分位点 | 对选定变量执行双侧 1%–99% 缩尾。 |
preserve / restore | 估计副本 | 对应 STATAU 不改写当前原始数据的行为。 |
reg ... | 基础模型 | 根据页面选择换成对应估计命令。 |
可删除代码段提示
- 如果你明确希望直接改写 Stata 内存中的数据,可删除 `preserve` 和 `restore`;但这与 STATAU 的副本处理逻辑不同。
- 未采用 1%–99% 时,将 `cuts(1 99)` 改为页面实际设置。
在 STATAU 中操作步骤
- 在侧栏“稳健性检验”中选择“缩尾样本回归”,配置与基准回归一致的变量和基础模型。
- 在“缩尾变量”中勾选需要处理的连续变量;不应对类别编码、ID 或年份机械缩尾。
- 设置下、上分位点,并记录选择依据。
- 运行后先核对每个变量的实际边界和受影响观测数,再与基准回归比较。
结果怎么看
- 确认缩尾变量列表与研究设计一致,尤其留意未手动勾选时的自动处理范围。
- 查看每个变量的实际上下界和受影响观测数;若影响比例异常,应回头检查变量分布。
- 缩尾本身不删行;如实际样本量变小,通常来自缺失值清理或模型估计规则。
- 将缩尾后的系数方向、量级和置信区间与基准结果并列比较。
论文表述示例
- 可以写成:“对主要连续变量进行 1% 和 99% 分位点的双侧缩尾后重新估计,核心结果与基准回归基本一致。”应同时报告缩尾变量和分位点。
常见使用误区
- 缩尾不等于删除异常值,也不能修复错误单位或录入错误。
- 对企业编码、年份、行业编码等类别变量缩尾没有清晰的统计含义。
- 反复尝试不同分位点直到获得显著结果,会放大选择性报告风险。