Skip to content

缩尾样本回归教程

稳健性检验

说明 STATAU 缩尾样本回归的分位点设置、变量选择、Stata winsor2 对照代码与结果解读。

常用 Stata 命令winsor2 y x controls, cuts(1 99) replace reg y x controls, vce(robust)
在 STATAU 中打开此功能
缩尾样本回归缩尾回归winsor21% 99% 缩尾稳健性检验

这个页面解决什么问题

缩尾样本回归用来检查回归结果是否过度受连续变量极端值影响。系统把低于下分位点的数值压到下边界,把高于上分位点的数值压到上边界,然后用处理后的估计副本回归;原始上传数据不会被改写。

方法原理

缩尾不删除观测,而是替换超出边界的数值。例如 1%–99% 缩尾会将变量最低约 1% 的值设为第 1 百分位数,将最高约 1% 的值设为第 99 百分位数。因此样本行数通常不因缩尾本身减少,但变量分布和系数可能改变。

核心公式

双侧缩尾变换

xiW={qL,xi<qLxi,qLxiqUqU,xi>qU

qLqU 分别是页面设定的下、上分位点。回归使用 xiW,但不会改写当前数据集中的 xi

适用数据与前提

缩尾只适用于数值变量。建议先检查极端值是真实经济现象还是录入、单位或合并错误;后三者应修正数据,不应用缩尾掩盖。分位点应在看结果前按研究惯例或预先规则确定。

STATAU 页面中每个位置应该放什么变量

网站位置应放入的变量说明
因变量 (Y) / 自变量 (X) / 控制变量回归变量应与基准回归保持一致。
缩尾变量(多选)需要处理的连续数值变量未勾选时,系统自动使用 Y、X 和控制变量中的数值列。
下分位点 / 上分位点例如 1 和 99必须满足 0 ≤ 下分位点 < 上分位点 ≤ 100。
基础模型与标准误OLS / FE / RE / Pooled / Logit / Probit为便于对照,应与基准规格一致。

Stata 等效代码

* 复制数据后对指定变量做 1%–99% 缩尾
preserve
winsor2 [被解释变量] [解释变量] [控制变量], cuts(1 99) replace
reg [被解释变量] [解释变量] [控制变量], vce(robust)
restore
Stata 代码位置STATAU 网站对应位置应放入什么
winsor2 [变量], cuts(1 99) replace缩尾变量、下/上分位点对选定变量执行双侧 1%–99% 缩尾。
preserve / restore估计副本对应 STATAU 不改写当前原始数据的行为。
reg ...基础模型根据页面选择换成对应估计命令。
可删除代码段提示
  • 如果你明确希望直接改写 Stata 内存中的数据,可删除 `preserve` 和 `restore`;但这与 STATAU 的副本处理逻辑不同。
  • 未采用 1%–99% 时,将 `cuts(1 99)` 改为页面实际设置。

在 STATAU 中操作步骤

  1. 在侧栏“稳健性检验”中选择“缩尾样本回归”,配置与基准回归一致的变量和基础模型。
  2. 在“缩尾变量”中勾选需要处理的连续变量;不应对类别编码、ID 或年份机械缩尾。
  3. 设置下、上分位点,并记录选择依据。
  4. 运行后先核对每个变量的实际边界和受影响观测数,再与基准回归比较。

结果怎么看

  • 确认缩尾变量列表与研究设计一致,尤其留意未手动勾选时的自动处理范围。
  • 查看每个变量的实际上下界和受影响观测数;若影响比例异常,应回头检查变量分布。
  • 缩尾本身不删行;如实际样本量变小,通常来自缺失值清理或模型估计规则。
  • 将缩尾后的系数方向、量级和置信区间与基准结果并列比较。
论文表述示例
  • 可以写成:“对主要连续变量进行 1% 和 99% 分位点的双侧缩尾后重新估计,核心结果与基准回归基本一致。”应同时报告缩尾变量和分位点。

常见使用误区

  • 缩尾不等于删除异常值,也不能修复错误单位或录入错误。
  • 对企业编码、年份、行业编码等类别变量缩尾没有清晰的统计含义。
  • 反复尝试不同分位点直到获得显著结果,会放大选择性报告风险。

相关页面