工具变量:2SLS、弱工具变量与几种常见用法
模型和两个条件
是内生的(和 相关), 是工具变量。它要满足两个条件:
- 相关性:,即控制 之后 和 相关。这一条可以用第一阶段检验。
- 外生性:其实包含两层,一是 本身近似随机,和误差项无关;二是排他性约束, 只通过 影响 。这一条没法直接检验:只有一个工具变量时连过度识别检验都做不了;有多个工具变量时可以做 Hansen J 检验,但它最多说明这几个工具变量彼此“一致”,证明不了它们都有效。归根到底要靠制度背景和论证。
一个内生变量、一个工具变量时,2SLS 估计量就是简约式系数除以第一阶段系数:
是 对 回归后的残差。
两个常见的错误:一是手动跑两步 OLS,点估计没错,标准误是错的,因为第二步的残差是用 而不是 算的;二是第一阶段用 probit 或 logit,把拟合值代入第二阶段,这种“禁止回归”(forbidden regression)一般得不到一致估计(Angrist and Pischke, 2009)。
模拟:内生性和 2SLS
set seed 20260928
set obs 400
gen id = _n
gen a = rnormal()
expand 10
bysort id: gen year = 2011 + _n
gen z = rnormal()
gen v = rnormal()
gen u = 0.8*v + 0.6*rnormal() // u 与 v 相关,d 因此是内生的
gen x1 = rnormal()
gen d = 0.25*z + 0.5*a + v
gen y = 1*d + 0.5*x1 + a + u
reghdfe y d x1, absorb(id year) vce(cluster id) // OLS
ivreghdfe y x1 (d = z), absorb(id year) cluster(id) first // 2SLS
OLS 估计为 1.766,离真实值 1 很远;2SLS 为 1.088(标准误 0.063)。第一阶段 ,Kleibergen–Paap F 为 230.5。first 选项还会报告弱工具变量稳健的 Anderson–Rubin 检验。
弱工具变量:看哪个 F
工具变量太弱时,2SLS 会偏向 OLS,t 检验的实际水平也会失真。检验第一阶段强弱时,常见的几个统计量:
| 统计量 | 适用的误差结构 | 说明 |
|---|---|---|
| Cragg–Donald Wald F | 同方差、相互独立 | Stock and Yogo(2005)的临界值是按它算的 |
| Kleibergen–Paap rk Wald F | 异方差、聚类 | ivreg2、ivreghdfe 都会报告;常被拿去和 Stock–Yogo 临界值比较,但那套临界值并不适用于它 |
| Montiel Olea–Pflueger 有效 F | 异方差、聚类 | 有配套的临界值(weakivtest);只有一个内生变量和一个工具变量时,与 KP F 相等 |
“F 大于 10”的经验法则来自 Staiger and Stock(1997)。Lee et al.(2022)进一步指出,要让通常的 5% 水平 t 检验真正只有 5% 的错误拒绝率,F 需要大于 104.7;达不到时可以用他们给出的 tF 调整临界值。第一阶段偏弱时,更稳妥的是用对弱工具变量稳健的推断,比如 Anderson–Rubin 检验和置信区间。Andrews, Stock and Sun(2019)有一篇很好的综述。
* 要有效 F:weakivtest 只能接在 ivreg2 或 ivregress 后面
ivreg2 y x1 i.year i.id (d = z), cluster(id)
weakivtest
同一个模型,ivreghdfe 报告的 KP F 是 230.5,把个体虚拟变量直接写进 ivreg2 得到的是 207.4,weakivtest 给出的有效 F 也是 207.4。差别来自自由度调整:ivreghdfe 不把嵌套在聚类里的固定效应算进参数个数。论文里最好注明用的是哪个命令。个体多的时候,把几百个虚拟变量写进 ivreg2 也会很慢。
LATE:估计的是谁的效应
处理效应因人而异时,工具变量估计的不是全体的平均效应。以二元的 和 为例,在单调性假设下(没有人会因为 反而从 变成 ),2SLS 识别的是依从者(compliers,即 会随 改变的那部分个体)的平均效应,也就是局部平均处理效应 LATE(Imbens and Angrist, 1994)。
由此有两个推论:换一个工具变量,依从者就变了,估计值也可能跟着变;过度识别检验(Hansen J)被拒绝,未必说明某个工具变量不外生,也可能只是两个工具变量对应的依从者不同。
模糊断点回归其实也是这个框架:以“是否越过门槛”为工具变量,识别的是门槛附近依从者的效应,见断点回归那篇。
国内论文里常见的几类工具变量
内生变量的滞后项。 最常见,也最站不住。如果误差项有序列相关,或者存在不随时间变的遗漏变量,滞后项同样和误差相关;滞后项也解决不了联立性(Reed, 2015;Bellemare, Masaki and Pepinsky, 2017)。
同行业、同地区其他企业的均值。 相关性几乎是构造出来的,难在外生性:行业层面的冲击会同时影响同行的 和本企业的 ,同群效应也可能直接作用于 。
历史或地理变量。 比如 1984 年的邮电局数量、地形起伏度、到港口的距离。它们不随时间变化,在面板里会被个体固定效应吸收,所以通常和一个随时间变化的全国性变量交乘,思路类似 Nunn and Qian(2014)。这时外生性要论证的是交乘项,而不只是历史变量本身。
Bartik(份额—移动)工具变量。 用期初的行业份额乘以全国层面的行业增长。识别可以来自份额的外生性(Goldsmith-Pinkham, Sorkin and Swift, 2020),也可以来自冲击的外生性(Borusyak, Hull and Jaravel, 2022),两种思路需要的论证不一样。
参考文献
- Andrews, I., Stock, J. H., & Sun, L. (2019). Weak instruments in instrumental variables regression: Theory and practice. Annual Review of Economics, 11, 727–753.
- Angrist, J. D., & Pischke, J.-S. (2009). Mostly Harmless Econometrics: An Empiricist's Companion. Princeton University Press.
- Bellemare, M. F., Masaki, T., & Pepinsky, T. B. (2017). Lagged explanatory variables and the estimation of causal effect. Journal of Politics, 79(3), 949–963.
- Borusyak, K., Hull, P., & Jaravel, X. (2022). Quasi-experimental shift-share research designs. Review of Economic Studies, 89(1), 181–213.
- Goldsmith-Pinkham, P., Sorkin, I., & Swift, H. (2020). Bartik instruments: What, when, why, and how. American Economic Review, 110(8), 2586–2624.
- Imbens, G. W., & Angrist, J. D. (1994). Identification and estimation of local average treatment effects. Econometrica, 62(2), 467–475.
- Lee, D. S., McCrary, J., Moreira, M. J., & Porter, J. (2022). Valid t-ratio inference for IV. American Economic Review, 112(10), 3260–3290.
- Montiel Olea, J. L., & Pflueger, C. (2013). A robust test for weak instruments. Journal of Business & Economic Statistics, 31(3), 358–369.
- Nunn, N., & Qian, N. (2014). US food aid and civil conflict. American Economic Review, 104(6), 1630–1666.
- Reed, W. R. (2015). On the practice of lagging variables to avoid simultaneity. Oxford Bulletin of Economics and Statistics, 77(6), 897–905.
- Staiger, D., & Stock, J. H. (1997). Instrumental variables regression with weak instruments. Econometrica, 65(3), 557–586.
- Stock, J. H., & Yogo, M. (2005). Testing for weak instruments in linear IV regression. In D. W. K. Andrews & J. H. Stock (Eds.), Identification and Inference for Econometric Models (pp. 80–108). Cambridge University Press.