Amber Memo

工具变量:2SLS、弱工具变量与几种常见用法

工具变量2SLS因果推断Stata

模型和两个条件

Yi=βDi+Xiγ+uiY_i=\beta D_i+X_i'\gamma+u_i
Di=πZi+Xiδ+viD_i=\pi Z_i+X_i'\delta+v_i

DD 是内生的(和 uu 相关),ZZ 是工具变量。它要满足两个条件:

  • 相关性π0\pi\neq 0,即控制 XX 之后 ZZDD 相关。这一条可以用第一阶段检验。
  • 外生性:其实包含两层,一是 ZZ 本身近似随机,和误差项无关;二是排他性约束,ZZ 只通过 DD 影响 YY。这一条没法直接检验:只有一个工具变量时连过度识别检验都做不了;有多个工具变量时可以做 Hansen J 检验,但它最多说明这几个工具变量彼此“一致”,证明不了它们都有效。归根到底要靠制度背景和论证。

一个内生变量、一个工具变量时,2SLS 估计量就是简约式系数除以第一阶段系数:

β^IV=Cov^(Z~,Y)Cov^(Z~,D)\hat\beta_{IV}=\frac{\widehat{\Cov}(\tilde Z,Y)}{\widehat{\Cov}(\tilde Z,D)}

Z~\tilde ZZZXX 回归后的残差。

两个常见的错误:一是手动跑两步 OLS,点估计没错,标准误是错的,因为第二步的残差是用 D^\hat D 而不是 DD 算的;二是第一阶段用 probit 或 logit,把拟合值代入第二阶段,这种“禁止回归”(forbidden regression)一般得不到一致估计(Angrist and Pischke, 2009)。

模拟:内生性和 2SLS

set seed 20260928
set obs 400
gen id = _n
gen a = rnormal()
expand 10
bysort id: gen year = 2011 + _n
gen z  = rnormal()
gen v  = rnormal()
gen u  = 0.8*v + 0.6*rnormal()     // u 与 v 相关,d 因此是内生的
gen x1 = rnormal()
gen d  = 0.25*z + 0.5*a + v
gen y  = 1*d + 0.5*x1 + a + u

reghdfe y d x1, absorb(id year) vce(cluster id)              // OLS
ivreghdfe y x1 (d = z), absorb(id year) cluster(id) first     // 2SLS

OLS 估计为 1.766,离真实值 1 很远;2SLS 为 1.088(标准误 0.063)。第一阶段 π^=0.245\hat\pi=0.245,Kleibergen–Paap F 为 230.5。first 选项还会报告弱工具变量稳健的 Anderson–Rubin 检验。

弱工具变量:看哪个 F

工具变量太弱时,2SLS 会偏向 OLS,t 检验的实际水平也会失真。检验第一阶段强弱时,常见的几个统计量:

统计量 适用的误差结构 说明
Cragg–Donald Wald F 同方差、相互独立 Stock and Yogo(2005)的临界值是按它算的
Kleibergen–Paap rk Wald F 异方差、聚类 ivreg2ivreghdfe 都会报告;常被拿去和 Stock–Yogo 临界值比较,但那套临界值并不适用于它
Montiel Olea–Pflueger 有效 F 异方差、聚类 有配套的临界值(weakivtest);只有一个内生变量和一个工具变量时,与 KP F 相等

“F 大于 10”的经验法则来自 Staiger and Stock(1997)。Lee et al.(2022)进一步指出,要让通常的 5% 水平 t 检验真正只有 5% 的错误拒绝率,F 需要大于 104.7;达不到时可以用他们给出的 tF 调整临界值。第一阶段偏弱时,更稳妥的是用对弱工具变量稳健的推断,比如 Anderson–Rubin 检验和置信区间。Andrews, Stock and Sun(2019)有一篇很好的综述。

* 要有效 F:weakivtest 只能接在 ivreg2 或 ivregress 后面
ivreg2 y x1 i.year i.id (d = z), cluster(id)
weakivtest

同一个模型,ivreghdfe 报告的 KP F 是 230.5,把个体虚拟变量直接写进 ivreg2 得到的是 207.4,weakivtest 给出的有效 F 也是 207.4。差别来自自由度调整:ivreghdfe 不把嵌套在聚类里的固定效应算进参数个数。论文里最好注明用的是哪个命令。个体多的时候,把几百个虚拟变量写进 ivreg2 也会很慢。

LATE:估计的是谁的效应

处理效应因人而异时,工具变量估计的不是全体的平均效应。以二元的 DDZZ 为例,在单调性假设下(没有人会因为 Z=1Z=1 反而从 D=1D=1 变成 D=0D=0),2SLS 识别的是依从者(compliers,即 DD 会随 ZZ 改变的那部分个体)的平均效应,也就是局部平均处理效应 LATE(Imbens and Angrist, 1994)。

由此有两个推论:换一个工具变量,依从者就变了,估计值也可能跟着变;过度识别检验(Hansen J)被拒绝,未必说明某个工具变量不外生,也可能只是两个工具变量对应的依从者不同。

模糊断点回归其实也是这个框架:以“是否越过门槛”为工具变量,识别的是门槛附近依从者的效应,见断点回归那篇

国内论文里常见的几类工具变量

内生变量的滞后项。 最常见,也最站不住。如果误差项有序列相关,或者存在不随时间变的遗漏变量,滞后项同样和误差相关;滞后项也解决不了联立性(Reed, 2015;Bellemare, Masaki and Pepinsky, 2017)。

同行业、同地区其他企业的均值。 相关性几乎是构造出来的,难在外生性:行业层面的冲击会同时影响同行的 DD 和本企业的 YY,同群效应也可能直接作用于 YY

历史或地理变量。 比如 1984 年的邮电局数量、地形起伏度、到港口的距离。它们不随时间变化,在面板里会被个体固定效应吸收,所以通常和一个随时间变化的全国性变量交乘,思路类似 Nunn and Qian(2014)。这时外生性要论证的是交乘项,而不只是历史变量本身。

Bartik(份额—移动)工具变量。 用期初的行业份额乘以全国层面的行业增长。识别可以来自份额的外生性(Goldsmith-Pinkham, Sorkin and Swift, 2020),也可以来自冲击的外生性(Borusyak, Hull and Jaravel, 2022),两种思路需要的论证不一样。

参考文献

  • Andrews, I., Stock, J. H., & Sun, L. (2019). Weak instruments in instrumental variables regression: Theory and practice. Annual Review of Economics, 11, 727–753.
  • Angrist, J. D., & Pischke, J.-S. (2009). Mostly Harmless Econometrics: An Empiricist's Companion. Princeton University Press.
  • Bellemare, M. F., Masaki, T., & Pepinsky, T. B. (2017). Lagged explanatory variables and the estimation of causal effect. Journal of Politics, 79(3), 949–963.
  • Borusyak, K., Hull, P., & Jaravel, X. (2022). Quasi-experimental shift-share research designs. Review of Economic Studies, 89(1), 181–213.
  • Goldsmith-Pinkham, P., Sorkin, I., & Swift, H. (2020). Bartik instruments: What, when, why, and how. American Economic Review, 110(8), 2586–2624.
  • Imbens, G. W., & Angrist, J. D. (1994). Identification and estimation of local average treatment effects. Econometrica, 62(2), 467–475.
  • Lee, D. S., McCrary, J., Moreira, M. J., & Porter, J. (2022). Valid t-ratio inference for IV. American Economic Review, 112(10), 3260–3290.
  • Montiel Olea, J. L., & Pflueger, C. (2013). A robust test for weak instruments. Journal of Business & Economic Statistics, 31(3), 358–369.
  • Nunn, N., & Qian, N. (2014). US food aid and civil conflict. American Economic Review, 104(6), 1630–1666.
  • Reed, W. R. (2015). On the practice of lagging variables to avoid simultaneity. Oxford Bulletin of Economics and Statistics, 77(6), 897–905.
  • Staiger, D., & Stock, J. H. (1997). Instrumental variables regression with weak instruments. Econometrica, 65(3), 557–586.
  • Stock, J. H., & Yogo, M. (2005). Testing for weak instruments in linear IV regression. In D. W. K. Andrews & J. H. Stock (Eds.), Identification and Inference for Econometric Models (pp. 80–108). Cambridge University Press.