Amber Memo

笔记

按建议的阅读顺序排列。方法类的笔记会随学随改,改过的会标出更新日期。

  1. 双重差分(上):从 2×2 到事件研究

    DID 到底估计的是什么,平行趋势该怎么理解,事件研究图怎么画,以及两种安慰剂检验。文中代码都在模拟数据上跑过。

    DID因果推断Stata
  2. 双重差分(下):交错处理与新估计量

    政策分批实施时,双向固定效应估计量可能严重失真。用一个模拟例子看偏差从哪里来,再比较 Callaway–Sant'Anna、Sun–Abraham、插补估计量和 de Chaisemartin–D'Haultfœuille 几种方法及对应的 Stata 命令。

    DID交错DIDStata
  3. 合成控制法:权重、置换检验与合成 DID

    只有一个受政策影响的地区时怎么估计效应:合成控制的权重从哪来,为什么比 DID 灵活,置换检验怎么做,以及 synth、synth_runner、sdid 三个命令。附一个平行趋势不成立、DID 失效的模拟例子。

    合成控制因果推断Stata
  4. 中介效应:逐步法、Sobel、Bootstrap,以及它们回答不了的问题

    三步法、Sobel 检验和 Bootstrap 置信区间怎么做;一个模拟例子说明“间接效应显著”不等于找到了机制;以及江艇(2022)之后,机制分析更稳妥的写法。

    中介效应机制分析Stata
  5. 双重机器学习(DML):原理、代码和几个坑

    部分线性模型里的 DML 做了两件事:正交化和交叉拟合。用一个非线性混杂的模拟比较 OLS、Lasso 和树模型,附 Stata ddml 与 Python DoubleML 的代码,以及面板数据上要注意的地方。

    DML机器学习StataPython
  6. 工具变量:2SLS、弱工具变量与几种常见用法

    相关性和外生性怎么论证,第一阶段该看哪个 F 值,LATE 是什么意思,以及“滞后一期当工具变量”“同行业均值当工具变量”这些做法的问题。

    工具变量2SLS因果推断Stata
  7. 断点回归(RDD):局部线性、带宽与操纵检验

    精确断点和模糊断点各识别什么,为什么用带宽内的局部线性而不是全样本高阶多项式,rdrobust 的稳健置信区间怎么读,以及密度检验、协变量平衡、安慰剂断点这几项检验。附一个驱动变量被操纵的反例。

    断点回归RDD因果推断Stata
  8. 固定效应与聚类标准误:reghdfe 的几个细节

    固定效应吸收了什么,reghdfe 的样本量为什么和 xtreg 不一样,标准误聚类到哪一层,聚类数很少时怎么办。附一个蒙特卡洛:不聚类时,名义 5% 的检验实际拒绝了 21.6%。

    固定效应聚类标准误reghdfeStata