邮箱: econometrics666@126.com 所有计量经济圈方法论 丛的code程序
, 宏微观 数据库和各种软 件都放在社群里.欢迎到计量经济圈社群交流访问 .
今天, 接着 “ 1.重磅! 创始人亲笔综述, 双重机器学习DML到底该怎么用?” ,看一篇文章《 双重机器学习的原理与拓展:从横截面到面板数据》。
双重机器学习, 1.重磅! 创始人亲笔综述, 双重机器学习DML到底该怎么用? 2. 现在本科研究生上来就"双重机器学习", 这玩意黑箱太多了, 看看写给实证研究者的操作手册. 3.
最全! 国内哪些政策适合用队列DID, 模糊断点RDD, 双重机器学习DML进行评估?4. 更精准地分析政策效果的“秘密武器”: 机器学习双重差分法(MLDID) 5. 双重机器学习DML用途, 步骤, 优势, 示例和代码等完整方法, 不信你还不懂, 附code. 6. 使用双重机器学习DML方法进行因果推断和政策评估的案例, 数据和代码分享
在经济学实证研究中,高维数据与模型误设是传统因果推断所面临的两大挑战。近年兴起的机器学习方法不仅适用于高维数据,且可在相当程度上避免模型设定误差,故在因果推断领域用途广阔,尤以双重机器学习为代表。
本文系统回顾了双重机器学习的相关文献,从截面数据的双重拉索估计开始,然后推广至以内曼正交性与交叉拟合为特征的一般双重机器学习,以及将其应用于聚类数据、断点回归、面板数据及双重差分模型。本文也讨论了双重机器学习在经济学实证研究中的应用及误区,并提出相应建议。
1. 实用! 把经管科研全流程, 做成了复制即用的《经管科研AI提示词库手册》. 2. 实用! 把经管社科复现从大半天压到半小时,全靠这套AI打法《经管社科论文AI复现手册》.3. 实用! 把经管社科因果推断全流程做成了复制即用的《面向Agent时代的因果推断方法手册》,4. 实用! 做了一本可复制的《经管科研AI工作流手册》, 把AI嵌入经管等社科科研全流程操作. 5. 实用! 做了本最全《中国社会科学研究数据手册》, 将经管社科研究349个数据整理成手册.
文章简要介绍:
众所周知,可信的实证研究殊为不易,面临诸多挑战。首先,如何选择控制变量;其次,怎样克服几乎无处不在的内生性。对于后者,计量经济学家发明了一系列因果推断方法(陈强,2025);对于前者,怎样选择好控制变量而避免坏控制变量(bad control),也日益引起经济学家的关注(张子尧和黄炜,2025)。但即使变量选择与内生性问题均已解决,实证研究者仍可能面临模型误设的陷阱。
记 为结果变量,
为处理变量,而控制变量为 维向量 。我们对 对
的因果效应感兴趣,考虑把 对 与 进行回归。但应如何设定回归方程的函数形式?由于经济理论通常无具体指导,故实证研究者一般使用最简单的线性模型,例如以下截面模型:
其中,
是我们感兴趣的目标参数(target parameter), 为样本容量,而扰动项 与所有解释变量均不相关(无内生性)。研究者为了避免模型误设,有时也会在回归方程中加入某些变量的平方项、交互项或对数值,但模型误设的威胁几乎始终存在。即使我们相信方程设定正确,也依然可能面临高维数据的挑战。如果 的维度很高,甚至超过样本容量(即 ),则最小二乘法(OLS)不可行。
此时可使用适用于高维数据的机器学习方法,比如拉索估计(lasso)(Tibshirani,1996)。但使用机器学习处理高维数据通常也要付出代价,若直接对方程进行拉索回归,则存在“正则化偏差”(regularization bias)。事实上,以预测为目的的机器学习方法,通常无法直接用于因果推断,一般需要通过“去偏”(debiased)才能使用,例如双重拉索估计(double lasso)(Chernozhukov et al.,2015)。
但双重拉索估计依然假设了线性模型,并未根本解决模型误设问题。在一篇重量级开创性论文中,Chernozhukov et al.(2018)引入了更一般的“双重机器学习”(double machine learning,DML),可使用非参数机器学习方法(例如随机森林、梯度提升法等)进行半参数估计,在相当程度上解决了模型误设偏差。
DML 通常分为两个阶段。在第一阶段,使用机器学习方法(两次及以上)估计“厌恶参数”(nuisance parameters)或“厌恶函数”(nuisance functions),即我们不感兴趣却绕不开的参数或函数。在第二阶段,代入第一阶段所估的厌恶参数或函数,进行 OLS 回归或矩估计。由于在第一阶段中使用了两次或两次以上的机器学习,故名“双重机器学习”。
但 Chernozhukov et al.(2018)仅考虑了截面数据的情形,而实践中常用面板数据,特别是面板数据中的双重差分模型(DID 模型)。理论与实践的这种差距使得实证研究者莫衷一是,甚至陷入误区。所幸最新理论研究已开始将 DML 应用于 DID 模型(Chang,2020;Callaway et al.,2023)以及面板固定效应模型(Clarke & Polselli,2026)。
尽管 DML 的理论尚未成熟,但 DML 在经济学实证研究中的应用已快速增长。据我们不完全统计,目前国内外已有 700 余篇经济学实证文献使用 DML,涉及金融、城市经济、农业经济、环境经济、数字经济等多个领域,参见图 1。对比 DML 的中外文献可知,虽然中文 DML 文献起步较晚,但近两年发文量已反超国外文献。
目前关于 DML 的文献综述还较少。针对信息系统(information systems)领域的读者,Shi et al.(2025)对 DML 作了通俗介绍。Ahrens et al.(2025)对 DML 作了深入而权威的介绍。在一本有关机器学习与因果推断的未出版专著中,Chernozhukov et al.(2025)对 DML 的理论与应用作了详细介绍,但散落在不同章节。
另外,Baiardi & Naghi(2024)通过“再访研究”(revisited studies),总结了双重机器学习对于因果推断的增加值(value added),包括可以灵活地估计结果变量、处理变量与协变量之间的复杂关系,以及比传统方法更适用于变量相对样本容量较多的数据。胡诗云等(2026)对 DML 进行了较为全面的文献综述。
与胡诗云等(2026)相比,本文具有以下独到特色:第一,本文首先介绍双重拉索估计,再推广至一般 DML,便于读者理解。第二,本文深入浅出地介绍了 DML 的数学原理,包括推导了 DML 估计量渐近分布的偏差项,以及交叉拟合(cross-fitting)如何使这些偏差项在大样本下消失。第三,本文介绍了如何将 DML 应用于聚类数据乃至多向聚类数据。第四,本文详细介绍了 DML 在面板数据及 DID 模型中的应用。第五,本文系统梳理了 DML 在实证应用中的诸多误区。
本文系统介绍 DML 的基本原理及其在横截面数据中的一系列成熟应用,包括双重拉索估计、部分线性模型、工具变量法、聚类数据及断点回归等。这部分方法已相对成熟,实证研究者可放心使用。
在此基础上,还介绍 DML 在面板数据中的前沿拓展,包括双重差分法及一般固定效应模型。这部分文献还很少,属于尚未成熟的前沿探索,我们将重点讨论其应用边界及可能误区,为 DML 在经济学中的应用提供指南。
陈强,齐霁,颜冠鹏.双重机器学习的原理与拓展:从横截面到面板数据[J].经济学动态,2026,(7):198-224.
1. 最全! 我国适合"断点回归"的政策都整理出来了, 让你有做不完的RDD断点政策评 2. 最全! 我国适合"合成控制法"的政策都整理出来了, 让你有做不完的SCM政策评估 3.
最全106页! 我国适合DID双重差分的政策都整理出来了, 让你有做不完的DID政策 4. 最全! 我国适合DDD三重差分的政策都整理出来了, 让你有做不完的DDD政策论 5. 最全! 国内哪些政策适合用队列DID, 模糊断点RDD, 双重机器学习DML进行评估? 6. 最全! 国内哪些政策情景适合用Bartik IV, 空间DID, 模糊DID方法进行评估?
7. 最全! 我国各种X的工具变量IV都整理出来了 , 8.
最全! 把CFPS研究过的全部自变量X与因变量Y做成数据库了, 全网第一份CFPS选题数据库. 9. 最全! 把CHFS研究过的全部自变量X与因变量Y做成数据库了, 第一份CHFS金融选题数据库. 10. 中国健康与养老CHARLS选题库, X与Y的研究组合助你研究老年人问题. 11. 把CSMAR研究过的自变量X与因变量Y做成数据库了, 第一份公司与金融微观选题数据库. 12. 三农微观数据选题库, 从此AI轻易助你选择经过检验了的X与Y的不同组合选题. 13. CHIP和CEPS选题数据库, 轻松助你选择经过检验了的X与Y的不同组合家庭收入和教育选题.
下面这些短链接文章属于合集,可以收藏起来阅读,不然以后都找不到了。
8年,计量经济圈近2500篇不重类计量文章,
可直接在公众号菜单栏搜索任何计量相关问题 ,
Econometrics Circle
计量经济圈组织了一个计量社群,有如下特征: 热情互助最多 、 前沿趋势最多 、社科资料最多、社科数据最多、科研牛人最多、海外名校最多。因此,建议积极进取和有强烈研习激情的中青年学者到社群交流探讨,始终坚信优秀是通过感染优秀而互相成就彼此的。