社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

双重机器学习正在被国内大量用错, 最新长文讲透DML,DID与面板数据.

计量经济圈 • 19 小时前 • 13 次点击  
图片
凡是搞计量经济的,都关注这个号了
邮箱:econometrics666@126.com
所有计量经济圈方法论丛的code程序 , 宏微观数据库和各种软件都放在社群里.欢迎到计量经济圈社群交流访问.


今天, 接着1.重磅! 创始人亲笔综述, 双重机器学习DML到底该怎么用?”,看一篇文章《双重机器学习的原理与拓展:从横截面到面板数据》。

双重机器学习,1.重磅! 创始人亲笔综述, 双重机器学习DML到底该怎么用? 2.现在本科研究生上来就"双重机器学习", 这玩意黑箱太多了, 看看写给实证研究者的操作手册. 3. 最全! 国内哪些政策适合用队列DID, 模糊断点RDD, 双重机器学习DML进行评估?4.更精准地分析政策效果的“秘密武器”: 机器学习双重差分法(MLDID) 5.双重机器学习DML用途, 步骤, 优势, 示例和代码等完整方法, 不信你还不懂, 附code. 6.使用双重机器学习DML方法进行因果推断和政策评估的案例, 数据和代码分享

在经济学实证研究中,高维数据与模型误设是传统因果推断所面临的两大挑战。近年兴起的机器学习方法不仅适用于高维数据,且可在相当程度上避免模型设定误差,故在因果推断领域用途广阔,尤以双重机器学习为代表。

本文系统回顾了双重机器学习的相关文献,从截面数据的双重拉索估计开始,然后推广至以内曼正交性与交叉拟合为特征的一般双重机器学习,以及将其应用于聚类数据、断点回归、面板数据及双重差分模型。本文也讨论了双重机器学习在经济学实证研究中的应用及误区,并提出相应建议。

1.实用! 把经管科研全流程, 做成了复制即用的《经管科研AI提示词库手册》.2.实用! 把经管社科复现从大半天压到半小时,全靠这套AI打法《经管社科论文AI复现手册》.3.实用! 把经管社科因果推断全流程做成了复制即用的《面向Agent时代的因果推断方法手册》,4.实用! 做了一本可复制的《经管科研AI工作流手册》, 把AI嵌入经管等社科科研全流程操作. 5.实用! 做了本最全《中国社会科学研究数据手册》, 将经管社科研究349个数据整理成手册.

文章简要介绍:

众所周知,可信的实证研究殊为不易,面临诸多挑战。首先,如何选择控制变量;其次,怎样克服几乎无处不在的内生性。对于后者,计量经济学家发明了一系列因果推断方法(陈强,2025);对于前者,怎样选择好控制变量而避免坏控制变量(bad control),也日益引起经济学家的关注(张子尧和黄炜,2025)。但即使变量选择与内生性问题均已解决,实证研究者仍可能面临模型误设的陷阱。

记  为结果变量, 为处理变量,而控制变量为  维向量 。我们对  对  的因果效应感兴趣,考虑把  对  与  进行回归。但应如何设定回归方程的函数形式?由于经济理论通常无具体指导,故实证研究者一般使用最简单的线性模型,例如以下截面模型:

其中, 是我们感兴趣的目标参数(target parameter), 为样本容量,而扰动项  与所有解释变量均不相关(无内生性)。研究者为了避免模型误设,有时也会在回归方程中加入某些变量的平方项、交互项或对数值,但模型误设的威胁几乎始终存在。即使我们相信方程设定正确,也依然可能面临高维数据的挑战。如果  的维度很高,甚至超过样本容量(即 ),则最小二乘法(OLS)不可行。

此时可使用适用于高维数据的机器学习方法,比如拉索估计(lasso)(Tibshirani,1996)。但使用机器学习处理高维数据通常也要付出代价,若直接对方程进行拉索回归,则存在“正则化偏差”(regularization bias)。事实上,以预测为目的的机器学习方法,通常无法直接用于因果推断,一般需要通过“去偏”(debiased)才能使用,例如双重拉索估计(double lasso)(Chernozhukov et al.,2015)。

但双重拉索估计依然假设了线性模型,并未根本解决模型误设问题。在一篇重量级开创性论文中,Chernozhukov et al.(2018)引入了更一般的“双重机器学习”(double machine learning,DML),可使用非参数机器学习方法(例如随机森林、梯度提升法等)进行半参数估计,在相当程度上解决了模型误设偏差。

DML 通常分为两个阶段。在第一阶段,使用机器学习方法(两次及以上)估计“厌恶参数”(nuisance parameters)或“厌恶函数”(nuisance functions),即我们不感兴趣却绕不开的参数或函数。在第二阶段,代入第一阶段所估的厌恶参数或函数,进行 OLS 回归或矩估计。由于在第一阶段中使用了两次或两次以上的机器学习,故名“双重机器学习”。

但 Chernozhukov et al.(2018)仅考虑了截面数据的情形,而实践中常用面板数据,特别是面板数据中的双重差分模型(DID 模型)。理论与实践的这种差距使得实证研究者莫衷一是,甚至陷入误区。所幸最新理论研究已开始将 DML 应用于 DID 模型(Chang,2020;Callaway et al.,2023)以及面板固定效应模型(Clarke & Polselli,2026)。

尽管 DML 的理论尚未成熟,但 DML 在经济学实证研究中的应用已快速增长。据我们不完全统计,目前国内外已有 700 余篇经济学实证文献使用 DML,涉及金融、城市经济、农业经济、环境经济、数字经济等多个领域,参见图 1。对比 DML 的中外文献可知,虽然中文 DML 文献起步较晚,但近两年发文量已反超国外文献。

目前关于 DML 的文献综述还较少。针对信息系统(information systems)领域的读者,Shi et al.(2025)对 DML 作了通俗介绍。Ahrens et al.(2025)对 DML 作了深入而权威的介绍。在一本有关机器学习与因果推断的未出版专著中,Chernozhukov et al.(2025)对 DML 的理论与应用作了详细介绍,但散落在不同章节。

另外,Baiardi & Naghi(2024)通过“再访研究”(revisited studies),总结了双重机器学习对于因果推断的增加值(value added),包括可以灵活地估计结果变量、处理变量与协变量之间的复杂关系,以及比传统方法更适用于变量相对样本容量较多的数据。胡诗云等(2026)对 DML 进行了较为全面的文献综述。

与胡诗云等(2026)相比,本文具有以下独到特色:第一,本文首先介绍双重拉索估计,再推广至一般 DML,便于读者理解。第二,本文深入浅出地介绍了 DML 的数学原理,包括推导了 DML 估计量渐近分布的偏差项,以及交叉拟合(cross-fitting)如何使这些偏差项在大样本下消失。第三,本文介绍了如何将 DML 应用于聚类数据乃至多向聚类数据。第四,本文详细介绍了 DML 在面板数据及 DID 模型中的应用。第五,本文系统梳理了 DML 在实证应用中的诸多误区。

本文系统介绍 DML 的基本原理及其在横截面数据中的一系列成熟应用,包括双重拉索估计、部分线性模型、工具变量法、聚类数据及断点回归等。这部分方法已相对成熟,实证研究者可放心使用。

在此基础上,还介绍 DML 在面板数据中的前沿拓展,包括双重差分法及一般固定效应模型。这部分文献还很少,属于尚未成熟的前沿探索,我们将重点讨论其应用边界及可能误区,为 DML 在经济学中的应用提供指南。

陈强,齐霁,颜冠鹏.双重机器学习的原理与拓展:从横截面到面板数据[J].经济学动态,2026,(7):198-224.

1.最全! 我国适合"断点回归"的政策都整理出来了, 让你有做不完的RDD断点政策评 2.最全! 我国适合"合成控制法"的政策都整理出来了, 让你有做不完的SCM政策评估3. 最全106页! 我国适合DID双重差分的政策都整理出来了, 让你有做不完的DID政策 4.最全! 我国适合DDD三重差分的政策都整理出来了, 让你有做不完的DDD政策论 5.最全! 国内哪些政策适合用队列DID, 模糊断点RDD, 双重机器学习DML进行评估?6.最全! 国内哪些政策情景适合用Bartik IV, 空间DID, 模糊DID方法进行评估?

7.最全! 我国各种X的工具变量IV都整理出来了, 8. 最全! 把CFPS研究过的全部自变量X与因变量Y做成数据库了, 全网第一份CFPS选题数据库.9.最全! 把CHFS研究过的全部自变量X与因变量Y做成数据库了, 第一份CHFS金融选题数据库.10.中国健康与养老CHARLS选题库, X与Y的研究组合助你研究老年人问题.11.把CSMAR研究过的自变量X与因变量Y做成数据库了, 第一份公司与金融微观选题数据库.12.三农微观数据选题库, 从此AI轻易助你选择经过检验了的X与Y的不同组合选题.13.CHIP和CEPS选题数据库, 轻松助你选择经过检验了的X与Y的不同组合家庭收入和教育选题.

下面这些短链接文章属于合集,可以收藏起来阅读,不然以后都找不到了。

8年,计量经济圈近2500篇不重类计量文章,

可直接在公众号菜单栏搜索任何计量相关问题,

Econometrics Circle




数据系列 空间矩阵 | 工企数据 | PM2.5 | 市场化指数  | CO2数据 |  夜间灯光 官员方言  |  微观数据 | 内部数据
计量系列匹配方法 | 内生性 |  工具变量 | DID | 面板数据 | 常用TOOL |  中介调节 | 时间序列 | RDD断点 | 合成控制  | 200篇合辑 | 因果识别 | 社会网络 | 空间DID
数据处理Stata | R | Python |  缺失值 | CHIP/ CHNS/CHARLS/CFPS/CGSS等 |
干货系列能源环境 |  效率研究 | 空间计量 | 国际经贸 | 计量软件 |  商科研究 | 机器学习 | SSCI | CSSCI |  SSCI查询 | 名家经验
计量经济圈组织了一个计量社群,有如下特征:热情互助最多前沿趋势最多、社科资料最多、社科数据最多、科研牛人最多、海外名校最多。因此,建议积极进取和有强烈研习激情的中青年学者到社群交流探讨,始终坚信优秀是通过感染优秀而互相成就彼此的。
图片
图片

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199917