研究 | 艾春荣、方悦:数据驱动,精准施策——开创连续型政策学习新范式
香港中文大学(深圳)经管学院艾春荣教授、方悦助理教授联合北京大学光华管理学院Haitian Xie教授,在计量经济学权威期刊《Journal of Econometrics》发表突破性成果——Data-driven Policy Learning for Continuous Treatments。该研究首次系统构建了连续型政策学习的理论和方法框架,填补了从“是否干预”到“如何精准干预”的方法论空白,为教育、环境及社会福利等领域的精细化治理提供了强有力的量化工具。

作者简介

艾春荣
香港中文大学(深圳)经管学院教授、副院长、深圳高等金融研究院副院长
研究领域
计量经济学、机器学习与政策学习、实证产业组织、实证金融、中国经济

方悦
香港中文大学(深圳)经管学院
助理教授
研究领域
计量经济学、应用微观经济学
本文合著者
Haitian Xie
Guanghua School of Management,
Peking University
研究简介
研究背景
从“二元决策”到“连续优化”的跨越
政策学习(Policy Learning)作为计量经济学与人工智能的交叉前沿,旨在利用数据驱动的方法,基于个体异质性匹配最优政策方案,以实现社会总体福利最大化。然而,现有文献多局限于二元离散场景(如“是否参与培训”),难以应对现实政策中普遍存在的连续性特征(如税率高低、培训时长、补贴额度等)。
面对连续型政策场景,传统方法面临三大挑战:
- 福利函数复杂:需进行非参数估计。
- 政策空间无限维:需在无限维空间中寻找最优解并满足形状约束。
- 方法适用性受限:现有二元模型无法直接迁移,亟需发展新的理论框架。
大数据与机器学习的发展为这一难题提供了契机:高维信息与精细颗粒度的观测值,使得设计数据驱动、个性化的连续政策成为可能。
核心突破
首创连续型政策学习理论框架
本研究首次系统解决了上述难题,实现了三大创新:
- 理论框架首创:建立了适用于连续型政策学习的完整体系,将决策空间从离散的“0/1选择”拓展至连续的“最优水平匹配”。
- 方法论革新:
- 无限维逼近:提出采用筛法(Sieve Method)逼近无限维政策空间。
- 偏差纠正:引入双重去偏(Double Debiased)估计技术,有效纠正机器学习估计带来的偏差。
- 自适应算法:设计了数据驱动的惩罚算法,自动选择核带宽与逼近维度,平衡偏差、方差与近似误差。
- 理论保证:从理论上证明了所提算法的最优收敛速率。
研究内容与实证发现
模型构建与估计
研究定义了基于总体福利最大化的优化目标,并构建了多种具有经济意义的政策空间(如单指标形式、可分单调形式及分段线性形式)。通过基于逆概率加权的核平滑估计量及双重去偏估计方程,实现了对连续政策效果的精准评估,并在此基础上实现了数据驱动、个性化最有政策的设计。
实证应用:美国JTPA职业培训数据
作者将该方法应用于美国《就业培训伙伴关系法》(JTPA)数据,探究基于个体特征的最优培训时长分配。
- 主要发现:与传统的二元决策(仅决定“是否培训”)相比,连续型框架能提供更精细的个性化建议。
- 关键驱动因素:受教育水平是影响最优培训时长分配的核心变量。
- 政策启示:针对不同教育背景的群体分配差异化的培训时长,能显著提升整体就业福利。
研究意义
推动公共政策迈向“精细化治理”
- 填补理论空白:首次系统建立了连续型政策学习的理论与计算基础,极大拓展了政策学习文献的适用边界。
- 提供实操工具:提出的双重去偏估计与数据驱动参数选择方法,为基于观测数据的连续政策优化提供了可落地的解决方案。
- 赋能科学决策:助力教育(个性化学习时长)、环境(差异化碳税)、社会福利(精准补贴)等领域,实现从粗放式的“是否干预”向科学化的“如何干预、干预多少”的根本性转变。
*本文基于发表于《Journal of Econometrics》的最新研究成果整理。