当下金融、经济实证研究领域,正迎来大语言模型、Python 文本挖掘驱动的研究范式革新。从政府政策文本量化、上市公司年报解读,到招聘、专利、舆论评论类文本实证,传统人工编码、词典手工构建的研究方式,已无法适配海量文本数据,也难以精准识别政策强度、企业风险、技术溢出等核心微观变量,严重限制 DID、面板回归、网络分析等主流计量模型的识别效果。
本次《AI 辅助 Python 文本分析方法训练营》直击社科量化研究核心痛点,打通 “大模型工具 Codex+Python 文本挖掘 + 经济学实证检验” 完整实操链路,摒弃纯理论说教,全程搭配顶刊复刻实战案例,设置三大递进核心模块,一站式完成从文本原始数据处理到可直接用于论文的标准化变量构建全流程教学。
三大模块完整复刻《经济研究》《管理世界》等顶刊案例:
Codex 批量构造政策面板变量,落地数字政府、供应链数字化等政策量化
FinBERT/BERT 深度文本建模,拆解年报风险、劳动力需求、舆论情绪
文本向量相似度 + 网络建模,测算专利创新、新闻叙事资产定价
课程时间:8月1号(周六) 下午 14:00-16:00
授课形式:腾讯会议线上直播+课后回放+课程资料+答疑
本课程优势:
Codex 辅助的政策文本变量构造
Codex 辅助的领域文本建模
Codex 辅助的文本向量、相似度与网络建模
刘老师,金融学专业 博士毕业于Top财经类高校
本硕博均毕业于国内顶尖财经类211高校,主要研究领域包括资产定价、货币政策、投资者行为等。
擅长计量实证、机器学习/大语言模型、文本分析相关的内容3年金融学专业论文指导经验,辅导多名学生发表SSCI期刊。
发表SSCI、CSSC1、北大核心共16篇,包括多ABS3量、4星顶刊等,截至目前,论文总被引700+次。
获多项国家级、省级学术荣誉,优秀毕业生,多篇C刊审稿人。
a) 从经济学研究问题出发界定政策构念:数字政府、供应链数字化、产业政策、绿色转型、人工智能关注度等
b) 批量收集中央、省级、地级市政府工作报告和地方政策文件
c) 设计关键词库、语义判别规则和结构化输出格式
d) 结合大模型识别政策文本中的真实行动、政策方向和执行强度
e) 聚合为城市-年份、省份-年份或行业-年份变量,并接入面板回归、DID和机制检验
实战案例1:使用大语言模型分析地方政府工作报告,构建地级市供应链数字化指标
参考文献:刘歆, 杨亚平. [星河通衢,万链同航:地方供应链数字化建设与数字出海——来自大语言模型的经验证据](https://qks.sufe.edu.cn/mv_html/j00001/202603/a5t4Ad37-EEyo-0owC-myUF-6kuL5SWePPv8_WEB.htm)[J]. 《财经研究》, 2026, 52(3): 49-63
实战案例2:使用 DeepSeek 分析地级市政府工作报告,测度数字政府建设水平
参考文献:张希羚, 于昊平, 徐龙炳, 卞子咏. [数字政府建设何以赋能企业全要素生产率](https://qks.sufe.edu.cn/mv_html/j00001/202602/JvPtjssC-YayD-ty4V-D4CM-yhf69FTXQilD_WEB.htm)[J]. 《财经研究》, 2026, 52(2).
实战案例3:使用 FinBERT 和 GPT 分析 A股年报 MD&A,构造企业数字技术风险暴露指标
参考文献:陆瑶, 施函青, 周欣怡. [中国企业数字技术风险暴露对企业价值的影响——来自大语言模型的文本分析证据](https://www.sem.tsinghua.edu.cn/info/1207/32174.htm)[J]. 《经济研究》, 2025, 60(2): 73-89.
a) 构建领域训练样本:人工标注、弱监督标注与大模型辅助标注
b) 完成文本清洗、分词、长文本切分和训练集划分
c) 建立 BERT、FinBERT、Chinese RoBERTa 等领域文本模型
d) 比较词典法、传统机器学习和深度学习模型效果
e) 输出分类概率、情绪评分、风险暴露或服务质量指标,并完成有效性检验
实战案例4:使用中国招聘平台大数据,识别人工智能如何改变企业劳动力需求
参考文献:陈琳, 高悦蓬, 余林徽. [人工智能如何改变企业对劳动力的需求?——来自招聘平台大数据的分析](https://pure.ecnu.edu.cn/zh/publications/人工智能如何改变企业对劳动力的需求来自招聘平台大数据的分析/)[J]. 《管理世界》, 2024, 40(6): 74-93.
实战案例5:使用中国酒店评论数据识别服务机器人采用情况,研究机器人服务对顾客满意度的影响
参考文献:Ma S, Ge L, Jia H, Wang Y. [Understanding and Mitigating the Robot Disadvantage in Luxury Services](https://pubsonline.informs.org/doi/10.1287/isre.2023.0229)[J]. *Information Systems Research*, 2025, 36(4): 2134-2150.
实战案例6:使用平台评论数据研究评论激励机制、交易行为与社会福利
参考文献:罗俊, 潘佳艺, 邹乐豪. [超越经济激励:平台经济中的评论激励机制、市场交易行为与社会福利](https://www.ncpssd.org/journal/secure/details?params=V2ZQZUlGQnRhM3lxVEkrUDlvU2gyZkVJUE8yTmpKZDFHMElFUUNUR0MyWT0)[J]. 《管理世界》, 2026(5): 148-167.
第三讲:Codex 辅助的文本向量、相似度与网络建模
a) 将专利摘要、招聘文本、产品描述、政策文件和新闻报道转化为语义向量
b) 使用 Sentence-BERT、Sentence Transformer 或 Embedding 模型计算文本相似度
c) 构造技术接近度、知识溢出、政策相似度、技能需求相似度和企业竞争相似度
d) 将相似度矩阵转化为网络指标、暴露度指标和匹配强度指标
e) 与 DID、事件研究、shift-share、空间计量和网络分析结合,形成经济学识别设计
实战案例7:使用中国发明专利文本相似度测度专利质量,并研究其经济增长效应
参考文献:陈志远, 章逸然, 张杰, 刘泽轩. [中国专利质量的测度、变化机制与经济增长效应](https://lib.zjsru.edu.cn/26-5.19-1.pdf)[J]. 《经济研究》, 2026, 61(3): 28-52.
实战案例8:使用机器学习生成专利文本相似度,测度创新知识溢出
参考文献:龙小宁, 张帆, 易巍. [创新知识溢出的测度与检验——基于机器学习生成专利文本相似度的证据](https://brri.xmu.edu.cn/ywgk/xwzx.htm)[J]. 《数量经济技术经济研究》, 2026(2).
实战案例9:使用 BERT 提取新闻叙事因子并构建资产定价模型
参考文献:樊嘉诚, 林建浩, 李宗余. [基于AI大语言模型的叙事资产定价研究](https://nsd.pku.edu.cn/xzyj/cbw/jjxjk/qkml/f478cbf0153943a1b2eee4738c883a70.htm)[J]. 《经济学(季刊)》, 2026, 26(3).
在课程未开始前,接受“7天无理由退款”,由于是知识付费,一旦直播课开始后,不接受退款。退款请联系客服。