📌 讲授计划
本页忠实呈现课程大纲 中初级班六讲的专题、要点与 AI 协作训练清单。大纲是契约:正文各讲的专题、要点与承诺的 AI 实现只能来自这里,不擅自 增删。
三天总览
| 时段 | 专题 | 讲义 |
|---|---|---|
| Day 1 上午 | A1 从顶刊复现项目开始:实证研究的完整流程 | 第 1 讲 |
| Day 1 下午 | A2 数据处理、探索性分析与样本构造 | 第 2 讲 |
| Day 2 上午 | A3 从总体到推断:实证分析的五层框架 | 第 3 讲 |
| Day 2 下午 | A4 线性回归的建模语言:CEF、OLS 与统计推断 | 第 4 讲 |
| Day 3 上午 | A5 FWL、虚拟变量、交乘项与固定效应:理解条件比较 | 第 5 讲 |
| Day 3 下午 | A6 综合实操:从复现代码到自己的分析任务 | 第 6 讲 |
- 授课时间:上午 9:00–12:00,下午 14:30–17:30(17:30–18:00 答疑);
- 授课方式:流程讲解 + 论文复现展示 + 代码实操 + AI 辅助代码阅读。
A1 从顶刊复现项目开始:实证研究的完整流程
以 Lane (2025, QJE) 的复现材料为主案例,展示一篇论文如何从政策事实、处理对象、数据合并键、 分析样本、核心回归、动态图形和结果解释逐步展开,让学员理解一项实证研究如何被组织成一个可 复现的项目。
本讲要点
- 实证研究的基本链条:问题、数据、模型、结果、论文;
- 复现项目的文件夹结构、
README、主脚本和输出文件; - 原始数据、中间数据、分析样本、图表结果之间的关系;
- 如何识别一个复现包的主程序、数据处理脚本和结果输出脚本;
- 如何用 AI 辅助阅读 replication package,而不是让 AI 替代研究判断;
- Lane (2025) 中政策行业、产业代码、工业面板、IO 表和贸易数据之间的映射关系;
- 从复现文档中学习研究设计、数据处理和结果组织。
AI 协作训练
- 让 AI 根据
README生成复现路线图; - 让 AI 解释项目文件夹结构和主程序调用关系;
- 让 AI 阅读一段 Stata / R 代码,并说明它在论文复现流程中的位置;
- 让 AI 总结「从数据到结果」的复现日志。
A2 数据处理、探索性分析与样本构造
围绕「如何把原始数据整理成可以分析的数据」展开:数据来源确认、变量口径统一、主键检查、数据 合并、样本筛选、缺失值处理、离群值分析、变量构造和探索性分析。探索性分析和可视化应出现在数据 清洗阶段,帮助理解变量分布、发现异常值、检查样本结构。
本讲要点
- 数据来源、数据字典和变量口径;
- 观察单位、数据颗粒度、主键和唯一性检查;
- 横截面、时间序列、面板数据和多层级数据;
- 数据合并、追加、聚合、频率转换和长宽转换;
- 缺失值、离群值、缩尾、截尾、对数转换和标准化;
- 字符变量、日期变量和简单文本变量处理;
- 探索性数据分析 (EDA):直方图、密度图、箱线图、散点图、时间趋势图和分组均值图;
- 如何用图形检查变量分布、离群值、样本断点、组间差异和潜在样本选择问题;
- 样本筛选日志、变量字典、匹配率和样本流失检查;
- 数据处理过程的记录、复核和可复现性。
AI 协作训练
- 让 AI 根据变量清单和数据字典生成清洗计划;
- 让 AI 检查 merge / join 逻辑是否合理;
- 让 AI 解释缺失值、离群值、缩尾、截尾和对数转换的差别;
- 让 AI 根据变量类型建议合适的探索性图形;
- 让 AI 把 Stata 数据处理逻辑翻译成 Python / R;
- 让 AI 生成变量构造说明和样本筛选日志。
A3 从总体到推断:实证分析的五层框架
引入一个贯穿初级班的分析框架:Population、Sample、Data、Model 和 Inference。围绕这五个层次 讲解实证分析的基本问题,并为理解随机试验、样本选择偏误、自选择偏误、外推边界和统计推断打下 基础。
实证分析的五层框架
Population
总体 → Sample
样本 → Data
数据 → Model
模型 → Inference
推断
一个实证研究是否可信,不只取决于模型是否复杂,还取决于总体、样本、数据、模型和推断之间是否一致。
本讲要点
- Population:研究总体、目标对象和外推边界;
- Sample:样本产生机制、抽样误差和样本选择偏误;
- Data:变量测量、代理变量、测量误差和数据质量;
- Model:模型设定、函数形式和误设风险;
- Inference:标准误、置信区间、显著性和不确定性表达;
- 随机抽样与随机分配的区别;
- 样本选择偏误与自选择偏误的基本直觉;
- 如何利用分组统计量、密度函数图、样本筛选表和政策背景说明,检查研究总体、分析样本、变量测量 和模型设定是否相互匹配。
AI 协作训练
- 让 AI 帮助拆解一篇论文的 Population、Sample、Data、Model 和 Inference;
- 将 AI 设定为 coauthor 或论文导师,请它从五个层次追问:研究对象是否清楚,样本是否可能存在 选择偏误,关键变量是否能准确测量,模型是否匹配研究问题,推断是否支持论文结论;
- 让 AI 根据分组统计量、密度函数图、样本筛选表和政策背景材料,生成一份「样本与研究设计一致性 检查清单」;
- 让 AI 检查研究问题、样本口径、变量构造和模型设定之间是否存在明显不一致。
A4 线性回归的建模语言:CEF、OLS 与统计推断
从条件期望函数 (CEF) 和线性投影入手,讲解 OLS 的基本含义。重点不是推导复杂公式,而是帮助 学员理解回归模型是一种对条件均值关系的近似表达,把「跑回归」转化为「理解模型」。FWL 定理在 下一讲集中展开。
本讲要点
- 条件期望函数 (CEF) 与线性投影;
- OLS 系数的含义和局限;
- 回归系数不是简单的「影响」,而是在特定条件下形成的比较;
- 模型设定、函数形式和变量尺度;
- 对数模型、比例变量、标准化变量和系数解释;
- 统计显著性、经济显著性和结果解释边界;
- 异方差稳健标准误与聚类稳健标准误;
- 如何阅读回归表中的系数、标准误、置信区间、显著性和样本量;
- 如何从回归表写出不过度解释的结果说明。
AI 协作训练
- 让 AI 用自然语言解释一张回归表中的核心系数;
- 让 AI 检查结果解释是否把相关关系误写成因果关系;
- 让 AI 根据变量定义说明对数转换、标准化和系数解释是否合理;
- 让 AI 把一段回归代码改写成更清楚的注释版。
A5 FWL、虚拟变量、交乘项与固定效应:理解条件比较
围绕「如何理解控制之后的比较」展开。FWL 定理提供关键线索:多元回归中的系数,可以理解为在 去除其他变量影响之后,处理变量与结果变量之间的剩余比较。本讲从虚拟变量、交乘项和条件比较的 角度理解 DID 和 RDD,为后续系统学习识别策略打下基础。
本讲要点
- FWL 定理的直觉:残差化之后的比较;
- 控制变量、遗漏变量、坏控制和过度控制;
- 虚拟变量、分类变量、基准组和虚拟变量陷阱;
- 个体固定效应、时间固定效应和双向固定效应;
- 高维固定效应的基本思想;
- 交乘项、条件效应、调节效应和异质性分析;
- DID 中的组别、时间和处理交乘项;
- RDD 中的阈值虚拟变量、运行变量、趋势项和交乘项;
- 如何理解带固定效应和交乘项模型中的系数。
AI 协作训练
- 让 AI 解释含有 FWL、虚拟变量和交乘项的回归式;
- 让 AI 检查 DID 型回归中每个变量和交乘项的含义;
- 让 AI 生成交乘项结果的边际效应解释;
- 让 AI 检查固定效应模型中的系数是否可以被识别;
- 让 AI 把复杂回归式改写成「变量含义 + 比较对象 + 系数解释」三列表。
A6 综合实操:从复现代码到自己的分析任务
作为初级班的收束,把前面五讲串联起来。以一个小型复现任务或简化案例为基础,带学员走一遍 「打开项目—理解数据—检查样本—设定模型—解释系数—整理结果」的完整流程。
本讲要点
- 如何打开和理解一个复现项目;
- 如何根据研究问题列出数据处理和模型实现清单;
- 如何检查样本筛选、变量构造和图形诊断结果;
- 如何解释 OLS、虚拟变量、交乘项和固定效应模型;
- 如何整理复现日志、结果说明和待检查问题清单;
- 如何借助 AI 生成代码注释、复现路线图和 debug 记录;
- 如何判断 AI 输出是否可靠,哪些问题必须回到数据和模型本身。
AI 协作训练
- 让 AI 根据项目文件夹和
README生成复现路线图; - 让 AI 根据变量字典和样本筛选规则生成数据检查清单;
- 让 AI 解释一段回归代码和输出表格;
- 让 AI 生成复现日志初稿,并由学员检查其中的错误或遗漏;
- 让 AI 把一次分析流程整理成可复用的项目模板。