📌 讲授计划

本页忠实呈现课程大纲 中初级班六讲的专题、要点与 AI 协作训练清单。大纲是契约:正文各讲的专题、要点与承诺的 AI 实现只能来自这里,不擅自 增删。

三天总览

时段 专题 讲义
Day 1 上午 A1 从顶刊复现项目开始:实证研究的完整流程 第 1 讲
Day 1 下午 A2 数据处理、探索性分析与样本构造 第 2 讲
Day 2 上午 A3 从总体到推断:实证分析的五层框架 第 3 讲
Day 2 下午 A4 线性回归的建模语言:CEF、OLS 与统计推断 第 4 讲
Day 3 上午 A5 FWL、虚拟变量、交乘项与固定效应:理解条件比较 第 5 讲
Day 3 下午 A6 综合实操:从复现代码到自己的分析任务 第 6 讲
  • 授课时间:上午 9:00–12:00,下午 14:30–17:30(17:30–18:00 答疑);
  • 授课方式:流程讲解 + 论文复现展示 + 代码实操 + AI 辅助代码阅读。

A1 从顶刊复现项目开始:实证研究的完整流程

以 Lane (2025, QJE) 的复现材料为主案例,展示一篇论文如何从政策事实、处理对象、数据合并键、 分析样本、核心回归、动态图形和结果解释逐步展开,让学员理解一项实证研究如何被组织成一个可 复现的项目。

本讲要点

  • 实证研究的基本链条:问题、数据、模型、结果、论文;
  • 复现项目的文件夹结构、README、主脚本和输出文件;
  • 原始数据、中间数据、分析样本、图表结果之间的关系;
  • 如何识别一个复现包的主程序、数据处理脚本和结果输出脚本;
  • 如何用 AI 辅助阅读 replication package,而不是让 AI 替代研究判断;
  • Lane (2025) 中政策行业、产业代码、工业面板、IO 表和贸易数据之间的映射关系;
  • 从复现文档中学习研究设计、数据处理和结果组织。

AI 协作训练

  • 让 AI 根据 README 生成复现路线图;
  • 让 AI 解释项目文件夹结构和主程序调用关系;
  • 让 AI 阅读一段 Stata / R 代码,并说明它在论文复现流程中的位置;
  • 让 AI 总结「从数据到结果」的复现日志。

A2 数据处理、探索性分析与样本构造

围绕「如何把原始数据整理成可以分析的数据」展开:数据来源确认、变量口径统一、主键检查、数据 合并、样本筛选、缺失值处理、离群值分析、变量构造和探索性分析。探索性分析和可视化应出现在数据 清洗阶段,帮助理解变量分布、发现异常值、检查样本结构。

本讲要点

  • 数据来源、数据字典和变量口径;
  • 观察单位、数据颗粒度、主键和唯一性检查;
  • 横截面、时间序列、面板数据和多层级数据;
  • 数据合并、追加、聚合、频率转换和长宽转换;
  • 缺失值、离群值、缩尾、截尾、对数转换和标准化;
  • 字符变量、日期变量和简单文本变量处理;
  • 探索性数据分析 (EDA):直方图、密度图、箱线图、散点图、时间趋势图和分组均值图;
  • 如何用图形检查变量分布、离群值、样本断点、组间差异和潜在样本选择问题;
  • 样本筛选日志、变量字典、匹配率和样本流失检查;
  • 数据处理过程的记录、复核和可复现性。

AI 协作训练

  • 让 AI 根据变量清单和数据字典生成清洗计划;
  • 让 AI 检查 merge / join 逻辑是否合理;
  • 让 AI 解释缺失值、离群值、缩尾、截尾和对数转换的差别;
  • 让 AI 根据变量类型建议合适的探索性图形;
  • 让 AI 把 Stata 数据处理逻辑翻译成 Python / R;
  • 让 AI 生成变量构造说明和样本筛选日志。

A3 从总体到推断:实证分析的五层框架

引入一个贯穿初级班的分析框架:Population、Sample、Data、Model 和 Inference。围绕这五个层次 讲解实证分析的基本问题,并为理解随机试验、样本选择偏误、自选择偏误、外推边界和统计推断打下 基础。

实证分析的五层框架

Population
总体
Sample
样本
Data
数据
Model
模型
Inference
推断

一个实证研究是否可信,不只取决于模型是否复杂,还取决于总体、样本、数据、模型和推断之间是否一致。

本讲要点

  • Population:研究总体、目标对象和外推边界;
  • Sample:样本产生机制、抽样误差和样本选择偏误;
  • Data:变量测量、代理变量、测量误差和数据质量;
  • Model:模型设定、函数形式和误设风险;
  • Inference:标准误、置信区间、显著性和不确定性表达;
  • 随机抽样与随机分配的区别;
  • 样本选择偏误与自选择偏误的基本直觉;
  • 如何利用分组统计量、密度函数图、样本筛选表和政策背景说明,检查研究总体、分析样本、变量测量 和模型设定是否相互匹配。

AI 协作训练

  • 让 AI 帮助拆解一篇论文的 Population、Sample、Data、Model 和 Inference;
  • 将 AI 设定为 coauthor 或论文导师,请它从五个层次追问:研究对象是否清楚,样本是否可能存在 选择偏误,关键变量是否能准确测量,模型是否匹配研究问题,推断是否支持论文结论;
  • 让 AI 根据分组统计量、密度函数图、样本筛选表和政策背景材料,生成一份「样本与研究设计一致性 检查清单」;
  • 让 AI 检查研究问题、样本口径、变量构造和模型设定之间是否存在明显不一致。

A4 线性回归的建模语言:CEF、OLS 与统计推断

从条件期望函数 (CEF) 和线性投影入手,讲解 OLS 的基本含义。重点不是推导复杂公式,而是帮助 学员理解回归模型是一种对条件均值关系的近似表达,把「跑回归」转化为「理解模型」。FWL 定理在 下一讲集中展开。

本讲要点

  • 条件期望函数 (CEF) 与线性投影;
  • OLS 系数的含义和局限;
  • 回归系数不是简单的「影响」,而是在特定条件下形成的比较;
  • 模型设定、函数形式和变量尺度;
  • 对数模型、比例变量、标准化变量和系数解释;
  • 统计显著性、经济显著性和结果解释边界;
  • 异方差稳健标准误与聚类稳健标准误;
  • 如何阅读回归表中的系数、标准误、置信区间、显著性和样本量;
  • 如何从回归表写出不过度解释的结果说明。

AI 协作训练

  • 让 AI 用自然语言解释一张回归表中的核心系数;
  • 让 AI 检查结果解释是否把相关关系误写成因果关系;
  • 让 AI 根据变量定义说明对数转换、标准化和系数解释是否合理;
  • 让 AI 把一段回归代码改写成更清楚的注释版。

A5 FWL、虚拟变量、交乘项与固定效应:理解条件比较

围绕「如何理解控制之后的比较」展开。FWL 定理提供关键线索:多元回归中的系数,可以理解为在 去除其他变量影响之后,处理变量与结果变量之间的剩余比较。本讲从虚拟变量、交乘项和条件比较的 角度理解 DID 和 RDD,为后续系统学习识别策略打下基础。

本讲要点

  • FWL 定理的直觉:残差化之后的比较;
  • 控制变量、遗漏变量、坏控制和过度控制;
  • 虚拟变量、分类变量、基准组和虚拟变量陷阱;
  • 个体固定效应、时间固定效应和双向固定效应;
  • 高维固定效应的基本思想;
  • 交乘项、条件效应、调节效应和异质性分析;
  • DID 中的组别、时间和处理交乘项;
  • RDD 中的阈值虚拟变量、运行变量、趋势项和交乘项;
  • 如何理解带固定效应和交乘项模型中的系数。

AI 协作训练

  • 让 AI 解释含有 FWL、虚拟变量和交乘项的回归式;
  • 让 AI 检查 DID 型回归中每个变量和交乘项的含义;
  • 让 AI 生成交乘项结果的边际效应解释;
  • 让 AI 检查固定效应模型中的系数是否可以被识别;
  • 让 AI 把复杂回归式改写成「变量含义 + 比较对象 + 系数解释」三列表。

A6 综合实操:从复现代码到自己的分析任务

作为初级班的收束,把前面五讲串联起来。以一个小型复现任务或简化案例为基础,带学员走一遍 「打开项目—理解数据—检查样本—设定模型—解释系数—整理结果」的完整流程。

本讲要点

  • 如何打开和理解一个复现项目;
  • 如何根据研究问题列出数据处理和模型实现清单;
  • 如何检查样本筛选、变量构造和图形诊断结果;
  • 如何解释 OLS、虚拟变量、交乘项和固定效应模型;
  • 如何整理复现日志、结果说明和待检查问题清单;
  • 如何借助 AI 生成代码注释、复现路线图和 debug 记录;
  • 如何判断 AI 输出是否可靠,哪些问题必须回到数据和模型本身。

AI 协作训练

  • 让 AI 根据项目文件夹和 README 生成复现路线图;
  • 让 AI 根据变量字典和样本筛选规则生成数据检查清单;
  • 让 AI 解释一段回归代码和输出表格;
  • 让 AI 生成复现日志初稿,并由学员检查其中的错误或遗漏;
  • 让 AI 把一次分析流程整理成可复用的项目模板。

配套材料

本课程提供三类配套材料:课堂学习材料 (幻灯片、案例精要、概念说明与图表)、本地运行材料 (examples/chNN/chNN_main.dochNN_python.ipynb、可本地 render 的 online-book)、 AI 协作与复现模板 (提示词、复现流程模板、变量字典、样本筛选日志,见 附录 Askills 索引)。