附录 A — 任务说明书与提示词模板

本附录给出一套可直接套用的任务说明书写法四个场景的提示词模板。它们把第 3、4 讲的「规划 → 执行 → 审查」落成可复制的文字。核心思路只有一句:先和 AI 讨论清楚、确认之后,再让它动手;改完再逐项检查。

下面每个模板框右上角都有复制按钮,点一下即可复制纯文本,直接粘贴给 AI 使用。

A.1 任务说明书写法要点

无论用对话式 AI 还是执行型 Agent,一份好的任务说明书都应包含六个要素:

  1. 目标:一句话说清要得到什么结果。
  2. 输入:列出数据文件、说明文档、已有代码的路径。
  3. 输出:结果以什么形式交付(.do 脚本、report.md、图表),放在哪个文件夹。
  4. 修改边界:不许动的东西(如 data/raw/ 原始数据不得修改)、不许删的文件。
  5. 风格要求:中文注释、相对路径、变量命名规范等。
  6. 验收标准:怎样才算做对了(如「回归表能对上样本量」「图能重画出来」)。

两条通用纪律,写进说明书能显著减少翻车:

  • 先计划、后修改:复杂任务的第一条指令是「先阅读项目结构并列出计划,不要动手改」。
  • 小步修改、逐项检查:一次只改少量文件,改完看 diff、看 log、核对结果,再进行下一步。
通用「背景卡片」(每次新对话时先粘贴)

把它放在 notebook 第一个单元格或对话开头,避免 AI 忘记你的环境和数据结构。

【项目背景】请记住以下信息,本次对话中的所有代码都基于它。
- 项目:<一句话描述>
- 运行环境:Stata 19,Windows;如涉及 notebook 则为 VS Code + nbstata(Python 3.11)
- 数据:data/ 下有 <文件名与列说明>
- 规范:相对路径、中文注释、变量名用小写下划线
- 当前进度:<已完成什么,正在做什么>
接下来请帮我:…… <本次具体任务> ……

A.2 场景模板一:数据清理与回归

Note

这是 demo README.md 的骨架化版本,适合「一批数据 + 一个分析目标」的常规任务。

# 任务:数据清理与回归分析

## 目标
基于 data/ 下的数据,完成清洗并跑出主回归,输出可复现的脚本与结果说明。

## 输入
- data/*.csv:原始数据(切勿修改)
- README.md:变量口径与分析要求

## 输出
- code/01_clean.do:数据清洗(含中文注释)
- code/02_reg.do:主回归
- outputs/report.md:结果说明,指出看哪一行、哪个系数

## 处理要求
- 关键连续变量做 1% 缩尾(winsor2)
- 路径一律用相对路径;不要写死绝对路径
- 面板数据先 xtset,缺失值与异常值的处理要在 report 中记录

## 修改方式
- 先阅读数据与 README,列出清洗与建模计划,等我确认后再执行
- 改完逐个文件说明改了什么

A.3 场景模板二:论文复现

Note

适合「一篇 PDF + 一个 dofile + 一份数据」的期刊复现包(如 Energy Economics 常见的简单复现包)。

# 任务:论文复现体检与复跑

## 目标
让别人下载后能从原始数据开始,复现论文的描述性统计、主回归表和主要图形。

## 输入
- paper/*.pdf:论文原文
- code/:作者提供的 dofile
- data/:作者提供的数据

## 要求(先诊断,后复跑)
1. 先不要改任何文件。阅读 PDF 与代码,说明:
   - 主程序是哪个、脚本的运行顺序
   - 路径是否写死在作者电脑上、缺哪些外部命令
   - 哪个脚本生成描述性统计 / 主回归表 / 主要图形
2. 输出一份「复现路线图」(reproduce_plan.md)等我确认
3. 确认后:把绝对路径改为相对路径、补装外部命令、逐个脚本复跑
4. 生成 outputs/reproduce_log.md:每一步做了什么、结果是否与论文一致

## 边界
- data/ 原始数据不得修改;每轮修改后给出 diff 与运行 log

A.4 场景模板三:概念学习 / 生成讲义

Note

适合「我想弄懂一个新方法」——让 AI 结合可运行的 Stata 例子,生成一份自学讲义。

# 任务:生成一份 <方法名,如 交叠 DID> 的自学讲义

## 目标
面向已掌握 OLS 的读者,讲清 <方法名> 的直觉、适用条件与 Stata 实现。

## 输出
- notes/<方法名>.md,含:
  1. 一句话它解决什么问题、什么时候该用
  2. 与传统做法(如 TWFE)的关键区别(直觉,不堆公式)
  3. 一个最小可运行的 Stata 例子(用 sysuse 或模拟数据),配中文注释
  4. 结果怎么读:看哪张表、哪个系数、哪张图
  5. 三条常见误用与延伸阅读

## 要求
- 例子必须能在 Stata 中跑通;用到的外部命令注明 ssc install
- 先给提纲,我确认后再展开正文

A.5 场景模板四:模拟分析

Note

「自己造数据、真值已知」是检验方法、也是教学演示的利器(demo 的对照表就来自这里)。

# 任务:模拟数据并对比估计量

## 目标
生成一份已知真值的模拟数据,比较不同估计量离真值的远近。

## 设定
- 数据生成过程(DGP):<写清个体数、时期数、处理时点、真实处理效应 τ=…>
- 造成偏误的来源:<如 交叠处理 + 异质处理效应>

## 输出
- dgp/simulate.do:生成模拟数据(设定随机种子,可复现)
- code/compare.do:分别用 TWFE、csdid、jwdid 估计处理效应
- outputs/compare.md:一张对照表(各估计量 vs 真值),并用一句话总结谁更接近真值

## 要求
- 固定随机种子;对照表要标出真值列
- 先说明 DGP 与对比方案,我确认后再执行

A.6 场景模板五:让 AI 找一篇”研究设计相近”的论文当模板

很多时候,我们手头已经有数据、也有一个大致的研究话题,但不知道该怎么设计、从哪下手。这时一个高效的办法是:找一篇已发表的、研究设计相近的论文当模板——发表过的论文通常把识别策略、数据处理、图表组织都写得很清楚,Agent 读完就能给你一个靠谱的整体规划。这对实证经验有限的人尤其友好。

关键:找”研究设计相近”,而不是”话题相同”。

  • 话题相同 → 容易缺乏新意;而且你选的话题在现有文献里可能根本没有——那恰恰是你研究的价值所在
  • 研究设计相近 → 你能借鉴它的识别逻辑、平行趋势/事件研究、稳健性与异质性分析的组织方式,套到自己的(新)话题上。

以本课 demo 为例:我们手头是”分批推行的绿色转型试点 + 城市面板 + 每万人绿色专利”,研究设计是交叠 DID(政策在不同城市、不同年份先后实施)。那么”设计相近”的模板论文,就是任何用交叠 DID / 事件研究评估某项政策或试点的清晰论文——它讲的是最低工资、税收改革、环保督察还是别的,都无所谓。

⚠️ 一条红线:AI 会编造文献

对话式 AI 可能”一本正经”地给出不存在的论文。拿到候选清单后,务必去真实复现库核实论文与复现包是否真实、可下载,再采用:EJD·13000 篇顶刊复现openICPSRHarvard Dataverse、期刊的 data editor 页面。

下面给三组提示词,对应不同的目标期刊层次与方法基础。用时把 <...> 换成你自己的信息;同一件事有多种说法,侧重点不同。

版本 A · 冲高目标 / 方法基础较强

Note

<...> 换成你的信息,整段发给对话式 AI:

我手头有一份面板数据,可做一项政策评估:<一句话描述你的数据与话题,
如"分批推行的某类试点政策 + 城市/企业面板 + 某结果变量">。研究设计上
它适合用交叠(多期)DID。

我想冲击高水平期刊,也能驾驭较前沿的方法。请帮我找 2–3 篇
**研究设计相近**(都用交叠 DID / 事件研究评估政策,话题不必相同)、
且**有公开复现包**的高水平论文(Top5 或顶级 field 期刊、经 data editor 审核者优先)。

每篇请给出:
- 识别策略与关键假设(平行趋势、处理时点、对照组构造);
- 如何处理交叠处理与效应异质(是否用 Callaway–Sant'Anna、Sun–Abraham、
  de Chaisemartin–D'Haultfœuille 等现代估计量);
- 事件研究图、稳健性与异质性分析是怎么组织的;
- 可核验信息:DOI、期刊、复现包链接(openICPSR / Dataverse)。

请区分"你确信的"与"需要我自己核对的",避免虚构文献。先只给候选清单。

版本 B · 常规目标 / 中等基础

Note

<...> 换成你的信息,整段发给对话式 AI:

我手头有一份面板数据,想做一项政策评估:<一句话描述>。研究设计上适合用 DID。

我的目标是发一篇扎实的应用论文(好的 field 期刊即可),方法不必太前沿,
但要规范、说得清楚。请帮我找 2–3 篇**研究设计相近**(用 DID / 事件研究评估
政策,话题可不同)、**写作清晰、且有公开复现包**的论文。

每篇请给出:核心识别思路、数据与变量构造、主要图表(尤其事件研究图)、
基本稳健性检验,以及可核验信息(DOI、期刊、复现包链接)。
优先挑复现包结构清楚、我能照着跑通的。请标明哪些需我自己核对,避免虚构文献。
先只给候选清单。

版本 C · 入门 / 基础较弱、怕复杂方法

Note

<...> 换成你的信息,整段发给对话式 AI:

我刚开始学做实证,基础比较弱,怕太复杂的方法。我手头有一份面板数据,
想评估某项政策的效果:<一句话描述>。

请帮我找 1–2 篇**研究设计相近**(用最基础的 DID / 前后对比评估政策)、
**写得通俗、复现包简单、我大概率能跑通**的论文(不必是顶刊)。

每篇请用我能听懂的话说明:它到底在比较什么、数据长什么样、
最核心的那张表/图怎么来的;并给出可核验信息(题目、期刊、复现包链接)。
如果有中文讲解或整理过的复现资料就更好。请务必标明哪些是你不确定、
需要我自己去核对的,避免编造不存在的论文。先给我候选清单就行。

拿到候选清单并核实之后,把选定论文的 PDF 与复现包放进项目文件夹,按 附录 B《用 Agent 复现一篇论文》 的流程让 Agent 读,产出一份”研究设计 + 数据处理路线图”,作为你自己研究的脚手架。

A.7 换个风格:口语化的分阶段推进

前面五个模板是结构化的任务说明书,适合边界清楚的正式任务。但真实研究往往更复杂——与其一开始就让 Agent 设计一个面面俱到的大方案,不如切成几个阶段、用日常口语一段一段地交代,每跑完一段自己看一眼再继续。提示词说清大意即可,不必反复润色,一般的 AI 都能理解。

下面是本课 demo 的一个分阶段示例。注意开场:想清楚”这份数据到底是为回答哪个问题而收集的”是第一位的,否则 AI 也帮不上忙。

开场(先讲清问题和数据)

我想搞清楚:「绿色转型试点」政策到底有没有真的提升城市的绿色创新。背景是——某国从 2016 年起分三批(2016、2018、2020)在一部分城市推行试点;我关心的结果是城市每万人绿色专利授权量。数据在 01_data/,字段和三张表怎么关联见 01_data/README.md。你先读一遍,用自己的话跟我讲讲每张表是啥、靠什么 key 关联,我确认对了再往下走。

第一步 · 查验清洗

帮我把这三张表先查验和清洗一下:有没有缺失、重复,字段类型对不对,城市名各表是否一致。发现的问题先列给我看,别急着改。

第二步 · 合并 + 描述统计

按确认的 key 合并成”城市-年份”面板,对关键变量做描述性统计;顺便说下合并前后样本量怎么变的。

第三步 · 探索性分析

做点探索性分析——画几张图、分组比较或简单回归,先看看变量大致什么关系。只是探路,先别下因果结论。

第四步 · DID 设计与估计

这是政策在不同城市、不同年份先后推行的场景,适合 DID。先别动手:先告诉我能用哪几种 DID 估计方法、各自假设和局限,我们商量着选。选定后在一个 notebook 里都跑一遍,代码和解释都写进去;你不确定、要我拍板的地方专门开个单元格列出来。

第五步 · 整理成报告

把 notebook 结果整理成报告:各方法估计结果放一起对比,说清假设和局限,最后谈谈政策启示。像论文实证部分那样,克制、准确就行。

完整可编辑的版本见仓库 demo/task-plan-Lian-R0.md“口语化分阶段”和”结构化说明书”各有场景:正式项目值得把说明书写清楚,日常推进口语交代即可。


更系统的提示词与工作流写法,见延伸阅读:从 Prompt 到 Skills:把论文复现、数据清洗和代码规范写进 AIClaude Code Skills 写作指南