附录 A — 任务说明书与提示词模板
本附录给出一套可直接套用的任务说明书写法和四个场景的提示词模板。它们把第 3、4 讲的「规划 → 执行 → 审查」落成可复制的文字。核心思路只有一句:先和 AI 讨论清楚、确认之后,再让它动手;改完再逐项检查。
下面每个模板框右上角都有复制按钮,点一下即可复制纯文本,直接粘贴给 AI 使用。
A.1 任务说明书写法要点
无论用对话式 AI 还是执行型 Agent,一份好的任务说明书都应包含六个要素:
- 目标:一句话说清要得到什么结果。
- 输入:列出数据文件、说明文档、已有代码的路径。
- 输出:结果以什么形式交付(
.do脚本、report.md、图表),放在哪个文件夹。 - 修改边界:不许动的东西(如
data/raw/原始数据不得修改)、不许删的文件。 - 风格要求:中文注释、相对路径、变量命名规范等。
- 验收标准:怎样才算做对了(如「回归表能对上样本量」「图能重画出来」)。
两条通用纪律,写进说明书能显著减少翻车:
- 先计划、后修改:复杂任务的第一条指令是「先阅读项目结构并列出计划,不要动手改」。
- 小步修改、逐项检查:一次只改少量文件,改完看
diff、看 log、核对结果,再进行下一步。
把它放在 notebook 第一个单元格或对话开头,避免 AI 忘记你的环境和数据结构。
【项目背景】请记住以下信息,本次对话中的所有代码都基于它。
- 项目:<一句话描述>
- 运行环境:Stata 19,Windows;如涉及 notebook 则为 VS Code + nbstata(Python 3.11)
- 数据:data/ 下有 <文件名与列说明>
- 规范:相对路径、中文注释、变量名用小写下划线
- 当前进度:<已完成什么,正在做什么>
接下来请帮我:…… <本次具体任务> ……
A.2 场景模板一:数据清理与回归
A.3 场景模板二:论文复现
A.4 场景模板三:概念学习 / 生成讲义
A.5 场景模板四:模拟分析
A.6 场景模板五:让 AI 找一篇”研究设计相近”的论文当模板
很多时候,我们手头已经有数据、也有一个大致的研究话题,但不知道该怎么设计、从哪下手。这时一个高效的办法是:找一篇已发表的、研究设计相近的论文当模板——发表过的论文通常把识别策略、数据处理、图表组织都写得很清楚,Agent 读完就能给你一个靠谱的整体规划。这对实证经验有限的人尤其友好。
关键:找”研究设计相近”,而不是”话题相同”。
- 话题相同 → 容易缺乏新意;而且你选的话题在现有文献里可能根本没有——那恰恰是你研究的价值所在。
- 研究设计相近 → 你能借鉴它的识别逻辑、平行趋势/事件研究、稳健性与异质性分析的组织方式,套到自己的(新)话题上。
以本课 demo 为例:我们手头是”分批推行的绿色转型试点 + 城市面板 + 每万人绿色专利”,研究设计是交叠 DID(政策在不同城市、不同年份先后实施)。那么”设计相近”的模板论文,就是任何用交叠 DID / 事件研究评估某项政策或试点的清晰论文——它讲的是最低工资、税收改革、环保督察还是别的,都无所谓。
对话式 AI 可能”一本正经”地给出不存在的论文。拿到候选清单后,务必去真实复现库核实论文与复现包是否真实、可下载,再采用:EJD·13000 篇顶刊复现、openICPSR、Harvard Dataverse、期刊的 data editor 页面。
下面给三组提示词,对应不同的目标期刊层次与方法基础。用时把 <...> 换成你自己的信息;同一件事有多种说法,侧重点不同。
版本 A · 冲高目标 / 方法基础较强
版本 B · 常规目标 / 中等基础
版本 C · 入门 / 基础较弱、怕复杂方法
拿到候选清单并核实之后,把选定论文的 PDF 与复现包放进项目文件夹,按 附录 B《用 Agent 复现一篇论文》 的流程让 Agent 读,产出一份”研究设计 + 数据处理路线图”,作为你自己研究的脚手架。
A.7 换个风格:口语化的分阶段推进
前面五个模板是结构化的任务说明书,适合边界清楚的正式任务。但真实研究往往更复杂——与其一开始就让 Agent 设计一个面面俱到的大方案,不如切成几个阶段、用日常口语一段一段地交代,每跑完一段自己看一眼再继续。提示词说清大意即可,不必反复润色,一般的 AI 都能理解。
下面是本课 demo 的一个分阶段示例。注意开场:想清楚”这份数据到底是为回答哪个问题而收集的”是第一位的,否则 AI 也帮不上忙。
开场(先讲清问题和数据)
我想搞清楚:「绿色转型试点」政策到底有没有真的提升城市的绿色创新。背景是——某国从 2016 年起分三批(2016、2018、2020)在一部分城市推行试点;我关心的结果是城市每万人绿色专利授权量。数据在
01_data/,字段和三张表怎么关联见01_data/README.md。你先读一遍,用自己的话跟我讲讲每张表是啥、靠什么 key 关联,我确认对了再往下走。
第一步 · 查验清洗
帮我把这三张表先查验和清洗一下:有没有缺失、重复,字段类型对不对,城市名各表是否一致。发现的问题先列给我看,别急着改。
第二步 · 合并 + 描述统计
按确认的 key 合并成”城市-年份”面板,对关键变量做描述性统计;顺便说下合并前后样本量怎么变的。
第三步 · 探索性分析
做点探索性分析——画几张图、分组比较或简单回归,先看看变量大致什么关系。只是探路,先别下因果结论。
第四步 · DID 设计与估计
这是政策在不同城市、不同年份先后推行的场景,适合 DID。先别动手:先告诉我能用哪几种 DID 估计方法、各自假设和局限,我们商量着选。选定后在一个 notebook 里都跑一遍,代码和解释都写进去;你不确定、要我拍板的地方专门开个单元格列出来。
第五步 · 整理成报告
把 notebook 结果整理成报告:各方法估计结果放一起对比,说清假设和局限,最后谈谈政策启示。像论文实证部分那样,克制、准确就行。
完整可编辑的版本见仓库
demo/task-plan-Lian-R0.md。“口语化分阶段”和”结构化说明书”各有场景:正式项目值得把说明书写清楚,日常推进口语交代即可。
更系统的提示词与工作流写法,见延伸阅读:从 Prompt 到 Skills:把论文复现、数据清洗和代码规范写进 AI、Claude Code Skills 写作指南。