3 对话式 AI 与执行型 Agent
3.1 先分清两类任务
用 AI 时的很多低效,不是因为模型不够强,而是把任务放错了地方。任务其实只有两类。
一类是对话任务:主要发生在「脑子里」和「文字讨论」中。比如解释一篇论文的贡献、比较几种研究设计、判断一个识别策略有没有风险、把一段话改得更清楚、生成一张教学插图。这类任务的重点是理解、表达和判断——放在 ChatGPT / Claude 的对话框里最合适。例如,定制每日 Stata 快讯。
另一类是项目任务:已经落到「文件夹」和「代码库」里。比如批量修改一组脚本、检查一个 notebook、统一图片路径、根据报错改代码、把数据、结果和文字整合进同一个项目。这类任务的重点不是继续聊天,而是读取文件、执行修改、验证结果——放进 Codex / Claude Code 这样的执行型 Agent 里最合适。例如,可以让 ChatGPT 做好可以直接让 Codex 在本地执行的任务说明文档,参见 DID 与 ML 结合推文规划;trop:三重稳健性 DID 估计方法。
一个简单的判断标准:
任务主要在「文字讨论」中,优先用 ChatGPT / Claude;任务已经落到「文件夹」里,优先用 Codex / Claude Code。
很多人觉得「AI 工具越用越乱」,往往不是工具太多,而是没把任务拆成不同环节:任务还没想清楚就丢给 Agent,会得到一堆看似完整、方向却不准的修改;任务已经散落在几十个文件里,却还在对话框里反复复制粘贴,人就成了低效的「文件搬运工」。
3.2 两类工具的分工
| 维度 | 对话式 AI(ChatGPT / Claude) | 执行型 Agent(Codex / Claude Code) |
|---|---|---|
| 核心形态 | 对话助手 | 项目执行 Agent |
| 主要对象 | 问题、文本、材料、图片 | 文件夹、代码库、脚本、项目 |
| 擅长环节 | 理解、规划、表达、审稿、绘图 | 读取、修改、运行、检查、交付 |
| 典型问题 | 「这件事该怎么想?」 | 「这个项目该怎么改?」 |
一句话:对话式 AI 解决「如何理解」,执行型 Agent 解决「如何落地」。 二者不是替代关系,而是前后环节的关系——Agent 越擅长执行,就越需要对话式 AI 先把任务定义清楚。

3.3 关键的中间产物:任务说明书
从「想清楚」到「做出来」,中间需要一个交接物——任务说明书(可以叫 to-agent-任务说明.md,或写进 README.md)。它把一次任务的目标、输入文件、输出格式、修改边界、风格要求、验收标准写清楚。任务说明书越清楚,Agent 越不容易误改。
一份任务说明书大致长这样:
# 任务说明
## 目标
基于项目文件夹里的数据和说明,完成一次数据清洗与回归分析。
## 输入
- data/*.csv:原始数据
- README.md:变量说明与分析要求
## 输出
- code/analysis.do:分析脚本(含中文注释)
- outputs/report.md:结果说明,指出看哪一行、哪个系数
## 修改方式
- 请先阅读项目结构并列出计划,不要一上来就改
- 不要删除原始文件
- 改完说明每个文件改了什么3.4 一个真实例子:这本讲义就是这样做出来的
这不是纸上谈兵。你现在看到的这个仓库和讲义,就是按上面这套流程做出来的:先在网页版 AI 里把”想做一个什么样的公开课仓库”聊清楚,让它拆解目标、制定计划,甚至直接生成了一整个任务文件夹(里面是一份份任务说明书);然后把这个文件夹交给本地的 Agent,让它逐个任务去执行——收割素材、搭建仓库、生成 demo 数据。本课的演示中,会展示这个本地工作目录,以及 AI 拟定的那些计划文档。
和网页版 AI 聊”规划”时,把三件事说清楚,它给出的计划会完整得多:
- 你的目标:想做成什么、给谁用、成功长什么样;
- 你已有的资料:手头有哪些数据、文档、素材、参考仓库;
- 希望它完成的工作:需要它帮你拆解、规划,还是直接产出任务说明书。
不必每句话都像下命令。适当”示弱”,让 AI 来反问、引导,往往能得到更完整的分析和建议,而不是一个仓促的答案。比如:
- 「我目前还不太清楚应该如何开始这个分析。」
- 「我不知道网上有没有类似的项目,比如 Top Journal 发布的复现资料,或 GitHub 仓库,你能帮我找一下吗?」
- 「这些只是我初步想到的,不知你是否有更好的建议?」
3.5 稳妥的流程:规划 → 执行 → 审查
把一次完整任务拆成三步,是目前比较稳的做法:
规划(对话式 AI)→执行(Agent)→审查(人 / 另一个 Agent)
- 规划:用 ChatGPT / Claude 把模糊任务拆成清楚任务,判断任务边界,生成任务说明书。
- 执行:让 Codex / Claude Code 进入项目文件夹,按任务说明读文件、改文件、跑命令。复杂任务里,第一条指令最好不是「直接修改」,而是「先阅读项目结构并列出修改计划」。
- 审查:回到对话式 AI(或换一个 Agent)检查产出——逻辑是否清楚、代码与文字是否一致、有没有遗漏或误改。高风险任务(涉及代码结果、论文事实、政策时点、参考文献)值得让第二个 Agent 交叉复核。

3.6 关键论断
工具在快速演化、边界也在模糊:Copilot 不再只是补全,Cursor 也能跑 Agent,Codex 既能在本地也能连 GitHub。与其纠结「哪个最强」,不如记住一句话:
软件本身不再是门槛,「搭配好环境、制定好计划」才是。
这正是本课的主线:先想清楚要解决什么问题,再决定用哪种工具、交给谁做、如何检查。第 4 讲,就把这套「规划 → 执行 → 审查」放到一个真实的 demo 项目里跑一遍。