3  对话式 AI 与执行型 Agent

本讲要回答的问题

同样都能写代码,对话式 AI(ChatGPT、Claude)和执行型 Agent(Codex、Claude Code)到底怎么分工?

3.1 先分清两类任务

用 AI 时的很多低效,不是因为模型不够强,而是把任务放错了地方。任务其实只有两类。

一类是对话任务:主要发生在「脑子里」和「文字讨论」中。比如解释一篇论文的贡献、比较几种研究设计、判断一个识别策略有没有风险、把一段话改得更清楚、生成一张教学插图。这类任务的重点是理解、表达和判断——放在 ChatGPT / Claude 的对话框里最合适。例如,定制每日 Stata 快讯

另一类是项目任务:已经落到「文件夹」和「代码库」里。比如批量修改一组脚本、检查一个 notebook、统一图片路径、根据报错改代码、把数据、结果和文字整合进同一个项目。这类任务的重点不是继续聊天,而是读取文件、执行修改、验证结果——放进 Codex / Claude Code 这样的执行型 Agent 里最合适。例如,可以让 ChatGPT 做好可以直接让 Codex 在本地执行的任务说明文档,参见 DID 与 ML 结合推文规划trop:三重稳健性 DID 估计方法

一个简单的判断标准:

任务主要在「文字讨论」中,优先用 ChatGPT / Claude;任务已经落到「文件夹」里,优先用 Codex / Claude Code。

很多人觉得「AI 工具越用越乱」,往往不是工具太多,而是没把任务拆成不同环节:任务还没想清楚就丢给 Agent,会得到一堆看似完整、方向却不准的修改;任务已经散落在几十个文件里,却还在对话框里反复复制粘贴,人就成了低效的「文件搬运工」。

3.2 两类工具的分工

维度 对话式 AI(ChatGPT / Claude) 执行型 Agent(Codex / Claude Code)
核心形态 对话助手 项目执行 Agent
主要对象 问题、文本、材料、图片 文件夹、代码库、脚本、项目
擅长环节 理解、规划、表达、审稿、绘图 读取、修改、运行、检查、交付
典型问题 「这件事该怎么想?」 「这个项目该怎么改?」

一句话:对话式 AI 解决「如何理解」,执行型 Agent 解决「如何落地」。 二者不是替代关系,而是前后环节的关系——Agent 越擅长执行,就越需要对话式 AI 先把任务定义清楚。

四类 AI 工具的分工

3.3 关键的中间产物:任务说明书

从「想清楚」到「做出来」,中间需要一个交接物——任务说明书(可以叫 to-agent-任务说明.md,或写进 README.md)。它把一次任务的目标、输入文件、输出格式、修改边界、风格要求、验收标准写清楚。任务说明书越清楚,Agent 越不容易误改。

一份任务说明书大致长这样:

# 任务说明

## 目标
基于项目文件夹里的数据和说明,完成一次数据清洗与回归分析。

## 输入
- data/*.csv:原始数据
- README.md:变量说明与分析要求

## 输出
- code/analysis.do:分析脚本(含中文注释)
- outputs/report.md:结果说明,指出看哪一行、哪个系数

## 修改方式
- 请先阅读项目结构并列出计划,不要一上来就改
- 不要删除原始文件
- 改完说明每个文件改了什么

3.4 一个真实例子:这本讲义就是这样做出来的

这不是纸上谈兵。你现在看到的这个仓库和讲义,就是按上面这套流程做出来的:先在网页版 AI 里把”想做一个什么样的公开课仓库”聊清楚,让它拆解目标、制定计划,甚至直接生成了一整个任务文件夹(里面是一份份任务说明书);然后把这个文件夹交给本地的 Agent,让它逐个任务去执行——收割素材、搭建仓库、生成 demo 数据。本课的演示中,会展示这个本地工作目录,以及 AI 拟定的那些计划文档。

在网页版制定计划时,怎么把话说清楚?

和网页版 AI 聊”规划”时,把三件事说清楚,它给出的计划会完整得多:

  • 你的目标:想做成什么、给谁用、成功长什么样;
  • 你已有的资料:手头有哪些数据、文档、素材、参考仓库;
  • 希望它完成的工作:需要它帮你拆解、规划,还是直接产出任务说明书。
一个小技巧:适当「示弱」,让 AI 反问你

不必每句话都像下命令。适当”示弱”,让 AI 来反问、引导,往往能得到更完整的分析和建议,而不是一个仓促的答案。比如:

  • 「我目前还不太清楚应该如何开始这个分析。」
  • 「我不知道网上有没有类似的项目,比如 Top Journal 发布的复现资料,或 GitHub 仓库,你能帮我找一下吗?」
  • 「这些只是我初步想到的,不知你是否有更好的建议?」

3.5 稳妥的流程:规划 → 执行 → 审查

把一次完整任务拆成三步,是目前比较稳的做法:

Agent 工作流

规划(对话式 AI)执行(Agent)审查(人 / 另一个 Agent)

  1. 规划:用 ChatGPT / Claude 把模糊任务拆成清楚任务,判断任务边界,生成任务说明书。
  2. 执行:让 Codex / Claude Code 进入项目文件夹,按任务说明读文件、改文件、跑命令。复杂任务里,第一条指令最好不是「直接修改」,而是「先阅读项目结构并列出修改计划」
  3. 审查:回到对话式 AI(或换一个 Agent)检查产出——逻辑是否清楚、代码与文字是否一致、有没有遗漏或误改。高风险任务(涉及代码结果、论文事实、政策时点、参考文献)值得让第二个 Agent 交叉复核。

规划 → 执行 → 审查

3.6 关键论断

工具在快速演化、边界也在模糊:Copilot 不再只是补全,Cursor 也能跑 Agent,Codex 既能在本地也能连 GitHub。与其纠结「哪个最强」,不如记住一句话:

软件本身不再是门槛,「搭配好环境、制定好计划」才是。

这正是本课的主线:先想清楚要解决什么问题,再决定用哪种工具、交给谁做、如何检查。第 4 讲,就把这套「规划 → 执行 → 审查」放到一个真实的 demo 项目里跑一遍。

3.7 延伸阅读