1  重新审视 Stata

本讲要回答的问题

AI 都能帮我们写代码了,为什么还要学一点 Stata?

1.1 界面与语法:从何处深入了解

Stata 的窗口、菜单和语法,是使用 Stata 的基本功。若需系统了解这些内容,推荐阅读在线书 Stata 101,尤其是下面三节:

Stata 界面

1.2 为何还要学 Stata?

写代码的门槛正在被 AI 拉低:你说一句话,它就给你一段 Stata 代码。既然如此,为什么还要花时间学 Stata?

因为「让 AI 写」和「看懂、用好、检查」是两回事。下面这张图是一项实证研究的典型流程——从数据到结果,每一步都需要研究者自己做判断,而不是把方向也交给 AI。

Stata 实证分析流程

具体来说,在 AI 时代仍值得懂一点 Stata,有以下五个理由。

C1 具备「审查能力」,不要被 AI 误导

AI 生成的 Stata 代码常常”看起来对、也跑得动,结果却不对”——变量名猜错、选项用反、把跨个体的滞后算到了别的单位、把相关关系写成因果。只有自己懂一点 Stata,才能读懂它到底写了什么、判断结果是否合理。

C2 能自行搜索新命令、查看帮助文件

遇到不认识的命令,能 help 一下看语法、findit 一下找方法、看懂它来自官方还是 SSC。有了这个能力,才判断得出 AI 推荐的命令靠不靠谱、有没有更合适的替代。

C3 知道 Stata 安装路径与 profile.do 机制

这一点和”用 Agent”直接相关:让 Claude Code、Codex 或 MCP 工具去调用、配置 Stata 时,必须告诉它 Stata 的安装路径,以及 profile.do 的存在——这是 Stata 启动时自动运行的配置文件,可能会改变工作目录、加载外部命令路径。不了解这套机制,Agent 配置常常莫名卡住。

C4 有些方法,Stata 仍有独特优势(如 reghdfe

不少前沿计量方法的成熟实现最先出现在 Stata:reghdfe(高维固定效应)、csdid / jwdid(现代交叠 DID)、ivreghdfe 等。做面板与因果推断时,Stata 生态往往比 Python / R 更省心、更”开箱即用”。

C5 路径依赖:复现包与合作者都在用 Stata

大量顶刊论文的复现包是用 Stata 写的;导师、师兄师姐、合作者也很可能多年都在用 Stata。想读懂别人的代码、复现别人的结果、和团队顺畅协作,就绕不开它。会一点 Stata,是融入现有学术生产链的现实需要。

一句话:AI 让你把代码写得更快,而懂一点 Stata,才让你把结果做得更对。

关于”AI 时代为什么还要懂一点 Stata”的更完整讨论,参阅:丁闪闪, 2026, Stata:AI 写代码时代,为什么还要懂一点?

1.3 动手走一遍

用 Stata 做一次分析,最小的一套动作如下(操作细节见上文 Stata 101 链接):

  • 认识四个窗口,用 sysuse auto, clear 载入数据,在变量窗口查看数据结构。
  • 新建 01_first.do,写三行 use → summarize → regress,用 do 一键跑通——能重跑、能分享,正是 dofile 相对于”手敲命令”的根本优势。
  • help regress 读语法行与一个选项;findit 一个关键词做模糊搜索。
  • ssc install winsor2, replace 安装一个外部命令,help winsor2 验证。
  • 路径只记一句话:永远用项目文件夹 + 相对路径(把绝对路径改成 ./data/...)。这也是第 4 讲里 Agent 能接管整个项目的前提。

1.4 延伸阅读