三个层次

  • 补全:Tab 补全,省的是打字时间;
  • 对话:提问-回答,省的是查文档时间;
  • Agent:给目标、给工具、给验收标准,省的是整段流程时间。

第三层才是真正的杠杆,也最容易翻车。

一条可复用的工作流

目标 → 拆解 → 工具调用 → 自检 → 交付
        ↑                        ↓
        └──── 失败时回退重试 ─────┘

关键在于 自检:让 Agent 用可执行的命令验证自己的产出,而不是靠"我觉得完成了"。

我给 Agent 配的三件套

  1. 文件系统:能读能写,才有产出物;
  2. 终端:能跑测试、能装依赖、能看日志;
  3. 网络检索:遇到不确定的 API 先查再写。

踩过的坑

> Agent 最怕的不是不会,而是"过于自信"。所以我把"不确定就停下来说明"写进它的指令里。

  • 权限给太宽 → 用沙箱限制工作目录;
  • 没有验收标准 → 先写测试再让它改代码;
  • 一次给太多目标 → 拆成可独立验收的小任务。