这两年朋友圈最流行的晒法是贴一张截图:”我的 Agent 自主跑了 3 小时,烧了几百万 Token,把整个项目干完了”。但吴恩达(Andrew Ng)最新这篇文章,专门给这种晒法泼了盆冷水。
9 月 4 日,吴恩达在 LinkedIn 发布《AI Engineering Skills Map: Using Coding Agents》。他和团队访谈了多位顶尖 AI 工程师、结合自身实践后得出一个判断:真正拉开差距的不是”会不会让 Agent 跑”,而是会不会”指挥”它。这是他把今年在推进的《AI 工程技能地图》研究(基于上万条招聘数据和专家访谈的长期项目)里”使用 Coding Agent”这一项,单独展开成的一篇完整方法论。今天逐条拆给你看,文末附落地清单。
一、三阶段工作流:规划 → 执行 → 部署监控
吴恩达发现,尽管 Coding Agent 改变了写软件的方式,顶尖工程师的工作流仍然可以归纳成三个阶段。
Planning(规划)——先想清楚,再让 Agent 动手。 规划不只是写一段 Prompt。真正动手前,要做问题分析、研究、理解现有代码库,然后写出一份 Spec,把需求、技术设计、架构明确下来,再拆成可执行的计划。这里有个很重要的判断:过去大家讲 Prompt Engineering,而在复杂的 Agent 项目里,更重要的能力正在变成 Spec Engineering——把”要什么、约束什么、怎么算验收通过”写清楚。
Execution(执行)——难点是给 Agent 多大自主权。 执行阶段的核心是 Build → Test → Verify。真正难的不是让 Agent 开始写代码,而是判断它该独立跑多久:低风险任务可以放手让它长时间自主运行,涉及生产数据、权限、核心架构的高风险任务,就得加密人工检查点。这种根据风险动态调节人机分工的能力,吴恩达叫它 Autonomy Calibration(自主权校准)。
Deployment & Monitoring(部署与监控)——Agent 的活不止写代码。 代码写完后,Agent 还能参与 CI/CD 部署、盯日志、发现异常、给出修复方案,再进入下一轮。Coding Agent 正在从”写码助手”长成”工程 Agent”。
二、五项核心能力:到底练什么
顺着三阶段,吴恩达把”用好 Coding Agent”收敛成五类可练习的能力:
1. 指挥工作流(Directing the Workflow)。 判断什么时候该研究、什么时候开始写代码、Spec 该写多细、大任务怎么拆成可验证的小块、什么时候让 Agent 继续、什么时候人必须介入。工程师的角色正在从”自己把活干完”变成”组织 Agent 把活干完”。
2. 赋予 Agent 恰当的自主权(Enabling Agent Autonomy)。 不是”让 AI 随便跑”,而是按任务选自主程度:有的任务适合人机高频交互,有的可以设定目标让 Agent 循环执行直到完成。同时要管好上下文——项目架构、历史决策、业务规则、编码约定,Agent 缺了这些再强的模型也会”在错误信息上做正确推理”。任务足够大时,还可以拆成 Planner、Coding、Testing、Review、Monitoring 多个 Agent 并行。
3. 审查产出(Reviewing the Work)。 Agent 的输出是不确定的——可能写出好方案,也可能非常自信地埋一个 bug。所以不能”Agent 写完直接上生产”,而要 Build → Test → Verify → Review → Improve。判断 AI 工程是否成熟的标准不是”Agent 能不能做”,而是”它做完以后,你能不能判断它做对了”。拿不准的,可以上评测集 + LLM-as-a-Judge,但最终拍板必须是人:Agent 做、Agent 审、人决定。
4. 定制 Agent 与环境(Customizing the Agent and Its Environment)。 成熟的 Coding Agent 不是”模型 + 一段 Prompt”,而是模型 + Tools + Skills + Plugins + MCP + 上下文 + 代码库的组合。通过 MCP 接上代码仓库、API、数据库、测试、日志,Agent 才能从聊天机器人变成”数字工程师”。用 CLAUDE.md、AGENTS.md 这类持久上下文文件,把人的隐性知识(项目结构、架构、编码风格、测试方法)变成 Agent 每次开工都能读到的显性知识——这正是我写过的 AI 编程项目规则迁移清单 在做的事。再往上,可以用 Hooks 自动触发代码审查、测试、安全检查、CI/CD,把人工工作流改造成 Agent 驱动。
5. 理解底层原理(Coding Agent Foundations)。 不一定要自己造 Agent,但至少得懂代码库搜索、检索、上下文窗口、工具调用、MCP、子 Agent、Agent Harness 这些机制——因为你只有理解 Agent 怎么工作,才知道它为什么会失败。吴恩达列了五种典型失败模式:过度设计(简单问题被搞复杂)、缺乏验证(代码跑通了但结果不对)、提前完工(活没干完就报告 Done)、上下文丢失(干久了忘了关键约束)、危险操作(误删文件、覆盖配置、改错生产数据)。最后这一条,上周的 Claude Code 删掉 700GB 事故 就是活生生的案例。
三、泼冷水:别迷信”让 Agent 自主跑几小时”
这是全文我最想让读者记住的一段。吴恩达的原话是:“最高效的 Coding Agent 用法,是一个复杂、高频迭代的过程。”
现在很多人展示 Agent 连续自主运行几个小时、消耗几百万甚至几千万 Token,好像跑得越久越先进。但如果一开始的目标、假设或架构就是错的,让 Agent 一直跑下去,只会更高效地执行错误方向。真正有效的循环是:Agent 干活 → 人审查 → 调整 → Agent 继续 → 验证 → 迭代。关键能力不是”完全不管 Agent”,而是知道什么时候不该干预、什么时候必须干预。
四、落地清单:从今天就能练起的五步
说再多不如直接上手。结合这篇文章,给你一份从今天就能开始练的清单:
- 动手前先写 Spec 再开工:目标、验收标准、约束条件写清楚。参考我之前整理的 AI 编程上线检查清单,把”怎么算完成”提前定义好。
- 给项目建一份 CLAUDE.md / AGENTS.md:把架构、约定、常用命令固化进去,让每个 Agent 开工都有完整上下文。
- 先写测试,再让 Agent 改:验证闭环前置,Agent 每次改动都有测试兜底,你才有底气给它更大自主权。
- 高风险操作留人确认:涉及删文件、改数据、动权限的指令,宁可多一次确认。
- 记录 Agent 的失败模式:每次它”闯祸”都记一笔,攒成你自己的检查单——过度设计、提前完工、上下文丢失,见多了你就能在它跑偏前介入。
这五步看着简单,但每一项对应的都是吴恩达说的”能力”,而不是”会某个工具”。工具每几周就大更新一次(Claude Code、Codex、Cursor 都在这个节奏上),AI 实践 这个行当真正值钱的是那些不随工具迭代贬值的手艺。
老达点评:瓶颈早就不在模型,在人
我的判断是,吴恩达这篇的价值不在介绍了什么新工具,而在于把”用好 Agent”从玄学变成了可练习的技能清单。这跟我之前在写 Anthropic 官方《AI 原生开发手册》 时的判断完全一致:当模型能力普遍够用之后,项目成败的瓶颈已经转移到”人怎么组织 Agent 干活”。
两点补充意见:
第一,”人机比”比”自主时长”更值得晒。与其秀”连跑 3 小时”,不如记录”我这轮 review 拦下了几个错误方向”——那才是工程能力。第二,别把 Spec、CLAUDE.md 这些当成负担。它们本质是把你想清楚的东西写下来,AI 只是逼着你更早、更系统地想清楚。等你想清楚了,AI 编程工具专题 里那些工具差异,反而成了最不重要的部分。