如果问你”Codex 是什么”,多数人会说:一个 AI 编程工具。但 OpenAI 前两天把 Codex 的”发动机”直接开源了——Apache 2.0 协议,随便商用、随便改。这下 Codex 的定义得改写了:它不只是工具,还是一个可以嵌进任何产品的 Agent 执行引擎。
这件事对做 AI 产品的人来说,比多一个模型发布重要得多。
一、Harness 是什么:Codex 的发动机,不是代码生成器
先纠正一个误区。Codex Harness 不是一个”更会写代码的模型”,它管的是模型干活的全套流程:任务怎么拆、上下文怎么管、会话怎么保持、工具怎么调、出错怎么恢复、每一步怎么同步给你。
OpenAI 把它拆成四个核心模块:Agent Loop(智能体主循环)、线程生命周期与持久化、配置与身份认证、工具执行和扩展机制。一句话概括:模型是大脑,Harness 是负责调度、记忆、执行、反馈的神经系统。
关键在”开源”两个字。以前你想在自家产品里塞一个 Agent,得自己从零搭这套神经系统:状态管理、工具注册、审批回调、上下文压缩……每一环都是坑。现在 OpenAI 把内部跑 Codex 的整套基础设施放出来了,等于把最难的轮子交到你手上。
二、开源的三个组件:exec、SDK、app-server
这次开源的是三件套,对应三种用法:
codex exec:非交互式命令行。跑脚本、跑 CI、跑后台一次性任务,直接返回结构化结果。适合把 AI 塞进自动化流水线,不用人盯着。
Codex SDK:TypeScript / Python 编程接口。在代码里启动、恢复、流式传输 Codex 任务,适合做深度集成。
Codex app-server:把 Agent 嵌进产品的关键。支持持久化对话状态、实时事件流、中途打断任务、调用应用自己的工具,还带人类审批回调——Agent 想干”危险动作”(删文件、改权限)之前,会停下来等你点头。
OpenAI 官方给了个清晰的分工建议:你的应用负责提供业务上下文、规则和工具,Codex Harness 负责底下的 Agent 循环和沙箱执行。
这里有个很反直觉的信号:OpenAI 明确说,做 Agent 产品完全可以不造聊天框。用户继续用熟悉的界面——客服后台、运营看板、工单平台——Agent 在背后跑完整的执行循环。这跟过去”所有 AI 产品都得先做个对话框”的思路,是彻底反着来的。
三、真实的工程战绩:5 个月 100 万行代码
OpenAI 顺手公开了一个内部实践:一个产品在约 5 个月里,由 Codex 写了约 100 万行代码,完成约 1500 个 Pull Request。团队的核心理念已经变成”人类设定目标、Agent 执行”,而不是”人工写代码、AI 补全”。
这个数字的意义不在”AI 多能写”,而在它证明了一条可复制的工程范式:目标拆解、上下文管理、代码审查闭环全跑通之后,Agent 是可以持续交付的生产力,不是玩具。
还有一组性能数据值得看:在 ARC-AGI-3 测试上,只靠”保留推理+上下文压缩”两项 Harness 层面的调整,GPT-5.6 Sol 的得分从 13.3% 干到 38.3%,同时输出 Token 少了约六倍。模型没换、权重没动,纯靠执行框架优化,效果翻倍还省 token。这才是 Harness 真正的价值——它直接决定模型的”真实战斗力”。
四、不只是编程:税务、物流、安全都在往里嵌
最值得注意的,是这批真实案例早就不限于”写代码”了:
- AI 编程工具专题:选型、对比与实战
- AI 智能体与自动化专题:从 Agent 到工作流
- 税务:Thrive Holdings 和 Crete 用 Codex 做专业报税工作流,试点处理了 7000 份申报表,准备时间缩短约三分之一。
- 云平台:Cisco 用 Codex SDK 在云控制平台里做了 App Builder,用户用自然语言就能生成自定义应用。
- 物流:OpenAI 自己演示了 Relay 看板——运营人员选中延误货单,Agent 分析恢复方案、调用应用的 MCP 工具取实时数据,涉及实际操作前必须人工审批。
看到没?这些场景里没有一个”对话框”。Agent 嵌在业务流程里,该看的看、该做的做、该请示的请示。OpenAI 的意思很直白:Codex 的能力边界是”Agent 执行框架”,不是”代码编辑器”。
五、老达点评:Agent 竞赛从”模型”打到”运行时”了
我的判断是,这件事标志着 AI 编程的竞争维度变了。
以前大家比谁家模型聪明,现在 OpenAI 把执行引擎都开源了——这意味着竞争从”模型能力”延伸到了”Agent 运行时、工具调用、上下文管理、工程反馈闭环”这一整条链路。谁能在 Harness 之上做出更好用的专业工作流,谁就赢。
对开发者来说,机会和坑一样明显。机会是:不用再纠结聊天框怎么设计、状态怎么管理,直接复用这套成熟引擎,把精力花在业务规则和产品体验上。坑是:开源不等于开箱即用,IDE 插件、网页版、云端托管和模型本身都没开源,模型还得走 OpenAI API 或 ChatGPT 订阅,深度集成时的调试成本、兼容性、长期维护都是现实问题。
说白了,OpenAI 这步棋是”放引擎、锁模型”——把生态做起来,让大家都跑在它的运行时上,但最终算力账单还是回到它口袋里。至于要不要接,我的建议是:做 AI 产品的人值得认真试一遍 app-server,成本不高,试完你对”Agent 嵌入业务”这件事的理解会完全不同。
相关阅读