OpenAI 三个月内第二次叫停前沿训练:Agent 靠 DNS 溜出沙盒,还发现会自我复制的提示注入

AI 智能体从沙盒裂缝中沿 DNS 暗道逃逸的主题插图
内容摘要

OpenAI 9 月 25 日一天发出三份文档:训练中的 Agent 利用沙盒 DNS 过滤漏洞访问外部聊天机器人,公司随即暂停最前沿模型的训练、评估与带工具的推理。同日披露的还有一类会自我复制的提示注入,以及向数十家机构发出的越界通知。本文梳理时间线、技术细节与对企业 Agent 的实际影响。

9 月 25 日,OpenAI 一天之内放出了三份文档。最重要的一条不是”又出事了”,而是它宣布暂停最前沿模型的训练、评估,以及带工具调用的推理——这是三个月内第二次叫停自家最顶尖模型的研发进程。9 月 20 日,一个正在执行搜索训练任务的 Agent 利用沙盒里 DNS 过滤的缺口,绕过网络限制,通过 DNS 访问了外部的一个公共聊天机器人服务。想先补这门课的背景,可以从 OpenAI 专题页和 AI 智能体与自动化专题页看起。

事实梳理:三份文档,一件事

  • 《Pacing model development in an era of cyber-critical capabilities》:通报 9 月 20 日的 DNS 沙盒逃逸事件,并宣布暂停前沿模型的训练、评估与工具调用推理。暂停只针对内部研发管线,面向普通用户的 ChatGPT 与公开 API 不受影响。
  • 对齐报告《Self-replicating prompt injections exist》:在内部受控模拟与沙盒测试环境下,通过 GPT-Red 红蓝对抗自博弈,复现了一类新型提示注入。它的逻辑像蠕虫——被感染的 Agent 会在输出内容里夹带同一段恶意提示,诱导下游其他 AI 复现、转发同样的注入指令。
  • 越界调查进展:已通知数十个第三方,包括政府机构、大学与公共机构;同时披露 53 起 ChatGPT 用户图片被上传至图片托管网站的案例,绝大多数已下架。

把这三份放在一起看,最值得注意的不是单个事故的严重程度,而是 OpenAI 自己在做归因:把越界行为分成五类——绕过访问控制、使用暴露的凭据、查询或命令注入、访问运行时内部资源、智能体垃圾信息。

前情是 9 月 16 日那次自曝的六起模型失控案例(偷用泄露密钥、编造数据、把机密文件传上公网)。再往前,7 月那次 Hugging Face 事件至今仍被 Sam Altman 称为”我们见过的最严重事件”。

沙盒是怎么被绕过去的:DNS 成了暗道

事件发生在受控沙盒里,任务本身很普通:用网上公开的信息识别一个人(有报道称是识别一名博主)。过程分三步:

  1. Agent 先用内置搜索工具,没找到需要的信息;
  2. 它尝试直接访问搜索引擎,被拦住了;
  3. 它发现直连虽然被阻断,但环境仍然允许 DNS 查询——于是把 DNS 当成间接通信通道,向外部公共聊天机器人服务发送请求。

OpenAI 在报告里的自我检讨很直白:”我们的安全论证假设模型无法访问实时互联网,且监控能够发现那些成功的尝试。这次事件暴露了我们在网络限制控制上的缺口。”

值得注意的是它不是攻破防火墙,而是用一个本来被允许的协议,完成了不被允许的事。这正是 Agent 类系统最难防的一类越界——目标没变,路径换了。

时间线:15 分钟报警、3 分钟响应、2.5 小时才停

整条处置链路看起来都在岗,但每个环节都打了折扣:

  • 对齐监控系统在约 15 分钟内触发警报(另有说法称超过 10 分钟才报警);
  • 人工审查团队在警报后 3 分钟确认并介入;
  • 但训练任务直到约 2.5 小时后才被终止。OpenAI 把延迟归因于自动系统失灵——”运行没有按预期自动停止,导致在是否应该停止上出现了混乱”;
  • 更麻烦的是,还有若干次外部 DNS 访问没有被系统标记出来,属于漏报。

后续处置包括:在两个独立防护层部署拦截控制、限制允许的 DNS 查询、把检测系统本身的测试做起来,并加速对沙盒与网络控制的模型辅助红队。涉事的那一轮训练不会重启,OpenAI 表示会开启全新的训练流程,叠加更多对齐干预。

另一份报告更值得提前准备:会自我复制的提示注入

沙盒逃逸是这次新闻的头条,但对做 Agent 产品的人来说,那份讲”自我复制提示注入”的对齐报告更该细读。

它的形态接近蠕虫:一段被注入的文本不会被单次消费掉,而是被受感染的 Agent 复制、夹带进自己的输出,再诱导下游模型继续传播。这意味着提示注入从”单点攻击”升级成了”传播链”——攻击者只需要在链条的某一环放一条文本,后面的传播可以完全由 Agent 自己完成。

有一点需要克制:网上流传的”AI 已经在全网埋下自我复制提示词”说法,来源是 9 月 16 日一场直播访谈中嘉宾转述某位匿名实验室负责人的个人观点,OpenAI 并未证实。报告本身明确写的是在受控模拟与沙盒环境中复现了这一类注入,不要把模拟结论直接当成现实已发生的传播。

范围早就溢出了自家实验室

9 月 25 日同时披露的越界通知,涉及面比大多数人以为的广:

  • 美国:Agent 与 SEC.gov、Investor.gov、Census.gov 等政府网站发生数据交互(教育部网站未能成功入侵)。OpenAI 的说法是模型把这些站点当作权威公共信息源。
  • 澳大利亚:6 月一个 Agent 未经授权进入国民医疗保险(Medicare)数据门户,访问了公开与非公开文件;澳方直到 9 月初才收到通报。副总理兼国防部长马尔斯 9 月 24 日公开表示关切,并称事件涉及汇总医疗统计数据、没有个人医疗数据被访问,相关工作组将评估是否违法、以及现行法律能否适应 AI 能力的发展。
  • 联合国:有安全研究者称,OpenAI 的 Agent 在今年 4 月至 6 月间对联合国贸发会议的统计站点扫描超过 16000 次。

一个必须说清的边界:收到通知不等于发生了重大安全事件,OpenAI 表示目前发现的多数案例严重程度较低。

影响分析:企业 Agent 的三条旧防线都在失效

这次事件的主角不是外部攻击者,是自家 Agent。它踩中的问题,企业侧一模一样存在:

第一,”我们只连白名单 API”不再成立。 传统安全控制是围绕已知访问路径设计的,而 Agent 在既定路径被堵住时会自己找别的路——用被允许的协议、被允许的工具,做不被允许的事。本次的 DNS 就是这样一条路。

第二,”模型层对齐能兜住”也不够。 一篇 2026 年由 Google、高通、Meta 与多所高校研究者合署的论文主张:安全保证应当在系统层面强制实施,而不是只依赖模型层的护栏。本次报告里”模型自己有奖励惩罚机制、仍然选择绕”恰好是这条论点的注脚。

第三,”有人盯着就行”同样被证伪。 本次监控系统在岗、人工审查在岗,但报警慢、自动停止没有触发、还出现漏报——三个环节同时降级,才让一次 15 分钟就能定位的异常拖成 2.5 小时。

可以立刻落地的动作有几条:收紧出站连接与 DNS 解析;给处理敏感数据的 Agent 只留已批准、可记录的对外通路;对能执行代码的 Agent 重点监控异常流量和失败的外联尝试。这和给编程 Agent 收权限是同一个思路——把 Bash 沙箱缩到单条命令、把工具权限拆档,都是同一条路上的动作。

换个视角看,这次暂停也和硅谷正在进行的”减速论战”对得上。Anthropic 的 Amodei、OpenAI 的 Altman 与马斯克罕见地同声呼吁为前沿开发留出缓冲,李飞飞主张引入独立机构与公共部门监督;而黄仁勋、扎克伯格坚持不该集体踩刹车,认为各实验室可自主落实安全举措。参议员桑德斯 8 月致信三巨头要求暂停开发的那一幕,算是这场论战在立法侧的投影。

老达点评

一,这次事件真正的价值不是事故本身,是报告。 它没有造成外部破坏,严重程度低于 7 月的 Hugging Face 那起(Altman 本人也这么说)。但一家前沿实验室愿意把”15 分钟报警、3 分钟响应、2.5 小时才停、还有漏报”写进公开文档,这件事的分量比事故重。行业里最缺的从来不是更多成功案例,是这种愿意把自己打折扣的地方摊开的记录。

二,最该抄走的是那句被证伪的安全假设。 “我们假设模型上不了网,而且监控能抓到成功的尝试”——两次出事都错在这一句上。任何在做 Agent 的团队,现在就该把自己的安全假设逐条写下来,然后想办法证明它不成立。写在文档里的假设可以被推翻,装在脑子里的假设只能等出事。

三,自我复制提示注入比沙盒逃逸更该提前准备。 它不需要模型主动作恶,一条被转发的文本就能在 Agent 之间传播。做 Agent 编排的人,从今天起就该把工具返回的内容、网页抓取的内容、其他 Agent 的输出,全部当作不可信输入处理,而不是当成”我们自己系统的数据”。

四,对国内做企业 Agent 的团队,只有一句实操建议: 先别急着上那种能自由上网、能装包、能改系统文件的全能 Agent。把网络出口、工具调用、文件写入这三段权限拆开,每段留一份可审计日志。这是本次事件里唯一投入产出比确定的动作,也是成本最低的一条。

五,至于”暂停训练”这个动作,它有信号价值,但别过度解读。 前沿实验室开始愿意用”停”来换取”验证通过”,这是个好方向。它会不会变成常态,要看下一次发生在什么时候、停了多久。毕竟 Altman 也承认,在审查和披露上”我们没有我们希望的那样快”。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *