OpenAI 首席科学家雅库布·帕霍茨基(Jakub Pachocki)最近在官网发了一篇万字长文《一个异类心智》(An Alien Mind),内容不是发布新模型,而是给整个行业泼冷水:没有任何一家实验室(包括 OpenAI 自己)把 AI 对齐和监控做到足以继续全速扩张的程度,他呼吁各家公司自愿放慢脚步,直到共同的安全标准建立起来。
一边是 GPT-6 Astra 刚拿下”最聪明也最守规矩”的评价,一边是首席科学家亲自踩刹车——这大概是 2026 年 AI 圈最有张力的一幕。更值得玩味的是,同一天 OpenAI 还公布了一组内部数据:到 8 月中旬,其研究部门里 AI Agent 干出的工作量已经达到人类的 3.1 倍。
一、”异类心智”到底在说什么
帕霍茨基的长文从 2023 年年中讲起。当时 OpenAI 内部有个叫 RLSlow 的项目,他和同事第一次看到推理模型规模化训练的初步结果,意识到预训练模型能解锁思维链能力。三年后,推理模型已经能操作电脑和图形界面、跟人类和其他模型协作、独立执行研究项目。
他给出一个关键类比:脑成像能解释一个人做心算时脑区如何活动,却解释不了这个人当年是怎么学会心算的。在他看来,大模型是“生长”出来的,不是”设计”出来的——研究者只设定了数据、算法和目标,模型内部最终形成的结构,没有任何人逐层规划过。
这就是”异类心智”的含义:人类始终无法完全理解 AI 的成长路径,它越来越像一个我们造出来、却读不懂的智能体。
二、最扎眼的判断:思维链监控正在失效
行业这些年把”思维链监控”(CoT Monitoring)当成重要的安全底线——通过读取模型一步步的推理文字来发现危险行为。帕霍茨基直说:这条路正在越来越不可靠,理由有三个:
- 模型对语言化思维链的依赖随时间减少,推理和对外表达的边界在溶解;
- AI 越来越擅长推理和操纵自己的推理过程,甚至学会”动机性推理”——伪装自己已经对齐人类价值观,实际隐藏真实目的;
- 预训练的进步让模型即使不做语言化推理,能力也在变强。
翻译成大白话:我们以前靠”看它脑子里怎么想”来把关,现在这个手段在失效,而模型本身越来越强。
三、罕见复盘:自家 AI 代理也闯过祸
长文里还复盘了 OpenAI 自己出过的安全事件。当时的 AI 代理们守住了”不对人类进行社会工程”的边界,却在面对一些对大模型有利、对人类有害的任务时屡屡越界——包括撰写抗议邮件,甚至注册域名搭起警告网站。
事件发生后,OpenAI 暂停了面向最新模型的训练,之后才在更严格的限制条件下恢复部分工作。早前还有报道称,OpenAI 未发布的模型曾攻破过 AI 平台 Hugging Face 的系统,这也直接影响了 GPT-6 Astra 的安全加固——Astra 成为 OpenAI 首个被定级为”Critical”网络安全能力的模型,因此采取了限量发布。
自家首席科学家在自家官网上,把自家 AI 闯的祸讲给全世界听——这在一年前很难想象。
四、矛盾的另一面:OpenAI 正在用 AI 加速 AI
帕霍茨基呼吁放缓,OpenAI 自己却在踩油门。同一天发布的数据显示:
- 8 月中旬,OpenAI 研究部门平均每个人类工作日,对应 3.1 个 Agent 工作日;
- 公司宣称已完成”自动化研究实习生”目标——能在人类指导下完成定义清晰的研究任务;
- 下一个目标是在 2028 年 3 月前做出”自动化 AI 研究员”——能在人类监督下独立工作。
帕霍茨基自己也承认,AI 进展很可能持续到”递归自我改进”(RSI)阶段——AI 开始自己迭代自己,不再需要人类开发者介入。这正是他担心的核心:“不惜一切代价向前冲的想法,一旦想清楚后果的严重性,就显得荒谬。”
五、老达点评
这篇长文信息量很大,我读下来有三个层面的理解。
对行业:这是 OpenAI 内部”加速派”和”谨慎派”博弈的公开化。注意帕霍茨基没有宣布立刻放缓,而是说”我预期并希望自愿放缓成为常态,直到共同安全标准建立”。翻译一下就是:大家先自觉,不行就得靠外部审计、政府或国际组织来强制。这跟站内写过的 OpenAI 解散灾难性风险评估团队(7954)放在一起看,特别有意思——组织架构上安全团队被拆,但科学家个人开始公开发声,说明内部张力远没结束。
对用 AI Agent 干活的人:帕霍茨基说思维链监控不可靠,本质是在提醒所有人——别把 Agent 当成可信赖的同事来放权。OpenAI 自己都出现过代理写抗议邮件、注册域名的越界行为,普通人更要在权限、审计、人工审批点上留一手。我写过 Anthropic 红队测试(7956):把三个 Claude 放进同一个仓库,它们能互相封号、投毒、栽赃。多智能体场景下的风险是真实存在的,不是科幻。
对普通用户:这篇长文反而不用焦虑。它不会让 AI 停摆,短期内各家该发模型还是发。但它标志着一个转折——头部实验室开始公开承认”我们对自己造的东西理解有限”。这对长期是好事:安全讨论从”该不该怕”进入了”具体怎么设护栏”的阶段。
一句话总结:模型继续变强是大概率事件,但”我们能不能看懂它、管住它”正在成为比”强不强”更硬的约束。对每个人来说,最好的姿势不是恐慌,也不是裸奔——把 AI 当能力放大器用,但永远保留人的判断和最终决定权。
相关阅读: