GPT-6 Astra 正式发布:OpenAI 说它”最聪明也最守规矩”,能操作电脑干完整活,编程登顶却先限量给企业

GPT-6 Astra 官方旗舰模型发布概念图,AI 智能体在电脑桌面自动执行多步骤任务,画面包含代码窗口、数据看板与操作面板
内容摘要

GPT-6 Astra 正式发布,OpenAI 称其为迄今最智能、最对齐的模型:软件工程能力登顶,FrontierMath 刷到 98%,可在 Codex 中跨上下文窗口保留记忆。本文梳理发布要点与限量发放原因,帮你判断值不值得等、普通用户何时能用上。

OpenAI 每次发旗舰模型,都会先甩一串跑分,这次 GPT-6 Astra 直接把 FrontierMath 刷到 98%、网络安全测试拿了满分,然后补了一句”所以我们要慢慢放”。能力越强反而发得越谨慎,这在 AI 圈已经成了新常态。

如果你只想知道一件事:GPT-6 Astra 是什么? 简单说,它是 OpenAI 眼里”最智能、也最对齐”的新一代旗舰模型,重点不是陪你聊天,而是替你干活——操作电脑、跑浏览器、写代码、做研究,把一份多步骤工作从头干到尾。9 月 3 日官宣当天只对一小批组织和网络安全项目开放,普通 Plus/Pro 用户要再等几天。

一、官宣了哪些硬信息

OpenAI 在 9 月 3 日的公告里,把 Astra 定位成”全球最智能且最对齐的模型”,强调它是预训练、强化学习与对齐研究多年积累的产物。能力覆盖六个方向:计算机操作、浏览器使用、软件工程、网络安全、科学研究与专业工作。

几个关键事实帮你快速建立认知:

  • 软件工程:OpenAI 称 Astra 是”迄今最好的软件工程模型”,接棒此前 Codex 线在编程上的积累。
  • 数学:FrontierMath Tier 4 拿到 98%,OpenAI 还提到它已帮助解决数学中长期悬而未决的开放问题。
  • 通用推理:ARC-AGI-3 得分 99.9%,接近刷满。
  • 网络安全:ExploitBench 满分 100%,OpenAI 明确说这轮网络安全能力是”显著跃升”。
  • 发放范围:9 月 3 日起面向有限组织及网络安全 Daybreak 项目成员,未来几天陆续覆盖 ChatGPT Plus / Pro / Business / Enterprise、API 与 AWS。

值得注意的是,用量包含在现有订阅额度内,不需要额外付费解锁;Pro / Business / Enterprise 还会额外拿到一个更强的 GPT-6 Astra Pro。企业工作区默认关闭,需要管理员主动开启。

二、普通用户最该关心的变化:Codex 换上下文不”失忆”

这一轮发布里,我建议你把注意力放在一个看起来很小、其实很要命的改动上:Codex 的跨上下文窗口记忆机制

以前模型干活,上下文窗口一满,就只能把前面的内容”压缩”成一段摘要。做过大型重构或跨天调试的人都知道,压缩会丢细节——某个修复为什么失败、某个组件到底怎么调用的,摘要里常常没有。Astra 的做法是不再只依赖压缩:它会在窗口之间保留笔记,前面窗口里的需求、测试结果、工具输出仍然可检索。也就是说,干到一半换窗口,它记得住自己为什么这么干。

这个功能目前在 Codex 里是实验性的,未来几周会成为 Astra 的默认行为。配合我 8 月底写过的那篇 Codex 持久模式,能看出 OpenAI 在”长任务不中断、状态不丢失”上是一路加码的——先让 AI 主动找活干,再让它干活不丢记忆,两件事拼起来,才是能托付大活的 Agent。

三、为什么能力越强,反而发得越慢

Astra 这轮发布最反常的地方是节奏:先是小范围组织,再逐步扩大。OpenAI 自己把原因说得很直白——它的网络安全能力达到了内部安全框架里的 Critical(关键)阈值,属于”能力太强需要防滥用”的那一档。

我把这理解成一个分水岭:模型能力已经强到”会不会被坏人拿去用”比”好不好用”更优先了。回顾这个夏天 OpenAI 在安全组织上的调整,解散灾难性风险评估团队引发过不小的争议,而 Astra 的限量发放算是把”能力红线”摆到了台面上。安全团队可以解散,安全阈值不会消失——这个信号比跑分本身更值得琢磨。

另外,从产品线看,OpenAI 最近在”让 Agent 真正操作真实世界”上明显是三线并进:模型层上 Astra 强化计算机操作,协议层上周刚发的 WebMCP(网页把按钮变成工具接口),加上桌面端的 Codex 应用。模型、协议、终端一起改,目标不是做一个更聪明的聊天框,而是做一个能在你电脑上独立干活的执行体。

四、老达点评

先说结论:Astra 值得等,但普通用户这一两周感受不会太剧烈。 对大部分读者来说,最实际的收益其实是 Codex 的跨窗口记忆——如果你经常让 AI 干几个小时以上的活,这个改变会直接改善体验。真正的质变要等 Astra 大规模开放、第三方应用接入之后才显现。

几点个人判断:

1. “会操作电脑”才是这轮发布的真主题。 跑分只是注脚,Astra 把 computer use 和推理绑在一起,目标明确:让 AI 能独立完成”打开软件→查资料→写文档→生成表格→检查结果”这种真实工作流。这是对 OpenAI 专题 里那条”从聊天到干活”主线的延续。

2. 网络安全能力是双刃剑,限量是对的。 一个 ExploitBench 满分、能操作电脑的模型,如果无差别开放,后果不难想象。分批发放短期内可能让你觉得”OpenAI 又在挤牙膏”,但从风险控制角度,这是目前最负责任的做法。

3. 企业用户现在就该做功课。 如果你所在的公司用企业版,管理员很快会面对一个选择题:开不开 Astra、给哪些人开、操作电脑的权限怎么审计。建议在 AI智能体与自动化专题 里先理清自己的 Agent 使用边界,再决定灰度策略,别等员工自己偷偷开。

4. 别只看分数,看它”干完活能不能自己检查”。 OpenAI 官方描述里有个细节:Astra 能执行工作流并检查结果。能干活不稀奇,能干完活自己复核,才是从”助手”到”执行者”的关键一步。这一点我会在实际用上之后单独写一篇体验。

回看 9 月初那篇 Astra 内测泄露的传闻,当时传得神乎其神的功能,这周基本都有了官方版本。接下来几天,模型选择器里出现 Astra 的时候,别急着下单,先想想:你手头有没有一份”从头到尾都能交给它”的完整工作?有的话,这次升级才真正对你值回票价。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *