9 月 22 日,OpenAI 和 Anthropic 在同一个小时里各出一张牌。Anthropic 发布 Claude Opus 5.5,把每百万 token 的输入、输出价格从 Opus 5 的 5 美元、25 美元降到 4 美元、20 美元;不到两小时后,OpenAI 放出 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 的促销价直接砍半。
这不是一次普通的版本更新。两家前沿实验室第一次不约而同地把”更便宜”放到了发布说明的标题位置,跑分退到第二位。
一、先看牌面:两家到底各做了什么
Anthropic 这边:
- Claude Opus 5.5 是新的 5.5 家族首款模型,输入 4 美元 / 输出 20 美元(每百万 token),较 Opus 5 降 20%
- 缓存读取从 0.50 美元降到 0.20 美元,降幅 60%;缓存写入从 6.25 美元降到 5 美元
- 官方口径:默认设置下典型工作负载成本比 Opus 5 低约 40%,输出速度提升超过 30%
- 上下文 100 万 token,最大输出 12.8 万 token,知识截止 2026 年 6 月
- 已上线 Claude 平台以及 AWS、Google Cloud、Microsoft Azure,模型名为 claude-opus-5-5
- Claude Code 与 Claude 平台提供一个 Fast 模式研究预览,速度约为标准档 2.5 倍,价格 8 美元 / 40 美元
OpenAI 这边:
- GPT-6 Sol:输入 2 美元 / 输出 10 美元,定位在 Astra 之下,主打复杂专业工作、编码和 Agent 任务
- GPT-6 Luna:输入 0.10 美元 / 输出 0.50 美元,面向信息抽取、文档摘要这类高吞吐场景
- 两款价格较 GPT-5.6 对应版本下调 50%,官方强调是长期定价,不是限时折扣
- 已上线 ChatGPT Work、Codex 和 API;免费版与 Go 用户可在桌面端用到 Luna
顺便说一句定价上的巧合:GPT-5.6 此前的价位大约就是 4 美元 / 20 美元——那正好是 Opus 5.5 现在站的位置。Anthropic 把自家旗舰定价精准落在了 OpenAI 刚腾出来的那一档。一个多月前 OpenAI 还只是”首次给旗舰降价超 20%”,现在直接变成了同一天对着出牌,这条线的演变可以看老达之前那篇《OpenAI 首次给旗舰模型降价超 20%》。
二、降的不是单价,是”每任务成本”
表面看是单价打折,实际两家讲的都是同一件事:干完一次活儿总共花多少钱。
Anthropic 拆得更细:单价降 20%,但每任务消耗的 token 也变少了,两个因素叠起来才是 40%——单价的贡献只占一部分。它举了两个内部测试:
- 把负载均衡软件 HAProxy 从 C 语言重写成 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,成本低 51%,两版改写都通过了几乎全部回归测试
- 从一份刻意藏起财报的网页副本里写公司季度业绩报告:18 份 Opus 5.5 报告中有 16 份通过了”任何编造的数字或引语都算失败”的质量关,Fable 5.1 与 Opus 5 一次都没过
缓存是这里的关键变量。Anthropic 说缓存读取占了 Agent 和编码任务成本的绝大部分,所以把它从 0.50 美元砍到 0.20 美元,对长跑任务账本的影响远大于单价上那 20%。这和它一个月前调整 Fable 5.1 缓存价格时的思路一脉相承,可以对照《Claude Code 默认模型换成 Fable 5.1》那篇看。OpenAI 也把提示缓存优化写进了发布说明,默认给更高的命中率。
国产模型这边的动作也一样直接。9 月 12 日 DeepSeek V4.1 Flash 把 KV 缓存砍到四分之一(《DeepSeek V4.1 Flash 发布》),9 月 22 日阶跃星辰 Step 5 Preview 把单任务成本压到 Opus 5 的八分之一(《阶跃星辰 Step 5 Preview 开放》)。降本早就不是哪一家的独门动作。
结论很直白:这轮降价对”一问一答”的聊天用户几乎没感觉,对需要反复喂同一份上下文的 Agent 用户才是真金白银。
三、跑分放一边:三处容易被带偏的地方
第一,两家对标的是对方比较好打的那一版。
OpenAI 说 Sol 在 xhigh 强度下的 AutomationBench 成绩超过 Opus 5 的最高强度,每任务成本只有它的 9%——比的是 Opus 5,不是当天发布的 Opus 5.5。而 Anthropic 对比表里 GPT-6 Astra 的数据标注是”as reported by OpenAI”,也就是引用对方自报成绩,不是同机重跑。
第二,Anthropic 自己的对比表里也输了两项。
在它公布的九项测试中,Opus 5.5 领先七项,编程三项都拿到最高分——Terminal-Bench 4.0 的 66.4%、FrontierCode v1.1 的 54.4%、CursorBench 4.0 的 57.8%。但业务流程类的 AutomationBench(40.0% 对 GPT-6 Astra 的 41.4%)和科研工具类的 Terminal-Bench-Science 0.1(58.7% 对 64.6%)落后。
评分误差也该看一眼:Terminal-Bench 4.0 的标准误差是 ±2.6 分,Terminal-Bench-Science 是 ±3.5 到 5 分,比它宣传的部分领先幅度还大。官方自己在发布文里也承认,到了这个能力水平,跑分差距已经不能可靠地反映真实差异。
第三,Opus 5.5 是在开启安全护栏的情况下测的。
Anthropic 明确写了:评测时生产环境的防护是打开的,被拦下的网络安全任务改由 Opus 4.8 完成,生物和前沿模型开发任务改由 Opus 5 完成,这很可能压低了它在这几项上的分数。同时它还提了一句少见的坦白——模型经常”怀疑自己在被测”,这让真实环境中的行为更难判断。
四、为什么是现在
时间线摆在一起就很清楚:距离 GPT-6 Astra 发布 19 天,距离 Anthropic 自家的 Fable 5.1 和 Mythos 5.1 也不过 21 天。开发者社区还传出 Anthropic 原本准备发 Opus 5.2,最后直接跳到 5.5。
“减速”的呼吁没有让迭代慢下来。Anthropic CEO 达里奥·阿莫代伊一周前刚公开主张前沿开发要放慢节奏、让安全实践跑在能力前面,Opus 5.5 就是这句话之后的第一款产品。OpenAI 的奥特曼则把降价解释成扩大使用规模的一步,希望推动一场新的”文艺复兴”,马斯克也公开附议了阿莫代伊的减速说法。
另一条更实在的推力来自成本敏感的客户。多方分析都指向同一个背景:千问、月之暗面、DeepSeek 这类更便宜的开源模型正在抢走对价格敏感的企业预算,闭源厂商想守住份额,就只能跟着降。这条线上还有一层信号值得记:发布同日有 13 笔合计约 17.5 亿美元的融资公布,没有一笔投给做通用大模型的公司,钱全部流向训练数据、安全、基础设施这些”模型离不开但要付费”的环节。
五、老达点评
一、这是”每块钱买到多少智能”的竞争,不是”谁最强”。 过去看谁刷分高,现在看同样的活谁便宜。这个转向对使用者是好事,但也意味着以后再看到”某模型性价比第一”,得先问清楚:比的是单价还是每任务成本?缓存命中率假设是多少?别把宣传口径直接搬进自己的预算表。
二、发布节奏跟安全叙事之间的裂缝,越来越明显。 一边喊放慢,一边三周内两次上新加降价。这不是道德评判,是商业现实——但做长期技术选型时,不该把”安全承诺”当成能力门槛之外的额外确定性。
三、便宜不等于该换。 Opus 5.5 换的是模型名字符串,不是重写代码,迁移成本确实低。但如果你的活儿是长上下文的 Agent 循环,先拿自己真实的缓存命中率算一遍账再决定,宣传里的 40% 是官方默认场景下的数字。
四、这一轮真正的受益者是长跑 Agent。 缓存读取降 60% 这个动作,瞄准的正是”反复喂同一份上下文”的自动化场景。如果你在做每天跑一次的批处理 Agent,今天就是重新算成本的好时机。
六、现在该做的三件事
- 重算自己的账:拿最近一周的真实调用日志,按缓存读取、缓存写入、输入、输出四类分开统计,别只看宣传的百分比。
- 用 Opus 5.5 跑一遍你现在的评测集,尤其是长任务。它和 Fable 5.1 的差距比跑分表看起来更小,官方文档已经建议大多数工作负载优先用 Opus 5.5、把 Fable 5.1 留给高难度推理和长周期 Agent 任务。
- 把 Luna 放进候选池。0.10 美元 / 0.50 美元的价位落在信息抽取、批量摘要这类高吞吐任务上,是这一轮里最有杀伤力的产品。
之前那篇《OpenAI 把 GPT-6 Astra 卖进华尔街》讲过算力产能吃紧、订阅档位被迫收缩的事,如今同一家公司把便宜档位铺开,恰好说明瓶颈正在从”能不能造出来”转向”能不能卖得动”。想自己动手把成本压下来的,可以照着《AI 模型降价潮下,怎么用「多模型路由」把 API 成本砍掉 70%》里的路由思路试一遍。更多关于两家实验室的持续跟踪,可以看站内的 OpenAI 专题 和 Claude 专题。