Claude Sonnet 5.5 发布:中端模型反超旗舰,编程跑分从 10.3% 跳到 70.6%

Claude Sonnet 5.5 中端模型在编程跑分上反超旗舰模型的主题插图
内容摘要

Anthropic 推出新一代中端模型 Claude Sonnet 5.5:列表价与上一代持平,输出快三成以上,单任务成本最高降三成,编程智能体跑分从 10.3% 跳到 70.6%,首次反超自家旗舰。本文拆解官方实测数据、计费口径的真实变化、迁移要改的配置,以及谁该换、谁先别换。

Anthropic 在 9 月 28 日发布 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5。官方口径里有两个数字最扎眼:编程智能体评测 Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 跳到 70.6%,单任务成本最高下降 30%——而列表价一分没动。

这款模型的定位很清楚:Opus 5.5 负责”需要持续判断的复杂开放式工作”,Sonnet 5.5 负责”边界清晰的日常活”——修 bug、写文档、做表格、出幻灯片。它已经上线 Claude 平台、AWS、Google Cloud 和 Microsoft Azure,模型 ID 是 claude-sonnet-5-5。想先看 Claude 这一整条产品线怎么排的,可以翻一下 Claude 专题页。

事实梳理:Sonnet 5.5 改了三件事

性能。 官方公布的关键分数:Terminal-Bench 4.0 拿到 70.6%(Sonnet 5 为 10.3%,Opus 5.5 为 66.4%);CursorBench 4.0 为 55.5%(Sonnet 5 为 34.1%,Opus 5.5 为 57.8%);FrontierCode 1.1 主集在 Xhigh 档为 52.1%(Opus 5.5 为 54.4%,OpenAI 的 GPT-6 Sol 为 49.3%);知识工作类评测 GDPval-AA v2.1 为 1844 分(Opus 5.5 为 1846,Sonnet 5 为 1449,GPT-6 Sol 为 1487)。此外 Humanity’s Last Exam 带工具 64.5%,OSWorld 2.1 部分分 80.1%,图表识别 Chartography 61.6%。Anthropic 还提到,这是第一个只靠截图就能通关宝可梦红(Pokémon Red)的 Sonnet 模型。

速度与成本。 输出速度比 Sonnet 5 快 30% 以上,是 Anthropic 迄今最快的 Sonnet。价格维持在每百万输入 token 2 美元、每百万输出 token 10 美元,缓存读取每百万 0.20 美元——列表价完全没降。官方说法是”同样一件事用的 token 少得多”,在自家测试里单任务成本最多比上一代低 30%。

安全。 因为 Sonnet 5.5 的网络安全能力已经和 Opus 5 接近,它成了第一个带上 cyber safeguards 与 fallbacks 的 Sonnet 档模型;生物学防护与 Sonnet 5 一致。官方强调两套防护只拦极少数高风险请求,日常软件开发与多数生命科学工作不受影响。Claude Haiku 5.5 会在未来几周内补齐家族第三档。

跑分跳了 60 个百分点,这个坑得说清楚

10.3% 到 70.6% 的对比很抓人,但基数有水分。Terminal-Bench 的维护方指出,Sonnet 5 当时经常撞上超时和 token 上限,所以 10.3% 本身偏低,把它理解成”提升了 6 倍”是不准确的。

另一处要注意的是测试口径:Artificial Analysis 的 GDPval-AA 与 AA-Briefcase 跑在预发布版本上,存在一个结构化输出 bug(已修复),官方脚注说这个 bug 只会低估 Sonnet 5.5 的表现、不会高估;同时 OpenAI 刚修复 GPT-6 Sol 的图像理解问题,第三方分数可能还没跟上。看跑分连脚注一起看,才不会被数字带节奏。

真实场景:早期测试方给出的生产数据

比跑分更值得看的,是几个已经把它放进生产流程的团队怎么说:

  • CodeRabbit 的 AI 副总裁 David Loker:跨复杂度判断力优于 Sonnet 5,输出 token 明显更少,公司打算先把简单与中等难度的代码评审切过去。
  • Base44 工程负责人 Gabriel Grinberg:在 118 个真实 App 构建里,Sonnet 5.5 平均 3.6 轮迭代就达到目标质量,Opus 5 需要 7.7 轮,且失败的工具调用是所有对比模型里最少的。
  • Slack 首席工程师 Curtis Allen:离线 Slackbot 评测中输出 token 少了约 14%,而且没有改任何 prompt。
  • Zendesk AI 主管 Abhinay Kathuria:工单处理速度比 Zendesk 现网在用的 Claude 模型快 20%。
  • Epic Games 的早期测试:用 Sonnet 5.5 处理数万行代码规模的游戏系统架构,多小时任务没有靠重型 prompt 工程硬撑。

上手:从 Sonnet 5 迁到 5.5 要动哪几处

  1. 模型 ID 换成 claude-sonnet-5-5。 Claude 平台、AWS、Google Cloud、Azure 四端都可用,享受零数据保留。
  2. 关 thinking 的用法要改。 如果你现在给 Sonnet 显式关闭 thinking,迁到 5.5 之前要改成新的 between_tools 设置;Opus 5.5 已经直接拒绝完全关闭 thinking 的请求。
  3. 先用中档 effort 试。 官方称部分评测里 Sonnet 5.5 在低档或中档就能打过 Sonnet 5 的最好成绩,单位任务成本约为其十分之一。默认中档跑,卡住了再升档,比一上来就拉满省钱得多。
  4. 缓存读取是 0.20 美元/百万 token。 多轮会话把稳定不变的系统提示与长上下文放前面,命中缓存的部分成本极低。
  5. 别只看官方跑分,跑一版自己的任务集。 抽样比对 Sonnet 5.5 与 Opus 5.5 在你业务上的成功率、迭代轮数和单任务成本,这三项才是账单的真正决定因素。

如果你在选编程模型这条线上还在纠结,AI 编程工具专题页里有 Codex、Claude Code、Cursor 这些工具横向的实战记录,可以先对照自己的使用习惯再决定换不换。

优缺点

优点: 同价位下编程智能体能力跳档;token 效率带来的真实降本(而非降价);输出速度快,适合高频迭代;知识工作与文档类任务接近 Opus 5.5;首次在 Sonnet 档位配上网安防护。

缺点: 列表价没有下调,降本完全依赖”少用 token”这一官方口径;跑分基数本身有解释空间;复杂开放式工作仍明显不如 Opus 5.5;网安防护首次下放,做安全相关开发的团队要重跑一遍回归。

谁该换、谁先别换

该换的人: 还在用 Sonnet 5 的团队,官方这个升级幅度没有理由不迁;拿 Opus 5.5 干修 bug、写文档、做表格、改 UI 这类边界清晰任务的人,中档或高档的 Sonnet 5.5 基本够用,价格差很难再被合理化;按 token 结算、对迭代轮数特别敏感的小团队——Base44 那组”3.6 轮 vs 7.7 轮”对你们就是直接的账单。

先别换的人: 任务需要长时间开放式判断的,官方自己承认 Opus 5.5 在这一点上明显更强;正在做网络安全相关开发的,Sonnet 5.5 首次带 cyber 防护,可能触发拒答与回退,迁移前务必重跑回归。

替代方案

  • Opus 5.5:每百万输入 4 美元、输出 20 美元,接力复杂开放式工作。它和 OpenAI 的降价同天发生,可以对照我们此前的记录:OpenAI 和 Anthropic 同日降价。
  • GPT-6 Sol:与 Sonnet 5.5 同价(2/10 美元),FrontierCode 主集 49.3%,略低于 Sonnet 5.5 的 52.1%。
  • 按题计费的国产路线:像阶跃星辰 Step 5 Preview 用”一道题 0.71 美元”打成本账,适合对话量小、单次任务重的场景,见 Step 5 Preview 的成本口径。
  • 不绑模型的编辑器:JetBrains Air 这类新编辑器允许 Claude Code、Codex、Copilot 混用,换模型不用换 IDE,适合先观望再决定主力的团队。

老达点评

第一,这次最值钱的不是 70.6%,是”价格不动、账单下降”。 Anthropic 选择把成本优势记在 token 效率上,而不是继续打价格战。比起直接降价,这条路更可持续,也更难被对手用一次性促销追平。但代价是:省不省钱取决于你的任务形态,宣传里的”最多 30%”到了实际业务里可能只剩十几个点,得自己量。

第二,看到跳档数字先找脚注。 10.3% 这个基数偏低是评测维护方自己承认的,官方也老实标了预发布版本的 bug 说明。一个博客最该传递的态度不是”AI 又进化了”,而是”数字在什么口径下成立”。

第三,首次给 Sonnet 装网安防护,思路是对的。 防护资源按”能力”分配,而不是按”价格档位”分配——网络安全能力接近 Opus 5,就配 Opus 级的防护。这比按售价分层更符合风险本身的形状。

第四,对国内用户最实际的动作只有一条: 把日常代码评审、改 bug、写文档这类活先切到 Sonnet 5.5 的中档,把 Opus 5.5 留给真正难啃的开放式任务。同时别忘了 Claude Code 这条线上也在同步更新(一周四连更那次的复盘),模型换档和工具换版本,最好排在同一次回归里做。

一句话总结:Sonnet 5.5 不是”更便宜的 Opus”,而是”同价位的 Sonnet 终于能接住大部分日常活了”。对多数团队来说,它带来的最大变化不是能力上限,而是每次迭代敢多跑几轮的底气。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *