Cognition 发布 SWE-2:跟 Fable 5.1 只差 0.9 分,价格却便宜 64%,AI 编程开始卷成本

Cognition SWE-2 编程模型基于 Kimi K3 后训练,跑分逼近 Fable 5.1 而成本大幅下降的概念插画
内容摘要

Cognition 发布编程模型 SWE-2,底座是 2.8 万亿参数的 Kimi K3,在自家 FrontierCode 1.1 拿到 50.0 分,只比 Fable 5.1 低 0.9 分,公司称成本便宜 64%。它把重点放在"少绕路"而不是"刷最高分",本文梳理跑分、训练方法、真实短板,以及国产开源模型被海外产品拿去当底座这件事,对国内开发者意味着什么。

Cognition 发布了新的编程模型 SWE-2。跑分表上,它在自家的 FrontierCode 1.1 拿到 50.0 分,只比 Anthropic 的 Fable 5.1 低 0.9 分,而公司给出的口径是——同样这个分数,成本便宜 64%。

但真正值得多看一眼的不是数字,是它的底座:Kimi K3。

SWE-2 是什么:Devin 换了一台更省的引擎

Cognition 是 Devin 的母公司,估值 260 亿美元。9 月 10 日,它发布 SWE-2,接替之前的 SWE-1.7。现在已经在 Devin Desktop 和 Devin CLI 上线,Devin Web 和 Fusion 在陆续推送。

有个容易被忽略的细节:SWE-2 不是一个能单独调用的 API 模型。Cognition 没有公布权重、没有独立定价、也没给上下文窗口。你想用它,只能在 Devin 产品里选。这一点和 OpenAI、Anthropic 那种”发一个 API 让全世界接”的打法完全不同——它更像是给自己的 Agent 换发动机,顺带把发动机的性能指标公开发布了一遍。

背景里还有一层:a16z 合伙人 Marc Andreessen 在 SWE-2 发布前一天刚发过第二篇投资 Cognition 的文章,里面提到 Devin 现在已经写了 Cognition 自己 90% 以上的生产代码。所以 SWE-2 优先优化”省钱”和”少绕路”,逻辑上很顺——它首先服务的是自家天天用 Devin 干活的工程团队。

跑分:赢在哪、输在哪,一张清单看清楚

  • FrontierCode 1.1 Main:SWE-2 50.0%,Fable 5.1 50.9%,GPT-6 Astra 53.3%,Grok 4.6 48.0%,Kimi K3 44.2%,SWE-1.7 42.0%
  • DeepSWE 1.1:GPT-6 Astra 74.1%,SWE-2 73.0%,GPT-5.6 Sol 72.7%,Kimi K3 68.5%
  • Terminal-Bench 2.1:SWE-2 92.8% 排第一,Fable 5.1 91.4%,GPT-6 Astra 89.9%,SWE-1.7 81.5%
  • Terminal-Bench 4:Fable 5.1 55.8%,GPT-6 Astra 57.9%,SWE-2 只有 27.3%

读这张清单要注意两件事。

第一,这是 Cognition 自己跑的结果,FrontierCode 本身也是他们家的评测集(测的是”AI 写的 PR 人类维护者会不会合并”)。跨厂商排序只能当方向看,不能当定论。Cognition 自己也标了,部分数字来自内部 Devin CLI 在最强推理档下的运行。

第二,Terminal-Bench 4 上的差距不是零点几个点,是被拉开了差不多一倍。这个测试针对的是长周期、多步骤的 Agent 任务。也就是说,SWE-2 在”规规矩矩改代码”这类活上很能打,但一旦任务变成连续几小时的仓库重构,Anthropic 和 OpenAI 还是明显更稳。这一点和站内之前写过的 吴恩达那 5 项能力 对得上——”让 Agent 连跑几小时”确实是最难的那一档。

怎么练出来的:拿 Kimi K3 当毛坯房

SWE-2 的后训练底座是月之暗面的 Kimi K3,2.8 万亿参数、MoE 架构、约 104B 激活参数,而且拿过来的时候本身已经做过一轮 Agent 编程方向的强化学习。

Cognition 在这一层上又加了一轮 RL,做了一件挺有意思的事:用一次训练,同时训出 medium / high / max 三档推理力度,而不是训三个模型。奖励函数写成了 R = S - λe·C——S 是任务成功率,C 是运行时间加 API 成本,λe 跟着底座 Pareto 前沿的局部切线走。翻译一下:做对了给分,但花的时间和钱要扣分,而且在这个档位上越接近成本拐点,扣得越狠。

工程侧也有针对 2.8T 底座的处理:在线 draft 模型提解码吞吐、NVFP4 与 FP8 量化感知 kernel、训练环境数量翻了三倍,还加了”自动验证器要能扛住上一个版本模型”的加固。

这套做法其实说明了一件事:现在做垂直编程 Agent,不一定非要从零训基础模型。开源底座 + 一轮针对性后训练,就能把某个具体场景的成本曲线重新拉一遍。 站内 9 月 6 日写过的 Kimi 原生兼容 Codex 和 Claude Code,讲的是国产模型怎么”接进去”;SWE-2 讲的是国产模型怎么”被拿去用”——两件事合起来,才是国产开源模型现在的真实位置。

效率这部分,可能比跑分更重要

跑分是门面,成本是里子。Cognition 给了一组对比:在 FrontierCode 1.1 Main 上,SWE-2 的 medium 档相比 SWE-1.7——

  • 平均交互步数从 127 步降到 53 步,少了 58%
  • 平均成本降 81%
  • 第一次真正改代码的中位步数,从 48 步提前到 18 步

这组数字对应的其实是日常使用里最烦人的体验:模型在仓库里翻来翻去、读一堆不相关的文件、绕一大圈才动手。Cognition 说法是底座容量上来之后,模型能更早判断哪些目录分支不用看。另外他们还提到 SWE-2 写测试的习惯变了——会补端到端集成测试、并且会重新推导结论而不是重复上一版的错误假设。

如果你已经在用 Cursor Projects 这类”协调者带一堆子 Agent”的玩法(9 月 12 日那篇 Cursor Projects 聊过),单次调用省 80% 成本这件事会被放大很多——因为子 Agent 是并行跑的,成本是乘出来的。

谁适合、谁先别急

适合的:

  • 已经在用 Devin 的团队,今天就能在 Desktop / CLI 里切到 SWE-2,主要收益是账单和等待时间
  • 想观察”开源底座 + 后训练”这条路径的开发者,SWE-2 是一份写得很坦诚的公开样本

先别急的:

  • 工作内容是长时间、跨仓库的自主重构——Terminal-Bench 4 上 27.3% vs 57.9% 的差距是实打实的
  • 需要独立 API、私有权重或明确单价的场景——Cognition 这几项都还没给

替代方案上,如果在意长任务的稳定性,Fable 5.1GPT-6 Astra 还是更保险的选择;如果在意的是”能不能进内网、代码不出企业”,Cursor 自托管机器 那条路更直接。Cognition 这边还有个新动作值得一提:他们收购了 Poke——唯一被苹果官方支持、能跑在 iMessage 里的 AI Agent,三个月做了 1 亿多条消息交互。看起来 Devin 想从”工程工具”往”随身的 Agent”扩。

老达点评

第一,AI 编程这半年从”比谁分高”转向了”比谁账便宜”,这是好事。 SWE-2 的 50.0 分本身不惊艳,只比上一代产品线里的对手差不到 1 分,但它把成本压到对手的 1/3 到 1/4。对每天挂着 Agent 跑活的团队来说,这个变化的体感比多 3 个跑分点强得多。

第二,Kimi K3 被拿去做底座,比任何宣传都更有说服力。 一款国产开源模型成为海外头部 Agent 公司的后训练毛坯,说明开源模型的价值已经不只是”免费能跑”,而是”能被继续训练出专用能力”。想入局的人不一定非要训基础模型,选好底座 + 做好后训练,是一条更现实的路。

第三,也是最需要提醒的一点:这份跑分是自测的。 FrontierCode 是 Cognition 自家的评测集,Terminal-Bench 4 上的短板他们也没藏。真要判断 SWE-2 值不值得迁,别只看发布页,拿自己仓库里最典型的那类任务跑一周,看它第一次改代码要几步、一个 PR 到底花多少钱——这两个指标比任何榜单都诚实。

想系统看这条线的更多文章,可以走 AI 编程工具专题AI 智能体与自动化专题;如果你更关心”这类工具到底值不值那个价”,AI 工具评测专题 里的横向对比可以一起看。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *