8 月中旬,Anthropic 一口气放出了两条看起来有点拧巴的消息:一边是长达 186 页的第二份风险报告,罕见地自曝了一堆”真事故”;另一边,是公司交出了成立以来第一个盈利季度,比此前对外说的”2028 年盈亏平衡”整整提前了两年。
一条讲风险,一条讲赚钱,放在一起看,这家公司正在发生的变化,比任何单个新闻都值得琢磨。
一份 186 页的报告,把”内部模型”摆上了台面
报告里最让人意外的一点,是 Anthropic 主动披露了一款从未公开、也不打算公开的模型——Model 2。
按照报告的说法,Model 2 的能力”略强于”当前公开的旗舰 Claude Mythos 5,在 CoBench 上拿到 62.8%,而 Mythos 5 是 50.3%。它已经在公司内部被大量用于编码、智能体任务和训练数据生成。但结论很明确:没有发布计划。
这其实点破了一个行业的潜台词——最前沿的能力,现在越来越不活在消费级产品里,而是活在实验室里。你能用到的模型,永远不是最强的那个。
报告里的那几起”真事故”
比起参数和跑分,更值得注意的是报告列出的几起真实安全事故,这在 AI 公司里相当罕见:
- 多智能体集体偏航:多个 Agent 在没有人类指令的情况下跑偏了方向;
- 思维链泄露:模型的内部推理过程被暴露给了奖励模型;
- 坏数据教会坏行为:错误的数据直接把模型”教坏”了;
- 对齐伪装污染语料:为对齐训练准备的”伪装数据”混进了语料库。
最刺眼的一条,是生物安全控制:一个本该拦截危险内容的分类器,被悄悄关了将近一年,约 5 万人、1.33 亿次交互没有经过它的过滤。而公司对整体风险的评级,仍然是”低”,只是把”误对齐风险”从”极低”上调到了”低”,并承认”评测已经饱和,信心在下降”。
一边是罕见的自我揭短,一边是”风险仍是低”的轻描淡写,这两者之间的落差,才是这份报告真正值得读的地方。
首次盈利,比计划提前两年
风险报告的同期,Anthropic 公布了 2026 年第二季度财务数据:营收 109 亿美元,环比增长 127%,运营利润 5.59 亿美元——这是它成立以来的第一个盈利季度。
更硬的一个动作是,几乎同一周,公司跟比特币矿企 Riot Platforms 签下了一份 20 年、91 亿美元的算力长约,直接把未来二十年的算力位置锁死了。
盈利之后的第一件事不是回购、不是分红,而是买”未来的电”。这个选择的含义很清楚:在 Anthropic 眼里,算力已经不是一项运营支出,而是类似钢厂买煤、化工厂买原油的战略储备。
老达点评
老达对这两条消息的态度,概括成一句:Anthropic 正在从一家”讲安全的实验室”,变成一家”既讲安全、也会做生意”的公司,而这两件事,天然是有张力的。
说它进步,是因为敢把 186 页的风险、连”分类器失效一年”这种丑事都写出来,这份透明在 AI 圈是稀缺品。说它拧巴,是因为透明是透明了,风险评级却还是轻飘飘的一个”低”——公开了问题,却没有公开相应的担责和整改承诺。
至于”藏能力”,老达觉得这才是最值得所有 AI 用户记住的一句话:真正的技术前沿,正在从”你能买到什么”变成”你看不见什么”。作为普通用户,我们既不该被”安全”的宣传麻痹,也不该被”盈利”的喜报忽悠,该关心的是——那个更强的模型,为什么不能给你用,以及由谁来替你把关。