美国也开源了:5010 亿参数的 Beam 只激活 230 亿,专挑中国模型软肋

Reflection AI 开源模型 Beam 主题插画:巨大的专家面板只有一小块被点亮,象征 5010 亿参数每次仅激活 230 亿的高效推理
内容摘要

美国公司 Reflection AI 发布开源模型 Beam:五千零一十亿参数,每次只激活二百三十亿,官方称推理算力只用对手的三分之一到四分之一。本文讲清训练账本、跑分口径与效率算法的边界,并回答现在能不能用、值不值得等权重。

10 月 5 日,美国公司 Reflection AI 放出自己的第一个开源权重模型 Beam。总参数 5010 亿,每个 token 只激活约 230 亿;纯文本、MoE 架构、100 万 token 上下文窗口;权重挂 Apache 2.0,官方说这个月晚些时候放出来。

它挑的对手不是 OpenAI,是中国的开源模型。官方口径是「与 GLM-5.2 同级,正在接近 Qwen 3.8-Max」,而推理算力只要三分之一到四分之一。

表面看是发了一个模型,实际上是同时发了三样东西:一份训练账单、一套还没被第三方验证过的跑分,和一句没说出口的话——开源权重这块场子,美国想抢回来。

一、先把基本盘摆出来

Beam 是一家 2024 年成立的布鲁克林公司做的,两位创始人 Misha Laskin 和 Ioannis Antonoglou 都来自谷歌 DeepMind,Laskin 任 CEO。这个背景解释了它为什么一出生就敢做 5000 亿参数的模型:它不差钱。

关键数字只有几个:

  • 总参数 5010 亿,每个 token 激活约 230 亿,占比接近 4.6%
  • 纯文本模型,不是多模态
  • 上下文窗口 100 万 token
  • 预训练用了 23.8 万亿 token,来源是公开网页加商业授权数据
  • 定位很明确:编程、推理、Agent 任务

这里要解释一句 MoE。它把网络切成很多「专家」,每次只叫醒少数几个干活。所以模型可以存得很大、跑得却很轻——Beam 大约每 22 个参数里只有 1 个在单次计算中出力。这是它能喊出「便宜」的物理基础,也是目前主流开源模型的通用做法。

二、真正的看点在训练账本

参数和跑分都是发布会上的常规动作。这份训练账本才是这次值得记一笔的地方,因为它把后训练(强化学习)提到了和预训练几乎平级的位置。

预训练这一段:不到 4 周,跑在 6144 张 GB300 NVL72 上,按 GPU 时间粗算约 410 万 GPU 小时的上限。

后训练这一段:4 周,10500 张 GB300,产出了超过 1 亿次 rollout,约 13 亿次沙箱执行,拼了近 100 万个编程、Agent、STEM、终端、搜索和工具调用的环境,单轮上下文最长到 25.6 万 token。按 GPU 时间粗算约 710 万 GPU 小时。

这两个数字不能直接当算力账对比,预训练和强化学习用卡的方式不一样。但有一个结论是清楚的:这家公司把强化学习当成了独立的扩展轴,而不是训练流程里一个收尾环节。官方还说,算力往上加的时候跑分一直在涨,到本轮训练结束都没看到平台期。

对做技术选型的人来说,这句话比跑分表重要——它意味着现在这个成绩可能只是起点。

三、跑分怎么读:赢在哪,输在哪

官方表格里的亮点是这些:SWE-Bench Verified 80.9,SWE-Bench Multilingual 78.0,Terminal Bench v2.1 80.1,SWE Bench Pro v1 65.5,AIME 2026 97.8,GPQA Diamond 90.5。

但把同表里的中国模型拉到一起看,故事就完整了:

  • 对 GLM-5.2:DeepSWE v1.1 是 44.4 对 44.0,SWE Bench Pro v1 是 65.5 对 62.1,Beam 小胜;换成 Terminal Bench v2.1 是 80.1 对 81.0,AIME 是 97.8 对 99.2,HLE 无工具是 36.2 对 40.5,Beam 落后
  • 对 Kimi K3:Terminal Bench 88.3、DeepSWE 68.0,差距是两位数
  • 对 DeepSeek V4.1 Flash:Terminal Bench 90.6、DeepSWE 74.2,差距更大

官方自己也没绕:Kimi K3 这类模型在原始能力上仍然领先,Beam 的卖点是推理时的效率。

口径上有四条边界必须记住:这是自家出的题、自家跑的;权重还没放,谁也复现不了;TechCrunch 说联系厂商要更多验证材料没得到回复;AIME 2026 这种数字在多个模型上已经逼近满分,区分度本来就有限。

三周前的德国 Kolibri 走的是另一条路——它把卖点放在合规和主权上(那篇拆得很细)。Beam 和它几乎是同一周、两种不同的「西方开源叙事」,拿来对照读会有意思。

四、「效率」到底是怎么算出来的

官方给的说法是:同等推理水平下,Beam 的算力消耗是 GLM-5.2 的三分之一到四分之一。

具体算法是,用大约两倍的激活参数乘以平均生成的 token 数,来估算生成阶段的算力。

这个算法没算进去的部分也很明确:prompt 预填充、随上下文长度变化的注意力运算、以及实际服务的调度开销。所以它成立的范围是「模型层面的近似对比」,不等于你在云上真正的账单和延迟。

不过在真实场景里,23B 激活这个数字确实有用。它意味着同一张卡能塞进更多并发请求。对同时跑一批 Agent 的团队来说,这比跑分高两分更值钱——你的瓶颈往往不是模型够不够聪明,而是排队的任务太多。

五、为什么美国公司现在急着开源

因为场子确实丢了。

按追踪开源模型生态的统计,中国模型在累计下载量上 2025 年 8 月就反超了美国;阿里 Qwen 家族到 2026 年 3 月拿到 9.42 亿次下载。在 OpenRouter 上,中国开源模型占开源模型推理 token 的份额,14 个月内就冲过了 70%。

而美国三大厂的最强模型,至今仍是闭源的。

所以 Beam 是美国的答案:不跟你比谁更强,跟你比谁更省。这条路我们前几天刚见过一次——Kimi K3 和 GLM-5.3 被接进 OpenAI 的企业采购账单,那是中国开源模型换了个打法出海;现在轮到美国用效率反打。

钱从哪来也值得看。公司累计融资约 47 亿美元,最新一轮估值 250 亿美元(投前),英伟达是最大股东。算力上签了两笔大单:与 SpaceX 签到 2029 年,用孟菲斯 Colossus 2 数据中心的 GB300,爬坡期之后每月支付 1.5 亿美元,总额最高约 63 亿美元;与 Nebius 的合作超过 10 亿美元。

但真正的生意不在模型。Reflection 卖的是「AI 工厂」:企业在自己的机房、用自己的数据,把基础模型训练成专属版本。韩国新世界集团已经签了 250 兆瓦主权 AI 工厂的合作备忘录——土地、电力、许可、融资由新世界负责,设备设计和运营归 Reflection。注意这只是意向,不是确定客户合同。

顺带一个有点反讽的结构:英伟达既是股东,又是间接的算力供应商。它同时在闭源那边押了 OpenAI,在开源这边押了 Reflection。

六、现在能用吗

三条实话。

第一,今天用不上。权重没放,只能排等待名单。官方说发布时会通过大厂云和 neocloud 分发,也会进开源库。

第二,如果效率的说法被第三方证实,受益最大的是自己托管开源模型、需要跑批处理的团队。省钱这件事在并发场景里是复利。

第三,别把它当成「美国最强开源」。它是「够用而且便宜」。这两句话在选型时的含义完全不同。同期开源模型里的开源第一类选手我们还是见过几个的,比如小米 MiMo-V2.6 那种把训练账单连 OOM 都公开的写法,以及H Company Holo4 那种能商用的那版只剩一半水平的教训——都提醒一件事:参数和跑分从来不是全部。

七、老达点评

第一,这次最值钱的不是 501B,是把强化学习当成独立扩展轴的思路。参数堆到一定程度,边际收益肉眼可见在下降,而顺着算力加 RL、跑分还在涨,这是条更值得跟的线。想系统跟这条线的,可以从AI 编程工具专题翻起,里面几篇把不同厂商的编程能力演进串起来了。

第二,「便宜三到四倍」这种话要跟「跑在哪」一起看。算法排除掉的预填充和注意力开销,恰恰是长上下文场景里的大头。对跑 Agent 的团队,这部分才是你的真账。想理解 Agent 成本结构的,AI 智能体与自动化专题里有几篇实测。

第三,开源在美国已经变成产业政策加商业模式。模型是诱饵,「AI 工厂」才是货。送出去一个免费的好模型,卖回来一整套私有基础设施——这笔账对卖卡的人是划算的。

第四,也是最重要的:等权重落地,等第三方复现。发布会上的跑分表可以看,但不能拿来做技术选型。三到六周之内,社区会给出第一个独立的答案。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *