德国发布 Kolibri:78B 模型只激活 3B,欧洲的卖点不是跑分是合规

Aleph Alpha Kolibri 示意图:一座深蓝基座承载稀疏激活的发光节点,外围环绕欧洲风格的合规徽章
内容摘要

德国公司 Aleph Alpha 十月三日开源大模型 Kolibri:七百八十亿参数每次只激活约三十亿,上下文最长撑到一百万,权重按宽松许可放出。本文讲清它的跑分口径、主动回答不知道的设计、七十八吉字节显存门槛,以及主权人工智能这门生意到底卖给谁。

一家只有 200 人、总部在海德堡的德国公司,10 月 3 日开源了一个 780 亿参数的大模型。它没有去争开源榜单第一——事实上它的公开跑分还输给了一个 270 亿的对手。

但它赌的是另一件事:在欧洲,能不能自己拿在手里,有时候比强不强更重要。

这个模型叫 Kolibri,发布当天正好是德国统一日。

先看它是什么

Kolibri 的规格,一句话能说完:780 亿总参数,每次只激活约 30 亿。

这是个 MoE(混合专家)架构,384 个专家里每次只挑 6 个上场。稀疏激活带来的是朴素的算术:推理时真正在算的参数量,跟一个 30 亿的小模型差不多,但脑子里的知识量接近 780 亿的模型。

其余关键数字:

  • 上下文:原生 26.2 万 token,通过启动参数可扩展到 104.8 万 token(约 100 万)
  • 许可:Apache 2.0,完整权重挂在 Hugging Face,可以商用
  • 语言:英语 + 德语,专门做了德英双语分词器
  • 训练:约 200 亿到 240 亿 token,用了 768 张英伟达 B200,跑 21 天
  • 算力位置:训练在德国和芬兰的基础设施上完成
  • 报告:配套发布了 189 页的技术报告

有一个诚实得有点意外的细节:开源的是权重和配置,训练代码和方法没放。 这跟 DeepSeek 那种”论文全公开、调度器不开源”的做法是同一类保留——开放的边界,各家画得都不一样。

“主权 AI”到底指什么

这是理解这个模型的钥匙。Aleph Alpha 把”主权”拆成两层意思:

一是怎么造出来的。 数据清洗、预训练、后训练、评测,整条链路自己走完,训练放在德法两国境内,按欧洲和德国法律来。公司说这叫”供应链完整可追溯”。

二是怎么交到客户手里。 客户可以完全离线部署,数据不出自己的机房,模型自带合规属性。官方明确说,Kolibri 在设计阶段就把 欧盟 AI 法案、通用 AI 行为准则和 GDPR 当成前提,而不是事后补。

目标客户写得很直白:公共管理、工业、航空航天。翻译过来就是——那些不允许把内部文档发到境外 API 上的机构。

这也是为什么它专门强化德语。官方说 21.3% 的预训练 token 是德语内容,分词器用了自家 UniBPE 算法,处理德语文本比 GPT-5 的分词器少用 11.2% 到 15% 的 token。公司联合创始人 Samuel Weinbach 的说法是:Kolibri 不是”读过一点德语的英语模型”,而是按德语需求定做的。

对国内读者来说,这套逻辑并不陌生——把”自主可控”当卖点,全世界都在讲。

跑分:数学强,工具调用一般,而且是自己跑的

先说清楚:下面全是 Aleph Alpha 自家评测的结果,最高推理档位下跑的。这家公司没有拿第三方榜单来站台。

几个能看的数字:

  • AIME 2026(数学竞赛):96.0
  • GPQA Diamond(研究生级科学题):84.3
  • LiveCodeBench v6(竞争性编程):85.9
  • SWE-Bench Verified(真实仓库改代码):66.4
  • BFCL v4(挑对要调用的工具):61.4
  • Tau2-Bench Telecom(客服场景):94.7

读法很关键。Kolibri 在数学和竞赛编程上很能打,在工具调用和软件工程上只能算中游,官方自己承认这块不如 Qwen3.6。更该注意的一处:同一份材料里更大的对照表显示,稠密的 Qwen3.8 27B 在英文上以 80.2 对 75.5 领先 Kolibri。

所以官方的说法一直不是”我第一”,而是“同等服务成本下质量最好”——一个关于性价比的声明,不是关于天花板的声明。

支撑这个说法的是它给的一组自测:同样跑 26.2 万 token 的长上下文查询,一个 123B 的变体在两张 H100 上只能扛 3 个并发,而 78B 的 Kolibri 能扛 18 个,解码还快 28%。还是那句话,厂商自测,仅供参考。

会主动说”我不知道”

这是我觉得最值得国内同行抄的一段。

Kolibri 的训练里加了两样东西:弃权数据和 Merlin-Arthur 协议。说白了,就是专门教模型”上下文里没有答案时,就说不知道”。

效果在 AA-Omniscience 这个考幻觉的公开测试上:非幻觉率 44.0%,比上一代 Kolibri Origin 的 14.8% 提升很大。

但同一张表里,Qwen3.6-35B-A3B 拿到了 56.7%。所以正确的表述是:这是相对自己上一代的巨大改进,不是对同行的领先。 官方口径审慎,我们也别替它吹。

想跑起来,门槛是 78GB 显存

这类”主权模型”的尴尬就在这儿:它卖的其实是买家的机房。

  • FP8 格式需要约 78GB 显存,大致是一张 H200,或者两张 80GB 的 A100/H100
  • 存储占用也是 78GB 上下
  • 官方给的部署方式是 vLLM 一行命令,带 fp8 缓存和推理/工具解析器;也提供了容器镜像
  • 超过 26.2 万 token 的上下文要手动开参数,把位置编码上限改到 104.8 万
  • 没有公布托管 API 的价格,企业采购得走销售

也就是说,普通开发者想在本机玩玩,基本没戏。想在本地低成本跑开源模型,还是得看 Ollama 和 LM Studio 那一路;如果只是想按需调用,AI 工具评测专题 里有一批现成的 API 方案可以对比。

一条容易被忽略的暗线

Kolibri 发布的时机很微妙:它出现在 Aleph Alpha 与加拿大公司 Cohere 达成合作之后。

这笔 4 月敲定的”跨大西洋主权 AI 合资”协议,被外界普遍解读为对 Aleph Alpha 的事实性收购。于是一个尴尬的问题冒出来了:一家刚被”外资”收入体系的公司,来发布一款主打”没有外国控制”的主权模型,这个叙事还能立得住吗?

Kolibri 就是在回答这个问题。它想证明的是:交易归交易,模型还是在德国境内、按德国法律、在自家管线里造出来的。

影响分析:这门生意卖给谁

第一,欧洲多了一个”可以不选美国云”的选项。 对那些受监管的政府和工业客户来说,选型的起点不是跑分榜,而是”数据能不能出境”。Kolibri 争的是这个位置,不是榜单。

第二,它顺手反驳了一个流行说法。 欧洲常被批评”监管太严、创新被掐死”。Aleph Alpha 的姿态是反过来的:监管不是包袱,是产品特性——合规做进模型里,卖给本来就要为合规付费的客户。

第三,对国内开源生态有参照价值。 站内刚发过 小米 MiMo 那种拼参数、拼榜单的开源路线,也发过 美团 LongCat “参数价格都齐了、验证材料一件没有”。Kolibri 是第三种打法:不争第一,把”产地 + 合规 + 可离线”打包成差异化的商品。 这个思路,做政企市场的团队值得研究,老达 AI 实践专题 里也按主题归档过一批同类选型笔记。

第四,别被”主权”两个字带走。 权重是开放的,但训练数据、训练代码、评测细节都没有完整公开。设备门槛又高。“能自己拿在手里”这句话,成立的前提是你先有一张 H200。

老达点评

第一,这可能是今年最被低估的一类发布。大家习惯了看跑分榜,但企业采购的真实决策链里,”数据不出境”的权重远高于”高出 5 分”。Aleph Alpha 没去争做不到的第一,去争了一个别人不好抢的位置。

第二,“会说我也不知道”这件事,比多拿几分更有意义。幻觉是 Agent 落地的头号杀手,这个月刚有报道说智谱模型的防线被 4400 美元抹掉,说明护栏的可靠性正在成为核心竞争点。把”弃权”当作一项能力去训练,方向是对的。可惜它的绝对水平还没到领先。

第三,77B 只激活 3B,是省钱思路,不是能力思路。稀疏激活让推理成本降到小模型量级,但天花板也跟着降。这跟 Holo4 那种”跑分高的那版不能商用” 提示的是同一件事:读开源模型公告,永远要分清”哪个版本”和”什么条件”。

第四,给国内团队的一句实话:如果做的是政企、工业、涉密这类市场,”产地 + 合规 + 可离线”是有溢价的;但如果做的是通用场景,一个在自家评测里都输给 27B 稠密模型的 78B 模型,暂时不该进你的选型清单。选型要看场景,不是看标签。

参考来源:Aleph Alpha 官方发布说明与技术报告(189 页)、Hugging Face 模型卡、Developers Digest、Velocity Startups、Clay Tribune 等公开报道。文中跑分、并发与成本数字均为厂商自测口径,发布前已逐项复核来源,未采用仅单一低质来源提及的说法。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *