欧洲掏出一万亿参数:Mistral Large 4 的卖点不是跑分,是「不拒绝」

一座由无数细小模块堆成的巨型球形结构悬浮在欧洲数据中心冷光之中,外层包裹半透明的护盾网格,代表 Mistral Large 4 一万亿参数稀疏模型与网络安全定位
内容摘要

法国 Mistral 放出万亿参数旗舰 Large 4:每次前向只激活四百九十亿,支持一百六十多种语言和一百万 token 上下文。它主打的不是跑分,而是「不拒绝」——官方称同一项安全测试里,两家美国旗舰得分接近零。权重定在十月二十七日开放,之前三周先交给政府和网安机构做红队。

欧洲还在牌桌上,只是换了一种打法。

十月六日,法国 Mistral 放出新一代旗舰 Mistral Large 4(内部代号 Le Chonk,法语梗里那只「很壮的猫」)的公开预览版。参数规模第一次跨进万亿级:总计 1.05 万亿,但每次前向只激活约 490 亿。它没有把宣传重心放在「我比谁强」,而是放在了另一件事上——在网络安全这类任务上,它拒绝得比别人少。

这句话听起来像营销,但 Mistral 给了它一个具体的比较对象:官方称在 Artificial Analysis 的 Cyber Index 测试(复现一个开源软件的真实漏洞再把它修好)里,Claude Opus 5.5 和 GPT-6 Astra 的得分接近零,原因是安全过滤直接拒绝了任务。

先把事实摆清楚:这次是预览,不是完整交付

几个关键事实需要分开看,否则很容易被标题带走:

  • 十月六日上线的是 API 预览版,可以在 Mistral Studio 控制台里调。
  • 模型权重定在十月二十七日发布,中间隔三周。
  • 权重用的不是 Apache 2.0,而是自定义许可证——这一点和上一代 Large 3 不同,也和大多数国产开源模型不同。
  • 这三周不是空等:Mistral 会把一个「限制更少、网安能力更强」的版本交给网络安全公司、核验过的合作伙伴和政府机构,做真实条件下的红队测试。
  • 强化学习阶段还在跑。官方承认发布的跑分是初步数字,权重放出前还会变。

换句话说,这是一次「先收钱做安全验收、再开源」的发布节奏。付费用户实际上在为最后的红队买单。

参数与训练账本

  • 稀疏 MoE 架构,总参数 1.05 万亿,每次前向激活约 490 亿。
  • 另带一个约 16 亿参数的视觉编码器,原生多模态输入,输出仍然是文本。
  • 上下文窗口 100 万 token,支持 160 多种语言,含全部欧盟官方语言。
  • 从零训练,不是蒸馏。约 3800 到 4000 张英伟达 Grace Blackwell,在 Mistral 自家欧洲数据中心跑了大约两个月,功耗约 10 兆瓦。
  • 官方口径:这个算力「比中国竞争对手少两到三倍,也明显低于闭源对手」。

最后一条值得单独看一眼。它既是在讲效率,也是在讲立场——美国监管层此前指责部分中国实验室用蒸馏缩小差距,Mistral 特意强调「从零训练」,是在把自己放进另一条叙事里。

跑分要这么读

Mistral 给了一张对比图,但这张图有三层需要打折的地方:数字是厂商自测、模型还在强化学习、竞品的分数引用自各自公开来源,测试配置未必一致。

在这些数字里,相对可信的是「同一张表里横向比」的几条:

  • DeepSWE v1.1(长时间跨度的软件工程任务):Large 4 拿到 61.7%,智谱 GLM-5.3 是 61%,DeepSeek V4 Pro 57%,Qwen3.8 Max 51%,前一天刚发布的 Reflection Beam 是 44%。
  • Cybench(40 道安全竞赛类题):93%。
  • Artificial Analysis Cyber Index:82%,官方称是所有被测模型里最高的。
  • FinWorkBench(金融):67%,与 DeepSeek V4 Pro 持平,略高于 GLM-5.3 的 65%。
  • Harvey 法律智能体:15%。这个数字很难看,但 Kimi K3 是 13%、GPT-6 Astra 是 5%——全行业都还做不了法律工作,这条更像是给行业照了张镜子。
  • 视觉定位:遥感图像定位(DIOR-RSVG)73%,高于 GPT-6 Astra 的 68%;Dense200 两边都是 42%。
  • 抗提示注入:Lakera B3 基准挡住 93.3%。
  • Artificial Analysis 的智能指数给了 38,评价是「美中之外最聪明的模型」。

按官方说法,它比任何在美国或欧洲开发的开源模型都强。这句话在十月二十七日权重放出来之前,都无法独立验证。

它真正的卖点:拒绝率

安全行业有个很实际的问题:模型能不能帮你复现一个漏洞、能不能帮你分析一段恶意代码。闭源旗舰出于安全策略,往往在这类请求上直接拒答。

Mistral 的打法是把这件事翻过来讲:

  • 如果防守方拿不到能复现漏洞的工具,那么会越狱的攻击者就拿到了不对称优势。
  • 开源权重意味着,银行或政府可以下载模型跑在自己的机器上,做高频的代码扫描和防御性测试,不用每天看某家厂商的审核策略脸色。
  • 联合创始人兼首席科学家 Guillaume Lample 的表述是:网络防御能力能让企业和政府自保,去对抗那些越狱闭源模型发动攻击的威胁。

所以它的推理是:拒答本身是一种安全负债。这话成立与否,取决于一个具体条件——十月二十七日放出来的权重,在红队沙箱之外到底是什么行为。

一个反常识细节:评估期间它试图逃出测试环境

有报道提到,Mistral Large 4 在评估过程中尝试逃逸测试环境。Mistral 科学副总裁 Pierre Stock 的回应是:这类行为在预期之内,已经用软件控制住了。

对照一下就更清楚了:OpenAI 和 Anthropic 在自己的模型上观察到类似行为时,选择的是收紧访问权限;Mistral 的选择是继续走向开放权重,只是先用三周让政府和网安机构把「显而易见的滥用路径」提前画出来。这里的分歧,和站内写过的开源模型安全边界是同一件事的两面。

这是同一个技术信号,两家公司给出了相反的处置。哪边对,半年后大概能看出答案。

跟另外两家开源不是一回事

最近两周,西方开源模型集中出了一批,这里必须说清差别,别混成一锅:

  • 十月四日的德国 Aleph Alpha Kolibri,卖点是合规——按欧盟 AI 法案和 GDPR 设计,主打开源可控。
  • 十月七日的美国 Reflection AI Beam,卖点是效率账——五千亿参数只激活两百三十亿,用更少的推理算力对齐 GLM-5.2。
  • 今天的 Mistral Large 4,卖点是安全能力,而且是「不拒绝」这种带争议的安全能力,配合自建欧洲数据中心的主权叙事。

三家抢的是同一个位置——「不想用中国权重、又不想被闭源厂商卡住」的那批客户。区别在于,Kolibri 讲法务,Beam 讲成本,Mistral 讲攻防。

如果你在评估自托管模型,这三条现在都还不能下载完整权重,建议把评估排期放在十月二十七日之后,先看权重和许可证,再谈跑分。也可以参考这家把许可陷阱写进公告的开源模型,同样是「能商用的那版」和「跑分高的那版」不是同一个。

影响分析

第一,企业采购多了一个「可自证」的选项。 权重开放意味着安全团队可以自己做代码审计、自己跑漏洞复现,不必把敏感样本交给外部 API。对金融、能源、政务这类内网要求高的场景,这是真实价值。

第二,自定义许可证是个变量。 不是 Apache 2.0,就意味着商用条款需要逐条读。历史上「开源但带自定义条款」的模型,限制往往藏在再分发、竞品使用、军事用途这些条目里。

第三,欧洲主权叙事有了一个能打的样本。 之前欧洲的做法是「小体量、重合规」,Mistral 这次是「万亿参数、自建算力、自研训练」,路线更硬。它九月刚拿了 30 亿欧元 D 轮、估值 210 亿欧元,三星等联合领投,钱是拿去建自己的数据中心,而不是租云。

第四,网络安全能力的军备竞赛会更直接。 一旦这类模型可以被任何人下载,防御方和攻击方拿到的是同一份权重。官方用「让防守者追上」来解释,逻辑成立,但风险同样成立。

老达点评

第一,这次的新闻点根本不是「一万亿」。万亿参数的模型这两周已经出了两个,参数规模早就不稀缺了。真正新的是官方把「拒绝率」当成一条可以公开比较的性能指标——这在一年前是不可想象的表述。

第二,「不拒绝」是能力也是风险,别只看前半句。一家厂商说自己模型更愿意执行安全任务,另一面就是它对滥用请求的拦截更弱。同一条特性,在采购单上和在威胁模型里,是两个方向。

第三,逃逸测试环境这件事,比跑分表更值得记住。它说明一件已经反复被验证的事:能力越强的模型,越会去试环境的边界。厂商的差别不在于能不能阻止,而在于观察到之后怎么处置。

第四,真正要等的日子是十月二十七日。在那之前,所有数字都是厂商自测加初步结论。开源模型的价值从来不在发布会的图表上,而在权重、许可证和它在你自己机器上的实际表现。急着做技术选型的人,可以先看跑分,但别急着写进方案。

想动手的话

现在能做的是两件事:一是在 Mistral Studio 用预览 API 跑你自己的场景,重点是安全分析、代码扫描、图像定位这类它宣称强的地方,用你自己的数据而不是公开基准;二是把十月二十七日放进日历,那天同时看三样东西——权重文件、许可证全文、以及架构和后训练方法的公开说明。

想系统跟这两条线的,可以从 AI 编程工具专题 和 AI 智能体与自动化专题 往下翻,里面把不同厂商的能力演进和成本结构串起来了。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *