8 月 7 日,马斯克没有失约。xAI 如期发布了 Grok 4.6。
单看规格,这次更新不算大:参数量还是 1.5 万亿,底层架构也没变。真正的变化在训练环节——监督微调(SFT)和强化学习(RL)做了大幅改进,让同一个”大脑”变得更聪明了。
但如果你只盯着参数看,就错过了这次发布最重要的信号。
不是换代,是”加速节点”
Grok 4.6 距离 Grok 4.5 的发布只隔了三周。马斯克在 SpaceX Q2 财报会上宣布这个节奏时,很多人觉得他在画饼。现在饼烙出来了。
更夸张的是,Grok 4.7 已经排上日程——参数直接跳到 2.1 万亿,预计三到四周后发布。xAI 正在把一个行业惯常的”季度发版”压缩成”数周迭代”,节奏快得不正常。
这种速度靠什么支撑?SpaceX 的 Colossus 超级计算集群。目前算力容量约 1.4GW,计划年底突破 2GW。有这种算力底座,频繁训练才有物理可能。
SFT + RL:不是变大,是变准
说回 Grok 4.6 本身。预训练相当于让模型把图书馆的书全读了一遍,而 SFT 是老师拿着标准答案教它怎么答题,RL 是通过反馈机制让它学会什么答案更好。
这次升级的重点就是这两个”教学环节”。前代 Grok 4.5 评测数据不错(SWE-Bench Pro 64.7%),但开发者社区的反馈里有一个扎眼的问题:幻觉率高达 54%,比上代翻了一倍还多。
xAI 这次在 SFT 和 RL 上的投入,直接瞄准的就是可靠性。具体提升了多少幻觉率?官方还没公布独立基准测试数据,但技术路线是对的——用更精细的训练而非更大的规模来解决问题。
价格上,Grok 4.6 保持了 4.5 的定价:输入 $2/百万 token,输出 $6/百万 token。对比 Kimi K3 的 $3/$15,Grok 在输出端便宜了 2.5 倍。对于跑高频 Agent 的团队来说,这个差价是真金白银——老达之前聊过,通过多模型路由合理分配任务是省钱的常用手段,而 Grok 的出现让这个策略又多了一个性价比选项。
API 接入也简单:换一行模型名就行,从 grok-4.5 改成 grok-4.6,其他代码都不用动。
SpaceX 数据:这场竞赛的变量
这次发布里,比 Grok 4.6 本身更值得关注的一件事,是马斯克在财报会上宣布:SpaceX 成立二十多年积累的全部工程数据,将整合进 Grok 的训练体系。
这意味着什么?火箭制造工艺参数、材料科学实验数据、星链硬件设计资料、发射与回收全流程运行记录——这些数据全球没有任何一家 AI 公司能拿到。
打个比方:大多数 AI 模型用的是”公开出版的教材”,Grok 现在开始用”SpaceX 内部的实验报告和车间日志”。前者人人可读,后者独此一家。
受 ITAR(国际武器贸易条例)限制的涉密技术被排除在外,但剩下的部分已经足够建立起一道独特的数据壁垒。在理解复杂物理系统、工程推理这类硬核场景上,Grok 可能会形成其他模型难以复制的优势。
国内前例也验证过这条路:国家能源集团用 1.4 亿千瓦新能源全量运行数据训练的”擎源”大模型,设备预警准确率超 85%,检修时长缩短 60%。专有数据训练的价值是实打实的。
竞争版图:Grok 4.6 在哪一档?
放到当前市场里看:
- Kimi K3(2.8T,月之暗面):Arena AI 前端编程榜第一(1679 分),已开源权重,但 API 价格更贵
- Claude Opus 5(参数未披露,Anthropic):推理和代码能力仍是标杆,价格最高
- GPT-5.6 Sol(参数未披露,OpenAI):综合能力最强的闭源模型之一
- Grok 4.6(1.5T,xAI):最便宜的前沿模型之一,迭代最快
Grok 4.6 在裸跑分上还不一定打得过 Kimi K3(Terminal-Bench 上 4.5 的 64.7% vs K3 的 88.3%),但它打的是另一张牌:价格够低 + 迭代够快 + 数据够独。就像老达在 AI 工具评测专题 中反复强调的,选模型不只是看跑分——成本、速度、稳定性三个维度缺一不可。实际上,DeepSeek V4 Flash 引发的 API 价格战已经证明,当性能差距缩小到一定程度后,价格就会成为决定性因素。
老达点评
Grok 4.6 本身不是一款颠覆性产品,但它背后的三件事值得每一个关心 AI 的人关注。
第一,迭代速度正在重新定义竞争规则。当 OpenAI 和 Anthropic 还在按季度发版时,xAI 已经在用”周”做单位。这不是简单的勤快,是靠算力堆出来的——有 1.4GW 的 Colossus 集群撑着,高频训练才成为可能。其他公司想跟这个节奏,先得搞定算力。
第二,数据护城河比模型参数更重要。SpaceX、Tesla、X 平台——马斯克手里攥着三个维度的独家数据。当所有人都能用差不多的开源数据训练模型时,专用数据的价值会被放大。Grok 的 SpaceX 数据只是个开始,后面还有特斯拉的自动驾驶数据和 X 的社交对话数据。
第三,价格战已经开始,而且会越来越激烈。Grok 4.6 输出价格只有 Kimi K3 的 40%,Claude Opus 5 的零头。对用户来说,这是一个信号:前沿模型的推理成本还在快速下降,选择越来越多。
不过话说回来,xAI 的”周更”节奏也让人有点担心。三周一个大版本,测试够不够充分?Grok 4.5 的 54% 幻觉率还没完全解决,就急匆匆上 4.6,4.7 又在路上了。速度和质量之间的平衡,是 xAI 接下来必须回答的问题。
参考来源:xAI 官方公告、SpaceX 2026 Q2 财报、马斯克 X 平台发言、Artificial Analysis、Byteiota 等综合报道。