美国当地时间 9 月 21 日,马斯克旗下的 xAI(官方渠道现在挂的是 SpaceXAI 品牌)正式发布新一代旗舰模型 Grok 4.7。中文媒体第二天跟进时给出的标题都很实在:跑分超过了上一代,但仍够不到第一梯队。
官方的卖点只有一句话——同样的价格,同样的速度,更强的性能。输入每百万 token 2 美元、输出 6 美元,与 Grok 4.6 一模一样。
但独立测试把这句话拆开之后,故事变复杂了:token 单价确实没变,可干完同一件活儿的总账,反而变贵了。
一、这次到底改了什么
按官方发布说明和中文媒体的转述,Grok 4.7 的变化集中在三处:
- 基座换大。参数量从前代的 1.5 万亿提升到约 2.1 万亿,涨幅约四成。这是 xAI 目前参数量最大的模型。
- 训练重心挪到长任务。强化学习训练时长拉长,训练数据的加权偏向”需要数小时才能完成的工作”,同时专门优化了自我校验和长上下文管理能力。
- 原生适配自家 harness。模型在训练阶段就针对 Grok Bot 这套 Agent 框架做了原生理解,官方称在对话、通用知识工作、文档与演示文稿生成上的表现都有改善。
发布时间也值得一提:据中文媒体报道,xAI 此前至少推迟了五次,这次的发布被不少海外科技媒体形容成”一场反响平平的晚到派对”。
价格结构是这样的(每百万 token):
- 提示词在 20 万 token 以内:输入 2 美元、缓存输入 0.50 美元、输出 6 美元
- 提示词达到或超过 20 万 token:输入 4 美元、缓存输入 1 美元、输出 12 美元,并且整单请求都按高档计费
- 高速版(Grok 4.7 Fast):输出速度翻倍,价格同步翻倍到 4 美元 / 12 美元,目前出现在 Cursor 和 Grok Build 里
- 上下文 50 万 token,文本加图片输入、文本输出,推理档位有 low / medium / high / xhigh 四档,默认 high
上线渠道是 Cursor、Grok Build、Grok API,以及第三方编程工具框架、模型路由和主流云平台。
二、跑分:官方数字和第三方数字差在哪
Grok 4.7 的官方对比表,几乎全面盖过上一代:
- CursorBench 4.0:46.3%,上一代 40.4%
- DeepSWE v1.1(high 档):71.0%,上一代 65.2%
- Terminal-Bench 4.0:38.0%,上一代 20.3%——单项涨了近 18 个点,是这轮最亮眼的数字
- EEBench 电气工程:64.0%,上一代 53.0%
- AA Briefcase v1.1(多小时办公任务):1657 分
- Harvey 法律 Agent 基准:19.6%
独立机构 Artificial Analysis 给出的智能指数是 46 分。参照系是:Grok 4.6 是 44 分,而 Claude Fable 5.1 和 GPT-6 Astra 都是 53 分。也就是说,综合智能只涨了 2 分,单模型排在第 16 名。
马斯克在 X 上喊的是”智能体编程第三把交椅”。这个第三名来自另一张榜:把 Grok 4.7 套上 Grok Build 框架后,Coding Agent Index 拿到 56 分,排在 Fable 5.1、GPT-6 Astra 和 Opus 5 之后——有中文媒体直接点出,这个”第三”是把 Anthropic 的两个模型归成了一家。
更有意思的是 Terminal-Bench 4.0 上的口径分歧。官方报的是 38.0%(xhigh 档、配 Grok Build),中文媒体对照后认为它只略高于 GPT-5.6 Sol Max 的 37.3%,远低于 Fable 5.1 的 57.9%;而另一篇分析则指出,换到统一基准后这个数字会掉到 26% 到 27%。同一个模型、同一个基准名,报出来的差距接近一倍,原因就是推理档位和评测框架不一样。
反向的榜单也有。评测机构 ValsAI 上,Grok 4.7 从上一代的第 14 名掉到第 24 名,比 Grok 4.6 还倒挂 5 分。
所以看这轮跑分,结论应该是:Grok 4.7 在”长时程编程与知识工作”上确实有实打实的进步,但它并没有跨进第一梯队,而各家报出来的数字需要先确认测试条件才能比较。
三、单价没涨,为什么每件活儿更贵了
这才是这篇文章真正想讲的部分。
同一家机构在标准智能指数上测了每个任务消耗的输出 token 数:
- Grok 4.7 在最高推理档位下,每个任务约消耗 8.1 万个输出 token
- Grok 4.6 约 3.6 万个
- 对照的 OpenAI 主力模型约 2.7 万个
也就是比上一代多用约 125% 的输出 token,接近对照模型的 3 倍。token 单价不变,输出量翻倍多,账单自然跟着涨:
- 在相同推理档位下,跑完一道基准题的实测成本从 Grok 4.6 的 1.86 美元升到 2.73 美元,涨了约 47%
- 换到官方发布数字所用的最高档位,单任务成本大约翻倍;有一项测试里,生成一份演示文稿花了约 8 美元,上一代同样任务是 4.40 美元
- 最高档位还有一个副作用:输出速度掉到每分钟不足 40 token,而智能指数上的分数和高档位完全一样——又慢又贵,分数没动
再叠加上面提到的 20 万 token 门槛:一旦提示词长度越过这条线,整个请求改按 4 美元 / 12 美元计费,而长任务恰恰最容易越线。
这跟一个多月前那篇《OpenAI 首次给旗舰模型降价超 20%》里的判断是同一个方向:现在真正该比的不是单价,而是每件活儿的总花费。9 月 22 日两家前沿实验室同日降价,打的也是这张牌(《OpenAI 和 Anthropic 同日降价》);再往前,阶跃星辰把单任务成本压到 Opus 5 的八分之一(《Step 5 Preview 开放》),走的也是同一条路。
四、安全条款这次给得比较具体
xAI 沿用了一套新的防护体系,官方说法是拒答和抗越狱达到内部测试最好水平。两处数字比较少见公开:
- LatchBio 生物安全基准:62.4 分
- HackerBench v0.3 网络安全测试:只有 3.3% 的高风险双重用途提示被放行,同时”较少阻止合法的安全工作”
公司还向部分网络安全合作伙伴开放了邀请制访问,用于红队和防御研究。对比同月 OpenAI 主动披露六起模型错位案例(《OpenAI 自曝六起模型失控案例》),”拒答率”这种指标开始被摆到发布说明里,是个值得留意的变化。
五、老达点评
一、”同价升级”这四个字,得看是哪种同价。 单价不变、参数量涨四成、跑分涨 2 分、单任务成本涨 47%,这四个数字放一起才是完整的发布说明。以后再看任何模型宣称”价格不变性能提升”,第一件事应该是查它的输出 token 消耗,而不是看单价表。
二、xhigh 档这次更像是营销档,不像是干活档。 分数一样、速度掉到不足 40 token/s、成本翻倍——这个组合说明在很多任务上多花钱买不到东西。除非你的任务明确需要极限推理,否则 high 档就是性价比拐点。
三、它的定位其实很清楚:量大、活糙、预算敏感。 2 美元 / 6 美元的价位大约是 GPT-6 Astra 和 Fable 5.1 的四分之一,法律和电气工程这类专业场景上成绩相当能打。如果你的流水线是每天几百次短任务,它比第一梯队划算;如果是长上下文 Agent 循环,先把账算清楚。
六、上手别踩的三个坑
第一步:拿自己的任务跑对照,别用官方跑分表选型。 同一个 prompt,分别在 high 和 xhigh 下各跑一遍,比较通过率和总消耗。多数情况下你会发现自己根本不需要 xhigh。这也是《Cognition 发布 SWE-2》那篇文章里提过的做法——成本惩罚只有放在自己的评测集里才看得出真实差别。
第二步:盯 output token,而不是单价。 如果用的是统一路由层,记得把输出 token 单独统计出来。Grok 4.7 的问题不在价格表上,而在那里。
第三步:控制上下文长度。 20 万 token 是一条硬门槛,越线后整单按高档重计费。长任务建议拆成多个会话、把历史压缩成摘要再喂回去,这跟《Kimi Code 桌面版上线》里提到的权限分档思路是一回事:把可控项提前固定住,别让账单替你做决定。
Grok 4.7 之后,xAI 的下一代模型 Grok 4.8 据说已经训练完成,体量约 2.5 万亿。上一代那篇《Grok 4.6 正式发布》提过 xAI 进入”周更”节奏,一年前那条”15 秒搭好一个应用”的 Grok Bot 路线(《Grok Bot 硅谷爆火》)也还在延续。想持续跟这条线,可以看站内的 AI 编程工具专题 和 AI 智能体与自动化专题。