8 月 20 日,全球最大的 AI 聚合平台 OpenRouter 上,悄悄多了一个没有名字的模型:stealth/ox-alpha。
没有发布会、没有团队署名、没有介绍文档。它只挂着三行信息:免费试用一周,支持文本、图像和视频输入,上下文窗口 104.8 万 token。结果开发者们测完就炸了——10 项 DeepSWE 编程测试,它跑分约 80%,把 Claude Fable 5(65%)、GLM-5.3(62%)、Grok 4.6(62%)和 GPT-5.6 Sol(52%)全甩在了后面。
更吊诡的是身份。独立研究员 Ben Davis 在 X 上放话:他”99% 确定”这个匿名模型是智谱还没发布的 GLM-5.x 旗舰。一个不署名的模型,凭什么碾压各家旗舰?这背后到底是怎么回事?
一、事件始末:一个没有名字的模型,悄悄登顶编程榜
先还原时间线。8 月 20 日,stealth/ox-alpha 上线 OpenRouter,预览期免费,大约持续到 8 月 27 日,期间零数据保留。规格相当能打:上下文窗口 1,048,576 token(约 104.8 万),最大输出 131,072 token,多模态输入(文本、图像、视频都支持)。独立分析推测其架构约为 7440 亿总参数、400 亿活跃参数的 MoE(混合专家)模型。
它不止出现在 OpenRouter。终端编程智能体 OpenCode 也把它接进了免费套餐,声称每日可处理 100 万亿 token。
真正引爆讨论的是跑分。开发者 Ben Davis 让 ox-alpha 完成了 DeepSWE 的十项测试任务——这个基准衡量的是 AI 读取真实代码库、识别漏洞并生成有效补丁的能力。结果:ox-alpha 平均约 80%,Claude Fable 5(max)65%,GLM-5.3(max)62%,Grok 4.6(xhigh)62%,GPT-5.6 Sol(max)只有 52%。Davis 自己都说,鉴于模型来源不明,这个结果让他困惑不解。OpenRouter 这个词大家应该不陌生,之前 Stripe 拟收购 OpenRouter 的新闻里聊过它在开发者生态里的位置。
二、80% 的跑分,含金量到底几何
冷静一下。这个被反复传播的 80%,要打两个折扣。
第一,它来自 10 项任务的小样本用户测试,不是官方审核的榜单跑分。截至 8 月 21 日,DeepSWE 的公开榜单 BenchSift 并没有收录 ox-alpha——样本量太小,方差极大。诚实的解读是:ox-alpha 的编程能力处于前沿水平,但”确定碾压 GPT-5.6″这种结论还为时过早。第三方测试里它的表现也有差异,比如 Kingbench 上得分约 87.5%。
第二,即便如此,一个来历不明的模型能在这个量级的测试里跑出这个成绩,本身就说明问题。它至少是”前沿档位”的选手,而不是来凑热闹的。想理解 80% 和 52% 这种差距意味着什么,可以参考之前写过的智谱 GLM-5.3 上线——GLM-5.3 在网络安全基准 CyberGym 上拿到 84.5% 时,就已经是当时开源模型的天花板了。
三、身份之谜:为什么 99% 指向智谱
说回最精彩的部分:怎么查一个匿名模型的身世?
Ben Davis 的溯源逻辑主要靠三层指纹。第一层是视频编码器——也是最有力的证据:在四组受控视频测试中,ox-alpha 与智谱 GLM-5V-Turbo 的 video token 消耗完全一致,都呈现三个相同特征:帧率无关的帧采样方式、约每秒 147 token 的时长缩放比例、逐帧分辨率缩放机制。而小米 MiMo v2.5、Qwen 3.8 Max、GLM-4.6V 等候选模型都表现出明显不同的编码特征。
第二层是分词器指纹。通过对 25 个提示词做分析,发现 ox-alpha 的 token 数量与 GLM-5.3 几乎完全吻合,只存在恒定 75 个 token 的包装层偏差——这种一致性几乎不可能是巧合。第三层是行为特征:输出风格、音频拒绝行为等也与智谱架构高度吻合。
综合下来,Davis 说”99% 确定”,并排除了 MiMo、DeepSeek、微软 MAI 等其他猜测。智谱目前没有官方回应——但这反而让事情更有意思:8 月 28 日智谱计划发布 GLM-5.3 开放权重,如果 ox-alpha 真是 GLM-5.x 的续作,那等于在正式发布前,全世界已经帮它做了一周的”匿名公测”。智谱的另一款产品 ZCode 用户刚破百万,ZCode 的 Goal 模式 + 子智能体已经在 AI 编程上趟出一条路,这套模型储备是连贯的。
四、匿名上线,正在成为行业新玩法
把视角拉远一点:匿名上线 OpenRouter 做免费公测,正在成为一种”标准前戏”。
逻辑其实很朴素。一个免费的、不带品牌的前沿模型,会被开发者测得更狠、更诚实——没人给发布会面子,跑分好就是好,翻车就翻车。对厂商来说,这比任何宣传稿都靠谱,还能在正式发布前收集真实反馈、试探市场反应。智谱之前也用过类似的手法,行业里对这种”stealth 发布”已经见怪不怪。
对开发者来说,这反而是件好事:预览期免费,你可以直接用真实任务去验货,不用等官方口径。顺便说一句,这类”匿名模型”也会对大模型 API 的价格与选择格局产生微妙影响——免费前沿算力每多一个,开发者手里就多一张牌。
五、老达点评:数字要等官方,趋势已经很明显
我的看法分两层。
第一层,关于 ox-alpha 本身:在智谱官方确认之前,别把 80% 当成定论,但也别因为”小样本”就全盘否定——能在多模态 + 104.8 万上下文 + 前沿编程跑分上同时站住,这个模型的下限已经不低。真正该等的是 8 月 28 日 GLM-5.3 开放权重发布,以及后续有没有更正式的榜单收录。
第二层,关于这件事的意义:一个国产模型,敢不署名就上场跟 Claude、GPT 的旗舰正面碰,还能不落下风——这本身就是个信号。2026 年的模型竞争,已经从”开发布会拼参数”卷到了”匿名上线拼真实跑分”。开源和闭源的边界也在被这种玩法重新定义。对关注 AI 编程的朋友,AI编程工具专题和AI工具评测专题会持续跟踪这条线,有新进展我会第一时间更新。