每生成一个 token,这台模型只叫醒 6000 亿参数里的 270 亿——激活比例 4.5%,其余参数待在原地等下一句。
9 月 20 日,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,定位是「面向真实世界 Agentic 任务的旗舰基座模型」。官网的上一次更新还停在 Step 3.7 Flash,这次直接跳到 5。发布第二天,API 和 Studio 全量开放,10 月 15 日将释放模型权重。
先说规格:600B 总参数,每次只叫醒 27B
几个关键参数:
- 架构:稀疏 MoE,总参数 600B,激活参数仅 27B
- 上下文:100 万 Token
- 输入模态:原生支持文本与视觉(官方文档的规格表里写的是文本、图片、视频)
- 技术细节:92 层「窄而深」设计,Sparse GQA 配合 block-wise token merging,把 Indexer 成本压到原来的 1/8
- 模型 ID:
step-5-preview - 价格:输入 ¥7 / 输出 ¥20 / 缓存命中 ¥0.35,每百万 token
- 开源:10 月 15 日释放完整权重
官方给它的定位很明确:不是「回答问题」的问答模型,而是「完成任务」的主力工作模型,重点覆盖需要长上下文、多轮工具调用和持续执行的场景——AI 编程、软件工程、专业知识工作、金融。
44 分和 0.71 美元:这两个数字怎么来的
在第三方机构 Artificial Analysis 的智能指数(Intelligence Index v4.3,含 10 项评测)上,Step 5 Preview 拿到 44 分,官方说法是跻身全球开源模型前三。横向对照:
- Claude Fable 5(max)和 GPT-6 Astra 53 分
- Claude Opus 5(max)51 分
- GLM-5.3(max)45 分
- Kimi K3(max)44 分
- 阶跃 Step 5 Preview 44 分
分数不是最扎眼的,价格才是。按 Artificial Analysis 的口径,它跑一道题 0.71 美元;而比它高 7 分的 Claude Opus 5 要 5.86 美元,正好是它的 8 倍多;比它高 1 分的 GLM-5.3 要 2.01 美元,也贵了约 2.8 倍。
不过这个 0.71 美元要看清楚是怎么算出来的:它每题平均输出 6.4 万个 token,跑完整套智能指数一共生成 1.6 亿个输出 token,而中位数是 9200 万。Artificial Analysis 把它的冗长度评为满分 4/4,页面上直接写的是「very verbose」。换句话说,这 0.71 美元是按它自己很啰嗦的用量算出来的——便宜,但便宜的幅度和输出的啰嗦程度绑在一起。
24 小时那条曲线:它自己改代码、跑测试、比结果
官方放了一条长任务曲线,这是整次发布里最值得看的部分。
实验是这样的:给 Step 5 Preview 24 小时,在一张 NVIDIA H100 上从零开始优化一个 MLA GPU 内核(头维度 512,生产配置 batch size 1、64 个注意力头、8192 token)。模型自己实现修改、运行内核、测量吞吐量;某个候选方案能跑通但吞吐下降,它会放弃并回到此前找到的最佳版本继续。
结果:经过约 22 小时,峰值性能提升到 508 TFLOPS(前向加反向),超过 Claude Opus 5 的 493 TFLOPS。同一张图上,Kimi K3 是 307,GLM-5.3 是 286。
另一个更安静但可能更有价值的实验:同样给 24 小时做自动后训练,模型自己决定怎么用标注 API、怎么调整训练数据,把 Qwen3-30B-A3B 基础模型在 AIME24 上的准确率从 53.3% 提升到 60%,与 Claude Opus 5 持平,且消耗的标注 token 更少。
还有一个不太正经的测试——让它玩《宝可梦 红》:3093 个回合、接近 629 万 token,打到第三个道馆徽章。
这里必须踩一脚刹车:以上全部来自厂商自述,没有第三方复现。那张曲线能说明的是它连续二十多小时在改代码、跑测试、比结果,不能说明它是第一个做到这件事的模型。
怎么用:接入方式和档位
如果你打算试,路径很直接:
- API 接入:国内走 platform.stepfun.com,国外走 platform.stepfun.ai,模型 ID 填
step-5-preview - 先白嫖再决定:Studio 平台 studio.stepfun.com 可以在线体验;官方还在做新用户活动——注册送 99 元包,登录再送 15 天,首次调用后再送 15 天,邀请好友注册每人加 15 天,最多累计 45 天,合起来最长能免费用 75 天
- 按档位选:模型有 low / high / max 多档,日常批量任务用低档压成本,复杂软件工程和长程规划再切高档
- 等开源再自托管:想私有化部署的,10 月 15 日之后再看权重
短板也要说清楚
便宜不等于全都好。几个明显的短板:
- Terminal-Bench v4 只有 33.3%。这项是它输得最明显的:GLM-5.3 是 41.9%,Opus 5 是 52.3%,它只赢了 Kimi K3 的 12.6%。
- 软件工程不是碾压,是贴身。官方自己的 DeepSWE v1.1 上它拿 67.7%,Kimi K3 67.5%,GLM-5.3 66.9%——基本是并排站;而闭源的 GPT-6 Astra 是 74.1%,Opus 5 是 74.0%,仍有明显一档差距。
- 自家的 StepCodeBench 要打折看。这项它拿 49.0%,开源模型里最高(Kimi K3 43.9%、GLM-5.3 40.2%),但题目是阶跃自己出的,参考价值有限。
- 冗长是隐性成本。输出啰嗦意味着同样的任务烧更多 token,成本优势会被吃掉一部分。
- 速度一般。第三方实测大约 100 token/s,已经有人反馈「实际使用速度不算快」,如果免费用户继续增多,速度可能还会下滑。
- 对比表不是同机同天重跑。官方那张横评表下有一行小字:对手分数取的是各家公开结果。
- 「开源」目前还是预告。今天能用的只有 API 和 Studio,权重一个字节都还没放出来;Artificial Analysis 的模型页在发稿时仍把它归在「专有模型」一栏。
谁适合用,谁可以先等等
适合先用起来的人:
- 跑长周期 Agent 任务、经常被上下文长度卡住的团队
- 成本敏感的大批量任务(分类、抽取、结构化、日常代码修改)
- 需要「一个模型既读文档又读截图」的多模态场景
- 想找一个能对标 Kimi K3 但账单更低的国产主力模型
建议先等等的人:
- 必须自托管、必须私有化部署的——等 10 月 15 日权重落地
- 对延迟极敏感的在线交互场景
- 强依赖终端操作的 CI 流水线(Terminal-Bench 那项确实偏弱)
替代方案对照:预算优先看 DeepSeek V4.1 Flash,上下文和生态优先看 Kimi K2.8,要闭源旗舰能力就还是 Claude Opus 5 / GPT-6 Astra。
站内这几篇可以配合着读:Kimi K2.8 Preview 全量上线讲的是百万上下文普惠的路子,DeepSeek V4.1 Flash 讲的是架构级降本(KV 缓存砍到 1/4),Cognition SWE-2 则是把「成本战」写在了脸上——跟 Fable 5.1 只差 0.9 分,价格便宜 64%。
老达点评
第一,这一轮竞争的关键词是「每块钱买到多少智能」,不是「谁分数最高」。 阶跃自己把话说明白了:过去 Scaling 的核心是用更多计算换更强智能,成本被同步放大;下一阶段的重点是提升计算转化为智能的效率。从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,三代模型都在追同一个问题。这个判断是对的,而且对整个行业都比「又刷了个榜」有意义。
第二,0.71 美元这个数字要连冗长度一起读。 同一套评测跑完,Opus 5 花了 7274.74 美元,它花了 922.84 美元——差距确实存在,但它是靠「输出啰嗦 + 单价低」两个因素共同压出来的。真正的成本要按你自己的任务重新算:如果你的任务本来就要求长输出,它的优势会缩水;如果是短输出高频调用,缓存命中再打个 95% 折扣,优势会放大。别拿别人的榜单单价做自己的预算。
第三,厂商自述的 24 小时曲线,价值在方法而不在数字。 22 小时 508 TFLOPS 超过 Opus 5 的 493,这个数字没有第三方复现,现在下结论太早。但「给模型一个可测量的目标、让它自己改代码跑测试比结果、并在退步时回滚到最佳版本」这套长任务闭环,是任何团队都能抄的作业。对比一下站内Anthropic 的研发自动化指数——那边披露的是「Claude 主导了 26% 的研发工作、约 3 万 Agent 同时在线」,这边是「模型自己把承载自己的内核优化了 22 小时」,两条线指向的是同一件事:Agent 开始接手优化工作本身。这条线怎么设边界、怎么留人工把关,我在智谱押注 RSI 那篇里已经聊过了,逻辑同样适用。
第四,「10 月 15 日开源」这句话,现在还不能当既成事实用。 愿意等权重的可以等,但别把「即将开源」写进你的技术选型文档当确定项。真要压方案,就把日期当成一个待验证的里程碑:到那天权重真放出来、许可证真友好、推理真能跑起来,再谈替换。
想继续跟国产模型的性价比这条线,AI 编程工具专题收的是工具层的更新,AI 智能体与自动化专题收的是长任务和 Agent 编排的实战,两条线配合看更完整。