字节跳动联手清华放出 CUDA Agent:AI 自己写 GPU 底层算子,跑赢编译器 2.11 倍

发光的 GPU 芯片与代码流,测速仪表盘表示跑赢编译器,象征 AI 自己优化底层算子
内容摘要

字节跳动 Seed 联手清华 AIR 发布 CUDA Agent,用强化学习让大模型自己写 GPU 底层算子,在 KernelBench 上 96.8% 跑赢 torch.compile、平均提速 2.11 倍,比 Claude、Gemini 高约 40 分。本文拆解它怎么做到、开源了什么、对开发者意味着什么。

AI 写代码这件事,这两年早被聊烂了。Claude Code、Codex、Cursor 一个比一个能写,但你要是真拿它们去碰 GPU 上那层底层算子——CUDA kernel,会发现一个尴尬的现实:它们能把代码写对,却未必能把代码写快。很多时候,模型生成的 kernel 语法完全正确,一跑起来,反而比编译器自己生成的结果还慢。

8 月 18 日,字节跳动 Seed 团队和清华大学 AIR(智能产业研究院)联合放出了一套叫 CUDA Agent 的系统,专治这个「能写对、写不快」的毛病。他们用强化学习,把大模型关进一个真实的 CUDA 开发环境里,逼它一遍遍 profile、编译、调优,直到写出来的 kernel 稳定跑赢 torch.compile。

一、问题出在哪:能写对,不代表能写快

先看一组数字,很能说明问题。

字节自家的基座模型 Seed1.6,在 KernelBench 这个 250 题的 GPU kernel 基准上,正确率是 74.0%。看着不低对吧?但把「跑得比 torch.compile 快」当成标准再筛一遍,就只剩 27.2% 了。更狠的是几何平均速度:0.69×,意思是它写的 kernel 平均比编译器慢了三成。

写对和写快,是两码事。编译器干了几十年的活,就是「把通用代码翻译成跑得快的机器码」,这个基本功,单靠大模型背代码样本,短期还真追不上。

二、CUDA Agent 的做法:把模型关进「编译车间」

CUDA Agent 没有走「喂更多正确代码」的老路,而是换了个思路:让模型在真实环境里自己折腾。

具体是这么个循环。模型被放进一个带性能分析工具、正确性校验、权限锁定沙盒的 CUDA 开发环境,按照一份 SKILL.md 规范干活:先 profile 一遍 PyTorch 模型,重写 model_new.py 塞进自定义 kernel,在 GPU 沙盒里编译,再迭代,直到 kernel 比 torch.compile 快 5% 以上为止。

这套流程用的是 OpenHands 风格的工具链,ReAct 模式,可以跑 Bash、读写文件、搜代码、看 notebook 输出。训练上走 PPO,150 步,131072 token 的上下文。说白了,就是让模型像个人一样「写完——测——发现慢——改——再测」。

三、真正的功夫在奖励设计:离散里程碑奖励

这套系统最值得细看的地方,不是模型多大,而是奖励怎么给。

他们没有用「速度越快奖励越高」这种连续奖励,而是用离散里程碑:−1 代表正确性失败;3 代表比 eager 和 torch.compile 都快 5% 以上;2 代表只比 eager 快;其余是 1。奖励卡在几个关键节点上,模型就知道往哪使劲。

为了防止模型「作弊拿高分」,他们上了五重约束:校验和 profile 脚本权限锁定、禁止 torch.nn.functional 兜底、五组随机输入交叉验证、profile 带预热和设备同步、不给联网搜索工具。

消融实验最能说明这套设计的分量:去掉 agent 循环,跑赢编译器的比例从 96.8% 直接掉到 14.1%;换成原始速度比奖励,也只有 60.4%。也就是说,奖励设计带来的提升,比堆模型规模更值钱。

四、结果:平均提速 2.11 倍,比 Claude、Gemini 高 40 分

最终成绩单相当亮眼:

  • 250 题总通过率 98.8%;
  • 96.8% 的 kernel 跑赢 torch.compile;
  • 几何平均提速 2.11 倍。

在最难的 Level 3 分片上,通过率 94.0%、跑赢编译器比例 90.0%、提速 1.52 倍,比 Claude Opus 4.5 和 Gemini 3 Pro 高出约 40 个百分点。论文里还提了个极限案例:一个对角矩阵乘法被重写成逐行缩放,提速直接干到 73.31 倍——这种量级的提升,对推理服务商来说就是实打实的「每 token 成本往下掉」。

五、开源了什么,没开源什么

对想复现的人来说,这里有个关键的冷热水。

没开源的是权重。底层 Seed1.6 是个 230B 总参数、23B 激活的 MoE 模型,训练沙盒光 profiling 就用了 128 张 H20 GPU,这个门槛把完整复现留给了前沿实验室和大型算力团队。

开源的是三样:CUDA-Agent-Ops-6K 数据集(6000 个样本,83.77% 是双算子组合)、SKILL.md 规范、以及奖励和 warm-up 的训练配方。中小团队可以把这几样套在一个开源基座上,做局部复现。

六、老达点评

这波我看了挺久,说三点。

第一,它证明了一个趋势:让 AI 写代码,瓶颈不在「会不会写」,而在「写出来快不快」。谁能在真实环境里用 RL 把性能逼出来,谁就拿到下一张牌。第二,底层算子优化直接关系到推理成本,AI 基础设施、大模型推理服务、量化交易、自动驾驶这些对延迟敏感的场景,会是第一波受益者。第三,权重不开源,短期看是国内大厂间的军备竞赛;但对普通开发者是个信号——「AI 写底层代码」这件事,正从实验室走向工程化,早晚会下沉到框架和工具里。

至于你我这种写业务代码的,先别焦虑。底层这层交给大厂和框架去卷,我们把手头的 Claude Code、Codex 用好,把业务逻辑写清楚,就已经跑赢大多数人了。

相关阅读

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *