文章/详情

AI 写代码,开始不只写对,还写快了

作者:青檬 CMS 团队

<p style="margin:.8em 0;line-height:1.85;">大模型写底层代码,一直卡在一个尴尬的地方。</p> <p style="margin:.8em 0;line-height:1.85;">写得对,但跑得慢。</p> <p style="margin:.8em 0;line-height:1.85;">字节 Seed 团队联合清华 AIR,昨天发了个系统,叫 CUDA Agent。</p> <p style="margin:.8em 0;line-height:1.85;">专门解决这个问题:训练大模型写高性能 GPU 内核。</p> <h3 style="margin:1.2em 0 .6em;font-size:1.1em;">起点,比你想的还惨</h3> <p style="margin:.8em 0;line-height:1.85;">先看一组起点数据。</p> <p style="margin:.8em 0;line-height:1.85;">基础模型 Seed1.6,在 KernelBench 基准上,任务通过率 74%。</p> <p style="margin:.8em 0;line-height:1.85;">这个数字不差,说明代码写得对。</p> <p style="margin:.8em 0;line-height:1.85;">但换一个维度看,就露馅了:</p> <p style="margin:.8em 0;line-height:1.85;">只有 27.2% 的内核,跑得比 torch.compile 这个编译器快。</p> <p style="margin:.8em 0;line-height:1.85;">几何平均速度,只有编译器的 0.69 倍。</p> <p style="margin:.8em 0;line-height:1.85;">翻译过来就是——大模型写的底层代码,平均比编译器自己生成的还慢。</p> <p style="margin:.8em 0;line-height:1.85;">写得对,但没用。</p> <h3 style="margin:1.2em 0 .6em;font-size:1.1em;">把模型扔进真实环境</h3> <p style="margin:.8em 0;line-height:1.85;">CUDA Agent 的解法,说穿了不复杂。</p> <p style="margin:.8em 0;line-height:1.85;">把模型放进一个真实的 CUDA 开发环境。</p> <p style="margin:.8em 0;line-height:1.85;">里面有性能分析工具,有正确性校验,还有一个权限锁定的沙箱。</p> <p style="margin:.8em 0;line-height:1.85;">然后用 PPO 强化学习,训练 150 步,上下文 131072 token。</p> <p style="margin:.8em 0;line-height:1.85;">关键是那个反馈循环:模型每写一版,沙箱就跑一次、测一次,跑得不够快就重来。</p> <p style="margin:.8em 0;line-height:1.85;">用真实的运行反馈,逼着模型学会「怎么写才快」。</p> <h3 style="margin:1.2em 0 .6em;font-size:1.1em;">结果反转了</h3> <p style="margin:.8em 0;line-height:1.85;">训练完之后,数字整个翻了过来。</p> <p style="margin:.8em 0;line-height:1.85;">250 个任务,通过率 98.8%。</p> <p style="margin:.8em 0;line-height:1.85;">96.8% 的内核,跑得过 torch.compile。</p> <p style="margin:.8em 0;line-height:1.85;">几何平均加速 2.11 倍。</p> <p style="margin:.8em 0;line-height:1.85;">在最难的 Level-3 分片上,比 Claude Opus 4.5、Gemini 3 Pro 领先约 40 个点。</p> <p style="margin:.8em 0;line-height:1.85;">一个对角矩阵乘法的改写,甚至跑到了 torch.compile 的 73 倍。</p> <p style="margin:.8em 0;line-height:1.85;">这种差距,对推理服务商来说,就是 token 成本的实打实下降。</p> <h3 style="margin:1.2em 0 .6em;font-size:1.1em;">关键不是模型,是奖励</h3> <p style="margin:.8em 0;line-height:1.85;">这套系统最反常识的结论,藏在消融实验里。</p> <p style="margin:.8em 0;line-height:1.85;">把 Agent 循环去掉,快过编译器的比例从 96.8% 跌到 14.1%。</p> <p style="margin:.8em 0;line-height:1.85;">把奖励函数从「离散里程碑」换成「原始加速比」,成绩掉 36.4 个点。</p> <p style="margin:.8em 0;line-height:1.85;">也就是说,真正值钱的不是模型多大,是奖励怎么设、环境怎么搭。</p> <p style="margin:.8em 0;line-height:1.85;">权重没开源,但配方开源了:6K 样本的数据集、SKILL.md 规范、奖励与预热配方,都放了出来。</p> <p style="margin:.8em 0;line-height:1.85;">中型团队在开源底座上,也能复现一部分。</p> <h3 style="margin:1.2em 0 .6em;font-size:1.1em;">下半场,是性能</h3> <p style="margin:.8em 0;line-height:1.85;">把这件事拉长看。</p> <p style="margin:.8em 0;line-height:1.85;">AI 写代码,前几年拼的是「能不能写对」。</p> <p style="margin:.8em 0;line-height:1.85;">正确率卷到头之后,新的战场是「能不能写快」。</p> <p style="margin:.8em 0;line-height:1.85;">尤其是底层代码——内核、算子、那些卡在延迟敏感路径上的东西。</p> <p style="margin:.8em 0;line-height:1.85;">谁能让 AI 写的代码又快又对,谁就能在算力成本上多抠出一块来。</p> <p style="margin:.8em 0;line-height:1.85;">这一仗,才刚刚开始。</p>

评论 0 收藏 0

评论

0 条
登录后即可发表评论。 去登录

暂时还没有评论,欢迎留下你的看法。