不用手写CUDA!抓来AI当免费苦力,这套工具帮你白嫖1.8倍模型加速
导语:零基础用AI写出光速CUDA内核!FlashAttention团队发布CODA,端到端加速高达20%。
嫌手写 CUDA 太慢、门槛太高?FlashAttention 作者 Tri Dao 刚刚在社交平台力荐了全新力作 CODA。只要配合 AI 工具,即使是零基础的新手,也能让 Transformer 跑出光速内核!
很多开发者在训练大模型时都会踩到显存读写瓶颈:明明手握 H100 等卡,算力却被 RMSNorm、激活函数、残差加法等“小算子”频繁的显存读写白白消耗。CODA 就是专为解决这一痛点而生的无痛提速框架。
💡 为什么它能带你“白嫖” 1.8 倍加速?
CODA 的秘密武器非常巧妙:它将大模型中绝大多数内存密集型操作,全部“塞”进了矩阵乘法(GEMM)最后的尾声(epilogue)阶段执行。在数据尚存留在寄存器里时,顺脚做完归一化、激活等计算,彻底避免了数据从显存往返搬运的额外消耗。

🛠️ 保姆级极速上手指南:用 AI 直接生成光速内核
CODA 并不只是一组固定死的数据,而是一套极具自由度的“乐高积木式”编程原语集。你可以直接派 AI(比如 Claude Code)去写底层代码!

- 调用五类原语:CODA 基于 CuTeDSL(NVIDIA CUTLASS 的 Python DSL)实现,对外暴露出逐元素变换、向量加载与存储、矩阵分块加载与存储、分块规约、有状态变换五类积木。
- AI 辅助编程:给 Claude Code 提供 CODA 的原语定义说明、若干现成示例,以及技巧提示 log,AI 就可以直接帮新手做主体开发,最终实现人工轻度监督的低门槛内核编写。
- 极低侵入与高精度:实验表明,用 AI 自动生成的内核在保证数值高精度的同时,表现几乎与人工顶尖专家手写的底层内核并无二致。

📊 H100 实战跑分:反向传播直接暴增 1.8 倍
项目组对比了强力的 cuBLAS + torch.compile,以及专为大模型优化过的 Liger Kernel:

- 反向传播加速:在 1B、7B 和 70B 参数模型的维度测试下,GEMM 反向传播的加速效果达到了 1.6 至 1.8 倍,SwiGLU 反向性能也有 1.4 至 1.6 倍的提升!
- 端到端加速:整层 Transformer 端的端到端前向运行效率可以额外白嫖 5% 至 20% 的速度提升,大模型规模越大,省下的资源越显著。
现在直接前往上方的 GitHub 仓库地址,拉取项目代码,开始用 AI 帮你压榨大模型训练的极限性能吧!
© 版权声明
本文部分内容、图片整理自互联网公开渠道,版权归原作者所有。ACGFav 仅负责对信息进行整理、翻译或排版优化,不代表本站完全赞同其观点。若文中内容涉及版权问题,请通过本站“关于我们”页面联系站长,我们将尽快核实并处理。