Cursor开源MoK重排GPU流水线,MoE训练提速41%
Cursor开源MoK,MoE训练提速41%
8月5日,Cursor开源Mixture-of-Kittens(MoK)项目,用于加速MoE大模型训练。
核心优化
- 将GPU数据传输与计算合并至同一kernel,减少等待
- 512块GB300 GPU实测,整体吞吐提高41%
- MoE层单测最高比公开方案快2.37倍
部署情况
MoK已用于Cursor数万块GPU的Composer训练,以Apache 2.0协议开源,当前仅支持英伟达Blackwell GPU,面向GB200、GB300 NVL72集群机构。