Cursor 开源 MoK:GB300 NVL72 机架上的 MoE 训练确定性能量加速器

Mixture-of-Kittens MoE Training Megakernel Visualization

近日,AI 编码与模型研发领域的创新者 Cursor Research 宣布了一个重磅消息:他们正式开源了名为 Mixture-of-Kittens (MoK) 的训练引擎。作为支撑 Cursor Composer 系列模型的核心基础设施,MoK 是一个专门为 GB300 NVL72 机架设计的确定性 MoE(混合专家模型)训练超级内核。这一开源举措不仅展示了 Cursor 在底层优化技术上的深厚积累,也为业界在处理大规模 MoE 模型训练时提供了极具参考价值的解决方案。

混合专家模型是当前大语言模型领域的主流趋势之一。与传统的稠密模型不同,MoE 模型通过将庞大的参数量拆分到多个“专家”网络中,仅在处理特定 token 时激活相关专家,从而在保持模型推理能力的同时大幅降低计算开销。然而,MoE 训练的难度极高,核心挑战在于专家之间频繁的通信开销。在分布式训练中,不同 GPU 之间需要同步专家的梯度,这种通信往往成为制约训练速度的瓶颈。Cursor Research 的 MoK 项目正是为了解决这一痛点而生。

MoK 的核心创新在于其“确定性”与“融合”特性。传统训练流程中,通信操作和计算操作通常是分离的,导致数据在 CPU 和 GPU 之间多次拷贝,造成效率低下。MoK 将所有混合专家的通信和计算步骤融合为一个单一的、确定性的内核。这种融合极大地减少了数据移动的延迟,使得计算单元可以专注于核心运算,而无需等待通信完成。在 GB300 NVL72 这种高带宽、高密度的机架级集群上,这种优化带来的性能提升是惊人的。

根据官方测试数据,MoK 在 GB300 NVL72 机架配置下,其运行速度达到了最强公开基准的 2.37 倍。这意味着开发者可以在相同的时间周期内训练出参数量更大、能力更强的模型,或者使用更少的硬件资源达到相同的训练效果。此外,MoK 的确定性特性对于科研人员来说至关重要,它保证了训练过程的可复现性,避免了因随机性导致的实验结果偏差,这对于大模型的迭代和调优具有不可替代的价值。

值得注意的是,MoK 的运行依赖于 Blackwell 架构的 SM100 或 SM103 GPU。Blackwell 是英伟达最新一代的 GPU 架构,SM100 和 SM103 属于针对数据中心和超级计算的高性能芯片。这意味着 MoK 的性能优势是建立在最新的硬件基础之上的。对于那些拥有 NVL72 机架容量的顶级 AI 研究机构和科技公司来说,这是一个直接可用的生产力工具。然而,对于大多数普通开发者而言,直接部署这种高端硬件并不现实。因此,Cursor 将其开源,旨在让全球的开发者和研究人员能够学习其内核优化的思想,甚至未来尝试将其移植到其他硬件平台上,从而推动整个 AI 训练生态的进步。

从行业影响来看,Cursor 开源 MoK 反映了当前 AI 基础设施领域的竞争焦点正在从单纯的模型架构设计转向底层计算效率的极致挖掘。随着模型规模的指数级增长,如何利用通信内核融合、张量并行等高级技术来榨干硬件性能,将成为决定模型能否落地应用的关键。MoK 的出现,无疑为那些致力于训练超大规模 MoE 模型的团队提供了一个强有力的参考范本。它证明了在特定的高性能计算环境下,通过精细化的内核工程,可以突破现有的性能天花板。

综上所述,Mixture-of-Kittens (MoK) 的开源不仅是 Cursor Research 技术实力的展示,也是开源社区的一笔宝贵财富。它为 MoE 训练的优化提供了新的思路,同时也预示着未来的大模型训练将更加依赖于底层硬件与软件的深度协同。对于关注 AI 技术发展的读者而言,深入理解 MoK 的工作原理,将有助于更好地把握下一代大模型技术的发展脉络。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/04/cursor-open-sources-mixture-of-kittens-mok-a-deterministic-moe-training-megakernel-for-gb300-nvl72-racks/

封面图片来源:Unsplash / 摄影师 Brett Jordan

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注