腾讯开源 AngelSpec:统一训练框架破解大模型推理速度瓶颈

在生成式人工智能(AIGC)领域,大语言模型(LLM)的推理速度一直是制约其大规模落地的核心痛点。为了解决这一难题,腾讯近期宣布正式开源其自主研发的统一训练框架——AngelSpec。该框架专注于多 Token 预测(MTP)和分块并行推测解码技术,旨在显著提升大模型在复杂并发场景下的推理效率,为行业提供了一套高性能的解决方案。

AngelSpec 是一个基于 PyTorch 原生的训练框架,其最大的亮点在于其跨架构的通用性。据官方介绍,该框架能够支持六种不同的模型架构,这意味着开发者可以利用它来训练各种类型的“草稿模型”。在推测解码(Speculative Decoding)的流程中,草稿模型的作用是快速生成多个 Token,随后由主模型进行验证。AngelSpec 的出现,为这一流程提供了标准化的训练解决方案,简化了开发者的部署流程。

在 AngelSpec 的技术架构中,DFly 模块扮演着核心引擎的角色。DFly 是一种基于分块扩散(Block-Diffusion)的草稿生成器。与传统的自回归生成方式不同,分块扩散技术允许模型在生成过程中进行并行处理,从而大幅提高了生成 Token 的吞吐量。此外,DFly 引入了“混合目标条件”机制,这赋予了模型更灵活的上下文理解能力。为了确保生成质量,DFLY 还配备了“隐藏修正自回归头”,这种机制允许模型在生成过程中动态捕捉并修正错误,从而在速度与准确性之间取得了微妙的平衡。

除了生成效率的提升,AngelSpec 还引入了 D-cut(Dynamic-cut)技术,用于管理运行时自适应验证预算。在推测解码中,验证环节往往需要消耗大量的计算资源,有时甚至会成为瓶颈。D-cut 技术能够根据当前的负载和计算能力,智能地调整验证的预算,避免不必要的资源浪费。这种自适应机制使得模型在不同并发度(从 4 到 64)下都能保持稳定的性能表现,确保了系统的鲁棒性。

为了验证 AngelSpec 的实际性能,研究团队在 HY3-295B-A21B 模型上进行了严格测试。在张量并行度(TP)设置为 8 的条件下,DFly-8 模型在并发度为 4 到 64 的范围内,相比传统的自回归解码方式,实现了 1.98 到 2.40 倍的速度提升。这一数据充分证明了该框架在处理大规模大模型推理任务时的巨大潜力,同时也验证了其在提升推理吞吐量方面的有效性。

AngelSpec 的开源,对于整个 AI 社区而言是一个重要的里程碑。它不仅为开发者提供了一个高性能的推理加速工具,更重要的是,它降低了构建复杂推测解码系统的技术门槛。通过 PyTorch 的原生支持,开发者可以更方便地将其集成到现有的工作流中,加速大模型应用的开发与落地。随着大模型向更复杂、更庞大的方向发展,像 AngelSpec 这样的高效推理框架将成为推动行业进步不可或缺的基础设施。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/07/30/tencent-open-sources-angelspec-a-unified-training-framework-for-mtp-and-block-parallel-speculative-decoding-on-hy3-models/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注