在人工智能领域,大语言模型的推理速度一直是制约其广泛应用的关键瓶颈。近日,AI 公司 Liquid AI 宣布推出了一项名为 LFM2.5-DSpark 的技术突破,通过引入“推测性解码”机制,在保持模型输出质量完全一致的前提下,将解码速度提升了高达 3.18 倍。这一进展对于追求实时交互体验的 AI 应用来说,无疑是一个重要的里程碑。
Liquid AI 的 LFM2.5-DSpark 模型并非对原有 LFM2.5 模型进行重训练,而是通过一种巧妙的架构设计——推测性解码来加速推理过程。简单来说,传统的解码方式是模型一个字一个字地生成文本,这种串行处理模式虽然准确,但速度受限。而 LFM2.5-DSpark 引入了一组由三个约 3 亿参数的小型“起草者”模型。这些小型模型并行工作,负责快速猜测下一个 token(词元)应该是什么。随后,核心的 LFM2.5 主模型会迅速验证这些猜测。如果猜测正确,主模型就直接确认,从而跳过原本的计算步骤;如果猜测错误,主模型则进行修正。
这种机制带来的最直接收益是惊人的性能提升。根据官方测试数据,LFM2.5-DSpark 在多种基准测试中展现出了高达 3.18 倍的解码加速比。这意味着,用户在使用基于该模型的聊天机器人或代码生成工具时,响应速度将显著加快。更重要的是,得益于其精心设计的验证机制,LFM2.5-DSpark 能够保证输出结果与原本的贪婪解码策略完全一致,即“零质量损失”。这在技术上是极具挑战性的,因为通常为了追求速度,开发者往往需要在准确性和速度之间进行权衡,而 LFM2.5-DSpark 成功打破了这一魔咒。
从行业影响来看,推测性解码技术近年来在 AI 研究圈备受关注。Meta、Google 等科技巨头也都在该领域有所布局。Liquid AI 此次开源并发布 LFM2.5-DSpark,表明开源社区在模型推理优化方面正在加速追赶。对于开发者而言,这意味着他们可以在不重新训练大模型的情况下,通过部署这套轻量级的起草模型来显著提升现有服务的性能,从而降低运营成本并提升用户体验。
在实际应用场景中,这种速度的提升将产生深远的影响。在实时对话系统中,更快的解码速度意味着更少的等待时间,这对于构建自然流畅的交互体验至关重要。在代码辅助工具中,快速生成代码片段可以大幅提高程序员的编码效率。此外,在需要高吞吐量的工业级应用中,3 倍以上的性能提升将直接转化为算力的节省和成本的降低。
综上所述,Liquid AI 发布的 LFM2.5-DSpark 模型不仅是技术参数上的胜利,更是对 AI 模型工程化落地的一次有力推动。它证明了在保持模型核心能力不变的前提下,通过巧妙的架构创新,我们依然可以大幅突破计算性能的极限。随着该技术的普及,我们有理由期待未来的 AI 应用将变得更加流畅、即时且高效。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/20/liquid-ai-releases-lfm2-5-dspark-draft-models-that-deliver-up-to-3-18x-faster-decoding/