Liquid AI 推出 LFM2.5-VL-3B-DSpark:通过推测解码将视觉语言模型推理速度提升 3 倍以上

在人工智能大模型竞赛日益激烈的今天,推理速度往往是决定模型能否落地应用的关键因素。近日,知名科技媒体 MarkTechPost 报道,AI 初创公司 Liquid AI 宣布推出了一项针对视觉语言模型(VLM)的优化技术——LFM2.5-VL-3B-DSpark。该技术通过引入业界领先的“推测解码”机制,在保持输出质量完全一致的前提下,显著提升了模型的推理效率。

LFM2.5-VL-3B-DSpark 本质上是一个极其精简的“草稿模型”,其参数量仅为 2.795 亿。它的工作原理巧妙地利用了“小模型猜、大模型验”的策略。具体而言,这个小模型会快速生成文本或视觉标记的初步预测,随后由庞大的 LFM2.5-VL-3B 主模型对这些生成内容进行验证。如果小模型猜对了,主模型就直接接受;如果猜错了,主模型再进行修正。这种机制避免了主模型对每个 token 都进行全量计算,从而大幅降低了计算延迟。

根据官方公布的基准测试数据,在 Apple M5 Max 平台上,该方案实现了高达 3.13 倍的解码速度提升;在 NVIDIA H100 高性能计算平台上,也能达到 2.66 倍的提升。更值得注意的是,在贪婪解码模式下,该技术能够保证输出结果与原模型完全一致,这意味着用户在追求速度时,不会牺牲模型生成的准确性。

视觉语言模型是当前 AI 领域备受关注的技术方向,它们结合了视觉理解与自然语言处理能力,广泛应用于自动驾驶、机器人视觉、医疗影像分析以及智能交互系统。然而,VLM 通常参数量巨大,计算开销高昂,实时处理高清视频流往往面临性能瓶颈。推测解码技术的引入,为解决这一痛点提供了新的思路。

此次开源支持涵盖了 llama.cpp、MLX-VLM 和 SGLang 等主流推理框架。这意味着开发者无需重构现有代码,即可在本地设备或云端环境中轻松部署这一加速方案。对于边缘计算场景尤为重要,例如在 Mac 或消费级显卡上运行复杂的视觉大模型。

总的来说,Liquid AI 的这一举措不仅展示了其在大模型工程化方面的深厚积累,也为整个行业提供了一个提升 VLM 推理效率的实用范例。随着 AI 应用对实时性要求的提高,此类高效的推理优化方案将成为未来模型落地的标配。

参考来源: MarkTechPost

原文链接: https://www.marktechpost.com/2026/09/25/liquid-ai-releases-lfm2-5-vl-3b-dspark-speculative-decoding-for-vision-language-models-with-up-to-3-13x-faster-decoding/

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/25/liquid-ai-releases-lfm2-5-vl-3b-dspark-speculative-decoding-for-vision-language-models-with-up-to-3-13x-faster-decoding/

由 oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注