Liquid AI 发布 LFM2.5-VL-3B:专为端侧部署优化的 3B 视觉语言模型

端侧 AI 的新里程碑:Liquid AI 推出 LFM2.5-VL-3B

随着人工智能技术从云端向边缘端迁移,模型轻量化与本地化部署已成为行业发展的核心趋势。近日,专注于生成式人工智能的初创公司 Liquid AI 正式对外发布了其最新的视觉-语言模型——LFM2.5-VL-3B。这款模型不仅参数量控制在 31 亿级别,更重要的是,它被专门设计用于在本地设备上运行,无需依赖昂贵的云端算力,为隐私保护和低延迟交互提供了新的解决方案。

极致轻量化与高性能并存

LFM2.5-VL-3B 的最大亮点在于其卓越的“端侧”适应性。该模型仅占用约 3GB 的存储空间,这使得它能够轻松部署在大多数消费级硬件设备上,包括 MacBook、高端移动设备或企业内部服务器。在解码速度方面,该模型在 Apple M5 Max 芯片上表现惊人,达到了每秒 228 个 token 的处理速度。这一性能指标表明,用户在本地运行该模型时,将获得接近实时的交互体验,极大地降低了延迟。

多模态能力的全面升级

作为一款视觉-语言模型,LFM2.5-VL-3B 展现出了强大的屏幕理解和物体定位能力。在 ScreenSpot-v2 基准测试中,该模型平均得分达到了 80.7,显示出其对用户界面(UI)元素的精准识别能力,这对于开发基于屏幕的 AI 助手至关重要。而在 RefCOCO 物体定位任务上,其准确率更是从以往的 57.1 大幅提升至 87.9,表明模型能够精准地“看懂”并定位屏幕上的具体物体,无论是图标、按钮还是文本区域。

引入工具调用功能,迈向 Agent 时代

值得注意的是,Liquid AI 在该系列模型中引入了“工具调用”这一创新功能,标志着模型正在从单纯的观察者向执行者转变。通过引入 ToolSandbox 技术,LFM2.5-VL-3B 不再局限于单纯的视觉分析,而是具备了调用外部工具的能力。在 ToolSandbox 的评估中,其得分从之前的 26.4 飙升至 59.5。这一突破意味着模型已经具备了成为“智能体”的潜力,能够根据屏幕内容执行操作,而不仅仅是进行观察和描述。

行业影响与未来展望

LFM2.5-VL-3B 的发布,标志着视觉语言模型正朝着更实用、更隐私的方向发展。以往,多模态大模型往往依赖云端服务器,这不仅消耗流量,还可能带来数据隐私泄露的风险。而 3B 参数的 LFM2.5-VL-3B 使得在手机、平板或个人电脑上运行复杂的多模态 AI 应用成为可能。未来,我们或许能直接在本地设备上获得具备 UI 自动化能力的 AI 助手,它们可以自动填写表单、导航应用界面,甚至在个人设备上自主完成复杂的任务流程。

总的来说,Liquid AI 的 LFM2.5-VL-3B 凭借其平衡的参数规模、优秀的端侧性能以及全面的多模态能力,为端侧 AI 的发展提供了一个强有力的范例。随着硬件技术的不断进步,这类“小而美”的模型有望在更多垂直领域落地,推动人机交互进入一个新的时代。

信息来源:MarkTechPost
原文链接:https://www.marktechpost.com/2026/08/13/liquid-ai-lfm2-5-vl-3b-on-device-vision-language-model/

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/13/liquid-ai-lfm2-5-vl-3b-on-device-vision-language-model/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注