近日,专注于生成式 AI 的初创公司 Liquid AI 正式发布了其最新的端侧模型——LFM2.5-2.6B。这款模型的发布标志着边缘计算领域在“智能体”应用上的重大突破,展示了轻量化模型在本地部署复杂任务处理能力的巨大潜力。
与以往只能在云端运行、依赖网络连接的大型语言模型(LLM)不同,LFM2.5-2.6B 被设计为完全在本地设备上运行。这不仅仅是硬件的适配,更是 AI 能力形态的进化。LFM2.5-2.6B 具备典型的“智能体”特征,它不仅能够生成文本,还能像人类一样进行多步推理、规划任务流程,并主动调用外部工具(如 Python 解释器、API 接口或本地文件系统)来完成复杂的跨步骤任务。这种能力的本地化实现,对于需要极高数据隐私保护、网络环境受限或对延迟敏感的应用场景来说,具有革命性的意义。
在技术架构方面,LFM2.5-2.6B 拥有 26.9 亿参数,属于轻量级模型,但其内部设计却极为精妙。模型在 30 层架构中混合使用了 22 个双门控短卷积块和 8 个 GQA(分组查询注意力)块。这种混合架构设计旨在平衡模型的推理速度与生成质量。其中,GQA 技术通过减少注意力计算量,显著提升了推理效率并降低了显存占用,这对于长上下文处理至关重要;而双门控短卷积块则有助于在处理长序列时保持信息的连贯性和捕捉长距离依赖。
在性能表现上,LFM2.5-2.6B 展现出了令人瞩目的指标。它支持高达 128K(131,072)的上下文窗口,这意味着用户可以一次性输入非常长的文本或文档进行处理,而无需繁琐的分块处理。在硬件适配方面,该模型在 Apple M5 Max 芯片上的测试数据显示,其解码速度达到了每秒 220 个 token,且显存占用低于 2.5GB。这一数据表明,即使在消费级或专业级笔记本电脑上,该模型也能流畅运行,为开发者提供了极大的便利。
此外,Liquid AI 采取了开放权重的策略,模型将以 GGUF、MLX 和 ONNX 等多种格式开源。这一举措将极大地促进学术界和工业界的开发者基于该模型进行二次开发。开发者可以将其集成到本地应用中,构建无需联网的个人助理、本地知识库问答系统,或者是针对特定垂直领域的专用智能体。LFM2.5-2.6B 的成功发布,不仅丰富了端侧 AI 的工具箱,也展示了轻量化、高性能模型在隐私计算和边缘计算领域的巨大前景。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/06/liquid-ai-lfm2-5-2-6b-on-device-agentic-model/
封面图片来源:Unsplash / 摄影师 Brecht Corbeel
