Thinking Machines Lab 发布高效多模态 MoE 模型 Inkling-Small,276B 参数仅需 12B 活跃

Thinking Machines Lab 近期宣布推出其旗舰多模态 MoE 模型 Inkling-Small 的开源版本。作为原版 Inkling 的轻量化衍生品,Inkling-Small 在保持核心能力的同时,将模型体积缩减至原来的四分之一,为更广泛的开发者社区提供了部署的可能性。

该模型采用了混合专家(Mixture of Experts, MoE)架构,其参数配置颇具巧思:虽然总参数量高达 2760 亿,但在处理特定任务时,仅有 120 亿个参数处于活跃状态。这种设计使得模型在推理阶段能够大幅降低计算开销,同时维持强大的表达能力。在技术层面,MoE 架构模拟了人类专家协作的机制,通过动态路由机制,模型只在处理特定输入时激活最相关的专家子集,从而避免了传统稠密模型在每次推理时都要计算全部参数的冗余。

值得注意的是,Inkling-Small 的硬件需求极具吸引力。得益于先进的 NVFP4(NVIDIA Fused Point Format 4)量化技术,该模型的检查点文件可以在单块 NVIDIA B300 显卡上流畅运行。这一特性打破了传统大型语言模型(LLM)需要昂贵集群才能部署的壁垒。NVFP4 是一种高效的参数压缩格式,它在保持模型精度的同时显著减少了内存占用和显存带宽压力。这意味着开发者无需购买多张 H100 或 A100 集群,只需利用最新的旗舰显卡,即可在本地或云端部署这一千亿级参数的超级模型,极大地降低了 AI 应用的准入门槛。

多模态能力的加入是 Inkling-Small 的另一大亮点。作为一款融合了文本与视觉理解能力的模型,它不仅能处理复杂的自然语言指令,还能对图像内容进行深度分析,适用于文档理解、图像问答、视觉推理等多种场景。在当前的 AI 浪潮中,多模态大模型已成为主流方向,能够兼顾文本与图像处理的高效模型尤为稀缺。Inkling-Small 的开源,填补了这一细分领域的空白。

从行业角度来看,Thinking Machines Lab 的这一举措顺应了当前大模型发展的“小而美”趋势。随着开源社区的壮大,如何平衡模型性能与推理成本成为了关键议题。虽然 Llama 等开源模型在文本领域表现强劲,但在多模态和极致效率方面仍有提升空间。Inkling-Small 的出现,为那些希望在边缘设备、个人工作站或成本受限的云环境中运行高级 AI 应用的开发者提供了一个强有力的工具。这不仅加速了 AI 技术的普惠化,也为未来的多模态交互应用探索了新的可能性。

此外,该模型的发布也展示了硬件与软件协同优化的巨大潜力。能够在单张 B300 GPU 上运行,表明未来 AI 模型的优化不再仅仅依赖于模型架构的微调,更依赖于与底层硬件的深度适配。对于寻求构建垂直领域 AI 应用(如智能客服、自动化办公助手)的初创公司而言,Inkling-Small 提供了一个即插即用的强大底座。

综上所述,Inkling-Small 不仅是一款参数量巨大的模型,更是一种高效、普惠的 AI 解决方案,标志着开源多模态大模型向更轻量、更易部署的方向迈出了重要一步。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注