在当今大模型蓬勃发展的背景下,检索增强生成(RAG)已成为提升模型准确性的关键手段。然而,现有的多模态检索模型往往面临着架构复杂、部署成本高昂的挑战。近日,H Company 正式对外发布了名为 NeoMME 的新一代多模态编码器家族,该模型在架构设计上做出了大胆革新,旨在为多模态检索任务提供更高效、更轻量的解决方案。
与传统多模态检索器(如 ColPali 风格)不同,NeoMME 采用了一种独特的“单塔”架构。这种架构摒弃了传统模型中常见的预训练视觉塔和因果解码器,转而直接将多语言文本令牌和原始 32×32 的图像补丁输入到一个统一的 Transformer 模型中。这种设计极大地简化了模型结构,使得文本和图像的处理能够在一个网络流中无缝完成,从而降低了推理延迟和系统复杂度。
为了在单一模型中高效学习图像特征,NeoMME 采用了掩码离散扩散(Masked Discrete-Diffusion)预训练目标。这种先进的训练方法允许模型在保留图像丰富语义信息的同时,有效地对图像内容进行编码。此外,模型配备了双检索头设计,分别支持密集检索和晚交互检索,这赋予了 NeoMME 在处理复杂查询时的灵活性和准确性。
在性能评估方面,NeoMME 家族提供了 260M 和 800M 两种参数规模的模型。根据 ViDoRe v3 基准测试的结果,260M 参数的 NeoMME 模型在 nDCG@10 指标上达到了 0.523,表现相当亮眼。更为重要的是,该模型在索引压缩方面展现了极高的效率,支持高达 255 倍的索引压缩率,且在单张 NVIDIA L40S GPU 上即可达到每秒 51.3 页的索引吞吐量。这一性能指标对于需要处理海量文档的企业级应用而言,具有极高的实用价值。
NeoMME 的问世,标志着多模态检索技术正朝着更轻量化、更高效化的方向发展。它特别适用于那些对实时性和计算资源有限制的场景,例如智能文档搜索、多模态问答系统以及长上下文处理。尽管作者在文中也坦诚了模型在纯文本检索任务上存在一定的差距,但这无疑为未来多模态编码器的研究指明了新的方向。随着 H Company 对该技术的持续优化,我们有理由期待 NeoMME 在未来的 AI 应用中发挥更大的作用。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/06/h-company-releases-neomme-a-family-of-260m-and-800m-single-tower-multimodal-encoders-that-drop-the-vision-tower-and-causal-decoder/