NeoMME:单塔原生多模态编码器如何实现高效视觉检索?
近年来,多模态人工智能系统在文档理解、视觉问答和跨模态检索等任务中展现出巨大潜力。然而,主流架构往往依赖于分离的预训练组件——如独立的视觉编码器(如ViT、SigLIP)与大型语言模型(LLM)拼接而成的视觉语言模型(VLM)。这种设计虽在生成任务中表现优异,却在非生成型任务(如检索、分类)中引入了不必要的计算冗余和参数开销。针对这一问题,NeoMME提出了一种颠覆性的解决方案:摒弃预训练模块的堆叠,转而构建一个真正原生的、端到端训练的单塔多模态编码器。
NeoMME的核心创新在于其统一的处理机制。它不使用任何预训练的视觉塔或文本编码器,而是让同一个双向Transformer直接接收原始输入:文本通过因子化词嵌入(factorized token embeddings)进入网络,而图像则被划分为32×32的非重叠块,并通过一个小型MLP投影后与文本共享相同的计算路径。这种设计消除了模态间的“翻译”成本,使得模型在预训练、微调和服务部署阶段都能实现更高效的资源利用和更紧密的跨模态对齐。
在架构层面,NeoMME融合了多项现代编码器的前沿技术。它采用分组查询注意力(Grouped-Query Attention, GQA)以平衡计算效率与表达能力,引入查询-键归一化(Query-Key Normalization)来稳定注意力分数,并使用门控注意力(Gated Attention)增强非线性建模能力。位置编码方面,模型采用二维旋转位置嵌入(2D Rotary Position Embeddings),能更好地适应图像的空间结构。此外,其MLP激活函数选用平方ReLU(Squared-ReLU),在保持稀疏性的同时提升了梯度流的稳定性。这些组件的协同作用,使得NeoMME在有限参数下实现了卓越的表示能力。

预训练策略是NeoMME成功的另一关键。研究团队没有采用常见的对比学习或图像-文本匹配目标,而是设计了一种基于掩码离散扩散(masked discrete-diffusion)的去噪任务。具体而言,对于纯文本样本,模型以0到1之间的随机比率对文本标记进行掩码;而对于图文混合样本,掩码率被限制在0.3到1之间,且图像块始终保持可见。这种设置迫使模型在高度掩码的情况下,必须依赖图像内容来重建被遮蔽的文本。例如,当句子“The [MASK] sat on the mat”中的“cat”被掩码时,若上下文信息不足,模型就必须从图像中识别出猫的形象才能正确恢复。这种高强度的跨模态依赖训练,有效抑制了模型走“纯语言捷径”的倾向,促使其学习到真正 grounded 的图文关联。
为了验证NeoMME作为基础编码器的有效性,研究团队将其微调为视觉文档检索器——NeoMME-Retriever。该任务的目标是直接对文档页面的截图进行排序,而非依赖OCR提取的文本。这种方法保留了原始文档的版式、图表、字体等关键视觉线索,这些信息往往是纯文本无法完整传达的。NeoMME-Retriever的精妙之处在于其双头设计:一个稠密头通过对所有隐藏状态进行平均池化,生成一个紧凑的全局向量;另一个晚期交互头则为每个文本标记或图像块生成一个128维的细粒度向量。这种设计赋予了用户极大的灵活性:稠密向量适用于大规模语料库的快速近似最近邻(ANN)检索,而晚期交互向量则能在重排阶段捕捉局部语义匹配,显著提升精度。
在权威的ViDoRe v3基准测试中,NeoMME-Retriever的表现令人瞩目。其260M版本取得了0.523的nDCG@10分数,超越了所有参数量严格小于8亿的竞品模型,甚至逼近了参数量高达37.5亿的ColQwen2.5(0.524),实现了约14倍的参数效率。800M版本则达到0.556,与同量级的Vultron Retriever Flash(0.565)相差无几。更重要的是,两个版本均位于模型规模与性能的帕累托前沿,证明了其架构的高效性。在推理速度方面,NeoMME-Retriever-260M在NVIDIA L40S GPU上处理2048×2048分辨率的页面时,吞吐量达到每秒51页,几乎是ColModernVBERT(26页/秒)的两倍。这对于需要大规模索引构建的实际应用场景而言,意味着显著的计算成本节约。

然而,晚期交互模型的一个固有挑战是存储开销。高分辨率图像会产生数千个向量,导致单个页面的嵌入体积高达1.5MB(float32格式)。为解决这一瓶颈,NeoMME团队提出了两种互补的压缩技术。首先是分层令牌池化(Hierarchical Token Pooling),它通过聚类算法将相似的文档向量合并为其均值,从而大幅减少存储的向量数量。其次是非对称量化(Asymmetric Quantization),即对存储的文档嵌入进行int8甚至二值化压缩,而查询嵌入则保持高精度(如float16),因为它们只在推理时动态生成,无需长期存储。实验表明,采用池化因子为8、int8查询和二值化文档的激进配置,可将存储需求降至惊人的6kB/页,压缩比高达255倍,同时仍能保留超过95%的原始检索质量(nDCG@10)。这使得在资源受限的环境中部署高精度晚期交互检索成为可能。

NeoMME的实用价值不仅体现在其卓越的性能上,更在于其对开发者生态的友好支持。模型已集成至Hugging Face Transformers库,并提供了完整的推理示例。用户只需几行代码,即可同时获取稠密和晚期交互嵌入,并利用sentence-transformers库中的mean_maxsim等工具进行评分。此外,团队还发布了专门用于Sentence Transformers v6微调的独立检查点,分别针对稠密头和晚期交互头,方便用户根据具体任务进行定制化训练。对于希望构建端到端系统的开发者,NeoMME-Retriever可无缝集成到视觉检索增强生成(Visual RAG)流程中:先用其检索相关页面图像,再将这些图像连同用户查询一起送入VLM进行答案生成,从而充分利用原始文档的全部视觉信息。

综上所述,NeoMME代表了多模态基础模型设计的一种新思路。它通过回归编码器的本质——双向、非自回归、统一处理——成功地在效率、性能和实用性之间取得了出色的平衡。其从零开始的训练范式、创新的预训练目标、以及针对实际部署痛点的优化(如压缩与加速),为未来高效多模态系统的构建提供了宝贵的参考。随着多模态数据在企业知识库、数字图书馆和智能办公等场景中的爆炸式增长,像NeoMME这样兼顾效果与成本的解决方案,无疑将在推动AI技术落地的过程中扮演关键角色。


