LFM2.5-Encoders:CPU上实现快速长上下文推理的新一代编码器
在自然语言处理领域,编码器模型一直是文本理解任务的核心。从早期的BERT到最近的ModernBERT,这一系列模型不断推动着精度和效率的边界。然而,随着输入文本长度的增加,许多模型在推理速度和资源消耗上显得力不从心,尤其是在CPU环境下。今天,我们聚焦于Liquid AI最新发布的LFM2.5-Encoder系列,探讨它们如何在不牺牲质量的前提下,实现长上下文的高效推理,为开发者提供了一种新的解决方案。
为什么需要通用编码器?
上个月,Liquid AI发布了LFM2.5-Retrievers,专注于多语言搜索。而LFM2.5-Encoders虽然源自同一家族,但定位更为广泛。它们采用掩码语言建模目标进行预训练,因此可以灵活地微调用于分类、token级任务甚至搜索。搜索只是编码器能力的一部分,构建一个通用模型能够覆盖更多生产环境中的NLP应用,如分类器、意图路由、安全过滤器等。这些任务通常全天候运行,且输入长度不断增长,对效率和成本提出了严苛要求。BERT开创了这一模型类别,ModernBERT进一步提升了精度和速度,而LFM2.5-Encoders则基于LFM2架构,在输入增长时成本增长缓慢,为长文本处理提供了新的可能。

架构创新:从因果解码器到双向编码器
LFM2.5-Encoders的构建基于LFM2.5解码器骨干,通过一系列改动将其转换为双向编码器。首先,采用双向注意力掩码,使每个token能够同时看到前后两侧的上下文,而非仅关注之前的token。其次,使用非因果短卷积,通过对称填充,让每个token的卷积操作能够混合其两侧邻居的信息。最后,在训练过程中掩码30%的token,以强化模型对上下文的理解。这些改动使得模型能够更全面地捕捉文本中的双向依赖关系。
训练过程分为两个阶段:第一阶段,在大型网络语料库上以1024 token的上下文进行短上下文掩码语言建模,建立通用的语言能力;第二阶段,将上下文扩展到8192 token,并在完整数据混合上训练,增强模型在事实性、法律和多语言方面的能力。这种两阶段策略确保了模型既具备扎实的语言基础,又能处理长文档的复杂结构。
基准测试:小模型,大表现
为了评估模型性能,研究团队在GLUE、SuperGLUE和多语言分类任务上进行了全面微调和测试,共涉及14个模型、17个任务。每个模型在五个固定种子上取平均分,确保结果的稳定性。结果显示,LFM2.5-Encoder-350M在14个模型中排名第四,而排在前面的三个模型均比它大,包括一个近10倍大小的3.5B模型。LFM2.5-Encoder-230M则超越了ModernBERT-base和所有EuroBERT模型,尽管其参数量更小。此外,这两个模型在相同任务上的表现也优于LFM2.5-Retrievers,证明了通用编码器的优势。

推理速度:CPU上的显著优势
在推理速度方面,LFM2.5-Encoders继承了LFM2骨干的快速推理特性。由于两个模型和ModernBERT都支持8192 token的上下文,研究团队在完整范围内测量了速度。在CPU上,LFM2.5-Encoder-230M在所有序列长度上都是最快的,甚至对于短输入也快于更小的ModernBERT-base。随着输入长度增加,ModernBERT的吞吐量急剧下降,而LFM2.5-Encoders则在中长输入区间保持稳定。在8192 token时,ModernBERT-base的前向传播需要超过90秒,而LFM2.5-Encoder-230M仅需约28秒,速度提升约3.7倍。这意味着开发者可以在笔记本电脑的CPU上,于30秒内扫描或分类一份完整的合同、转录文本或长支持线程。

在GPU上,模式类似但差距较小:在Apple GPU上,ModernBERT-base在约1K token以下领先,而LFM2.5-Encoders从约2K token开始占据优势。这表明对于长输入,LFM2.5-Encoders是更快的选择,尤其是在CPU环境下,优势更为显著。

实际应用:从意图路由到PII检测
LFM2.5-Encoders的实用性在多个演示中得到了体现,这些演示均运行在仅CPU的Hugging Face空间上。例如,零样本提示路由允许用户自定义路由类别,模型在一次前向传播中对整个提示进行评分;零样本政策检查则根据公司规则对文本进行逐token评分;拼写检查器能够逐token纠正拼写错误;PII检测可识别16种语言中的40种个人信息;此外,还有一个掩码扩散文本生成演示,展示了编码器作为聊天机器人的潜力,通过迭代去掩码而非从左到右生成文本。这些应用展示了编码器在实时、高吞吐量任务中的价值。
如何选择与微调
对于高容量的理解任务,如分类、路由、提取或评分,这些任务需要持续运行且成本敏感,LFM2.5-Encoders是理想选择。与生成式LLM相比,微调后的编码器更小、更快、更便宜,且能适配现有的CPU资源。在两种尺寸中,350M模型适合对精度要求更高的场景,而230M模型则适合硬件受限或需要更高吞吐量的情况。
使用过程非常简单,只需几行代码即可加载模型并进行掩码token预测,或附加自定义头部进行微调。例如,使用transformers库加载模型,然后通过AutoModelForMaskedLM进行预测。对于下游任务,可以加载编码器主体并附加分类、token分类或回归头部。如果GPU支持,还可以使用Flash Attention 2进一步提升效率。
微调是发挥模型潜力的关键。Liquid AI提供了详细的微调教程,指导用户如何在长法律文档等任务上进行微调,充分利用8k上下文。通过微调,模型能够适应特定领域和任务,实现更高的准确性。
开源与未来
LFM2.5-Encoders已作为开放权重模型在Hugging Face上发布,开发者可以立即下载使用。同时,Liquid AI提供了多个在线演示,无需设置即可在浏览器中体验。此外,微调教程和评估框架也已开源,方便社区进一步探索和改进。
随着文本理解需求的不断增长,高效的长上下文编码器将成为关键基础设施。LFM2.5-Encoders通过架构创新和训练策略,在保持高质量的同时实现了显著的性能提升,为开发者在资源受限环境下部署NLP应用提供了新的可能性。我们期待看到社区基于这些模型构建出更多创新的应用。