LFM2.5-VL-3B:边缘设备上的高效视觉语言模型突破
边缘智能的新标杆:LFM2.5-VL-3B的诞生背景
随着人工智能技术向边缘设备渗透,如何在有限的计算资源下实现强大的多模态理解能力,已成为行业面临的核心挑战。Liquid AI最新发布的LFM2.5-VL-3B模型,正是对这一挑战的精准回应。这款仅3.1B参数的视觉语言模型,在保持轻量化的同时,实现了对屏幕内容的理解、目标定位、多图像推理以及函数调用等高级功能,为实时交互和端侧应用开辟了新的可能性。
与上一代产品相比,LFM2.5-VL-3B在四个关键维度上实现了显著突破:屏幕/UI理解能力大幅增强,能够精准解析不同设备上的数字界面;目标定位与检测能力得到优化,可基于自然语言查询准确框选对象;多图像输入处理能力提升,支持跨图像推理;函数调用能力显著增强,尤其在视觉与文本混合场景下表现突出。这些进步使得该模型能够胜任从文档解析到UI自动化等一系列复杂任务。
技术架构与训练策略:从预训练到后训练的精妙设计
LFM2.5-VL-3B的技术架构体现了Liquid AI在模型设计上的深厚积累。该模型采用SigLIP2 400M NaFlex视觉编码器,与LFM2.5-2.6B文本模型共享预训练骨干网络,实现了视觉与语言特征的深度融合。在预训练阶段,模型处理了约34T的token,其中视觉数据量是前代的4倍,涵盖精选和合成的图像-标题对、OCR数据、目标定位数据以及指令跟随数据。为了支持非拉丁语系,团队通过原地扩展分词器的方式,将词汇量翻倍至128K,避免了从头训练的昂贵成本。
后训练阶段采用两阶段策略:首先进行监督微调(SFT),利用更大的教师模型进行知识蒸馏,并结合Antidoom训练技术防止模型退化;随后进行多奖励强化学习(RL),进一步优化模型在多个维度上的表现。这种训练策略使得模型在保持快速响应的同时,能够精准执行复杂指令。
基准测试全面领先:视觉与文本任务的双重验证
在视觉基准测试中,LFM2.5-VL-3B展现了全面的性能优势。在通用视觉理解任务上,MMStar得分63.3,MME得分73.1,RealWorldQA得分73.1,均优于同尺寸的LFM2-VL-3B和Gemma-4-E2B。特别值得关注的是,在屏幕理解任务中,ScreenSpot-v2 Desktop得分78.7,Mobile得分81.2,Web得分82.2,相比前代LFM2-VL-3B的个位数得分实现了质的飞跃,甚至超越了部分4B级模型。

在文档与OCR任务中,DocVQA得分91.1,ChartQA得分81.3,OCRBench v1得分84.2,显示出强大的文档解析能力。目标定位方面,RefCOCO-avg得分87.9,较前代提升超过30个百分点。多图像理解任务中,BLINK得分61.5,MuirBench得分58.3,均处于领先水平。

文本基准测试同样表现亮眼。指令跟随方面,IFEval得分82.3,Multi-IF得分59.4,较前代大幅提升。工具使用与函数调用方面,ToolSandbox得分59.5,BFCL V4得分32.5,与Gemma-4-E2B和Qwen3.5-2B等模型相当,证明了其在智能体应用中的实用性。
推理性能:速度与效率的极致追求
LFM2.5-VL-3B在推理速度上的表现令人印象深刻。在设备端,该模型在M5 Max上解码速度达到228 tokens/s,在Ryzen AI Max+ 395上达到116 tokens/s,内存占用仅约3GB。更令人惊叹的是,在Galaxy S26 Ultra上也能达到20 tokens/s,这意味着旗舰手机可以完全离线运行该模型。

在GPU推理方面,LFM2.5-VL-3B在多帧输入场景下延迟最低,输出吞吐量达到约11K tokens/s,是高并发场景下2B级模型的2倍,甚至超过部分4B级模型。这意味着在单个H100 GPU上,每天可处理近10亿个输出token,为大规模部署提供了极高的成本效益。

实际应用与部署指南
LFM2.5-VL-3B的部署极为便捷,支持transformers库(>=5.10.1),并兼容llama.cpp、MLX、vLLM、SGLang和ONNX等主流推理框架。开发者只需几行代码即可加载模型并进行推理。例如,通过AutoProcessor和AutoModelForImageTextToText,可以轻松实现图像描述、视觉问答等任务。
该模型在多个场景中展现出实用价值:在文档处理中,可快速提取表格、图表和文字信息;在UI自动化中,能理解屏幕元素并执行点击、输入等操作;在智能客服中,可结合视觉输入提供精准回答。Liquid AI还提供了WebGPU浏览器演示,用户无需安装任何软件即可体验模型的强大功能。
未来展望:边缘AI的无限可能
LFM2.5-VL-3B的发布标志着边缘AI进入了一个新阶段。它证明了在有限的计算资源下,模型依然可以实现高水平的视觉理解和交互能力。随着模型压缩技术和硬件加速的不断发展,我们可以预见,未来的边缘设备将能够运行更复杂的AI应用,从智能家居到工业自动化,从医疗影像到自动驾驶,LFM2.5-VL-3B所代表的技术方向将为这些领域带来革命性的变化。
对于开发者而言,LFM2.5-VL-3B提供了一个强大的基础模型,可以通过微调适配特定任务。Liquid AI提供了详细的微调教程和丰富的文档,降低了应用门槛。随着社区生态的不断壮大,基于该模型的应用将如雨后春笋般涌现,推动人工智能真正实现无处不在。