LFM2.5-2.6B:边缘设备上的智能代理部署新范式
在人工智能快速演进的今天,将强大的代理能力部署到边缘设备已成为行业的重要趋势。Liquid AI最新发布的LFM2.5-2.6B模型,正是这一趋势下的突破性成果。这款仅26亿参数的模型,通过创新的训练方法,实现了在资源受限设备上运行复杂代理任务的可能,为开发者提供了全新的解决方案。
模型架构与训练创新
LFM2.5-2.6B的研发基于约34万亿token的预训练数据,并通过中期训练将上下文窗口扩展至128K。然而,真正使其脱颖而出的是其独特的后训练流程,该流程分为四个关键阶段,每个阶段都旨在提升模型的代理能力。
监督微调(SFT)
模型首先经历两轮监督微调,重点强化代理相关数据,如工具使用、网络搜索和代理轨迹。这一阶段为模型奠定了坚实的指令遵循和工具调用基础,使其能够理解并执行复杂的任务指令。
教师专业化
为了在多个领域实现专家级性能,研究团队为每个领域(如数学、代码、工具使用等)训练了专门的教师模型。这些教师模型在各自领域表现出色,为后续的知识蒸馏提供了高质量的教学资源。
多领域在线策略蒸馏(MOPD)
通过多领域在线策略蒸馏技术,将多个教师模型的知识整合到一个学生模型中。这一过程不仅保留了各领域的专业知识,还通过在线策略优化,使模型在生成过程中能够动态调整策略,提升整体性能。
代理强化学习(Agentic RL)
最后阶段是代理强化学习,模型在真实的代理框架内进行多轮强化学习,学习如何在不同工具、系统提示和多轮任务环境中协同工作。这一阶段显著提升了模型的实用性和鲁棒性,使其能够适应各种复杂的代理场景。
性能基准测试
为了全面评估LFM2.5-2.6B的性能,研究团队将其与多个体积更大的模型进行了对比,包括gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)和Qwen3.5-9B(9.7B)。测试覆盖了STEM、指令遵循、工具使用和代理任务等多个维度。

指令遵循与工具使用

在指令遵循方面,LFM2.5-2.6B表现出色,在IFBench、Multi-IF和IFStruct等基准测试中均取得最高分。例如,在IFBench上,其得分达到59.17,远超其他模型。在工具使用方面,模型在BFCLv4和ToolSandbox测试中同样领先,仅在BFCLv4上略逊于Qwen3.5-9B。这些结果充分证明了其在复杂指令解析和工具调用方面的强大能力。
代理任务与知识掌握
在代理任务评估中,LFM2.5-2.6B在τ³-Bench Banking和Claw-Eval等测试中表现稳定,与体积更大的Qwen模型持平,并显著优于Gemma系列。此外,在知识密集型任务如AA Omniscience上,模型取得了-29.50的优异成绩,远超其他模型,显示出其广泛的知识储备。
数学与代码能力
尽管在数学和代码任务上,LFM2.5-2.6B略逊于部分大型模型,但其在AIME25上仍取得了51.87的得分,接近Qwen3.5-9B的56.07。在LiveCodeBenchv6上,其得分59.41,虽不及Qwen3.5-9B的69.86,但已超越Gemma系列。这表明模型在保持轻量化的同时,仍具备较强的逻辑推理能力。
推理速度与效率
LFM2.5-2.6B的高效性不仅体现在性能上,更体现在推理速度上。得益于其LFM2架构,模型在CPU和GPU上均展现出卓越的推理性能。
CPU推理性能
在Apple M5 Max上,模型实现了220 tokens/s的解码速度,而在AMD Ryzen AI Max+ 395上,速度达到113 tokens/s。即使在手机等低功耗设备上,模型也能以30 tokens/s的速度运行,为移动端代理应用提供了可能。
GPU推理性能
在GPU环境下,LFM2.5-2.6B同样表现出色,在高并发场景下,其输出速度接近每秒15K tokens,单张H100 GPU每天可处理约13亿tokens。这一性能使其成为高吞吐量应用的理想选择,同时大幅降低了云推理成本。
部署与应用指南
LFM2.5-2.6B已获得llama.cpp、MLX、vLLM、SGLang和ONNX等主流推理框架的全面支持,开发者可以轻松将其集成到现有系统中。
快速开始
首先,安装最新版本的transformers库(需兼容transformers>=5.0.0):
pip install -U transformers然后,通过以下代码加载并运行模型:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # 在兼容GPU上取消注释
)
tokenizer = AutoTokenizer.from_pretrained(model_id)

prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)

output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))
实际应用场景
LFM2.5-2.6B特别适合需要本地化、隐私敏感或高并发处理的代理应用。例如,在智能家居中,它可以作为本地语音助手,处理用户指令并控制设备;在移动应用中,它可以提供离线智能客服,无需网络连接即可响应用户查询;在工业场景中,它可以部署在边缘服务器上,实时处理传感器数据并做出决策。
未来展望
LFM2.5-2.6B的发布标志着边缘AI代理进入了一个新阶段。其卓越的性能和效率,使得在资源受限设备上运行复杂AI成为现实。随着硬件技术的不断进步和模型优化,我们有理由相信,未来的边缘设备将能够承载更加智能、更加自主的代理应用,为各行各业带来革命性的变化。
Liquid AI通过LFM2.5系列,不仅展示了其在模型压缩和训练技术上的深厚积累,也为整个AI社区提供了宝贵的开源资源。开发者可以基于这些模型,构建出更多创新应用,推动AI技术的普及和落地。