LFM2.5-2.6B:边缘设备上的智能代理部署新范式

0 阅读

在人工智能快速演进的今天,将强大的代理能力部署到边缘设备已成为行业的重要趋势。Liquid AI最新发布的LFM2.5-2.6B模型,正是这一趋势下的突破性成果。这款仅26亿参数的模型,通过创新的训练方法,实现了在资源受限设备上运行复杂代理任务的可能,为开发者提供了全新的解决方案。

模型架构与训练创新

LFM2.5-2.6B的研发基于约34万亿token的预训练数据,并通过中期训练将上下文窗口扩展至128K。然而,真正使其脱颖而出的是其独特的后训练流程,该流程分为四个关键阶段,每个阶段都旨在提升模型的代理能力。

监督微调(SFT)

模型首先经历两轮监督微调,重点强化代理相关数据,如工具使用、网络搜索和代理轨迹。这一阶段为模型奠定了坚实的指令遵循和工具调用基础,使其能够理解并执行复杂的任务指令。

教师专业化

为了在多个领域实现专家级性能,研究团队为每个领域(如数学、代码、工具使用等)训练了专门的教师模型。这些教师模型在各自领域表现出色,为后续的知识蒸馏提供了高质量的教学资源。

多领域在线策略蒸馏(MOPD)

通过多领域在线策略蒸馏技术,将多个教师模型的知识整合到一个学生模型中。这一过程不仅保留了各领域的专业知识,还通过在线策略优化,使模型在生成过程中能够动态调整策略,提升整体性能。

代理强化学习(Agentic RL)

最后阶段是代理强化学习,模型在真实的代理框架内进行多轮强化学习,学习如何在不同工具、系统提示和多轮任务环境中协同工作。这一阶段显著提升了模型的实用性和鲁棒性,使其能够适应各种复杂的代理场景。

性能基准测试

为了全面评估LFM2.5-2.6B的性能,研究团队将其与多个体积更大的模型进行了对比,包括gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)和Qwen3.5-9B(9.7B)。测试覆盖了STEM、指令遵循、工具使用和代理任务等多个维度。

lfm2_5_2_6b_evaluations

指令遵循与工具使用

lfm2_5_2_6b_gpu_inference

在指令遵循方面,LFM2.5-2.6B表现出色,在IFBench、Multi-IF和IFStruct等基准测试中均取得最高分。例如,在IFBench上,其得分达到59.17,远超其他模型。在工具使用方面,模型在BFCLv4和ToolSandbox测试中同样领先,仅在BFCLv4上略逊于Qwen3.5-9B。这些结果充分证明了其在复杂指令解析和工具调用方面的强大能力。

代理任务与知识掌握

在代理任务评估中,LFM2.5-2.6B在τ³-Bench Banking和Claw-Eval等测试中表现稳定,与体积更大的Qwen模型持平,并显著优于Gemma系列。此外,在知识密集型任务如AA Omniscience上,模型取得了-29.50的优异成绩,远超其他模型,显示出其广泛的知识储备。

数学与代码能力

尽管在数学和代码任务上,LFM2.5-2.6B略逊于部分大型模型,但其在AIME25上仍取得了51.87的得分,接近Qwen3.5-9B的56.07。在LiveCodeBenchv6上,其得分59.41,虽不及Qwen3.5-9B的69.86,但已超越Gemma系列。这表明模型在保持轻量化的同时,仍具备较强的逻辑推理能力。

推理速度与效率

LFM2.5-2.6B的高效性不仅体现在性能上,更体现在推理速度上。得益于其LFM2架构,模型在CPU和GPU上均展现出卓越的推理性能。

CPU推理性能

在Apple M5 Max上,模型实现了220 tokens/s的解码速度,而在AMD Ryzen AI Max+ 395上,速度达到113 tokens/s。即使在手机等低功耗设备上,模型也能以30 tokens/s的速度运行,为移动端代理应用提供了可能。

GPU推理性能

在GPU环境下,LFM2.5-2.6B同样表现出色,在高并发场景下,其输出速度接近每秒15K tokens,单张H100 GPU每天可处理约13亿tokens。这一性能使其成为高吞吐量应用的理想选择,同时大幅降低了云推理成本。

部署与应用指南

LFM2.5-2.6B已获得llama.cpp、MLX、vLLM、SGLang和ONNX等主流推理框架的全面支持,开发者可以轻松将其集成到现有系统中。

快速开始

首先,安装最新版本的transformers库(需兼容transformers>=5.0.0):

pip install -U transformers

然后,通过以下代码加载并运行模型:

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype="bfloat16",
    # attn_implementation="flash_attention_2"  # 在兼容GPU上取消注释
)
tokenizer = AutoTokenizer.from_pretrained(model_id)

![LFM2.5-2.6B-Training-Recipe](https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/jg-qhMYLMPi6PAslhT9S_.png)

prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True,
    return_tensors="pt",
    tokenize=True,
).to(model.device)

![LFM2.5-2.6B-Agentic-RL](https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/E8SUiijksSkOvMs9tMjlw.png)

output = model.generate(
    input_ids,
    do_sample=True,
    temperature=0.2,
    top_k=80,
    repetition_penalty=1.05,
    max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))

lfm2_5_2_6b_cpu_inference

实际应用场景

LFM2.5-2.6B特别适合需要本地化、隐私敏感或高并发处理的代理应用。例如,在智能家居中,它可以作为本地语音助手,处理用户指令并控制设备;在移动应用中,它可以提供离线智能客服,无需网络连接即可响应用户查询;在工业场景中,它可以部署在边缘服务器上,实时处理传感器数据并做出决策。

未来展望

LFM2.5-2.6B的发布标志着边缘AI代理进入了一个新阶段。其卓越的性能和效率,使得在资源受限设备上运行复杂AI成为现实。随着硬件技术的不断进步和模型优化,我们有理由相信,未来的边缘设备将能够承载更加智能、更加自主的代理应用,为各行各业带来革命性的变化。

Liquid AI通过LFM2.5系列,不仅展示了其在模型压缩和训练技术上的深厚积累,也为整个AI社区提供了宝贵的开源资源。开发者可以基于这些模型,构建出更多创新应用,推动AI技术的普及和落地。