科大讯飞星火X2.5:国产MoE大模型支持端侧百万Token上下文

3 阅读

星火X2.5是什么

科大讯飞最近推出了星火X2.5大模型系列。这个系列包括两个部分:一个是云端的大模型,采用MoE(混合专家)架构,总参数量293B,但每次推理只激活30B;另一个是开源的端侧轻量模型,有4B和1.7B两个版本。

Loomy

整个模型系列是在全国产算力上完成全流程训练的,从底层芯片到上层模型都实现了自主可控。官方强调,这解决了对海外算力依赖的问题。

在能力方面,星火X2.5重点加强了代码生成、智能体(Agent)协作和数学推理。特别值得注意的是,它的端侧模型原生支持100万Token的超长上下文——这在同类端侧模型中是第一个做到的。为了在手机、IoT设备这类低算力平台上跑得动,它用了混合注意力架构来控制计算开销。

硬件兼容性也做得比较全面,不管是英伟达GPU、华为昇腾NPU,还是海光、后摩的芯片都能跑。软件层面则支持vLLM、Ollama这些主流推理框架。目前模型已经上线讯飞开放平台,也能在Hugging Face上下载。

核心技术特点

全国产算力训练

星火X2.5最大的标签之一是“全国产”。它的预训练和后训练全部在华为昇腾等国产智算集群上完成。这意味着从芯片、框架到模型本身,整条技术链都不依赖国外技术。对于政府、金融、能源这些对供应链安全要求高的行业来说,这点很关键。

MoE高效架构

云端版本用了稀疏激活的MoE设计。总参数293B听起来很大,但实际推理时只调用30B的专家子网络。这种设计的好处是:既能保持大模型的表达能力,又不会让推理成本和显存占用失控。简单说,就是花小钱办大事。

端侧百万Token上下文

端侧模型支持100万Token上下文这事挺让人意外的。通常这种超长上下文都是云端大模型的特权,因为计算和内存开销太大。星火X2.5-4B/1.7B通过一种叫“混合注意力”的机制解决了这个问题:每4层注意力里,只有1层是全注意力,另外3层用滑动窗口限制计算范围。这样既保留了处理长文本的能力,又把计算量压了下来。

实测下来,它确实能在手机上处理整本小说或者几十页的合同,而不用切片或摘要。

能力专项优化

除了架构创新,讯飞还用MOPD(多目标偏好蒸馏)和大规模强化学习做了后训练优化。重点打磨了几个场景:

  • 代码生成:在SWE-Bench这类权威评测中,它的4B端侧模型甚至超过了某些9B级别的竞品。写算法、补全函数、解释报错这些任务表现都不错。
  • 智能体协作:深度集成了Codex、OpenClaw等主流Agent框架,能自己拆解复杂任务、调用工具、多步执行。比如让它订机票+酒店+接送,它会一步步调用不同API完成。
  • 数学推理:高考数学和AIME(美国数学邀请赛)的测试成绩进了行业第一梯队。不只是套公式,还能处理需要多步推导的应用题。

开源与部署

星火X2.5的端侧版本是真开源,许可证用的是Apache 2.0,商用也没问题。你可以在Hugging Face、ModelScope或者GitHub上直接下载权重文件。

部署方式也很灵活:

  • 如果你用NVIDIA GPU,可以用vLLM或SGLang跑,速度很快;
  • 华为昇腾用户可以直接拉官方Docker镜像,省去适配麻烦;
  • 苹果Mac用户用MLX就能跑起来;
  • 想快速体验的话,Ollama或LM Studio导入模型后点几下鼠标就能聊天。

对于企业用户,还可以用LLaMA-Factory对开源模型做微调,快速适配自己的业务场景,比如客服话术、合同审核之类。

和竞品比怎么样

拿它和阿里通义千问Qwen3.7-Max对比,能看出明显差异:

  • 架构:星火用MoE(293B总参/30B激活),千问是密集架构(约450B激活)。前者推理更省资源。
  • 算力:星火全靠国产昇腾集群,千问用阿里云灵骏集群(含英伟达芯片)。
  • 上下文:两家都支持100万Token,但星火是端侧原生支持,千问主要在云端。
  • 代码能力:星火4B端侧模型在SWE-Bench Pro得分44.4,千问Max是60.6。不过考虑到参数量差距,星火的单位参数效率更高。
  • 开源策略:星火端侧模型完全开源,千问Max闭源只能API调用。
  • 硬件生态:星火兼容英伟达/昇腾/海光/后摩,千问主要绑定阿里云生态。

简单说,如果你在意国产化、端侧部署或想自己魔改模型,星火X2.5优势明显;如果追求极致性能且不介意闭源,千问Max可能更强。

实际能用来干啥

智能编程助手

它的代码能力不是吹的。实测让它写一个带缓存的HTTP请求工具,不仅能正确实现,还会主动加异常处理和类型注解。在SWE-Bench这种模拟真实GitHub issue修复的测试里,表现超过了不少更大参数的模型。对开发者来说,相当于多了个懂上下文的AI同事。

企业自动化Agent

因为深度集成Agent框架,它可以处理那种需要多步操作的任务。比如“查下周北京到上海最便宜的航班,订一间浦东机场附近的四星级酒店,再叫个接送机”。它会先调航班API,再根据结果筛选酒店,最后安排接送——全程不用人干预。

端侧长文档处理

100万Token上下文在端侧的意义很大。以前手机上的AI只能看几段文字,现在能直接喂整份PDF合同进去,让它总结风险条款;或者上传一小时的会议录音转文字,直接问“张总提了哪三个建议”。离线场景下尤其有用,比如车载系统分析长篇导航日志,或者工业设备本地处理传感器历史数据。

数学教育辅导

数学能力不只是刷题快。它能解释为什么某个解法行不通,或者把一道高考压轴题拆成学生能理解的步骤。有老师试过让它生成个性化练习题——根据学生错题记录动态出题,难度和知识点都匹配。这种自适应辅导以前需要专门系统,现在一个模型就能搞定。

信创环境私有化部署

对国企、银行这些单位,数据不能出内网是硬需求。星火X2.5从芯片到模型全栈国产,正好满足信创要求。已经有金融机构在测试用它做内部知识库问答,所有数据留在本地,响应速度还比公有云快。

写在最后

星火X2.5没搞那些虚头巴脑的概念,而是扎扎实实在几个关键点上突破:国产算力闭环、端侧长上下文、MoE效率优化。特别是把100万Token带到端侧,打开了很多新场景。

开源策略也很实在——4B和1.7B模型直接放出来,Apache 2.0协议连商用都省心。对于想在国产硬件上跑大模型的团队,或者需要离线长文本处理的开发者,这可能是目前最可行的选择之一。

当然,它也不是全能。比如多模态能力这次没提,可能还在路上;代码能力虽强,但和顶尖闭源模型还有差距。不过在一个强调自主可控的时代,能用全国产栈跑出接近国际水平的效果,已经很难得了。