Qwen3.8-2.4T-A95B多芯片Day0适配:FlagOS如何实现超大规模MoE模型的规模化落地

1 阅读

从Day0适配到规模化验证:超大规模MoE模型的多芯片落地实践

2026年8月,阿里巴巴开源了其史上规模最大的MoE模型Qwen3.8-2.4T-A95B,总参数高达2.4万亿,激活参数950亿,首次将Qwen-Max级别的能力开放给开发者。这一模型在编程、专业工作、科研和长程智能体任务上表现卓越,支持动态推理深度调节和长上下文扩展。然而,如此庞大的模型如何在不同AI芯片上快速部署,成为产业界面临的现实挑战。

众智FlagOS社区在模型发布当天即完成了9款芯片的Day0适配,覆盖平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能和燧原等主流AI芯片。这标志着基于统一开源软件栈实现前沿模型“一次开发、多芯快速适配”已具备规模化落地能力。

超大规模参数带来的系统级挑战

Qwen3.8-2.4T-A95B的参数量相比前代Qwen3.5-397B扩大了6倍,这给系统软件栈带来了前所未有的压力。首先,模型权重和激活值的存储与访存需求激增,对显存容量和内存带宽提出了更高要求。其次,MoE架构中的专家并行和通信开销随规模增长而显著增加,需要精细的调度策略。最后,不同芯片的算力特性和显存大小差异巨大,如何让模型在各类硬件上高效运行,成为适配工作的核心难题。

FlagOS技术团队通过引入统一的INT8量化支持,有效缓解了显存压力。FlagOS-Compressor工具链提供了从FP8/BF16原生权重到INT8的两条量化路径,并完成了量化推理算子在多款芯片上的适配。量化后的模型在多种AI芯片上评测,与英伟达CUDA原生FP8版本相比,误差平均分偏差均在对齐区间内,保证了模型质量。

FlagOS技术栈:五大核心组件支撑跨芯适配

FlagOS 2.1统一多芯片系统软件栈为Qwen3.8-2.4T的快速适配提供了全链路技术支撑,涵盖算子层、编译层、框架层和工具层。

统一多芯片推理框架插件:vLLM-plugin-FL和SGLang-plugin-FL基于FlagOS统一后端开发,在不改变原生接口的前提下,实现了多芯片推理部署。针对MoE模型的专家调度、张量并行和流水线并行进行了专项优化,各芯片支持的框架版本和并行配置均有详细文档。

多芯片量化压缩工具FlagOS-Compressor:聚焦模型量化,通过降低权重和激活的存储与计算开销,服务于多芯片平台的高效部署。本次针对Qwen3.8-2.4T,实现了W8A8量化,将权重和激活从BF16压缩至INT8,显著降低显存占用,同时解决了80%以上存量AI算力不支持FP8的问题。

高性能算子库FlagGems:基于Triton语言实现,本次适配启用了MoE专家调度、Attention计算以及新增的INT8量化推理算子。算子库支持英伟达、摩尔线程、沐曦等多家芯片,各芯片实际启用的算子集合以模型卡说明为准。

统一AI编译器FlagTree:基于Triton深度定制,可将核心算子编译为多芯片后端可识别的指令,解决不同芯片编译器生态割裂的问题。

模型跨芯迁移发布工具FlagRelease:已完成Qwen3.8-2.4T在多种芯片上的模型迁移、精度对齐与版本发布,覆盖HuggingFace、魔搭等平台。截至2026年8月,FlagRelease已发布覆盖10+家芯片厂商、12+款硬件、80+个开源模型实例的跨芯适配版本。

开发者速用指南:两种方式快速部署

开发者可以通过两种方式快速部署Qwen3.8-2.4T-A95B。

方式一:源码安装部署。以vLLM为例,需依次安装vLLM、vllm-plugin-FL、FlagGems,可选安装FlagTree和FlagCX。具体命令如下:

# 1. 安装vLLM
git clone https://github.com/vllm-project/vllm.git
cd vllm
git checkout v0.24.0
VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation --no-deps

# 2. 安装vllm-plugin-FL
git clone https://github.com/flagos-ai/vllm-plugin-FL
cd vllm-plugin-FL
git checkout v0.3.0-dev
pip install --no-build-isolation -e .

# 3. 安装FlagGems算子库
git clone https://github.com/flagos-ai/FlagGems
cd FlagGems && git checkout v5.3.0
pip install --no-build-isolation -e .

运行推理时,需根据芯片型号调整模型路径、并行大小等参数。以下为平头哥平台INT8版本的示例:

from vllm import LLM, SamplingParams
prompts = ["请介绍下阿里巴巴开源最新模型QWen3.8"]
sampling_params = SamplingParams(max_tokens=10, temperature=0.0)
llm = LLM(
    model="FlagRelease/Qwen3.8-2.4T-A95B-INT8-zhenwu-FlagOS",
    max_num_batched_tokens=8192,
    max_num_seqs=32,
    tensor_parallel_size=16,
    pipeline_parallel_size=2)
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
    print(f"Prompt: {output.prompt!r}")
    print(f"Generated: {output.outputs[0].text!r}")

方式二:模型镜像直接下载。FlagRelease提供了多芯片版本的模型文件和镜像,预置了FlagGems、FlagTree等组件,开发者无需自行迁移,开箱即用。

开发者体验:零改码、精度对齐、开箱即用

FlagOS适配的Qwen3.8-2.4T在开发者体验上实现了三大突破。

零改码适配:无论是模型原有接口、vLLM推理引擎使用逻辑,还是开发者的日常调用代码,均无需修改。FlagOS通过统一插件实现算子从CUDA到Triton的替换,开发者无需学习硬件相关开发知识。

核心能力与原生版本对齐:经GPQA_Diamond、MUSR等权威评测集验证,适配后的模型在Agentic Coding能力、复杂推理等核心能力上与CUDA原生版本对齐,可放心应用于代码生成、日志分析、Bug排查等生产场景。

开箱即用部署:FlagRelease直接提供多芯片版本的模型和镜像,加载时底层优化自动生效,无需额外初始化代码。

开源共建:FlagOS持续做开发者的“跨芯适配后盾”

FlagOS社区自成立以来,始终以开源开放、众智共建为核心理念。目前,社区已有100家成员单位,包括科研机构、芯片企业、系统厂商等。FlagOS所有核心组件均在GitHub开源,并开放了数十款主流模型和十多款AI芯片的适配方案。

开发者可以通过多种路径参与共建:新手可提交Issue、完善文档;深度技术爱好者可参与FlagGems算子开发、FlagTree编译器后端扩展;生态贡献者还可基于FlagOS Skills开发AI Agent专业技能。

结语

Qwen3.8-2.4T-A95B的多芯片Day0适配,不仅展示了FlagOS在超大规模模型适配上的技术实力,更验证了开源统一软件栈在解决AI算力碎片化问题上的巨大潜力。随着模型规模持续增长,异构算力协同将成为常态,FlagOS的实践为产业界提供了可复用的范式。未来,FlagOS将继续推动“一次开发、多芯适配”的规模化落地,让更多开发者能够低成本地使用前沿模型,释放多元算力的价值。