阿里云栖大会公布Qwen4训练进展与全模态模型新能力

2 阅读

Qwen4已开始训练,参数规模将迈向10万亿

在2026年9月22日开幕的云栖大会上,阿里巴巴公布了其大模型技术的最新进展。其中最受关注的是下一代大语言模型Qwen4——目前已基于全新架构投入训练。官方透露,后续的Qwen4.5和Qwen5版本将把总参数量扩展至5万亿甚至10万亿级别。

文章配图

这一路线图延续了阿里对“更大参数带来更强性能”的判断。不过,单纯堆参数并非重点,真正关键的是如何在提升能力的同时控制成本。为此,阿里提前开源了Qwen3.8-Flash架构,该设计通过改进注意力机制和信息传递方式,在保持前沿性能的前提下,将训练成本降低近90%,推理效率也达到新的帕累托前沿。

值得注意的是,Qwen3.8-Max在Artificial Analysis排行榜上的得分已从40分提升至45分,进入与Claude、GPT等模型同列的前沿梯队。这一进步并非仅靠人工调优,而是得益于一套名为“模型自我进化”(RSI)的技术体系。

模型能自己训练自己?Qwen3.8-Max实现33轮无人干预迭代

传统大模型迭代依赖研究员分析问题、准备数据、安排训练,流程高度人工化。而Qwen3.8-Max现在可以自主搭建训练流程、构造数据、设计实验并定位缺陷,在人类完全不介入的情况下连续运行超过一个月,完成33轮有效迭代。

这种自主性不仅体现在训练环节。在推理优化上,Qwen3.8曾在未见过的平头哥新款GPU上,自动适配并优化了Qwen3.8-Flash模型的SGlang推理框架,使单实例推理吞吐量提升96%。更令人意外的是,它还能参与芯片设计协同:仅凭一份总线模块规范,模型自主调用EDA工具超万次,经过60多小时运行,最终实现了物理实现面积减少42%、标准单元数降低29%、功耗下降59.5%的优化结果。

这些尝试表明,大模型正从被动执行工具转向具备一定“工程智能”的参与者。虽然离真正的自主科研还有距离,但至少在特定任务链中,AI已能承担部分原本属于工程师的工作。

视频模型Wan3.0登顶,下一代支持导演级叙事

多模态是本次大会的另一焦点。视频生成模型Wan3.0在Artificial Analysis的文生视频与视频编辑两个榜单均位列全球第一。它支持单次生成30秒视频,能处理文档、表格、网页等结构化输入,并实现原生音画同步。

更值得关注的是即将于11月发布的下一代视频模型。据阿里介绍,新模型将在“更长、更可控、更完整、更智能”四个维度突破:长时间生成仍能保持角色和场景一致性;创作者可精准控制人物动作、镜头运动和环境变化;更重要的是,模型开始具备“导演思维”,不再只是生成孤立片段,而是理解完整叙事逻辑,从单镜头走向故事构建。

这一方向若能落地,将极大改变短视频、广告甚至影视预演的生产流程。目前行业主流仍停留在“提示词→片段”模式,而阿里试图让AI理解“起承转合”。

音频、图像、音乐、同传全面升级

语音方面,Qwen-Audio-3.1系列覆盖ASR(语音转写)、TTS(语音合成)和Realtime(实时交互)三大赛道,均进入国际第一梯队。其中Realtime模型已用于千问办公、Qoder及AI眼镜等产品,支持边听边想边说,并增强多语言、角色扮演和共情能力。

两款基于新架构的专用模型也亮相:TTS-Next可一键生成包含对白与环境音的完整音频,适用于有声书或影视剧;ASR-Next则能识别情绪、音乐类型、机械声等复杂音频元素,回答“这段录音中人的情绪如何”这类问题。

图像模型Qwen-Image-3.1针对电商和设计场景优化,将数小时的设计工作压缩至秒级,同时支持高精度编辑。其轻量版Qwen-Image-2.1(7B参数)已开源,在Qwen-Image-Bench评测中超越多数闭源模型,成为当前最强开源生图模型之一。它还原生支持透明图生成,能自动判断输出RGBA还是RGB,并支持最多10张参考图的多图编辑。

音乐模型Happy Shrimp 1.1提升了人声质量、多语种演唱和指令理解能力,支持百余种曲风和十余种语言。同声传译模型Qwen3.8-LiveTranslate采用Interleave架构,字均延迟降至2.3秒(人类平均为4秒),并支持说话人分离、双语同屏、长上下文消歧等功能。

世界模型HappyOyster 2.0 Preview则强化了实时交互、记忆能力和物理规律遵循,目标是从实验室走向真实可用。

开源生态爆发:Qwen成全球开发者基座

阿里强调“AI普惠”是其核心目标之一。Qwen3.8系列全部开源,一个月内相关模型下载超5600万次,衍生模型达1900个。其中Qwen3.8-27B在Hugging Face上超越DeepSeek-R1和Llama3.1,成为史上最受欢迎的大模型。

截至目前,阿里已开源460多个千问模型,总下载量超30亿次,衍生模型超30万个。Hugging Face官方报告称,Qwen已成为全球AI开源社区的基座模型,英伟达、AWS、微软、DeepSeek等公司均基于其开发自有应用。

企业落地案例也在增加。Airbnb CEO布莱恩·切斯基公开表示公司“大量依赖千问模型”,认为其“比OpenAI更好更便宜”;Pinterest使用Qwen搭建AI购物助手,成本不到Anthropic或OpenAI同类模型的8%;路透社则基于Qwen开发自有模型以降低对Claude的依赖。

软硬一体的长期投入

阿里称过去十七年持续投入AI与云计算,是中国唯一具备软硬一体垂直整合能力的全栈AI公司。其Token Foundry实验室聚集了国内最密集的AI人才,横跨语言与多模态领域。同时,千问办公、Qoder等内部工具提供了真实应用场景,形成“研发—应用—反馈”闭环。

从Qwen3.8-Max的自主迭代,到Wan3.0的视频生成,再到芯片协同优化,阿里的策略清晰:不止于模型性能竞赛,而是构建一个覆盖训练、推理、硬件、应用的完整生态。在这个生态中,开源不仅是技术输出,更是吸引全球开发者共同进化的杠杆。

未来几个月,随着Qwen4训练推进和下一代视频模型发布,这场围绕全模态智能的竞赛或将进入新阶段。