千问上线 Qwen3.8-Omni-Flash:支持1M上下文,音视频处理能力显著提升
千问推出新一代全模态模型 Qwen3.8-Omni-Flash
9月18日,千问正式上线 Qwen3.8-Omni-Flash,这是一款原生支持文本、图像、音频和视频输入的大模型,最大上下文长度达到100万token(即1M)。该模型已在千问AI平台开放体验,重点强化了以音视频为核心的 Agentic 应用能力。
所谓 Agentic 能力,指的是模型不仅能理解内容,还能主动执行任务。Qwen3.8-Omni-Flash 在此基础上拓展了视频剪辑、MV创作、影视解说、音视频转图文摘要以及音视频对话等复杂工作流的支持。这些场景往往需要模型同时处理多种模态信息,并做出连贯的决策或输出。
30项评测平均提升超26%
根据官方公布的数据,Qwen3.8-Omni-Flash 在累计30项评测中,平均得分较上一代 Qwen3.5-Omni-Plus 提升超过26%。这一进步在多个关键维度尤为突出:
- Agentic 能力:在 WildClawBench-MM 上提升36.5分,AgenticVBench 提升22.3分,UniClawBench 得分为69.6分。
- 基础多模态理解:LongAudioSpan 提升8.3分,OmniVideoBench 提升9.6分。
- 音视频转写质量:OmniCap-IF 的字符错误率(CSR)和词错误率(ISR)分别下降8.5和14.1个百分点。
- 会议语音处理:在 AliMeeting 数据集上,说话人错误率(DER)从88.11%降至3.35%,cpWER(考虑说话人切换的词错误率)从89.61%大幅降至17.18%。

这些数字背后,是模型对长时音频、复杂视频场景和多人对话的理解能力显著增强。比如 DER 从接近90%降到3%出头,意味着模型现在能更准确地区分不同说话人,这对会议记录、访谈整理等应用至关重要。

音频能力超越 Gemini3.8Flash,价格大幅下调
千问官方表示,Qwen3.8-Omni-Flash 的音视频综合能力已接近 Google 的 Gemini3.8Flash,而在纯音频处理方面整体表现更优。更值得注意的是成本变化:API 调用中,每小时音频输入的价格降幅超过98%,音视频混合输入的价格降幅也超过93%。
这意味着开发者可以用极低的成本接入高质量的音视频理解服务。例如,过去处理一小时会议录音可能花费数元甚至更高,现在可能只需几分钱。这种价格调整有望推动音视频AI应用在客服、教育、媒体等领域的快速落地。
优化推理效率:Token 消耗减少近一半
除了能力提升,新模型在推理效率上也有明显改进。通过扩展 Qwen-MM-Plugins 并开源 Qwen-Live Harness 工具,千问为长程工作流和实时交互提供了更好支持。
在 Agentic Understanding 模式下,模型处理视频任务的准确率从63.4%提升至67.8%,同时 Token 消耗从145,736降至79,117,降幅约45.7%。这意味着同样的硬件资源可以支撑更多并发请求,或者在相同成本下提供更快的响应速度。
Qwen-Live Harness 的开源也让开发者能更灵活地集成实时音视频处理能力,比如构建直播字幕、实时会议摘要或互动教学系统。
模型开始“自己训练自己”
一个有趣的细节是,千问团队尝试让模型参与自身的研发迭代。在一次实验中,Qwen3.8-Omni-Flash 在12小时内自主完成了评测集选择、训练数据构建和4轮模型迭代,累计生成3,413条训练样本。

这项自动化流程被用于优化方言识别能力。结果显示,基于该流程微调的 Qwen2.5-Omni-3B 模型,四川话识别的字符错误率从25.79%降至15.30%,相对下降约40.7%。虽然这仍是小规模实验,但它展示了大模型在数据工程和模型调优环节的潜力——未来或许能减少人工干预,加速垂直领域模型的定制。
首个支持“听声辨位”的全模态模型
同步推出的 Realtime 版本还带来一项新功能:“听声辨位”。这是业内首个在全模态大模型中实现该能力的版本。
“听声辨位”指的是模型不仅能听清声音内容,还能判断声源在空间中的位置。比如在一段多人对话视频中,模型可以识别出“左边穿蓝衣服的人说……”、“右侧背景中的喇叭正在播放音乐”等信息。这项能力对沉浸式视频分析、智能监控、虚拟现实交互等场景有重要价值。
目前尚不清楚该功能依赖的是单麦克风阵列还是多通道音频输入,但即便基于普通立体声,能实现基本的空间感知也已是不小突破。
实际应用场景正在打开
Qwen3.8-Omni-Flash 的升级并非只停留在 benchmark 数字上。它的能力组合恰好覆盖了当前 AI 应用最热门的几个方向:
- 自媒体创作者:可自动将长视频拆解为图文摘要,生成带时间戳的要点,甚至根据脚本自动剪辑 MV。
- 企业会议系统:高精度区分说话人、生成结构化纪要,并支持后续语音问答(如“张总提到的预算数字是多少?”)。
- 教育产品:实时将课堂录像转为带知识点标注的文字稿,学生可点击某段讲解回看视频片段。
- 无障碍服务:为视障用户提供视频内容的详细语音描述,包括人物动作、场景变化和字幕内容。
随着 API 成本大幅下降,这些应用的商业化门槛也在降低。过去只有大公司才能负担的多模态处理,现在中小团队也能尝试。
开源与生态建设同步推进
除了模型本身,千问此次还开源了 Qwen-Live Harness,这是一个用于构建实时多模态应用的工具链。它简化了音视频流接入、模型推理调度和结果后处理的流程,开发者无需从零搭建 pipeline。
结合已有的 Qwen-MM-Plugins 插件体系,用户可以像搭积木一样组合不同功能模块。例如,一个视频分析应用可以先调用“语音转写”插件,再用“情感分析”插件判断说话人情绪,最后通过“关键帧提取”插件生成摘要图集。
这种模块化设计降低了使用门槛,也鼓励社区贡献更多垂直领域的插件,形成良性生态。
下一步挑战在哪里?
尽管进步显著,但全模态模型仍面临一些现实问题。比如,1M 上下文虽长,但处理超长视频(如整场演唱会或全天会议)时,如何高效索引关键片段仍是难题。另外,多模态对齐的准确性——尤其是当音频、画面和文字信息存在冲突时——还需要更多真实场景验证。
此外,虽然 API 价格大幅下降,但高频调用下的累积成本仍不可忽视。对于需要7×24小时运行的应用(如智能客服),模型的推理速度和能耗效率可能比绝对精度更重要。
不过,Qwen3.8-Omni-Flash 至少证明了一点:全模态大模型正从“能做”走向“好用”,而不仅仅是实验室里的技术演示。