腾讯混元开源 AuK:一个能听懂指令的语音生成与编辑模型
AuK 是什么?
AuK 是腾讯混元推出的一个开源语音基础模型,参数量约 15 亿。它不走常见的自回归路线,而是采用流匹配(flow-matching)扩散架构。这个设计让它特别适合“编辑”类任务——不是从零生成一段新语音,而是在已有音频上做局部修改。

用户只需要用自然语言写一条指令,比如“把这句话里的‘明天’改成‘后天’”,或者“让声音听起来更兴奋一点”,AuK 就能完成操作。官方称它支持 16 种不同的语音任务,覆盖了生成、编辑、增强和分离等多个方向。为了提升推理速度,团队还发布了 AuK-Flash 版本,只需 4 步就能出结果,速度比标准版快 4.5 倍左右。
它能做什么?
AuK 的功能可以大致分成几类:
首先是语音合成。它支持两种方式:一种是 Zero-shot TTS,你给几秒钟的参考音频,它就能克隆出那个音色,再念你指定的新文本;另一种是 Instruct TTS,连参考音频都不需要,直接用文字描述声音特征,比如“年轻女性,语速偏快,带点南方口音”,模型就能生成对应的语音。
其次是内容编辑。这是 AuK 最突出的能力之一。你可以对一段已有的录音进行文字层面的修改——替换某个词、插入一句话、甚至删掉整段内容,而说话人的音色、语调、情绪基本保持不变。类似的功能也适用于歌声:保留原唱的旋律和嗓音特质,只改歌词。
第三类是声学属性调节。你可以精确控制音高(单位:半音)、语速(倍速)和音量(分贝)。比如把一段演讲调慢 1.2 倍,同时提高 3 分贝,让它更适合听力障碍者收听。
还有情绪与音色的独立编辑。比如一段平静的叙述,你可以让它变得愤怒或悲伤,但不改变字词;反过来,也可以保留内容不变,把男声换成女声,或者换成卡通角色的声音。
副语言事件也能处理。呼吸声、笑声、咳嗽声这些非语言成分,可以被添加或移除。它还能实现正常说话和耳语之间的转换。
最后,AuK 还具备音频分离能力。面对多人对话录音,它可以按说话顺序拆分成单人轨道;如果给一段描述,比如“提取穿红衣服那位女士的声音”,它也能尝试定位并分离目标人声。音乐场景下,它能从歌曲中抽取出干净的人声,去掉伴奏。
技术是怎么实现的?
AuK 的整体架构分为三个主要部分。
第一部分是一个多模态大模型,负责理解用户的自然语言指令,同时处理可能提供的参考音频。目前官方推荐使用 Qwen2.5-Omni-3B 来承担这个角色,它会输出一个语义条件向量,告诉后面的音频生成模块“要做什么”。
第二部分是音频 VAE(变分自编码器),它把原始的 24kHz 音频波形压缩成一个 50Hz 的隐空间表示。这个低维表示保留了声音的关键声学特征,但数据量大大减少,便于后续处理。
核心是第三部分:一个混合 Transformer 结构。它由 10 层双流 MMDiT 和 20 层单流 DiT 堆叠而成,模型宽度为 1536,总参数达到 15 亿。这个模块接收语义条件和音频隐表示,通过流匹配扩散过程,生成目标音频的隐表示,最后再由 VAE 解码回波形。
训练方面,团队用了大约 30.3 亿条“指令—音频”配对数据,累计有效监督时长约 195 万小时。关键在于,所有 16 种任务都被统一成同一种输入输出格式:“指令 + 输入音频 → 输出音频”。这种统一范式让模型学会泛化,而不是为每个任务单独训练一个专家模型。
此外,模型还经过了人类偏好优化和强化学习后训练(RL post-training),目的是让生成的语音听起来更自然、更准确地遵循指令,并提升整体听感质量。
怎么用起来?
想在本地跑 AuK,硬件门槛不低。你需要一块显存接近 24GB 的 NVIDIA GPU,比如 RTX 3090 或 4090。
具体步骤是:先从 GitHub 克隆 Tencent-Hunyuan/AuK 仓库;然后按说明配置好 Python 环境和依赖包;接着从 Hugging Face 或 ModelScope 下载 AuK 的主模型权重和配套的 VAE 文件;别忘了还要单独下载并配置好 Qwen2.5-Omni-3B 这个语义条件模型。
准备好之后,你就可以编写自然语言指令了。比如:“将音频中‘项目将在下周启动’改为‘项目将在下个月启动’,保持原音色和语速。” 然后通过命令行工具传入指令、参考音频(如果需要)和目标文本,启动推理。生成完成后,试听效果,如果不满意,可以调整指令的措辞、采样步数或者 CFG 强度,重新生成。
为什么说它有优势?
AuK 的核心优势在于“统一”和“编辑”。
过去,要做 TTS、降噪、人声分离这些事,通常得用好几个不同的专用模型。AuK 用一个模型、一个接口就搞定了 16 种任务,大大简化了开发和部署流程。
更重要的是,它的编辑能力在业界非常稀缺。很多 TTS 模型只能生成全新的语音,无法对已有录音进行精细修改。而 AuK 基于扩散架构,编辑时以原始音频的隐表示为起点,只对指令要求的部分进行“去噪”和修改,未改动的部分几乎没有任何损伤。这使得它在影视后期、播客剪辑等需要保留原始表演细节的场景中,价值巨大。
另外,Instruct TTS 功能降低了使用门槛。不需要找参考音频,只要能用文字描述清楚想要的声音,就能生成,这对创意工作来说是个很大的便利。
和阿里 CosyVoice 3 有什么不同?
拿 AuK 和阿里的 CosyVoice 3 对比,能看出两者定位差异很大。
CosyVoice 3 的核心是语音合成(TTS),强项在于多语言支持(9种语言+18种中文方言)和实时性(首包延迟低至150ms),适合用在对话机器人、实时播报这类需要快速响应的场景。但它不支持对已有音频进行内容编辑或分离。
而 AuK 的定位是语音生成与编辑的基础模型。它不追求低延迟,而是追求任务的广度和编辑的精度。16种任务覆盖了从生成到后期处理的完整链条。如果你的需求是“改一段录音里的错字”或者“从会议录音里提取某个人的发言”,那 AuK 是目前开源方案里少有的选择。
架构上,AuK 是纯扩散模型,CosyVoice 3 则结合了 LLM 和分块流匹配。参数规模两者都有 1.5B 版本,但应用场景完全不同。
实际能用在哪些地方?
AuK 的能力组合让它在不少领域都能派上用场。
在影视和短剧制作中,演员经常会在后期发现台词有误,或者剧本临时微调。传统做法是请演员回棚重录,成本高还可能情绪对不上。有了 AuK,可以直接在原录音上替换错误的词句,完美保留当时的表演状态。
播客主和记者也能受益。采访录音里难免有“呃”、“啊”之类的口误,或者背景有空调噪音。AuK 可以一键删除废话、调整语速节奏、去除混响,把粗糙的素材快速整理成可发布的成片。
对于有声书和 AI 配音生产,Instruct TTS 能根据角色设定生成差异化的声音。比如一个故事里有老人、小孩、反派,不用找多个配音员,用文字描述就能生成。后期如果觉得某个角色的情绪不够,还能单独调整,不用重录整段。
在音乐创作领域,翻唱爱好者可以用它改写歌词但保留原唱的旋律和嗓音特色,做出有趣的二创作品。制作人也能用它提取干净的人声轨,用于 remix。
最后,在无障碍和语言训练方面,它可以帮有口音或语言障碍的人生成更清晰、语速更合适的语音,提升沟通效率。
总的来说,AuK 不是一个单纯的 TTS 工具,而是一个面向语音内容全流程处理的“瑞士军刀”。它的出现,让复杂的语音编辑任务第一次有了开源、统一的解决方案。