微软发布 MAI-Transcribe-2:支持60种语言的高精度语音转文字模型

0 阅读

微软推出 MAI-Transcribe-2

微软最近发布了 MAI-Transcribe-2,这是其目前最强的语音转文字(ASR)模型。根据官方数据,该模型在包含60种语言的 FLEURS 基准测试中,平均词错误率(WER)仅为5.2%,其中中文表现更优,低至4.5%。这一成绩让它在准确率上超过了包括 Whisper v3-Large 和 Gemini 相关语音模型在内的多个主流系统。

和上一代相比,MAI-Transcribe-2 不只是精度提升,还把多项实用功能直接集成到模型内部,比如区分不同说话人、给每个词打时间戳、自动识别录音中的语言,甚至能在一段对话里自然切换语种。用户还能选择两种输出风格:一种保留“嗯”“啊”等语气词和口误(verbatim),另一种则自动清理这些内容,生成更干净易读的文本(clean)。

核心功能详解

MAI-Transcribe-2 的功能设计明显偏向实际应用场景,而不是单纯追求技术指标。

首先是多语言支持与自动语言识别。模型覆盖60种语言,上传音频时无需提前指定语种,系统会自动判断。更特别的是,它能处理混合语言的对话——比如一个人先说中文,接着用英文回答问题,模型可以实时切换识别,不需要人工干预。

说话人分离是另一个关键能力。在会议或访谈录音中,系统能自动区分不同发言者,并在输出中标注“Speaker 1”“Speaker 2”等标签。这对后续的内容分析、责任归属或行动项提取非常有用。

逐词时间戳则为字幕制作、音频剪辑和关键词检索提供了基础。每个识别出的词都带有精确到毫秒的时间信息,这意味着你可以点击某句话直接跳转到音频对应位置。

此外,模型还支持关键词偏置。如果你在医疗、法律或金融领域工作,可以提前输入专业术语列表,比如“心肌梗死”“对赌协议”等,系统会在解码时优先考虑这些词,减少误识别。

最后,它在噪声环境下的鲁棒性也经过优化。即使背景有键盘声、空调嗡鸣或轻微交谈,转写准确率依然保持稳定,这对真实世界的使用场景至关重要。

技术架构特点

MAI-Transcribe-2 没有采用传统的级联式设计(先做声学建模,再做语言建模,最后加后处理模块),而是用一个端到端的统一神经网络完成所有任务。语音输入进来,直接输出带说话人标签、时间戳和语言代码的结构化文本。

这种设计避免了传统流程中误差逐级放大的问题。比如,如果声学模型把“合同”听成“合通”,语言模型可能无法纠正,而后续的说话人分离模块又依赖错误文本做聚类,最终结果会越来越偏。端到端架构让所有子任务在训练时就协同优化,整体效果更一致。

模型通过多语言联合训练获得跨语言泛化能力。60种语言的数据一起喂给模型,让它学会共享底层声学特征(比如元音、辅音的发音模式),同时保留各语言的独特语法和词汇规律。这不仅提升了主流语言的表现,也让一些数据较少的语种受益。

在解码阶段,系统引入上下文感知机制。它不只是看当前几帧音频,还会结合整段对话的语义走向,并动态融合用户提供的关键词列表,调整输出概率。这也是为什么它能同时支持 verbatim 和 clean 两种风格——本质上是在解码策略上做了可控调节。

如何接入使用

目前 MAI-Transcribe-2 已在 Microsoft Azure AI Foundry 平台开放预览。用户需要先在 Azure 门户创建一个 AI Speech 服务资源,获取 API 密钥和区域终结点。

然后访问 https://ai.azure.com/catalog/models/MAI-Transcribe-2,进入模型调用界面。通过 REST API 提交请求时,只需在参数中指定 model: "MAI-Transcribe-2",并按需开启 speaker_diarization(说话人分离)和 word_level_timestamps(逐词时间戳)等选项。

Loomy

支持的音频格式包括 WAV、MP3、MP4 等常见类型。提交后,系统返回一个结构化的 JSON,包含完整转写文本、每句话的说话人 ID、每个词的起止时间、自动检测的语言代码,以及是否启用 clean/verbatim 模式的标记。

整个过程无需额外部署后处理脚本,所有功能开箱即用。

性能与成本优势

除了功能丰富,MAI-Transcribe-2 在速度和成本上也有明显优势。

官方数据显示,其处理速度达到 403.6 倍实时——也就是说,1小时的音频大约9秒就能转完。相比之下,某些竞品模型可能需要近1分钟。这种低延迟对实时字幕、语音助手或智能客服场景尤为重要。

定价方面,目前限时 0.10 美元/小时,比上一代产品降价约72%。考虑到它内置了说话人分离、时间戳等通常需要额外付费的功能,实际性价比更高。

在准确率上,5.2% 的平均 WER 已接近人类水平(一般认为人类转写的 WER 在4%-5%之间)。中文4.5%的成绩尤其突出,因为中文同音字多、语序灵活,对 ASR 系统挑战较大。

实际应用场景

这些技术特性很快能落地到具体业务中。

呼叫中心质检场景,系统可以自动区分客服和客户的声音,统计客服是否说了标准话术,客户是否表达了不满情绪。结合时间戳,管理者能快速定位到“客户第3次抱怨等待时间过长”的具体时刻。

会议记录也不再是混乱的语音文件。转写结果直接按发言人分段,方便会后整理决策事项。比如“张总同意预算增加”和“李经理提出风险担忧”会被清晰分开,避免责任混淆。

对于媒体和视频平台,逐词时间戳大幅降低字幕制作成本。传统做法需要人工对齐,现在机器自动生成的时间轴可以直接导入剪辑软件。60种语言支持也让全球化内容分发变得更简单。

合规与法律领域,精确的说话人归属和时间记录可作为电子证据。比如金融销售通话中,是否明确告知了产品风险,系统能提供带时间戳的文本证明,满足监管审计要求。

此外,它还能作为语音智能体的听觉输入层。配合微软的 MAI-Voice-2 Flash 语音合成模型,可以构建端到端的语音对话系统——你说一句话,AI 听懂、思考、再用自然语音回答,全程延迟极低。

与竞品的本质区别

需要注意的是,有些文章会拿 MAI-Transcribe-2 和 Gemini 的 TTS(文字转语音)模型对比,但这其实是两类任务。MAI-Transcribe-2 是 STT(语音转文字),核心目标是“听清并准确记录说了什么”;而 TTS 是“把文字变成声音”,方向完全相反。

真正可比的是 Whisper、Google Cloud Speech-to-Text 或 Amazon Transcribe 等 ASR 系统。从公开数据看,MAI-Transcribe-2 在多语言统一支持、原生功能集成度和推理速度上确实领先。尤其是把说话人分离和时间戳做到模型内部,省去了用户自己拼接多个 API 的麻烦。

不过,实际效果仍取决于具体使用环境。比如在极度嘈杂的工厂车间,或者方言浓重的对话中,任何通用模型都可能表现下降。这时候,结合关键词偏置或微调特定领域数据,才能发挥最大价值。

总的来说,MAI-Transcribe-2 不是一个炫技的实验室模型,而是一个为真实世界设计的工程化产品。它把准确率、速度、功能和成本平衡得不错,值得开发者和企业关注。