微软发布全新AI语音转文字模型MAI-Transcribe-2:更快、更准、更便宜,支持60种语言与说话人分离

SmartHey9月4日消息,微软于9月3日宣布推出MAI-Transcribe-2,官方称其为目前最快、最准确且最具性价比的AI语音转文字模型。

在定价策略上,该模型上市初期限时优惠价为0.10美元(按当前汇率约合0.67元人民币)/小时,优惠期将持续至2026年12月31日。

性能表现方面,MAI-Transcribe-2是微软迄今最强的语音转录模型,在准确率、处理速度与单位成本三项核心指标上均优于当前主流竞品。

在权威FLEURS基准测试中,MAI-Transcribe-2在强制指定语言和自动语言推断两种模式下,平均词错误率(WER)均为5.2%。作为对比,Gemini 3.1 Pro分别为5.3%和5.8%,GPT-Transcribe为10.4%和10.6%,Whisper v3-Large则高达22.8%和23.5%。

速度测试显示,据Artificial Analysis评测结果,MAI-Transcribe-2比GPT-Transcribe快10倍,比Scribe v2快7倍,比Gemini 3.5 Transcribe快5倍。

功能层面,MAI-Transcribe-2新增高精度说话人分离能力,可自动识别并区分录音中多位发言者,并将对应文本准确归属至各说话人;同时提供逐词级时间戳,精准标注每个词汇在音频中的起止位置,显著提升音频检索、内容导航、后期编辑及字幕同步效率。

模型还支持灵活的转写风格配置:verbatim模式完整保留语气词、重复语、口误等原始语音特征,适用于法律合规、学术分析等场景;clean模式则自动过滤冗余表达,输出简洁流畅的文本,适用于字幕生成、会议纪要整理及公开发布内容。此外,模型还集成关键词偏置、自动语言识别(ALI)、实时语种切换以及强噪声环境鲁棒转写等进阶能力。

MAI-Transcribe-2原生支持60种语言,并能自然处理多语混杂对话——用户无需预设语种,模型可自主识别并适应语言切换。目前,开发者可通过Microsoft Foundry、MAI Playground及OpenRouter平台直接调用或免费试用该模型。