Meta发布首个实时音频感知模型Muse Voice Transcribe:支持70+语言、20人说话人分离与自适应延迟识别
SmartHey9月2日消息,据科技媒体 9to5Mac 报道,Meta 公司正式推出 Muse Voice Transcribe——其首个面向开发者的实时音频感知语音转文本模型。
开发者可通过 Meta Model API 直接调用该服务,定价为每 1000 分钟音频 3 美元(按当前汇率约合 20.2 元人民币),即每小时仅需 0.18 美元(约 1.2 元人民币)。

该模型在单一处理流程中深度融合了流式自动语音识别(ASR)、说话人分离(Speaker Diarization)与智能端点检测(Endpoint Detection)能力。用户边说边转写,系统实时响应、同步输出文字,无需等待录音结束再批量处理。

Muse Voice Transcribe 可在多达 20 余名发言者的复杂会议录音中精准区分不同说话人,并能自主判断语句是否完结,从而动态划定输入音频的自然边界。

模型训练覆盖全球超 70 种语言,首发即完成其中 25 种语言的精度验证与优化。它原生支持时长超过 1 小时的长音频,并兼容句内及跨句的语言切换(如中英混说)。开发者还可通过指定目标语言、关键词或上下文偏置(context biasing),显著提升特定领域术语、专业词汇或本地化表达的识别准确率。
技术层面,Meta 创新引入“自适应延迟”(Adaptive Delay)机制,在实时性与准确性之间实现智能平衡:系统不再对所有词语采用统一延迟策略,而是逐词动态评估——对清晰、常见语音快速输出;对模糊发音、专有名词或语境依赖强的片段,则自动延长音频窗口,融合更多前后文信息后再决策,兼顾速度与鲁棒性。
截至 2026 年 9 月 1 日,Muse Voice Transcribe 已登顶 Artificial Analysis 全球流式语音转文本性能排行榜首位。
