阿里千问发布Qwen3.8-LiveTranslate同声传译大模型:Interleave架构实现低延迟高精度双语实时同传
SmartHey9月20日消息,阿里千问于9月19日正式发布全新同声传译大模型 Qwen3.8-LiveTranslate。该模型基于创新的 Interleave 架构重构实时同传流程,在翻译准确度、语言流畅度与表达简洁度三方面实现全面提升,字均延迟(LAAL)由原先的 2.8 秒显著降低至 2.3 秒。
官方介绍,Qwen3.8-LiveTranslate 在已支持 60 种语言的基础上,新增三大核心能力,显著增强其在真实会议、国际论坛、多语种直播等复杂场景下的实用性和鲁棒性:
- 实时说话人分离:精准区分不同发言者,每句话归属清晰明确,音色复刻稳定性更高;
- 原文译文同帧同出:实现双语内容严格同步显示,支持同屏对照阅读与理解;
- 长上下文消歧能力:依托长程语境建模,结合前文信息准确解析当前语义,使人名、专业术语等关键信息翻译更精准、一致。
技术层面,Qwen3.8-LiveTranslate 采用 Hybrid MoE(混合专家)驱动的 Thinker–Talker 双模块协同架构,并以 Interleave 方式无缝衔接流式语音理解、文本翻译生成与语音合成全流程。其中,Thinker 模块将视频流、音频信号、原文及译文统一编排为单条因果序列,按时间步交替建模,实现端到端的理解与翻译一体化输出;Talker 模块则融合译文文本与原始语音特征,生成高度保真原说话人音色的高质量译文语音。

在面向多说话人、长时长音频的权威评测集 Omnilingua-MSpeaker(覆盖 14 个语向)上,Qwen3.8-LiveTranslate 在翻译忠实度、流畅度、简洁度,以及说话人分离错误率(DER)四项关键指标上,全面超越当前主流实时同传系统。

此外,在涵盖 70 个语言方向的公开 FLEURS 音频测试集上,该模型亦在翻译质量、字均延迟、语音识别准确率(ASR)和语音合成自然度(TTS)四大维度,均优于上一代模型及现有行业标杆系统。
