字节跳动Seed发布原生音视频全双工大模型SeedRealtime,实现“边看、边听、边说”自然交互
SmartHey8月5日消息,字节跳动 Seed 今日宣布推出原生音视频全双工大模型 SeedRealtime,正式迈向全模态自然交互新阶段。
SeedRealtime 采用统一架构,原生融合音频、视频与文本三模态信号,可在连续多模态信息流中实现实时、低延迟交互,为用户带来“边看、边听、边说”的沉浸式自然对话体验。该模型在以下三大方向实现关键突破:
音视频联合理解:深度整合声学特征、视觉帧序列以及时序语义,支持跨模态联合消歧——既能结合画面场景精准区分同音词,也能理解视频中动态指代(如手势指向、视线焦点等),真正打通视听语言与表达意图。
主动的交互能力:具备持续环境感知与自主表达能力。当模型识别到画面关键变化(例如目标人物入场、物体状态切换)时,可主动发起提示;并能按需调用外部工具(如信息检索、图像分析)增强表达,推动人机交互从单向响应跃升为双向协作。
流畅的交互节奏:实时建模用户语音起止、停顿节奏与语境状态,实现更符合人类习惯的接话时机、自然停顿与上下文延续;同时强化噪声鲁棒性,可有效区分旁人对话与背景杂音,大幅降低误唤醒与干扰中断,保障沟通连贯性与舒适度。
端到端人工评测表明:相较于传统级联式音视频处理方案,SeedRealtime 将对话节奏类问题(如抢话、迟应、误触发)减少50%;单次对话全程顺畅完成率显著提升,交互拟真度与自然度达行业新高。
目前,SeedRealtime 已在豆包 App 全量上线,成为业内首个实现音视频全双工技术规模化商用的大模型应用。用户只需将豆包 App 更新至最新版本,在聊天界面选择“打电话”功能,进入视频通话模式即可即刻体验。
