字节跳动发布SeedRealtime:原生音视频全双工大模型已上线豆包
来源:互联网8月5日,字节跳动正式推出原生音视频全双工大模型SeedRealtime。该模型用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来”边看、边听、边说”的全新体验。目前,SeedRealtime已在豆包App全量上线。
端到端实时交互减少卡壳
传统多模态对话通常采用级联架构,即先识别语音或视频内容,再依次调用不同模型处理,容易造成延迟和交互断裂。SeedRealtime则采用端到端统一架构,将音频、视频与文本在模型层面融合。端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半,模型对说话时机的把握更加自然,”话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少。同时,单次对话能够完整、顺畅交流的概率也有明显提升。

多模态竞争进入实时化阶段
SeedRealtime的推出标志着国内大模型竞争从文本对话、文生图等单模态场景,加速向实时多模态交互演进。目前,GPT-5.6、Claude Opus 5等主流模型仍以文本为核心交互方式,音视频能力多作为辅助功能。字节跳动选择以”全双工实时交互”作为差异化切入点,试图在AI助手的使用体验上建立新的竞争维度。
分析人士指出,实时多模态交互对模型的延迟控制、注意力分配和场景理解能力提出了更高要求。SeedRealtime若能在实际使用中保持评测数据的表现,将推动AI助手从”一问一答”的工具形态向”持续陪伴”的交互形态转变。