当前位置:首页 / 业界 / 正文

字节跳动发布SeedRealtime:原生音视频全双工大模型已上线豆包

来源:互联网

8月5日,字节跳动正式推出原生音视频全双工大模型SeedRealtime。该模型用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来”边看、边听、边说”的全新体验。目前,SeedRealtime已在豆包App全量上线。

端到端实时交互减少卡壳

传统多模态对话通常采用级联架构,即先识别语音或视频内容,再依次调用不同模型处理,容易造成延迟和交互断裂。SeedRealtime则采用端到端统一架构,将音频、视频与文本在模型层面融合。端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半,模型对说话时机的把握更加自然,”话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少。同时,单次对话能够完整、顺畅交流的概率也有明显提升。

字节跳动发布SeedRealtime:原生音视频全双工大模型已上线豆包 图1

多模态竞争进入实时化阶段

SeedRealtime的推出标志着国内大模型竞争从文本对话、文生图等单模态场景,加速向实时多模态交互演进。目前,GPT-5.6、Claude Opus 5等主流模型仍以文本为核心交互方式,音视频能力多作为辅助功能。字节跳动选择以”全双工实时交互”作为差异化切入点,试图在AI助手的使用体验上建立新的竞争维度。

分析人士指出,实时多模态交互对模型的延迟控制、注意力分配和场景理解能力提出了更高要求。SeedRealtime若能在实际使用中保持评测数据的表现,将推动AI助手从”一问一答”的工具形态向”持续陪伴”的交互形态转变。

# #

声明:

1、凡本网注明“来源:XXX(非科极网)”的作品,均转载自其它媒体,转载目的在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。

2、如因作品内容、版权和其他问题需要与本网联系的,请在该事由发生之日起30日内进行。