ITCOW牛新网 8月5日消息,字节跳动Seed团队推出原生音视频全双工大模型SeedRealtime,依托统一架构融合音、视、文多模态信息,实现“边看、边听、边说”实时交互。

该模型拥有三大核心能力:一是音视频联合理解,结合画面、声音、时序信息消除语义歧义;二是具备主动交互能力,可识别画面变化主动提醒,还能调用工具协同;三是交互节奏流畅可控,可自主把握对话停顿、接话时机,抗背景杂音、旁人闲聊干扰,减少误触发。
人工评测显示,相比传统级联模型,其对话卡顿、时机错位问题减少一半,完整顺畅对话比例明显提升。
目前该模型已在豆包App全量落地,用户更新新版豆包后,通过对话框“打电话”入口进入视频通话即可体验,也是行业首个规模化落地的音视频全双工大模型。