(网经社讯)8月5日,字节跳动正式推出原生音视频全双工大模型SeedRealtime。该模型采用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。
据网经社AI台(AI.100EC.CN)获悉,SeedRealtime实现了三项核心突破:音视频联合理解方面,模型原生支持声音、画面与时序信息的深度融合,既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代;主动交互能力方面,模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,并能调用工具融入表达;流畅交互节奏方面,模型能实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应,同时具备较强的抗干扰能力。
在技术架构上,SeedRealtime摒弃了传统级联系统依赖ASR、VLM、TTS等多个模块串联的模式,将声音、画面、时序与表达统一到同一个端到端模型中,让感知、理解、决策与表达同步进行。端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半。
目前,SeedRealtime已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。用户将豆包App更新至最新版本,在对话框内选择“打电话”,进入视频通话界面即可体验。

































.png)



