字节跳动推出SeedRealtime:原生音视频实时交互模型,开启多模态对话新范式
talkingdev • 2026-08-06
1709 views
字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技术标志着多模态大模型从“理解”向“实时感知与表达”迈出了关键一步。SeedRealtime的架构设计使其能够在接收视觉与听觉信号的瞬间,同步生成语音输出,延迟极低,极大提升了人机交互的沉浸感。在演示中,模型可以一边观看视频画面,一边听取用户的提问,并像真人一样流畅地给出带有语气的回答,甚至能根据视频内容主动发起话题。该成果不仅展现了字节跳动在多模态和实时生成式AI领域的深厚积累,也为虚拟数字人、实时翻译、在线教育、无障碍交互等场景提供了全新的可能性。业界普遍认为,这类原生音视频模型将成为下一代智能终端的核心交互界面。