ByteDance Seed 官方发布·精选AI 评分78
字节 Seed 发布 SeedRealtime 音视频全双工大模型
SeedRealtime Audio-Visual Full-Duplex LLM Released: Toward Omni-Modal Natural Interaction
AI 导读
字节 Seed 正式发布 SeedRealtime,一个原生音视频全双工大语言模型,用统一架构融合音频、视频和文本,支持连续多模态流上的实时交互。官方称其实现音视频联合理解、主动交互和自然对话节奏三项突破,端到端人评显示相比级联模型,音视频对话节奏问题减少一半,单次对话顺畅完成的概率也明显提升。目前 SeedRealtime 已全面上线,官方称这是音视频全双工技术的大规模部署。
推荐理由
原文给出统一架构下的音视频全双工能力与端到端人评结果,读者可据此判断实时多模态交互的当前进展。
来源:ByteDance Seed 官方发布 · seed.bytedance.com