跳到正文
原文
Qwen Blog·· 2025-03-27精选AI 评分75

Qwen 发布端到端全模态模型 Qwen2.5-Omni

Qwen2.5 Omni: See, Hear, Talk, Write, Do It All!

AI 导读

Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。

推荐理由

原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。

来源:Qwen Blog · qwenlm.github.io