Qwen 发布端到端全模态模型 Qwen2.5-Omni
Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。
推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。
推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。
Qwen 团队以 Apache 2.0 许可开源 Qwen2.5-VL-32B-Instruct,在 Qwen2.5-VL 系列基础上用强化学习继续优化。
推荐理由:官方给出 32B 视觉语言模型的基准对比与演示案例,可据此判断同规模开源多模态模型的当前水平。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,采用 Apache 2.0 许可。
推荐理由:官方给出 Mistral Small 3.1 在文本、多模态与长上下文上的具体提升和部署门槛,便于判断其端侧可用性。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并支持将文档作为提示词生成 JSON 等结构化结果。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析的选型与成本。
Qwen 发布新一代旗舰视觉语言模型 Qwen2.5-VL,并开源 3B、7B、72B 的 base 与 instruct 版本,可在 Hugging Face 和 ModelScope 获取。
推荐理由:原文给出 Qwen2.5-VL 三个尺寸的开源权重与视觉智能体、长视频理解等能力变化,便于读者判断多模态模型的可选范围。
Qwen2-VL 发布,这是 Qwen 系列基于 Qwen2 的新版视觉语言模型,开源 Qwen2-VL-2B 和 Qwen2-VL-7B(Apache 2.0),并开放 Qwen2-VL-72B 的 API。
推荐理由:原文给出 Qwen2-VL 的视觉理解基准表现、开源规格与视频、智能体能力,读者可据此判断多模态选型。
Qwen 团队发布 Qwen2-Audio,这是 Qwen-Audio 的下一代音频语言模型,可接受音频和文本输入并生成文本输出。它首次支持无需 ASR 模块的语音对话,并能按文本指令分析语音、声音和音乐,支持中文、英语、粤语、法语等 8 种以上语言和方言。
推荐理由:官方给出 Qwen2-Audio 的语音对话与音频分析能力、开源权重和调用示例,读者可据此判断音频语言模型的实际用法。
Qwen 团队发布 Qwen-VL-Plus 和 Qwen-VL-Max 两个升级版视觉语言模型,在图像推理、细节识别与文字提取上均有提升,支持百万像素以上高清图和任意宽高比输入。
推荐理由:官方给出 Qwen-VL-Plus 与 Max 的基准对比和开放入口,可据此判断多模态模型在中文图文任务上的位置。
Qwen 团队发布 Chinese CLIP,采用两阶段预训练方法将 CLIP 迁移到中文,使用 LAION-5B 中文部分、Wukong 等公开数据集,图文对总量达 2 亿。
推荐理由:原文给出两阶段预训练方法和跨模态检索对比结果,读者可据此了解中文 CLIP 的迁移路径与数据构成。
Qwen 团队提出 OFA(One-For-All),一个统一理解与生成任务的统一多模态预训练模型,采用基于指令的多任务预训练,并开源了预训练和微调模型。OFA 统一了模态、架构和任务,用 VQ token 表示图像、用 bins 离散化边界框,预训练涵盖 8 个任务,包括视觉定位、图像描述、VQA、图文匹配、检测、图像补全和文本补全。
推荐理由:原文给出 OFA 的统一框架设计与 5 个尺寸的开源模型,读者可据此了解多模态统一模型的早期技术路线。