跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 61–76 条 · 共 76 条
6月26日周四
  1. Qwen Blog71

    原文发布 6月26日 22:00

    Qwen 发布统一多模态理解与生成模型 Qwen VLo

    Qwen 发布统一多模态理解与生成模型 Qwen VLo,预览版可通过 Qwen Chat 访问,支持直接文生图和上传图片后按指令修改。该模型采用从左到右、从上到下的渐进式生成方式,支持中英文等多语言指令,可完成风格迁移、背景替换、文字编辑以及检测、分割、边缘提取等任务。官方表示多图输入和极端宽高比生成尚未正式上线,模型仍处预览阶段,存在生成不准确、不遵循指令等不足。

    推荐理由:原文给出统一理解与生成模型的预览入口和能力边界,读者可据此判断多模态生成的实际可用程度。

5月7日周三
4月26日周六
  1. Kimi 官方 Blog69

    原文发布 4月26日 08:00

    Kimi 发布开源音频基础模型 Kimi-Audio-7B

    Kimi 发布开源音频基础模型 Kimi-Audio-7B,在单一框架内统一处理语音识别、音频理解、音频描述、情感识别、声事件分类和端到端语音对话等任务。模型基于 Qwen 2.5 7B 初始化,预训练数据超过 1300 万小时音频与文本,采用连续声学向量加离散语义 token 的混合输入和并行文本与音频 token 生成头。

    推荐理由:原文给出开源音频基础模型的架构、13M 小时预训练规模和多项基准对比,读者可据此判断统一音频处理框架的当前水平。

4月10日周四
  1. Kimi 官方 Blog72

    原文发布 4月10日 08:00

    Kimi 发布开源 MoE 视觉语言模型 Kimi-VL 及 Thinking 变体

    Kimi 发布开源 MoE 视觉语言模型 Kimi-VL,语言解码器仅激活 2.8B 参数,支持 128K 上下文和原生分辨率视觉编码器 MoonViT。基于长 CoT SFT 与 RL 的 Kimi-VL-Thinking 在 MMMU 得 61.7、MathVista 得 71.3。

    推荐理由:原文给出 Kimi-VL 系列在激活参数仅 2.8B 下的多模态与长上下文成绩,可对照同量级 VLM 的能力边界。

3月28日周五
  1. Qwen Blog71

    原文发布 3月28日 00:00

    Qwen 发布视觉推理模型 QVQ-Max 首个版本

    Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。

    推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。

3月27日周四
  1. Qwen Blog75

    原文发布 3月27日 00:00

    Qwen 发布端到端全模态模型 Qwen2.5-Omni

    Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。

    推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。

3月24日周一
3月17日周一
  1. Mistral AI71

    原文发布 3月17日 20:00

    Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,采用 Apache 2.0 许可。

    推荐理由:官方给出 Mistral Small 3.1 在文本、多模态与长上下文上的具体提升和部署门槛,便于判断其端侧可用性。

3月7日周五
  1. Mistral AI77

    原文发布 3月7日 01:00

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并支持将文档作为提示词生成 JSON 等结构化结果。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析的选型与成本。

1月26日周日
11月26日周二
  1. 腾讯混元官方动态62

    原文发布 11月26日 08:00

    腾讯混元推出视觉语言旗舰大模型 hunyuan-turbo-vision

    腾讯混元推出新一代视觉语言旗舰大模型 hunyuan-turbo-vision,采用全新的混合专家模型(MoE)结构。相比前一代模型,其在图文理解相关的基础识别、内容创作、知识问答、分析推理等能力上全面提升。

    推荐理由:原文给出混元新一代视觉语言旗舰模型的架构与能力提升方向,可了解其与前代在图文理解上的差异。

8月29日周四
8月9日周五
  1. Qwen Blog71

    原文发布 8月9日 16:18

    Qwen2-Audio 发布:支持语音对话与音频分析

    Qwen 团队发布 Qwen2-Audio,这是 Qwen-Audio 的下一代音频语言模型,可接受音频和文本输入并生成文本输出。它首次支持无需 ASR 模块的语音对话,并能按文本指令分析语音、声音和音乐,支持中文、英语、粤语、法语等 8 种以上语言和方言。

    推荐理由:官方给出 Qwen2-Audio 的语音对话与音频分析能力、开源权重和调用示例,读者可据此判断音频语言模型的实际用法。

1月25日周四
  1. Qwen Blog74

    原文发布 1月25日 13:33

    Qwen 发布 Qwen-VL-Plus 与 Qwen-VL-Max 两个升级版多模态模型

    Qwen 团队发布 Qwen-VL-Plus 和 Qwen-VL-Max 两个升级版视觉语言模型,在图像推理、细节识别与文字提取上均有提升,支持百万像素以上高清图和任意宽高比输入。

    推荐理由:官方给出 Qwen-VL-Plus 与 Max 的基准对比和开放入口,可据此判断多模态模型在中文图文任务上的位置。

12月24日周六
  1. Qwen Blog62

    原文发布 12月24日 14:54

    Chinese CLIP:中文对比视觉语言预训练

    Qwen 团队发布 Chinese CLIP,采用两阶段预训练方法将 CLIP 迁移到中文,使用 LAION-5B 中文部分、Wukong 等公开数据集,图文对总量达 2 亿。

    推荐理由:原文给出两阶段预训练方法和跨模态检索对比结果,读者可据此了解中文 CLIP 的迁移路径与数据构成。

11月14日周一
  1. Qwen Blog62

    原文发布 11月14日 16:01

    OFA:构建 One-For-All 统一多模态预训练模型

    Qwen 团队提出 OFA(One-For-All),一个统一理解与生成任务的统一多模态预训练模型,采用基于指令的多任务预训练,并开源了预训练和微调模型。OFA 统一了模态、架构和任务,用 VQ token 表示图像、用 bins 离散化边界框,预训练涵盖 8 个任务,包括视觉定位、图像描述、VQA、图文匹配、检测、图像补全和文本补全。

    推荐理由:原文给出 OFA 的统一框架设计与 5 个尺寸的开源模型,读者可据此了解多模态统一模型的早期技术路线。