跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 41–50 条 · 共 50 条
3月27日周四
  1. Qwen Blog75

    Qwen 发布端到端全模态模型 Qwen2.5-Omni

    Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。

    推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。

3月24日周一
3月17日周一
3月7日周五
  1. Mistral AI77

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并支持将文档作为提示词生成 JSON 等结构化结果。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析的选型与成本。

1月26日周日
8月29日周四
8月9日周五
  1. Qwen Blog71

    Qwen2-Audio 发布:支持语音对话与音频分析

    Qwen 团队发布 Qwen2-Audio,这是 Qwen-Audio 的下一代音频语言模型,可接受音频和文本输入并生成文本输出。它首次支持无需 ASR 模块的语音对话,并能按文本指令分析语音、声音和音乐,支持中文、英语、粤语、法语等 8 种以上语言和方言。

    推荐理由:官方给出 Qwen2-Audio 的语音对话与音频分析能力、开源权重和调用示例,读者可据此判断音频语言模型的实际用法。

1月25日周四
12月24日周六
11月14日周一
  1. Qwen Blog62

    OFA:构建 One-For-All 统一多模态预训练模型

    Qwen 团队提出 OFA(One-For-All),一个统一理解与生成任务的统一多模态预训练模型,采用基于指令的多任务预训练,并开源了预训练和微调模型。OFA 统一了模态、架构和任务,用 VQ token 表示图像、用 bins 离散化边界框,预训练涵盖 8 个任务,包括视觉定位、图像描述、VQA、图文匹配、检测、图像补全和文本补全。

    推荐理由:原文给出 OFA 的统一框架设计与 5 个尺寸的开源模型,读者可据此了解多模态统一模型的早期技术路线。