跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 50 条
7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布 Inkling 系列开源多模态模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,包含约 1T 参数的 Inkling 和 276B 总参数、12B 激活参数的 Inkling-Small,均可原生接收图像、文本和音频输入。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准数据,读者可据此判断这一开源多模态模型的定位与落地成本。

7月1日周三
6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,支持边界框与块分类

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 为 93.07 分,官方称独立标注者在多数文档上更偏好其输出。

    推荐理由:原文给出 OCR 4 的边界框、块分类与置信度输出,读者可据此判断它如何接入 RAG 与智能体流程。

6月9日周二
6月5日周五
  1. Google Research71

    Google 研究用手机摄像头被动监测心脏健康

    Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。

    推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 的肤色公平性进展。

5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景锚定能力,用户可选取美国境内地点并搭配风格与角色描述,生成以真实影像为起点的可交互世界,该能力由 Maps Imagery Grounding 驱动。

    推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 为 84.2%,输出速度是其他前沿模型的 4 倍。

    推荐理由:原文给出 3.5 Flash 在编码与智能体基准上的具体成绩和开放渠道,读者可据此判断速度与质量的取舍。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具。

    推荐理由:原文给出AI co-clinician在临床证据问答与实时多模态远程问诊中的评测结果,读者可据此了解医疗AI当前能力边界与协作定位。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力。

    推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,读者可据此判断机器人高层推理的进展。

4月3日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。

    推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR,用 Gemini 把自然语言变成 Android XR 应用

    Google Research 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,耗时不到 60 秒。

    推荐理由:原文给出从自然语言到可运行 Android XR 应用的完整流程与初步评测数据,读者可据此判断 XR 原型的门槛变化。

3月17日周二
12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3,表单与手写识别胜率较上一代提升 74%

    Mistral 发布文档识别模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。

    推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与每千页定价,便于评估替换成本。

12月3日周三
  1. Mistral AI82

    Mistral 发布 Mistral 3 系列模型,含 675B 参数 MoE 版 Mistral Large 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出 MoE 参数与部署方案,读者可据此判断开源前沿模型的可用边界。

7月24日周四
  1. Qwen Blog62

    Qwen 发布翻译模型 Qwen-MT(qwen-mt-turbo)

    Qwen 通过 Qwen API 推出翻译模型 Qwen-MT(qwen-mt-turbo),基于 Qwen3 并利用数万亿多语言与翻译 token 训练,结合强化学习提升翻译准确度与流畅度。

    推荐理由:原文给出 92 种语言支持、术语干预与低至每百万输出 token 0.5 美元的定价,便于评估翻译场景的落地成本。

7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线的整合方向。

6月26日周四
  1. Qwen Blog71

    Qwen 发布统一多模态理解与生成模型 Qwen VLo

    Qwen 发布统一多模态理解与生成模型 Qwen VLo,预览版可通过 Qwen Chat 访问,支持直接文生图和上传图片后按指令修改。该模型采用从左到右、从上到下的渐进式生成方式,支持中英文等多语言指令,可完成风格迁移、背景替换、文字编辑以及检测、分割、边缘提取等任务。官方表示多图输入和极端宽高比生成尚未正式上线,模型仍处预览阶段,存在生成不准确、不遵循指令等不足。

    推荐理由:原文给出统一理解与生成模型的预览入口和能力边界,读者可据此判断多模态生成的实际可用程度。

5月7日周三
3月28日周五
  1. Qwen Blog71

    Qwen 发布视觉推理模型 QVQ-Max 首个版本

    Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。

    推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。