Thinking Machines 发布 Inkling 系列开源多模态模型
Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,包含约 1T 参数的 Inkling 和 276B 总参数、12B 激活参数的 Inkling-Small,均可原生接收图像、文本和音频输入。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准数据,读者可据此判断这一开源多模态模型的定位与落地成本。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,包含约 1T 参数的 Inkling 和 276B 总参数、12B 激活参数的 Inkling-Small,均可原生接收图像、文本和音频输入。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准数据,读者可据此判断这一开源多模态模型的定位与落地成本。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:原文给出两款新模型的延迟、价格与可用入口,读者可据此判断图像与视频生成链路的成本取舍。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 为 93.07 分,官方称独立标注者在多数文档上更偏好其输出。
推荐理由:原文给出 OCR 4 的边界框、块分类与置信度输出,读者可据此判断它如何接入 RAG 与智能体流程。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,可在 16GB 显存或统一内存上本地运行。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此了解端侧多模态模型的设计取舍。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 的肤色公平性进展。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景锚定能力,用户可选取美国境内地点并搭配风格与角色描述,生成以真实影像为起点的可交互世界,该能力由 Maps Imagery Grounding 驱动。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 为 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:原文给出 3.5 Flash 在编码与智能体基准上的具体成绩和开放渠道,读者可据此判断速度与质量的取舍。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具。
推荐理由:原文给出AI co-clinician在临床证据问答与实时多模态远程问诊中的评测结果,读者可据此了解医疗AI当前能力边界与协作定位。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力。
推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,读者可据此判断机器人高层推理的进展。
Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。
推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。
Google Research 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,耗时不到 60 秒。
推荐理由:原文给出从自然语言到可运行 Android XR 应用的完整流程与初步评测数据,读者可据此判断 XR 原型的门槛变化。
Mistral 发布 Mistral Small 4,首次把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力合并进单一模型,采用 Apache 2.0 许可。
推荐理由:Mistral 把推理、多模态与编码能力合并进单一开源模型,并给出延迟与吞吐对比,可据此判断统一模型的取舍。
Mistral 发布文档识别模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与每千页定价,便于评估替换成本。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出 MoE 参数与部署方案,读者可据此判断开源前沿模型的可用边界。
Qwen 通过 Qwen API 推出翻译模型 Qwen-MT(qwen-mt-turbo),基于 Qwen3 并利用数万亿多语言与翻译 token 训练,结合强化学习提升翻译准确度与流畅度。
推荐理由:原文给出 92 种语言支持、术语干预与低至每百万输出 token 0.5 美元的定价,便于评估翻译场景的落地成本。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线的整合方向。
Qwen 发布统一多模态理解与生成模型 Qwen VLo,预览版可通过 Qwen Chat 访问,支持直接文生图和上传图片后按指令修改。该模型采用从左到右、从上到下的渐进式生成方式,支持中英文等多语言指令,可完成风格迁移、背景替换、文字编辑以及检测、分割、边缘提取等任务。官方表示多图输入和极端宽高比生成尚未正式上线,模型仍处预览阶段,存在生成不准确、不遵循指令等不足。
推荐理由:原文给出统一理解与生成模型的预览入口和能力边界,读者可据此判断多模态生成的实际可用程度。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业自部署的成本与可行性。
Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。
推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。