Google DeepMind 发布 Gemma 4 开源模型家族
Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。
推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。
推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。
Google DeepMind 公布由 Gemini 驱动的 AI 指针实验,让指针不仅知道指向什么,还能理解它对用户的意义,并给出四条交互原则。该指针已在 Chrome 中上线,用户可指向网页内容直接向 Gemini 提问,Googlebook 的 Magic Pointer 也将很快推出,实验环境可在 Google AI Studio 体验。
推荐理由:原文给出四条交互原则和 Chrome、Googlebook 的落地入口,读者可据此判断 AI 指针会怎样改变现有操作方式。
Google Research 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,耗时不到 60 秒。
推荐理由:原文给出从自然语言到可运行 Android XR 应用的完整流程与初步评测数据,读者可据此判断 XR 原型的门槛变化。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练与治理。
推荐理由:Mistral 官方给出企业自建前沿模型的分阶段训练路径与已合作机构名单,可据此判断企业定制模型的落地方式。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊预约前为患者采集病史,全程由医生通过视频通话监督。
推荐理由:原文给出 AMIE 在真实门诊的前瞻性可行性数据,读者可据此了解对话式医疗 AI 的安全监督方式与诊断表现。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 更新改为持续推送。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与定价方式,可据此判断终端编码智能体的工作流变化。
Mistral 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立评测对比,便于判断开源编码模型与闭源模型的差距。
Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把自家大规模系统的运维经验打包成企业平台,读者可了解生产级 AI 需要哪些基础设施能力。
Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,包括 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。
推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。
Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。
推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线的整合方向。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。
推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的内置连接器、状态化对话与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。
推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的集成与私有化选项。
Qwen 发布 Qwen3 系列,旗舰 MoE 模型 Qwen3-235B-A22B 在编码、数学和通用能力评测中与 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等模型表现相当。
推荐理由:原文给出 Qwen3 全系开源规格、混合思考模式与预训练数据规模,便于读者判断其与同级模型的定位差异。
Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。
推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。
Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。
推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。