跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 101–120 条 · 共 125 条
4月3日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。

    推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。

3月29日周日
  1. Google DeepMind62

    Google DeepMind 为 AI 时代重新设计鼠标指针

    Google DeepMind 公布由 Gemini 驱动的 AI 指针实验,让指针不仅知道指向什么,还能理解它对用户的意义,并给出四条交互原则。该指针已在 Chrome 中上线,用户可指向网页内容直接向 Gemini 提问,Googlebook 的 Magic Pointer 也将很快推出,实验环境可在 Google AI Studio 体验。

    推荐理由:原文给出四条交互原则和 Chrome、Googlebook 的落地入口,读者可据此判断 AI 指针会怎样改变现有操作方式。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR,用 Gemini 把自然语言变成 Android XR 应用

    Google Research 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,耗时不到 60 秒。

    推荐理由:原文给出从自然语言到可运行 Android XR 应用的完整流程与初步评测数据,读者可据此判断 XR 原型的门槛变化。

3月18日周三
  1. Mistral AI62

    Mistral AI 推出 Forge,让企业用自有知识训练前沿模型

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练与治理。

    推荐理由:Mistral 官方给出企业自建前沿模型的分阶段训练路径与已合作机构名单,可据此判断企业定制模型的落地方式。

3月12日周四
  1. Google Research62

    Google 研究:对话式诊断 AI AMIE 在真实门诊的可行性临床研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊预约前为患者采集病史,全程由医生通过视频通话监督。

    推荐理由:原文给出 AMIE 在真实门诊的前瞻性可行性数据,读者可据此了解对话式医疗 AI 的安全监督方式与诊断表现。

1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 更新改为持续推送。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与定价方式,可据此判断终端编码智能体的工作流变化。

12月9日周二
  1. Mistral AI80

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立评测对比,便于判断开源编码模型与闭源模型的差距。

10月24日周五
9月2日周二
  1. Mistral AI62

    Mistral 为 Le Chat 上线 MCP 连接器目录与 Memories 记忆功能

    Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,包括 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。

    推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。

7月30日周三
  1. Mistral AI60

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。

    推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。

7月22日周二
7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线的整合方向。

7月11日周五
6月4日周三
  1. Mistral AI60

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。

    推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。

5月27日周二
  1. Mistral AI67

    Mistral 发布 Agents API,内置连接器与多智能体编排

    Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。

    推荐理由:官方给出 Agents API 的内置连接器、状态化对话与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。

5月21日周三
  1. Mistral AI76

    Mistral AI 与 All Hands AI 发布 Devstral 智能体编码模型

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月7日周三
  1. Mistral AI60

    Mistral AI 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。

    推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的集成与私有化选项。

4月29日周二
3月28日周五
  1. Qwen Blog71

    Qwen 发布视觉推理模型 QVQ-Max 首个版本

    Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。

    推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。

3月6日周四
  1. Qwen Blog80

    Qwen 发布 QwQ-32B 推理模型,320 亿参数对标 DeepSeek-R1

    Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。

    推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。