跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 81–100 条 · 共 125 条
7月16日周四
  1. Hugging Face Blog82

    Hugging Face 披露 7 月安全事件:入侵由自主 AI 智能体驱动

    Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该攻击由一套自主 AI 智能体系统端到端驱动,通过数据集处理中的两条代码执行路径获得初始访问,随后提升权限、窃取云和集群凭证并在周末横向移动至多个内部集群。

    推荐理由:Hugging Face 披露一次由自主 AI 智能体端到端驱动的入侵,并说明用开源模型做取证的原因。

7月9日周四
  1. Google Research62

    Google Research 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自500万同意参与者、超过一万亿分钟的多模态传感器信号,覆盖100多个国家和20多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:原文给出万亿分钟级可穿戴数据预训练与35项健康任务评测,读者可了解通用生理表征的规模化路径。

7月7日周二
6月25日周四
6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,支持边界框与块分类

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 为 93.07 分,官方称独立标注者在多数文档上更偏好其输出。

    推荐理由:原文给出 OCR 4 的边界框、块分类与置信度输出,读者可据此判断它如何接入 RAG 与智能体流程。

6月16日周二
6月5日周五
  1. Google Research60

    Google 在 Gemini Enterprise Agent Platform 上线 Agentic RAG

    Google 在 Gemini Enterprise Agent Platform 推出基于 Agentic RAG 的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 和 Sufficient Context Agent 等角色协作处理多源多跳查询。

    推荐理由:原文给出多智能体 RAG 的架构细节与跨语料评测数据,可据此判断复杂多跳查询的检索可靠性。

5月28日周四
  1. Mistral AI62

    Mistral 发布工业工程 AI 栈并升级 Vibe 智能体

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,结合物理模型、工程经验与机器人技术,合作方包括 Airbus、BMW 和 ASML,用于加速设计、消除仿真瓶颈并优化资产性能,同时保持对专有数据的控制。

    推荐理由:原文给出工业工程 AI 栈的合作方与 Vibe 智能体的能力范围,读者可据此判断企业级智能体落地路径。

  2. Mistral AI82

    Mistral 将 Le Chat 升级为统一智能体 Vibe

    Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和套餐均已迁移。Vibe 提供 Work Mode 处理收件箱、深度研究和文档起草等多步任务,Code Mode 可从网页端启动远程编码会话并推进到 pull request,并新增 VS Code 扩展和 CLI 更新。

    推荐理由:原文给出统一智能体的工作与编码两种模式及 VS Code、CLI 入口,读者可据此判断它如何接入现有工作流。

5月22日周五
  1. Mistral AI82

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,支持 256k 上下文窗口,可在少至四块 GPU 上自托管。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的落地门槛。

5月20日周三
5月19日周二
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景锚定能力,用户可选取美国境内地点并搭配风格与角色描述,生成以真实影像为起点的可交互世界,该能力由 Maps Imagery Grounding 驱动。

    推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。

5月17日周日
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 为 84.2%,输出速度是其他前沿模型的 4 倍。

    推荐理由:原文给出 3.5 Flash 在编码与智能体基准上的具体成绩和开放渠道,读者可据此判断速度与质量的取舍。

5月12日周二
5月6日周三
  1. Google DeepMind74

    Google DeepMind 回顾 AlphaEvolve 一年进展:从 TPU 设计到商业落地

    Google DeepMind 发布 AlphaEvolve 推出一年的影响汇总,这一由 Gemini 驱动的编码智能体已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计并发现更高效的缓存替换策略。

    推荐理由:原文汇总了 AlphaEvolve 在芯片设计、电网优化和商业客户中的落地数据,可据此判断算法发现智能体的实际适用范围。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具。

    推荐理由:原文给出AI co-clinician在临床证据问答与实时多模态远程问诊中的评测结果,读者可据此了解医疗AI当前能力边界与协作定位。

4月27日周一
  1. Mistral AI71

    Mistral AI 发布 Workflows 公开预览版

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用于自动化关键流程。

    推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。