跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 141–160 条 · 共 185 条
3月18日周三
  1. MiniMax 官方 Blog82

    原文发布 3月18日 08:00

    MiniMax 发布 M2.7,首次让模型参与自身进化

    MiniMax 发布 M2.7,称这是其首个深度参与自身进化的模型,可构建复杂 agent harness 并完成高难度生产力任务。官方称 M2.7 在 SWE-Pro 得分 56.22%,接近 Opus 最佳水平,VIBE-Pro 为 55.6%,Terminal Bench 2 为 57.0%,GDPval-AA 的 ELO 为 1495,为开源模型最高。

    推荐理由:MiniMax 首次公开模型参与自身迭代的流程,并给出 SWE-Pro、GDPval-AA 等基准数据,可据此判断其智能体与编程能力位置。

  2. Mistral AI62

    原文发布 3月18日 00:00

    Mistral AI 推出 Forge,让企业用自有知识训练前沿模型

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练与治理。

    推荐理由:Mistral 官方给出企业自建前沿模型的分阶段训练路径与已合作机构名单,可据此判断企业定制模型的落地方式。

3月12日周四
  1. Google Research62

    原文发布 3月12日 00:58

    Google 研究:对话式诊断 AI AMIE 在真实门诊的可行性临床研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊预约前为患者采集病史,全程由医生通过视频通话监督。

    推荐理由:原文给出 AMIE 在真实门诊的前瞻性可行性数据,读者可据此了解对话式医疗 AI 的安全监督方式与诊断表现。

2月14日周六
  1. MiniMax 官方 Blog66

    原文发布 2月14日 08:00

    MiniMax 发布 Forge 可扩展 Agent RL 框架与算法

    MiniMax 发布内部强化学习框架 Forge,用于在真实智能体场景中大规模训练,并支撑 MiniMax M2.5 的能力突破。Forge 在 M2.5 训练中接入超过十万个不同的真实智能体脚手架与环境,上下文长度达 200k,日吞吐量达数百万样本,奖励保持收敛。

    推荐理由:原文披露了 Forge 在十万级智能体脚手架上的训练规模与 40 倍训练加速,可据此了解长程 Agent RL 的工程取舍。

  2. ByteDance Seed 官方发布84

    原文发布 2月14日 00:00

    字节 Seed 发布 Seed2.0 系列模型

    字节 Seed 发布 Seed2.0 系列,包含 Pro、Lite、Mini 三款通用 Agent 模型和一款专用 Code 模型,Pro 与 Code 已上线豆包 App 和 TRAE,全系列 API 在火山引擎开放。

    推荐理由:官方给出 Seed2.0 在多模态、长链任务与 token 定价上的具体变化,可据此判断其生产部署适配度。

2月12日周四
  1. Z.ai 官方发布75

    原文发布 2月12日 08:00

    智谱发布 GLM-5,面向复杂系统工程与长程 Agent 任务

    智谱发布 GLM-5,定位从编码转向工程,面向复杂系统工程与长程 Agent 任务,在后端架构、复杂算法和顽固 bug 修复上展现较强深度推理表现。官方称其在代码逻辑密度和系统工程能力上直接对标 Claude Opus 4.5,并集成 DeepSeek Sparse Attention 以提升 token 效率,同时保持长上下文质量。

    推荐理由:官方给出 GLM-5 面向复杂系统工程与长程 Agent 任务的定位,并说明其与 Claude Opus 4.5 的对标维度。

  2. MiniMax 官方 Blog85

    原文发布 2月12日 08:00

    MiniMax 发布 M2.5 模型,主打真实场景生产力

    MiniMax 发布最新模型 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,官方称其在编码、智能体工具调用与搜索上达到 SOTA。

    推荐理由:原文给出 M2.5 在编码、搜索与办公任务上的基准成绩和定价,读者可据此判断智能体任务的成本与速度边界。

2月9日周一
  1. Kimi 官方 Blog71

    原文发布 2月9日 08:00

    Kimi 发布 Agent Swarm,可调度 100 个子智能体并行工作

    Kimi 发布 Agent Swarm,可让 Kimi K2.5 自主组建并调度最多 100 个子智能体并行工作,执行超过 1500 次工具调用,结果比串行执行快 4.5 倍。该功能面向长周期任务,官方给出批量信息搜集、从 40 份 PDF 生成 100 页文献综述、多视角专家评审等用例。目前以早期研究预览形式向最高档订阅用户开放,后续将加入子智能体直接通信和并行宽度动态控制。

    推荐理由:原文给出并行子智能体数量、工具调用规模和提速倍数,读者可据此判断多智能体编排在长任务上的实际形态。

1月28日周三
  1. Mistral AI62

    原文发布 1月28日 00:00

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 更新改为持续推送。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与定价方式,可据此判断终端编码智能体的工作流变化。

1月27日周二
  1. MiniMax 官方 Blog60

    原文发布 1月27日 08:00

    MiniMax 发布角色扮演模型 MiniMax-M2-her

    MiniMax 发布角色扮演模型 MiniMax-M2-her,基于 Talkie / Xingye 三年角色扮演优化经验,围绕 Worlds、Stories、User Preferences 三个维度设计。

    推荐理由:原文公开了角色扮演模型的评测框架与两阶段对齐流程,可了解长对话稳定性为何成为优化重点。

  2. Kimi 官方 Blog87

    原文发布 1月27日 08:00

    Kimi K2.5 发布:原生多模态开源模型,支持最多 100 个子智能体的 Agent Swarm

    Kimi 发布开源模型 Kimi K2.5,在 K2 基础上用约 15T 混合视觉与文本 token 继续预训练,定位为原生多模态模型,主打编码与视觉能力以及自主编排的 Agent Swarm。

    推荐理由:官方给出 K2.5 的预训练规模、Agent Swarm 并行机制与三类基准表现,可据此判断开源模型在智能体方向的位置。

12月23日周二
  1. MiniMax 官方 Blog80

    原文发布 12月23日 08:00

    MiniMax 发布 M2.1,强化多语言编程与真实复杂任务

    MiniMax 发布 MiniMax M2.1,重点提升多语言编程与真实复杂任务表现,系统增强 Rust、Java、Golang、C++、Kotlin、Objective-C、TypeScript、JavaScript 等语言能力,并加强 Android 与 iOS 原生开发。

    推荐理由:原文给出多语言编程与 Agent 工具泛化的能力变化,并附 VIBE 基准与开源权重,可据此判断实际开发可用性。

12月22日周一
  1. Z.ai 官方发布76

    原文发布 12月22日 08:00

    智谱发布 GLM-4.7 基础模型

    智谱发布 GLM-4.7 基础模型,在编码、推理和智能体能力上有明显提升,可生成更可靠的代码并增强长上下文理解。该版本在主要编码与推理基准上取得开源 SOTA 表现,并改进了面向目标的多步智能体编码以及前端和文档生成质量。

    推荐理由:原文给出 GLM-4.7 在编码、推理与智能体能力上的升级方向,读者可据此判断其在开发工作流中的定位。

12月9日周二
  1. Mistral AI80

    原文发布 12月9日 20:00

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立评测对比,便于判断开源编码模型与闭源模型的差距。

11月9日周日
  1. 腾讯混元官方动态62

    原文发布 11月9日 08:00

    腾讯混元 Tencent HY 2.0 Think 上线

    腾讯混元 Tencent HY 2.0 Think 上线,模型底座从 TurboS 升级为混元2.0,模型能力全面提升。官方称该版本显著增强了复杂指令遵循、多轮及长文理解、代码、Agent 和推理能力。

    推荐理由:原文列出混元2.0底座升级与能力增强方向,读者可据此判断它在复杂指令与Agent场景的适用性。

11月6日周四
  1. Kimi 官方 Blog82

    原文发布 11月6日 08:00

    Kimi 发布开源思考模型 Kimi K2 Thinking

    Kimi 发布开源思考模型 Kimi K2 Thinking,可在使用工具的同时逐步推理,在 HLE 上取得 44.9%、BrowseComp 60.2%、SWE-Bench Verified 71.3%。

    推荐理由:原文给出 K2 Thinking 在 HLE、BrowseComp、SWE-Bench Verified 上的成绩与 INT4 推理效率,读者可据此判断开源思考模型的能力位置。

10月27日周一
  1. MiniMax 官方 Blog82

    原文发布 10月27日 08:00

    MiniMax 开源并发布 MiniMax M2,主打 Agent 与编码

    MiniMax 正式开源并发布 MiniMax M2,定位为面向 Agent 与编码的模型,API 定价为每百万输入 token $0.30、每百万输出 token $1.20,约为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍。

    推荐理由:原文给出 M2 的定价、推理速度与开源权重,读者可据此判断它在 Agent 与编码场景中的成本位置。

10月24日周五
  1. Mistral AI60

    原文发布 10月24日 20:00

    Mistral 发布 AI Studio 生产级 AI 平台

    Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

    推荐理由:Mistral 把自家大规模系统的运维经验打包成企业平台,读者可了解生产级 AI 需要哪些基础设施能力。

10月15日周三
  1. xAI API 官方发布62

    原文发布 10月15日 08:00

    xAI API 的 web_search、x_search 和 code_execution 工具正式可用

    xAI API 宣布 web_search、x_search 和 code_execution 等新的服务端智能体工具正式可用,官方同时提供了 Tools 使用指南。这些工具此前处于预览阶段,现在面向开发者开放接入。

    推荐理由:xAI API 把服务端工具转为正式可用,读者可据此判断智能体检索与代码执行能力的接入方式。

9月30日周二
  1. Z.ai 官方发布65

    原文发布 9月30日 08:00

    智谱发布旗舰编码模型 GLM-4.6

    智谱发布旗舰编码模型 GLM-4.6,在公开基准和真实编程任务上表现提升,官方称其为中国领先的编码模型。此次更新将上下文窗口扩展至 200K,以更好处理更长的代码和复杂智能体任务。

    推荐理由:原文给出 GLM-4.6 在公开基准与真实编程任务上的提升,以及 200K 上下文窗口对长代码和复杂智能体任务的意义。