跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 161–180 条 · 共 185 条
9月22日周一
  1. DeepSeek 官方更新62

    原文发布 9月22日 00:00

    DeepSeek 将 deepseek-chat 与 deepseek-reasoner 升级至 V3.1-Terminus

    DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级到 DeepSeek-V3.1-Terminus,前者对应非思考模式,后者对应思考模式。本次更新在保持原有能力的同时修复了用户反馈的问题,包括减少中英文混用和偶发异常字符,并进一步优化 Code Agent 与 Search Agent 的表现。

    推荐理由:官方说明了两个接口对应的模式与本次修复项,读者可据此判断升级是否影响现有调用。

9月5日周五
9月2日周二
  1. Mistral AI62

    原文发布 9月2日 12:00

    Mistral 为 Le Chat 上线 MCP 连接器目录与 Memories 记忆功能

    Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,包括 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。

    推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。

8月21日周四
7月30日周三
  1. Mistral AI60

    原文发布 7月30日 20:00

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。

    推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。

7月28日周一
  1. Z.ai 官方发布73

    原文发布 7月28日 08:00

    智谱发布 GLM-4.5 系列模型

    智谱发布原生智能体大语言模型 GLM-4.5 系列,官方称参数效率提升一倍,并具备较强的推理、编码和智能体能力。该系列还支持一键兼容 Claude Code 框架,更多细节见官方文档。

    推荐理由:官方给出 GLM-4.5 的参数效率与推理、编码、智能体能力变化,并说明与 Claude Code 框架的兼容方式。

7月22日周二
  1. Qwen Blog82

    原文发布 7月22日 21:00

    Qwen3-Coder 发布:480B MoE 编码模型与 Qwen Code 命令行工具开源

    Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。

    推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。

7月17日周四
  1. Mistral AI62

    原文发布 7月17日 20:00

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线的整合方向。

7月11日周五
  1. Kimi 官方 Blog84

    原文发布 7月11日 08:00

    Kimi 发布开源 MoE 模型 Kimi K2

    Kimi 发布最新 MoE 模型 Kimi K2,激活参数 32B、总参数 1T,在非思考类模型的前沿知识、数学和编码上达到 SOTA,并针对智能体任务优化。官方开源 Kimi-K2-Base 基础模型和 Kimi-K2-Instruct 后训练模型,后者适合直接用于通用对话和智能体场景。

    推荐理由:原文给出 MoE 参数规模、MuonClip 训练方案与开源权重,读者可据此判断其智能体任务定位与自部署门槛。

6月25日周三
  1. 腾讯混元官方动态62

    原文发布 6月25日 08:00

    腾讯混元上线 hunyuan-a13b 混合推理模型

    腾讯混元上线 hunyuan-a13b,这是混元首个混合推理模型,也是 hunyuan-standard-256K 的升级版本,总参数 80B、激活 13B,采用 MoE 结构。模型默认慢思考模式,可通过参数或在 query 前加 /no_think 切换快慢思考,官方称数学、科学、长文理解和 Agent 能力提升显著。

    推荐理由:原文给出混元首个混合推理模型的参数规模与快慢思考切换方式,读者可据此判断其适用场景。

6月20日周五
  1. Kimi 官方 Blog76

    原文发布 6月20日 08:00

    Kimi 发布自主研究智能体 Kimi-Researcher

    Kimi 发布自主智能体 Kimi-Researcher,基于内部版 Kimi k 系列模型,完全通过端到端智能体强化学习训练,在 Humanity's Last Exam 上取得 Pass@1 26.9%、Pass@4 40.17% 的成绩,从初始 8.6% 几乎全部由 RL 训练提升而来。

    推荐理由:原文给出端到端智能体 RL 训练的完整路径与 HLE 成绩,读者可据此判断自主搜索智能体的能力边界。

6月4日周三
  1. Mistral AI60

    原文发布 6月4日 20:00

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。

    推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。

5月27日周二
  1. Mistral AI67

    原文发布 5月27日 20:00

    Mistral 发布 Agents API,内置连接器与多智能体编排

    Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。

    推荐理由:官方给出 Agents API 的内置连接器、状态化对话与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。

5月21日周三
  1. Mistral AI76

    原文发布 5月21日 20:00

    Mistral AI 与 All Hands AI 发布 Devstral 智能体编码模型

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月7日周三
  1. Mistral AI60

    原文发布 5月7日 20:00

    Mistral AI 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。

    推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的集成与私有化选项。

4月29日周二
4月16日周三
  1. 腾讯混元官方动态62

    原文发布 4月16日 08:00

    腾讯发布混元 TurboS 新版本 hunyuan-turbos-20250416

    腾讯混元推出旗舰大模型新版本 hunyuan-turbos-20250416,预训练底座升级,增强指令理解与遵循能力。对齐阶段提升数学、代码、逻辑、科学等理科能力,并改进文创写作、文本理解、翻译准确率和知识问答等文科能力。该版本还增强各领域 Agent 能力,重点加强多轮对话理解。

    推荐理由:官方给出混元 TurboS 新版本在理科能力、文科能力和 Agent 多轮对话上的具体升级方向,便于判断是否值得切换。

3月28日周五
  1. Qwen Blog71

    原文发布 3月28日 00:00

    Qwen 发布视觉推理模型 QVQ-Max 首个版本

    Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。

    推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。

3月6日周四
  1. Qwen Blog80

    原文发布 3月6日 00:00

    Qwen 发布 QwQ-32B 推理模型,320 亿参数对标 DeepSeek-R1

    Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。

    推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。