跳到正文

#Agent

今日 30 条
9月29日周二
9月28日周一
  1. Hugging Face Blog72

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,便于对照其成本与能力取舍。

  2. Simon Willison12

    Muse AI Agent 代用户回复消息酿成失误

    Muse AI Agent 在代 @matt.j.robb 处理 MX Keys Mini 取件时,于 9:27 自动回复取件人 Usman“Yep I'm here!”,但用户当时并不在场,Usman 等待至 9:38 后离开并给出差评。该 Agent 已从用户账号发送道歉并提出改日再试,同时建议停止在无法核实的情况下自动回复“在家”。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体便会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月24日周四
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包好的经验,后者是连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它让模型基于训练数据之外的信息作答,能减少 token 消耗并降低答案不完整的概率。

9月17日周四
  1. GitHub Blog · AI & ML77

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 pull request 增量合入 main,而非一次性切换。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁移到 Rust 的完整工程方法,包括分层策略、跨会话协作与提示词缓存数据。

9月16日周三
  1. Mistral AI56

    Mistral 与 Mozilla 合作,为 Firefox Smart Window 提供模型支持

    Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)改由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。Smart Window 可帮助理解复杂搜索、找回此前点击离开的重要内容,并基于浏览器标签页整理信息。双方称对话默认不保存在 Mozilla 服务器上,Mistral 等合作方同意零数据保留。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML34

    GitHub Copilot 应用新手指南:使用 diff、终端与浏览器面板

    GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿红高亮显示增删改行,终端面板可直接运行项目命令并支持多窗口,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。完成后可直接在应用内接受变更并创建 pull request。

9月9日周三
  1. Mistral AI49

    Mistral 用 AI 智能体将 4 万行 Fortran 77 迁移至 C++

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 代码迁移为 C++,目标是一个无测试套件、无集中文档的物理储层模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工介入的 coder、tester、reviewer 智能体工作流逐模块迁移。

9月7日周一
9月3日周四
  1. Google DeepMind66

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber

    Google 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴限量开放其网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。

    推荐理由:官方披露了受限访问计划的能力组合与准入条件,可据此判断前沿网络防御能力的开放节奏。

8月31日周一
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel

    METR 研究显示 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率从 26.7% 升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 RAG 的替代路径。

8月17日周一
8月3日周一
7月26日周日
  1. Berkeley AI Research34

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也显著低于全上下文设置。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体构建、为智能体服务的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体服务、由智能体运行、由智能体构建。其中智能体查询会产生大量重复子计划,在 text-to-SQL 基准上仅 10-20% 子计划不同,80-90% 属重复工作,可通过多查询优化与近似查询处理加以利用。