跳到正文

#MCP/工具调用

今日 2 条
今天9月30日周三
  1. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,适用于自定义智能体、自动化流程和对话式数据分析。文章提出以具体性实现清晰、以业务上下文提升相关性、用示例代替描述等核心原则,并给出 CRISPE 结构化框架,从上下文与约束、角色与职责、意图与输入、步骤与范围等维度组织复杂提示词。

  2. AWS Machine Learning Blog22

    Amazon Quick 各组件提示词工程:模式与陷阱

    AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清触发时间、数据源、计算与输出格式,复杂逻辑用编号步骤,并可通过对话迭代修改;Quick Sight 的查询需包含业务问题、指标、维度和可视化偏好。

9月29日周二
  1. Hugging Face Blog29

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源正确",专门捕捉把某来源的事实错误归因到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

9月28日周一
  1. Hugging Face Blog72

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,便于对照其成本与能力取舍。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,agent 即可生成看板、发布清单或仪表盘等界面。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已通过 Awesome Copilot 分享现成模板。

9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体便会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包好的经验,后者是连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它让模型基于训练数据之外的信息作答,能减少 token 消耗并降低答案不完整的概率。

9月12日周六
9月11日周五
8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率从 26.7% 升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 RAG 的替代路径。