Anthropic Frontier Red Team 评估 GLM-5.3 等模型的漏洞利用能力
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机选取 100 个任务评估多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,报告认为一个有意义的能力门槛已被跨过。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机选取 100 个任务评估多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,报告认为一个有意义的能力门槛已被跨过。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源正确",专门捕捉把某来源的事实错误归因到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Evaluation Cards 平台公开分享评测结果,数据覆盖 HealthBench。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,题目来自 Formal Conjectures 数据集。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个原型AI蠕虫,利用被攻陷机器的GPU运行开源权重LLM进行推理,自主发现漏洞并自我复制,漏洞检测成功率约80%、利用成功率约53%、自我复制成功率88%,整体攻击成功率约37%。