跳到正文
原文
Simon Willison·· 5 小时前AI 评分62

Anthropic Frontier Red Team 评估 GLM-5.3 等模型的漏洞利用能力

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机选取 100 个任务评估多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,报告认为一个有意义的能力门槛已被跨过。

来源:Simon Willison · simonwillison.net