跳到正文
原文
Exa Semantic Discovery· George Pu, Mike Lee, Sam Denton·AI 评分42

Scale Labs 发布 LHAW:面向长时程任务的欠规范评测流水线

LHAW: Long-Horizon Task Workflows | Scale Labs

AI 导读

Scale Labs 发布 LHAW,一个与数据集无关的流水线,可将长时程任务转化为可控的欠规范变体,并基于 MCP-Atlas、TAC 和 SWE-Bench Pro 构建了 285 个经执行验证的评测任务。测试显示,前沿模型在可访问模拟用户时从欠规范中恢复的能力差异显著,反映出战略澄清能力的差距;问题质量、过度澄清和响应误读是差异最大的澄清失败模式。

来源:Exa Semantic Discovery · labs.scale.com