热点事件持续更新
Scale Labs 发布 LHAW 欠规范长时程任务评测
1 篇报道1 个报道来源14 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,Scale Labs 发布 LHAW,一个与数据集无关的流水线,可将长时程任务转化为可控的欠规范变体,并基于 MCP-Atlas、TAC 和 SWE-Bench Pro 构建了 285 个经执行验证的评测任务。测试显示,前沿模型在可访问模拟用户时从欠规范中恢复的能力差异显著,反映出战略澄清能力的差距;问题质量、过度澄清和响应误读是差异最大的澄清失败模式。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 08:00
Scale Labs 发布 LHAW 流水线,构建 285 个欠规范长时程评测任务。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- Exa Semantic DiscoveryScale Labs 发布 LHAW:面向长时程任务的欠规范评测流水线
Scale Labs 发布 LHAW,一个与数据集无关的流水线,可将长时程任务转化为可控的欠规范变体,并基于 MCP-Atlas、TAC 和 SWE-Bench Pro 构建了 285 个经执行验证的评测任务。测试显示,前沿模型在可访问模拟用户时从欠规范中恢复的能力差异显著,反映出战略澄清能力的差距;问题质量、过度澄清和响应误读是差异最大的澄清失败模式。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。