Exa Semantic Discovery· Priya Anand·· 事件 2026-10-01AI 评分62
TextQL Labs 发布 Argo-Bench 基准,Claude Opus 5.5 仅解出 34.8% 任务
Argo-Bench AI Benchmark: Top Model Clears 34.8% [2026]
AI 导读
TextQL Labs 于 10 月 1 日发布 Argo-Bench 基准,把 AI 智能体放进模拟纽约外卖公司的数据仓库,按最终运营动作的真实后果而非 SQL 语法打分。
来源:Exa Semantic Discovery · shattered.io