Tavily News Discovery·· 1 天前AI 评分31
构建企业级 AI 基准 Enterprise-Bench 如何改变了我评估 AI 的方式
Building an enterprise AI benchmark changed how I evaluate AI | CIO
AI 导读
为衡量企业 AI 真实表现,团队构建了 Enterprise-Bench,用一家含 42 个客户账户、40 个产品部件、5 套互连系统和 14 项任务的合成中端支付公司做测试,并将数据量放大至 256 倍。结果显示,结构化记忆系统任务正确率 94.3%,而使用同一 Opus 4.8 模型家族的 Claude Code 为 63.6%,且前者每个正确答案的 token 消耗约少 4.4 倍。
来源:Tavily News Discovery · cio.com