英国 AISI 采用 EvalEval 基础设施公开评测结果,提升可复现性
英国 AI Security Institute(AISI)正使用 EvalEval 的 Evaluation Cards 平台公开分享评测结果,数据覆盖 HealthBench。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Evaluation Cards 平台公开分享评测结果,数据覆盖 HealthBench。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续追踪结构关系。图像与视频生成工具仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。