Kimi 官方 Blog·AI 评分37
Kimi 发布 PerceptionBench:评估多模态大模型原子视觉感知能力
PerceptionBench
AI 导读
Kimi 团队发布 PerceptionBench,从 42 个基准的前沿模型失败案例中归纳出 10 类原子感知能力,构建 3,000 道经核验的题目,每题仅考察单一感知能力、无需推理或外部知识。在 16 个前沿多模态大模型上,无一模型准确率超过 60%,感知相关幻觉平均表现最弱。该数据集与评测代码已开源。
来源:Kimi 官方 Blog · kimi.com