跳到正文
原文
Kimi 官方 Blog·AI 评分37

Kimi 发布 PerceptionBench:评估多模态大模型原子视觉感知能力

PerceptionBench

AI 导读

Kimi 团队发布 PerceptionBench,从 42 个基准的前沿模型失败案例中归纳出 10 类原子感知能力,构建 3,000 道经核验的题目,每题仅考察单一感知能力、无需推理或外部知识。在 16 个前沿多模态大模型上,无一模型准确率超过 60%,感知相关幻觉平均表现最弱。该数据集与评测代码已开源。

来源:Kimi 官方 Blog · kimi.com