跳到正文
原文
Brave Web Discovery·· 16 小时前AI 评分27

Scale Labs 前沿 AI 模型排行榜与基准评测

AI Model Leaderboards & Benchmarks | Scale Labs

AI 导读

Scale Labs 推出前沿 AI 模型评测与排行榜,通过高复杂度评测暴露模型失败点、防止基准饱和。其排行榜结合私有数据集防止过拟合,并引入开源数据集以保证广泛基准测试与可比性;评测由人类设计复杂任务与标准,LLM 负责规模化执行。

来源:Brave Web Discovery · labs.scale.com