Brave Web Discovery·· 16 小时前AI 评分27
Scale Labs 前沿 AI 模型排行榜与基准评测
AI Model Leaderboards & Benchmarks | Scale Labs
AI 导读
Scale Labs 推出前沿 AI 模型评测与排行榜,通过高复杂度评测暴露模型失败点、防止基准饱和。其排行榜结合私有数据集防止过拟合,并引入开源数据集以保证广泛基准测试与可比性;评测由人类设计复杂任务与标准,LLM 负责规模化执行。
来源:Brave Web Discovery · labs.scale.com