跳到正文
原文
Brave Web Discovery·· 2 天前AI 评分41

相同运行、不同结果:开源权重模型上 AI 编码智能体的运行间方差研究

Add Identical Runs, Different Results — run-to-run variance in coding-agent evaluation · Issue #27 · natnew/awesome-agentops

AI 导读

一篇新论文对六个编码智能体与六个开源权重端点做了 584 次重复试验,发现同一智能体-模型组合的多次运行差异,比不同组合之间的差异还大。研究估计要在 80% 统计功效下区分两个智能体,每个实验组需跑数十到上百次,并建议在报告分数时同时报告规则遵守情况。同一模型下两个智能体的成本差距超过 20 倍,主要来自 prompt caching。

来源:Brave Web Discovery · github.com