跳到正文
原文
Mistral AI·AI 评分30

Mistral 如何用 LLM as a Judge 评估 RAG 系统

Evaluating RAG with LLM as a Judge

AI 导读

Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的答案打分,再对评测数据集求加权总分。其 API 新增结构化输出功能,可配合 RAG Triad 框架检查上下文相关性、 groundedness 与答案相关性,让评分结果更易机器读取。

来源:Mistral AI · mistral.ai