本文へ移動
原文
Mistral AI·· 2025-04-09

Mistral、LLM as a JudgeでRAGを評価する方法

Evaluating RAG with LLM as a Judge

AI による要約

Mistralはjudge LLMがgenerator LLMの回答を数値、二値、定性的尺度で採点し、評価データの加重平均を取るRAG評価を提案した。

入選の記録

入選せず二回の合計 60 < 基準の 2 倍 120

情報源の区分
公式・一次情報、この区分の基準は 60 点
予備審査
通過:Mistral官方讲LLM评估RAG系统

採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。

情報源:Mistral AI · mistral.ai