Mistral AI·· 2025-04-09
Mistral、LLM as a JudgeでRAGを評価する方法
Evaluating RAG with LLM as a Judge
AI による要約
Mistralはjudge LLMがgenerator LLMの回答を数値、二値、定性的尺度で採点し、評価データの加重平均を取るRAG評価を提案した。
入選の記録
基準 60公式・一次情報1 回目 382 回目 22
入選せず二回の合計 60 < 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:Mistral官方讲LLM评估RAG系统
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Mistral AI · mistral.ai