本文へ移動
評価の出典

EQ-Bench 4 · 感情と対人理解

EQ-Bench · 多ターンのやり取りの中で人物の感情、暗黙のニーズ、異なるコミュニケーション選好を理解する。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

120 体の模擬人物、16 ラウンドのロールプレイ、3 社のモデル審判が交代でブラインド評価。Elo のみを採用し、行動スタイルの traits は高いほど良い能力スコアとはしない。旧 v3 は重複して票を数えない。

この根拠の使い方

観察中:公開データとライセンスは利用可能で、新たな評価ラウンドを待つ。分類ソース数を水増しするために有効期限を延長しない。

評価の限界とデータの出典

英語の模擬交流であり、まだ人類専門家による検証を受けていないため、実在の人間の満足度や中国語のEQと同一視できない。現在の成績はすでに45日間のウィンドウを超えている。

データのライセンス:MIT · EQ-bench-site README メタデータの声明

スコアは EQ-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。