評価の出典公式の評価
EQ-Bench 4 · 感情と対人理解
EQ-Bench · 多ターンのやり取りの中で人物の感情、暗黙のニーズ、異なるコミュニケーション選好を理解する。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
120 体の模擬人物、16 ラウンドのロールプレイ、3 社のモデル審判が交代でブラインド評価。Elo のみを採用し、行動スタイルの traits は高いほど良い能力スコアとはしない。旧 v3 は重複して票を数えない。
この根拠の使い方
観察中:公開データとライセンスは利用可能で、新たな評価ラウンドを待つ。分類ソース数を水増しするために有効期限を延長しない。
評価の限界とデータの出典
英語の模擬交流であり、まだ人類専門家による検証を受けていないため、実在の人間の満足度や中国語のEQと同一視できない。現在の成績はすでに45日間のウィンドウを超えている。
データのライセンス:MIT · EQ-bench-site README メタデータの声明
スコアは EQ-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。