評価の出典公式の評価
Hyper-τ-bench
Sierra / コーディング · 業務資料に基づいて動作するカスタマーサービスエージェントを構築しテストする。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
エージェントの開発とデバッグを測定するもので、直接カスタマーサービスを実行するτ³-Bankingとは分ける。開発ツール、実行時間、受け入れ環境を固定し、システムをまたいで最高成績を選んではならない。
この根拠の使い方
観察中:コーディングと業務システム開発を補完できる。まず生の成績、ライセンス、固定した実行条件の審査を完了する。新しく公開されたからといって自動的にスコアリングはしない。
評価の限界とデータの出典
観察中:コーディングと業務システム開発を補完できる。まず生の成績、ライセンス、固定した実行条件の審査を完了する。新しく公開されたからといって自動的にスコアリングはしない。
データのライセンス:リーダーボードデータの使用境界は要確認
スコアは Sierra が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。