本文へ移動
評価の出典

Hyper-τ-bench

Sierra / コーディング · 業務資料に基づいて動作するカスタマーサービスエージェントを構築しテストする。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

エージェントの開発とデバッグを測定するもので、直接カスタマーサービスを実行するτ³-Bankingとは分ける。開発ツール、実行時間、受け入れ環境を固定し、システムをまたいで最高成績を選んではならない。

この根拠の使い方

観察中:コーディングと業務システム開発を補完できる。まず生の成績、ライセンス、固定した実行条件の審査を完了する。新しく公開されたからといって自動的にスコアリングはしない。

評価の限界とデータの出典

観察中:コーディングと業務システム開発を補完できる。まず生の成績、ライセンス、固定した実行条件の審査を完了する。新しく公開されたからといって自動的にスコアリングはしない。

データのライセンス:リーダーボードデータの使用境界は要確認

スコアは Sierra が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。