本文へ移動
評価の出典

Long-Horizon Terminal-Bench

Tencent HY / Lehigh など / コーディング · 長時間にわたりターミナルを使い続け、複雑なエンジニアリングとツールタスクを完遂する。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

90 分、2 時間、3 時間の予算をそれぞれ比較。修正前後の判定プロトコルを混在させず、異なる Agent の最良結果を統一モデルの成績として扱わない。

この根拠の使い方

候補観察:修正プロトコルを明記した新バッチを待つ。既存の旧スコアは公開ランキングに自動収集せず、採点もしない。これに基づきすべての旧結果が脆弱性を利用したと断定はしない。

評価の限界とデータの出典

公式が判題情報の漏洩を開示したことがある。現在、既存の成績が隔離判題後の同一プロトコルに属することを証明できない。一部タスクと他の専門評価の来源の重複は要確認。

データのライセンス:Apache 2.0 · 公式 IntelligenceLab/LHTB-leaderboard 成績データセット。帰属表示と変更説明を保持。

スコアは Tencent HY / Lehigh などが公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。