本文へ移動
評価の出典

Terminal-Bench 4 · システム参考

Harbor / Terminal-Bench / コーディング · モデルと異なる Agent を組み合わせた端末タスクの元の成績を残し、相互照合に供する。

公式の評価
News での扱い参考のみ
根拠の配分採点に使わない
元データの時点09/03 10:43
最後に同期に成功10/01 20:05

何をどう測るか

Terminal-Bench 4.0を固定し、モデル、Agentバージョン、推論ティア、実行回数をそれぞれ保持する。異なるツールシステムを統一モデル条件として解釈しない。

この根拠の使い方

元の成績参考:公式提出リストとデータバージョンを固定したうえで自動収集し、異なるシステム設定を逐条残し、モデル代表スコアは選ばない。相互照合のみに供し、総合やプログラミングのランキングには算入しない。

評価結果

以下はモデルと異なる Agent を組み合わせたシステム成績で、実行条件が異なるため参考まで。各項目は最大 30 件の構成を表示し、匿名テスト型番は表示しない。

元の順位元のモデル名元のスコア実行設定
1claude-fable-5-1Anthropic57.9%Claude Code 2.1.257 · max 推論
2claude-opus-5Anthropic51.8%Claude Code 2.1.231 · max 推論
3claude-fable-5Anthropic44.5%Claude Code 2.1.231 · max 推論
4glm-5.3Z.ai41.8%Claude Code 2.1.207 · max 推論
5gpt-5.6-solOpenAI37.3%Codex 0.149.1 · max 推論
6claude-opus-4-8Anthropic23.6%Claude Code 2.1.231 · max 推論
7gpt-5.6-terraOpenAI21.5%Codex 0.149.1 · max 推論
8grok-4.6xAI20.3%Grok Build 1.0.5 · 出典は推論レベルを報告していない
9gemini-3.8-flashGoogle19.1%mini-SWE-agent 2.4.6 · high 推論
10gpt-5.6-lunaOpenAI17.3%Codex 0.149.1 · max 推論
11grok-4.5xAI12.4%Grok Build 1.0.5 · 出典は推論レベルを報告していない
11claude-sonnet-5Anthropic12.4%Claude Code 2.1.231 · max 推論
13gemini-3.7-flashGoogle11.2%mini-SWE-agent 2.4.6 · high 推論
評価の限界とデータの出典

モデルごとに Claude Code、Codex、GrokBuild、mini-SWE など異なるツールを使用する。AA v4.3 は Terminal-Bench v4 を既に含むため、再度総合票に計上してはならない。

データのライセンス:Apache 2.0 · 公式 harbor-framework/terminal-bench リポジトリ内の成績提出。帰属表示、ライセンス、変更説明を保持。

スコアは Harbor / Terminal-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。