評価の出典公式の評価
Terminal-Bench 4 · システム参考
Harbor / Terminal-Bench / コーディング · モデルと異なる Agent を組み合わせた端末タスクの元の成績を残し、相互照合に供する。
News での扱い参考のみ
根拠の配分採点に使わない
元データの時点09/03 10:43
最後に同期に成功10/01 20:05
何をどう測るか
Terminal-Bench 4.0を固定し、モデル、Agentバージョン、推論ティア、実行回数をそれぞれ保持する。異なるツールシステムを統一モデル条件として解釈しない。
この根拠の使い方
元の成績参考:公式提出リストとデータバージョンを固定したうえで自動収集し、異なるシステム設定を逐条残し、モデル代表スコアは選ばない。相互照合のみに供し、総合やプログラミングのランキングには算入しない。
評価結果
以下はモデルと異なる Agent を組み合わせたシステム成績で、実行条件が異なるため参考まで。各項目は最大 30 件の構成を表示し、匿名テスト型番は表示しない。
| 元の順位 | 元のモデル名 | 元のスコア | 実行設定 |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 57.9% | Claude Code 2.1.257 · max 推論 |
| 2 | claude-opus-5Anthropic | 51.8% | Claude Code 2.1.231 · max 推論 |
| 3 | claude-fable-5Anthropic | 44.5% | Claude Code 2.1.231 · max 推論 |
| 4 | glm-5.3Z.ai | 41.8% | Claude Code 2.1.207 · max 推論 |
| 5 | gpt-5.6-solOpenAI | 37.3% | Codex 0.149.1 · max 推論 |
| 6 | claude-opus-4-8Anthropic | 23.6% | Claude Code 2.1.231 · max 推論 |
| 7 | gpt-5.6-terraOpenAI | 21.5% | Codex 0.149.1 · max 推論 |
| 8 | grok-4.6xAI | 20.3% | Grok Build 1.0.5 · 出典は推論レベルを報告していない |
| 9 | gemini-3.8-flashGoogle | 19.1% | mini-SWE-agent 2.4.6 · high 推論 |
| 10 | gpt-5.6-lunaOpenAI | 17.3% | Codex 0.149.1 · max 推論 |
| 11 | grok-4.5xAI | 12.4% | Grok Build 1.0.5 · 出典は推論レベルを報告していない |
| 11 | claude-sonnet-5Anthropic | 12.4% | Claude Code 2.1.231 · max 推論 |
| 13 | gemini-3.7-flashGoogle | 11.2% | mini-SWE-agent 2.4.6 · high 推論 |
評価の限界とデータの出典
モデルごとに Claude Code、Codex、GrokBuild、mini-SWE など異なるツールを使用する。AA v4.3 は Terminal-Bench v4 を既に含むため、再度総合票に計上してはならない。
データのライセンス:Apache 2.0 · 公式 harbor-framework/terminal-bench リポジトリ内の成績提出。帰属表示、ライセンス、変更説明を保持。
スコアは Harbor / Terminal-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。