評価の出典公式の評価
Terminal-Bench Science
Harbor / ビジネス業務 · ターミナルで科学研究タスクを完了する
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
Claude Code、Codex、mini-SWE などのシステムを区別する。異なるシステムの成績をそのままモデル能力とはみなせない。
この根拠の使い方
観察中:12モデルで、実行システムが混在しており、新しいフロンティアモデルはまだ不完全。
評価の限界とデータの出典
観察中:12モデルで、実行システムが混在しており、新しいフロンティアモデルはまだ不完全。
データのライセンス:リーダーボードデータの使用境界は要確認
スコアは Harbor が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。