本文へ移動
評価の出典

Terminal-Bench Science

Harbor / ビジネス業務 · ターミナルで科学研究タスクを完了する

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

Claude Code、Codex、mini-SWE などのシステムを区別する。異なるシステムの成績をそのままモデル能力とはみなせない。

この根拠の使い方

観察中:12モデルで、実行システムが混在しており、新しいフロンティアモデルはまだ不完全。

評価の限界とデータの出典

観察中:12モデルで、実行システムが混在しており、新しいフロンティアモデルはまだ不完全。

データのライセンス:リーダーボードデータの使用境界は要確認

スコアは Harbor が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。