評価の出典公式の評価
SWE-rebench
Nebius / コーディング · 実在のリポジトリの問題を継続的に収集し、多様なプログラミング言語におけるモデルのソフトウェア修正能力を比較する。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
タスクウィンドウ、ReAct環境、text/toolsインタラクションプロトコルを固定し、複数回実行の平均解決率と標準誤差を採用する。完全なAgent製品と基盤モデルを同一対象として混同しない。
この根拠の使い方
候補観察:実際のリポジトリタスクは補完する価値があるが、検証可能な実行日、安定した成績プロトコル、再展示の境界を待つ。まだ自動収集や採点は有効化していない。
評価の限界とデータの出典
ローリング問題、実行環境、タスクウィンドウが比較可能性に影響する。サイトの最近のメンテナンスは全モデルの再テストを意味しない。
データのライセンス:公式Hugging Face CC BY 4.0データセットがタスク問題集。ウェブページの最終成績の安定したエクスポートと再表示の境界は未確認。
スコアは Nebius が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。