本文へ移動
評価の出典

DeepSWE v1.1

DataCurve / コーディング · 統一されたコーディングアシスタント環境でリポジトリを変更し、欠陥を修正する。比較するのはコードを書くモデルそのものである。

公式の評価
News での扱い順位に反映
根拠の配分3.6%
元データの時点09/22 14:27
最後に同期に成功10/01 20:05

何をどう測るか

pass@1のみを採用。統一ハーネス内で、あらかじめ固定した推論ティアの優先順位に従って代表構成を選ぶ。

この根拠の使い方

コーディングとデザインの予算のうち3.6%。システムとバージョンを固定して統制。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
2gemini-3-8-flashGoogle73.8%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
3claude-opus-5Anthropic73.6%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
4gpt-6-astraOpenAI73.2%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
9gpt-5-6-solOpenAI72.7%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
13claude-fable-5Anthropic69.7%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
14gpt-5-6-terraOpenAI69.6%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
16glm-5-3Z.ai69.0%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
19kimi-k3Moonshot AI68.5%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
21gpt-5-6-lunaOpenAI67.2%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
22gpt-5-5OpenAI67.0%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
24grok-4-6xAI66.7%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
27gemini-3-7-flashGoogle65.3%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
30glm-5-3-flashZ.ai63.4%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
31deepseek-v4-proDeepSeek62.8%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
35claude-opus-4-8Anthropic59.0%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
37qwen3-8-maxAlibaba57.5%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
39muse-spark-1-2Meta54.9%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
42claude-sonnet-5Anthropic53.8%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
43grok-4-5xAI53.8%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46deepseek-v4-flashDeepSeek53.3%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46muse-spark-1-1Meta53.3%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
48gpt-5-4OpenAI51.8%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
53gemini-3-6-flashGoogle46.7%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
56glm-5-2Z.ai43.8%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
61gemini-3-5-flashGoogle36.1%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
63kimi-k2-7-codeMoonshot AI30.5%完全なシステム · mini-swe-agent · deepswe-v1.1:mini-swe-agent
65claude-sonnet-4-6Anthropic29.9%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
68gemini-3-1-pro-previewGoogle11.7%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
評価の限界とデータの出典

あくまでモデル+mini-swe-agent のシステム性能。メジャーバージョンの変更はスナップショットを分離する必要がある。

データのライセンス:公式公開の構造化結果。管理者のみの非公開観察であり、公開前にライセンスを再確認

スコアは DataCurve が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。