評価の出典公式の評価
DeepSWE v1.1
DataCurve / コーディング · 統一されたコーディングアシスタント環境でリポジトリを変更し、欠陥を修正する。比較するのはコードを書くモデルそのものである。
News での扱い順位に反映
根拠の配分3.6%
元データの時点09/22 14:27
最後に同期に成功10/01 20:05
何をどう測るか
pass@1のみを採用。統一ハーネス内で、あらかじめ固定した推論ティアの優先順位に従って代表構成を選ぶ。
この根拠の使い方
コーディングとデザインの予算のうち3.6%。システムとバージョンを固定して統制。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 2 | gemini-3-8-flashGoogle | 73.8% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 3 | claude-opus-5Anthropic | 73.6% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 4 | gpt-6-astraOpenAI | 73.2% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 9 | gpt-5-6-solOpenAI | 72.7% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 13 | claude-fable-5Anthropic | 69.7% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 14 | gpt-5-6-terraOpenAI | 69.6% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 16 | glm-5-3Z.ai | 69.0% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 19 | kimi-k3Moonshot AI | 68.5% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 21 | gpt-5-6-lunaOpenAI | 67.2% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 22 | gpt-5-5OpenAI | 67.0% | xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 24 | grok-4-6xAI | 66.7% | xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 27 | gemini-3-7-flashGoogle | 65.3% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 30 | glm-5-3-flashZ.ai | 63.4% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 31 | deepseek-v4-proDeepSeek | 62.8% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 35 | claude-opus-4-8Anthropic | 59.0% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 37 | qwen3-8-maxAlibaba | 57.5% | xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 39 | muse-spark-1-2Meta | 54.9% | xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 42 | claude-sonnet-5Anthropic | 53.8% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 43 | grok-4-5xAI | 53.8% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 46 | deepseek-v4-flashDeepSeek | 53.3% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 46 | muse-spark-1-1Meta | 53.3% | xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 48 | gpt-5-4OpenAI | 51.8% | xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 53 | gemini-3-6-flashGoogle | 46.7% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 56 | glm-5-2Z.ai | 43.8% | Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 61 | gemini-3-5-flashGoogle | 36.1% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 63 | kimi-k2-7-codeMoonshot AI | 30.5% | 完全なシステム · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 65 | claude-sonnet-4-6Anthropic | 29.9% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 68 | gemini-3-1-pro-previewGoogle | 11.7% | High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
評価の限界とデータの出典
あくまでモデル+mini-swe-agent のシステム性能。メジャーバージョンの変更はスナップショットを分離する必要がある。
データのライセンス:公式公開の構造化結果。管理者のみの非公開観察であり、公開前にライセンスを再確認
スコアは DataCurve が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。