Skip to content
Evaluation sources

DeepSWE v1.1

DataCurve / Coding · Modifying repositories and fixing defects in a unified coding assistant environment; what is compared is the model that writes the code itself.

Official evaluation
In NewsRanked
Evidence budget3.6%
Upstream data as of09/22 14:27
Last synced10/01 20:05

What it measures, and how

Only pass@1 is used; within the unified harness, the representative configuration is chosen by a pre-fixed reasoning-tier priority.

How this evidence is used

3.6% of the coding and design budget; controlled system and version fixed.

Results

Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.

Rank thereModel thereRaw scoreRepresentative configuration
2gemini-3-8-flashGoogle73.8%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
3claude-opus-5Anthropic73.6%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
4gpt-6-astraOpenAI73.2%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
9gpt-5-6-solOpenAI72.7%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
13claude-fable-5Anthropic69.7%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
14gpt-5-6-terraOpenAI69.6%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
16glm-5-3Z.ai69.0%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
19kimi-k3Moonshot AI68.5%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
21gpt-5-6-lunaOpenAI67.2%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
22gpt-5-5OpenAI67.0%xHigh reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
24grok-4-6xAI66.7%xHigh reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
27gemini-3-7-flashGoogle65.3%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
30glm-5-3-flashZ.ai63.4%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
31deepseek-v4-proDeepSeek62.8%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
35claude-opus-4-8Anthropic59.0%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
37qwen3-8-maxAlibaba57.5%xHigh reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
39muse-spark-1-2Meta54.9%xHigh reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
42claude-sonnet-5Anthropic53.8%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
43grok-4-5xAI53.8%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46deepseek-v4-flashDeepSeek53.3%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46muse-spark-1-1Meta53.3%xHigh reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
48gpt-5-4OpenAI51.8%xHigh reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
53gemini-3-6-flashGoogle46.7%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
56glm-5-2Z.ai43.8%Max reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
61gemini-3-5-flashGoogle36.1%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
63kimi-k2-7-codeMoonshot AI30.5%Complete system · mini-swe-agent · deepswe-v1.1:mini-swe-agent
65claude-sonnet-4-6Anthropic29.9%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
68gemini-3-1-pro-previewGoogle11.7%High reasoning · mini-swe-agent · deepswe-v1.1:mini-swe-agent
Limits and data attribution

Still the performance of a model plus mini-swe-agent system; major version changes must be isolated as snapshots.

Data licence: Official public structured results; admin-only private observation, with licence review before publication

Scores published by DataCurve. Raw scores and the News consensus score use different scales and cannot be added directly.