Mercor APEX-Agents 1.1
Mercor / Professional work · Long tasks from investment banking, consulting and law, testing whether a model can finish a complete piece of work as an assistant.
What it measures, and how
The 1.1 dataset and official Loop environment are fixed, using Pass@1 and its corresponding error, with configurations chosen by a pre-fixed reasoning tier. Mean Score is the average completion of scoring items and is not mixed with task completion rate.
How this evidence is used
The Pass@1 of the official Loop version 1.1 is fixed, taking 4% of the tools and office budget exclusively; the other 2% is used for banking tasks in the unified environment.
Results
Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.
| Rank there | Model there | Raw score | Representative configuration |
|---|---|---|---|
| 1 | gemini-4-argonGoogle | 82.2% | High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 2 | claude-sonnet-5-5anthropic | 75.5% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 3 | claude-opus-5-5Anthropic | 73.5% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 4 | claude-fable-5.1Anthropic | 68.6% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 5 | gemini-3.7-flashGoogle | 67.8% | High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 6 | claude-opus-5Anthropic | 65.8% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 7 | grok-4-6-xhighxAI | 65.3% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 8 | gpt-6-astra-maxOpenAI | 64.7% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 9 | gemini-3.8-flashGoogle | 64.3% | High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 10 | claude-fable-5Anthropic | 63.6% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 11 | qwen-3-8-max-xhighAlibaba | 63.3% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 12 | gpt-6-1-sol— | 60.0% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 14 | muse-spark-1-3Meta | 58.6% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 15 | gpt-5.6-terra-maxOpenAI | 58.2% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 16 | glm-5-3Z.ai | 56.6% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 17 | grok-4-5xAI | 56.2% | High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 18 | deepseek-v4-flashDeepSeek | 55.3% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 19 | gpt-5.5-xhighOpenAI | 55.1% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 20 | grok-4.7xAI | 54.6% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 21 | claude-sonnet-5-maxAnthropic | 54.5% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 22 | gpt-6-solOpenAI | 54.3% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 23 | glm-5-3-flashZ.ai | 52.8% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 25 | responses/gpt-5.4OpenAI | 52.4% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 26 | gpt-5-6-sol-max-proOpenAI | 51.4% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 27 | kimi-k3Moonshot AI | 50.6% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 28 | claude-opus-4-7Anthropic | 49.2% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 29 | claude-opus-4-8Anthropic | 48.9% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 30 | qwen-3-8-27bAlibaba | 47.5% | xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 31 | deepseek-v4-pro-08-13DeepSeek | 47.3% | Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 32 | gemini-3.6-flashGoogle | 46.9% | High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
Limits and data attribution
Limited to investment banking, consulting and legal tasks; the original page provides no per-model evaluation dates, and the reason for a few missing runs is not public. This score cannot be interpreted as the reliability of all office work.
Data licence: Official public results; data and code licences do not equal leaderboard redistribution authorisation
Scores published by Mercor. Raw scores and the News consensus score use different scales and cannot be added directly.