Skip to content
Evaluation sources

Mercor APEX-Agents 1.1

Mercor / Professional work · Long tasks from investment banking, consulting and law, testing whether a model can finish a complete piece of work as an assistant.

Official evaluation
In NewsRanked
Evidence budget4%
Upstream data as of09/08 08:00
Last synced10/01 20:05

What it measures, and how

The 1.1 dataset and official Loop environment are fixed, using Pass@1 and its corresponding error, with configurations chosen by a pre-fixed reasoning tier. Mean Score is the average completion of scoring items and is not mixed with task completion rate.

How this evidence is used

The Pass@1 of the official Loop version 1.1 is fixed, taking 4% of the tools and office budget exclusively; the other 2% is used for banking tasks in the unified environment.

Results

Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.

Rank thereModel thereRaw scoreRepresentative configuration
1gemini-4-argonGoogle82.2%High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-sonnet-5-5anthropic75.5%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-opus-5-5Anthropic73.5%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4claude-fable-5.1Anthropic68.6%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5gemini-3.7-flashGoogle67.8%High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6claude-opus-5Anthropic65.8%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7grok-4-6-xhighxAI65.3%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gpt-6-astra-maxOpenAI64.7%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9gemini-3.8-flashGoogle64.3%High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10claude-fable-5Anthropic63.6%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
11qwen-3-8-max-xhighAlibaba63.3%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
12gpt-6-1-sol—60.0%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14muse-spark-1-3Meta58.6%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15gpt-5.6-terra-maxOpenAI58.2%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16glm-5-3Z.ai56.6%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17grok-4-5xAI56.2%High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18deepseek-v4-flashDeepSeek55.3%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19gpt-5.5-xhighOpenAI55.1%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20grok-4.7xAI54.6%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21claude-sonnet-5-maxAnthropic54.5%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
22gpt-6-solOpenAI54.3%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23glm-5-3-flashZ.ai52.8%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
25responses/gpt-5.4OpenAI52.4%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26gpt-5-6-sol-max-proOpenAI51.4%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27kimi-k3Moonshot AI50.6%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28claude-opus-4-7Anthropic49.2%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29claude-opus-4-8Anthropic48.9%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30qwen-3-8-27bAlibaba47.5%xHigh reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31deepseek-v4-pro-08-13DeepSeek47.3%Max reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32gemini-3.6-flashGoogle46.9%High reasoning · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
Limits and data attribution

Limited to investment banking, consulting and legal tasks; the original page provides no per-model evaluation dates, and the reason for a few missing runs is not public. This score cannot be interpreted as the reliability of all office work.

Data licence: Official public results; data and code licences do not equal leaderboard redistribution authorisation

Scores published by Mercor. Raw scores and the News consensus score use different scales and cannot be added directly.