本文へ移動
評価の出典

Mercor APEX-Agents 1.1

Mercor / ビジネス業務 · 投資銀行、コンサルティング、法律分野の長いタスクで、モデルが助手として一つの仕事を最後までやり遂げられるかを見る。

公式の評価
News での扱い順位に反映
根拠の配分4%
元データの時点09/08 08:00
最後に同期に成功10/01 20:05

何をどう測るか

1.1データセットと公式Loop環境を固定し、Pass@1とそれに対応する誤差を採用、あらかじめ固定した推論ティアで構成を選ぶ。Mean Scoreは評価項目の平均達成度であり、タスク完了率と混同しない。

この根拠の使い方

1.1版公式LoopのPass@1を固定し、ツールとオフィス予算のうち4%を独占する。残り2%は統一環境の銀行業務タスクに用いる。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gemini-4-argonGoogle82.2%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-sonnet-5-5anthropic75.5%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-opus-5-5Anthropic73.5%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4claude-fable-5.1Anthropic68.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5gemini-3.7-flashGoogle67.8%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6claude-opus-5Anthropic65.8%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7grok-4-6-xhighxAI65.3%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gpt-6-astra-maxOpenAI64.7%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9gemini-3.8-flashGoogle64.3%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10claude-fable-5Anthropic63.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
11qwen-3-8-max-xhighAlibaba63.3%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
12gpt-6-1-sol—60.0%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14muse-spark-1-3Meta58.6%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15gpt-5.6-terra-maxOpenAI58.2%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16glm-5-3Z.ai56.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17grok-4-5xAI56.2%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18deepseek-v4-flashDeepSeek55.3%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19gpt-5.5-xhighOpenAI55.1%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20grok-4.7xAI54.6%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21claude-sonnet-5-maxAnthropic54.5%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
22gpt-6-solOpenAI54.3%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23glm-5-3-flashZ.ai52.8%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
25responses/gpt-5.4OpenAI52.4%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26gpt-5-6-sol-max-proOpenAI51.4%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27kimi-k3Moonshot AI50.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28claude-opus-4-7Anthropic49.2%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29claude-opus-4-8Anthropic48.9%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30qwen-3-8-27bAlibaba47.5%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31deepseek-v4-pro-08-13DeepSeek47.3%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32gemini-3.6-flashGoogle46.9%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
評価の限界とデータの出典

投資銀行、コンサル、法律タスクに限定。原ページは型番別の評価日を提供しておらず、少数の実行欠落の原因も未公開。このスコアをすべてのオフィス業務の信頼性と解釈することはできない。

データのライセンス:公式公開結果。データとコードのライセンスはリーダーボードの再配布許諾を意味しない

スコアは Mercor が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。