評価の出典公式の評価
Mercor APEX-Agents 1.1
Mercor / ビジネス業務 · 投資銀行、コンサルティング、法律分野の長いタスクで、モデルが助手として一つの仕事を最後までやり遂げられるかを見る。
News での扱い順位に反映
根拠の配分4%
元データの時点09/08 08:00
最後に同期に成功10/01 20:05
何をどう測るか
1.1データセットと公式Loop環境を固定し、Pass@1とそれに対応する誤差を採用、あらかじめ固定した推論ティアで構成を選ぶ。Mean Scoreは評価項目の平均達成度であり、タスク完了率と混同しない。
この根拠の使い方
1.1版公式LoopのPass@1を固定し、ツールとオフィス予算のうち4%を独占する。残り2%は統一環境の銀行業務タスクに用いる。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | gemini-4-argonGoogle | 82.2% | High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 2 | claude-sonnet-5-5anthropic | 75.5% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 3 | claude-opus-5-5Anthropic | 73.5% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 4 | claude-fable-5.1Anthropic | 68.6% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 5 | gemini-3.7-flashGoogle | 67.8% | High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 6 | claude-opus-5Anthropic | 65.8% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 7 | grok-4-6-xhighxAI | 65.3% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 8 | gpt-6-astra-maxOpenAI | 64.7% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 9 | gemini-3.8-flashGoogle | 64.3% | High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 10 | claude-fable-5Anthropic | 63.6% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 11 | qwen-3-8-max-xhighAlibaba | 63.3% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 12 | gpt-6-1-sol— | 60.0% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 14 | muse-spark-1-3Meta | 58.6% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 15 | gpt-5.6-terra-maxOpenAI | 58.2% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 16 | glm-5-3Z.ai | 56.6% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 17 | grok-4-5xAI | 56.2% | High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 18 | deepseek-v4-flashDeepSeek | 55.3% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 19 | gpt-5.5-xhighOpenAI | 55.1% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 20 | grok-4.7xAI | 54.6% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 21 | claude-sonnet-5-maxAnthropic | 54.5% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 22 | gpt-6-solOpenAI | 54.3% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 23 | glm-5-3-flashZ.ai | 52.8% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 25 | responses/gpt-5.4OpenAI | 52.4% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 26 | gpt-5-6-sol-max-proOpenAI | 51.4% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 27 | kimi-k3Moonshot AI | 50.6% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 28 | claude-opus-4-7Anthropic | 49.2% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 29 | claude-opus-4-8Anthropic | 48.9% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 30 | qwen-3-8-27bAlibaba | 47.5% | xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 31 | deepseek-v4-pro-08-13DeepSeek | 47.3% | Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 32 | gemini-3.6-flashGoogle | 46.9% | High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
評価の限界とデータの出典
投資銀行、コンサル、法律タスクに限定。原ページは型番別の評価日を提供しておらず、少数の実行欠落の原因も未公開。このスコアをすべてのオフィス業務の信頼性と解釈することはできない。
データのライセンス:公式公開結果。データとコードのライセンスはリーダーボードの再配布許諾を意味しない
スコアは Mercor が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。