評価の出典公式の評価
Vals Finance Agent
Vals AI / ビジネス業務 · 金融アナリストの日常業務問題で、リサーチレポートやモデリングといった仕事がどうかを確認する。
News での扱い順位に反映
根拠の配分3%
元データの時点09/29 08:00
最後に同期に成功10/01 20:05
何をどう測るか
Finance Agent v2の公式Overall正答率のみを採用する。
この根拠の使い方
業界専門タスクの予算は3%。現時点では金融を直接測定しており、すべての業界をすでに網羅したとは主張しない。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | google/gemini-4-argonGoogle | 65.4% | High 推論 |
| 2 | google/gemini-3.8-flashGoogle | 61.4% | High 推論 |
| 3 | meta/muse_spark_1_2Meta | 60.6% | xHigh 推論 |
| 4 | meta/muse_spark_1_3_maxMeta | 60.0% | Max 推論 |
| 5 | google/gemini-3.7-flashGoogle | 59.0% | High 推論 |
| 7 | anthropic/claude-fable-5-1Anthropic | 58.9% | Max 推論 |
| 8 | anthropic/claude-opus-5Anthropic | 58.6% | Max 推論 |
| 9 | anthropic/claude-opus-5-5Anthropic | 58.6% | Max 推論 |
| 10 | anthropic/claude-sonnet-5-5anthropic | 58.1% | Max 推論 |
| 11 | google/gemini-3.5-flashGoogle | 57.9% | High 推論 |
| 12 | zai/glm-5.3-flashZ.ai | 57.9% | Max 推論 |
| 13 | xiaomi/mimo-v2.6-proXiaomi | 57.3% | 情報源のデフォルト構成 |
| 14 | meta/muse_spark_1_1Meta | 57.2% | xHigh 推論 |
| 15 | anthropic/claude-fable-5Anthropic | 56.3% | Max 推論 |
| 16 | google/gemini-3.6-flashGoogle | 56.3% | High 推論 |
| 17 | xiaomi/mimo-v2.6-flashXiaomi | 56.3% | 情報源のデフォルト構成 |
| 18 | zai/glm-5.3Z.ai | 55.8% | Max 推論 |
| 19 | tencent/hy4-previewTencent | 55.1% | 情報源のデフォルト構成 |
| 20 | openai/gpt-5.6-lunaOpenAI | 55.0% | Max 推論 |
| 21 | ant/ling-3.0-flash-af-rc3Ant | 54.9% | 情報源のデフォルト構成 |
| 22 | openai/gpt-5.6-terraOpenAI | 54.4% | Max 推論 |
| 23 | kimi/kimi-k3Moonshot AI | 54.4% | 情報源のデフォルト構成 |
| 24 | anthropic/claude-opus-4-8Anthropic | 53.9% | Max 推論 |
| 25 | anthropic/claude-sonnet-5Anthropic | 53.9% | Max 推論 |
| 26 | openai/gpt-5.6-solOpenAI | 53.8% | Max 推論 |
| 27 | grok/grok-4.6xAI | 53.7% | High 推論 |
| 28 | openai/gpt-6-astraOpenAI | 53.5% | Max 推論 |
| 29 | deepseek/deepseek-v4.1-flashDeepSeek | 53.5% | High 推論 |
| 30 | grok/grok-4.7xAI | 52.3% | xHigh 推論 |
| 31 | openai/gpt-6.1-sol— | 52.0% | Max 推論 |
評価の限界とデータの出典
私有問題は一問ずつ再計算できない。APEX と同じくオフィスタスクに属し、一組の予算を共有しなければならない。
データのライセンス:公式公開結果。公開再表示時は公式の帰属表示を保持し、完全な再配布の許諾は依然としてValsの条項による
スコアは Vals AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。