本文へ移動
評価の出典

Vals Finance Agent

Vals AI / ビジネス業務 · 金融アナリストの日常業務問題で、リサーチレポートやモデリングといった仕事がどうかを確認する。

公式の評価
News での扱い順位に反映
根拠の配分3%
元データの時点09/29 08:00
最後に同期に成功10/01 20:05

何をどう測るか

Finance Agent v2の公式Overall正答率のみを採用する。

この根拠の使い方

業界専門タスクの予算は3%。現時点では金融を直接測定しており、すべての業界をすでに網羅したとは主張しない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1google/gemini-4-argonGoogle65.4%High 推論
2google/gemini-3.8-flashGoogle61.4%High 推論
3meta/muse_spark_1_2Meta60.6%xHigh 推論
4meta/muse_spark_1_3_maxMeta60.0%Max 推論
5google/gemini-3.7-flashGoogle59.0%High 推論
7anthropic/claude-fable-5-1Anthropic58.9%Max 推論
8anthropic/claude-opus-5Anthropic58.6%Max 推論
9anthropic/claude-opus-5-5Anthropic58.6%Max 推論
10anthropic/claude-sonnet-5-5anthropic58.1%Max 推論
11google/gemini-3.5-flashGoogle57.9%High 推論
12zai/glm-5.3-flashZ.ai57.9%Max 推論
13xiaomi/mimo-v2.6-proXiaomi57.3%情報源のデフォルト構成
14meta/muse_spark_1_1Meta57.2%xHigh 推論
15anthropic/claude-fable-5Anthropic56.3%Max 推論
16google/gemini-3.6-flashGoogle56.3%High 推論
17xiaomi/mimo-v2.6-flashXiaomi56.3%情報源のデフォルト構成
18zai/glm-5.3Z.ai55.8%Max 推論
19tencent/hy4-previewTencent55.1%情報源のデフォルト構成
20openai/gpt-5.6-lunaOpenAI55.0%Max 推論
21ant/ling-3.0-flash-af-rc3Ant54.9%情報源のデフォルト構成
22openai/gpt-5.6-terraOpenAI54.4%Max 推論
23kimi/kimi-k3Moonshot AI54.4%情報源のデフォルト構成
24anthropic/claude-opus-4-8Anthropic53.9%Max 推論
25anthropic/claude-sonnet-5Anthropic53.9%Max 推論
26openai/gpt-5.6-solOpenAI53.8%Max 推論
27grok/grok-4.6xAI53.7%High 推論
28openai/gpt-6-astraOpenAI53.5%Max 推論
29deepseek/deepseek-v4.1-flashDeepSeek53.5%High 推論
30grok/grok-4.7xAI52.3%xHigh 推論
31openai/gpt-6.1-sol—52.0%Max 推論
評価の限界とデータの出典

私有問題は一問ずつ再計算できない。APEX と同じくオフィスタスクに属し、一組の予算を共有しなければならない。

データのライセンス:公式公開結果。公開再表示時は公式の帰属表示を保持し、完全な再配布の許諾は依然としてValsの条項による

スコアは Vals AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。