評価の出典公式の評価
MCP Atlas
Scale AI / ビジネス業務 · 実際のMCPサービスを通じて資料検索、文書操作、データベース操作を行い、ソフトウェアをまたぐタスクを完了する。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
2026年4月に調整された運行プロトコルと100回のツール呼び出し予算を固定する。完全な1,000問と公開500問は分けて扱う。タスク通過率のみを採用し、回答条件カバー率を重複して投票しない。審判、リトライ、ツールのバージョンは成績バッチとともに固定する必要がある。
この根拠の使い方
観察中:オフィスソフトをまたぐツール実行の証拠を補完できる。安定した成績エクスポート、実際の評価バッチ、再表示の境界の確認待ちで、現時点では出典を収録するのみで、自動収集やスコアリングは行わない。
評価の限界とデータの出典
ウェブの旧手法の説明とリアルタイム成績は同期しない可能性がある。公開問題集のコードはリアルタイム成績のエクスポートではない。Scaleの他のランキングと同じ機関に属し、独立機関の数は増えない。
データのライセンス:公式環境コードはMITを採用。このライセンスはリアルタイムウェブ成績を自動的にカバーせず、リーダーボードデータの再表示境界は未確認。
スコアは Scale AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。