評価の出典公式の評価
OfficeQA Pro
Databricks / ビジネス業務 · 大量の実財務ファイルから検索・計算し、質問に答える。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
Pro は 133 題固定で、Full 246 題および Pro V2 の 90 題とは別。エンドツーエンド検索と、答えの載るページを直接提示するのは異なる条件である。Claude Agent SDK、Codex SDK、Antigravity CLI の成績はそれぞれの実行システムに属し、統一の基盤モデル評価として混同できない。ファイル理解を測るもので、オフィス文書の産出品質を表すものではない。
この根拠の使い方
観察中:公式は更新を続けているが、現状は主に異なる製品の実行システムを比較しており、生の集計プロトコルはまだ確認が必要。資料としての理解参考は保持し、異なるツールシステムの成績をそのまま基盤モデルに帰属させない。
評価の限界とデータの出典
コードおよび問題集のライセンスはすべての外部成績を自動的に覆うものではない。新旧の問題集、エンドツーエンドと回答ページ直供の条件を混在させられず、現在は成績の自動収集は行っていない。
データのライセンス:コードは Apache 2.0、問題データは CC BY-SA 4.0。現在はアクセス申請が必要な Hugging Face データセットに移行。
スコアは Databricks が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。