本文へ移動

評価・ベンチマーク

どのモデルが強いのか:ベンチマークの成績、評価方法をめぐる論争、ランキングの変化を継続して記録。

精選 9件関連トピックモデル発表論文・研究推論能力

最新の精選

1–9 件目 · 全 9 件

10月1日

木曜日今日
  1. Google、Gemini 4 Argonを発表 OpenAIとAnthropicとの差を縮めるも明確なリードはならず

    Googleは新たなフロンティアモデルGemini 4 Argonを発表した。一部のベンチマークではOpenAIやAnthropicの競合製品を上回るが、明確なリードは得ていない。このモデルはまずFairwindプログラムの「信頼できるサイバー防御者」とGoogle社内チームに公開され、その後開発者、企業、消費者向けに提供される予定で、日付は未公表。導入価格は入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで、キャッシュ入力は95%安い。

9月29日

火曜日

9月23日

水曜日

8月28日

金曜日

8月27日

木曜日
  1. Google DeepMind、世界初の二重盲検AI評価を試行

    Google DeepMindは、専有のフロンティア級AIモデルを対象とする世界初の二重盲検評価を発表した。外部評価を暗号技術で隔離した環境に限定し、モデルが事前に試験問題へ接触することを防ぐ。シンガポールのAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、プライバシーを保護した環境で非公開ベンチマークを使いGemini Flash Liteを評価する。

8月21日

金曜日
  1. Hugging Face 研究、音声認識のベンチマーク最適化をどう測るか

    Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。

8月4日

火曜日
  1. Microsoft Research、Orchardをオープンソース化、Orchard-SWEがSWE-bench Verifiedで69.7%

    Microsoft ResearchはオープンソースのOrchardフレームワークを公開した。中心はKubernetes環境サービスOrchard Envで、タスク間で環境、データパイプライン、評価手順を再利用し、Codex、OpenClaw、ZeroClawなどの実際の配置フレームワーク内で直接エージェントを学習できる。

7月15日

水曜日

5月16日

土曜日