本文へ移動

#評価・ベンチマーク

今日 1 件

10月1日

木曜日今日1 件
  1. Google、Gemini 4 Argonを発表 OpenAIとAnthropicとの差を縮めるも明確なリードはならず

    Googleは新たなフロンティアモデルGemini 4 Argonを発表した。一部のベンチマークではOpenAIやAnthropicの競合製品を上回るが、明確なリードは得ていない。このモデルはまずFairwindプログラムの「信頼できるサイバー防御者」とGoogle社内チームに公開され、その後開発者、企業、消費者向けに提供される予定で、日付は未公表。導入価格は入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで、キャッシュ入力は95%安い。

9月30日

水曜日
  1. Hugging Face、多言語 TTS と音声クローンの拡張可能な評価基盤 Open TTS Leaderboard を公開

    Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。

9月29日

火曜日

9月23日

水曜日

9月22日

火曜日

9月2日

水曜日
  1. Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

    Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

8月28日

金曜日

8月27日

木曜日
  1. Google DeepMind、世界初の二重盲検AI評価を試行

    Google DeepMindは、専有のフロンティア級AIモデルを対象とする世界初の二重盲検評価を発表した。外部評価を暗号技術で隔離した環境に限定し、モデルが事前に試験問題へ接触することを防ぐ。シンガポールのAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、プライバシーを保護した環境で非公開ベンチマークを使いGemini Flash Liteを評価する。

8月24日

月曜日
  1. Import AI 470:機械に権利は不要、SPADE の訓練環境生成、Hawkeye の GPU カーネル

    METR の研究では、AI の科学的発見への影響は一様でない。2026年の脆弱性報告は2025年より大幅に速く、数学はわずかな加速にとどまり、AI 研究自体のアルゴリズム進歩には有意な加速がない。複数大学のチームは LLM が実行可能な訓練環境の生成と解法を交互に行う SPADE を提案した。Qwen3-30B-A3B のゲーム環境平均点は58.3で、基準より8.1上がった。

8月21日

金曜日
  1. Hugging Face 研究、音声認識のベンチマーク最適化をどう測るか

    Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。

8月17日

月曜日

8月13日

木曜日
  1. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

8月12日

水曜日
  1. Google Research、大型モデルの事実の難点は記憶より想起と報告

    Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。

8月4日

火曜日
  1. Microsoft Research、Orchardをオープンソース化、Orchard-SWEがSWE-bench Verifiedで69.7%

    Microsoft ResearchはオープンソースのOrchardフレームワークを公開した。中心はKubernetes環境サービスOrchard Envで、タスク間で環境、データパイプライン、評価手順を再利用し、Codex、OpenClaw、ZeroClawなどの実際の配置フレームワーク内で直接エージェントを学習できる。

7月27日

月曜日

7月16日

木曜日
  1. DharmaOCR、ブラジル Portuguese OCR 評価で Mistral OCR4 と Unlimited-OCR を上回る

    DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。

7月15日

水曜日

7月6日

月曜日

7月1日

水曜日

6月30日

火曜日

6月15日

月曜日

5月16日

土曜日

5月4日

月曜日

4月14日

火曜日
  1. Google、生成 AI で将来の技能を評価する Vantage を公開

    Google は、高校生・大学生の問題解決や協働を生成 AI の模擬対話で評価する研究実験 Vantage を公開した。Google Labs で英語の登録を受け付ける。Executive LLM が会話を動的に進め、AI Evaluator が評価表で採点する。NYU との米国18~25歳188人の研究では、AI と専門家の採点一致度は専門家同士に近かった。

4月9日

木曜日

4月3日

金曜日

4月1日

水曜日

3月17日

火曜日

4月9日

水曜日