本文へ移動

#評価・ベンチマーク

今日 0 件

9月30日

水曜日
  1. Hugging Face、多言語 TTS と音声クローンの拡張可能な評価基盤 Open TTS Leaderboard を公開

    Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。

9月23日

水曜日

9月22日

火曜日

9月2日

水曜日
  1. Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

    Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

8月28日

金曜日

8月24日

月曜日
  1. Import AI 470:機械に権利は不要、SPADE の訓練環境生成、Hawkeye の GPU カーネル

    METR の研究では、AI の科学的発見への影響は一様でない。2026年の脆弱性報告は2025年より大幅に速く、数学はわずかな加速にとどまり、AI 研究自体のアルゴリズム進歩には有意な加速がない。複数大学のチームは LLM が実行可能な訓練環境の生成と解法を交互に行う SPADE を提案した。Qwen3-30B-A3B のゲーム環境平均点は58.3で、基準より8.1上がった。

8月21日

金曜日
  1. Hugging Face 研究、音声認識のベンチマーク最適化をどう測るか

    Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。

8月17日

月曜日

8月13日

木曜日
  1. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

8月12日

水曜日
  1. Google Research、大型モデルの事実の難点は記憶より想起と報告

    Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。

7月27日

月曜日

7月15日

水曜日

7月1日

水曜日

4月14日

火曜日
  1. Google、生成 AI で将来の技能を評価する Vantage を公開

    Google は、高校生・大学生の問題解決や協働を生成 AI の模擬対話で評価する研究実験 Vantage を公開した。Google Labs で英語の登録を受け付ける。Executive LLM が会話を動的に進め、AI Evaluator が評価表で採点する。NYU との米国18~25歳188人の研究では、AI と専門家の採点一致度は専門家同士に近かった。

4月9日

木曜日

4月3日

金曜日

4月1日

水曜日

3月17日

火曜日