Hugging Face、多言語 TTS と音声クローンの拡張可能な評価基盤 Open TTS Leaderboard を公開
Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。
Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。
OpenAIは専門家と構築したMentalHealthBenchを公開した。実際のメンタルヘルスの会話におけるAIの回答が有益で安全かを評価する。
英国AI Security Institute(AISI)は評価の科学的再現性を高めるため、EvalEvalのEvery Eval EverスキーマとEvaluation Cardsで結果を公開共有している。
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
Google DeepMindは、専有のフロンティア級AIモデルを対象とする世界初の二重盲検評価を発表した。外部評価を暗号技術で隔離した環境に限定し、モデルが事前に試験問題へ接触することを防ぐ。シンガポールのAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、プライバシーを保護した環境で非公開ベンチマークを使いGemini Flash Liteを評価する。
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。
Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。
Microsoft ResearchはオープンソースのOrchardフレームワークを公開した。中心はKubernetes環境サービスOrchard Envで、タスク間で環境、データパイプライン、評価手順を再利用し、Codex、OpenClaw、ZeroClawなどの実際の配置フレームワーク内で直接エージェントを学習できる。
DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
Hugging FaceはSpring、Jakarta EE、Quarkus間の企業Javaアプリ移行を評価するScarfBench(Self-Contained Application Refactoring Benchmark)を公開した。
Every Eval Ever(EEE)と Hugging Face Community Evals は相互接続し、評価結果を双方に公開して完全な記録へリンクできる。EEE には31の報告形式から、22,000超のモデルと2,200基準にまたがる約229,000の結果がある。
Google DeepMindとGoogle ResearchのAI気象モデルWeatherNextは、米国立ハリケーンセンターがハリケーンMelissaのジャマイカへのカテゴリー5での上陸を5日前に80%の確信度で予測するのを支援した。3日前には確信度がほぼ100%となった。
Google は、高校生・大学生の問題解決や協働を生成 AI の模擬対話で評価する研究実験 Vantage を公開した。Google Labs で英語の登録を受け付ける。Executive LLM が会話を動的に進め、AI Evaluator が評価表で採点する。NYU との米国18~25歳188人の研究では、AI と専門家の採点一致度は専門家同士に近かった。
Google Researchは衣料品購入の4000以上の人・機械の複数ターン会話、約15000ターンのConvApparelを公開した。LLM利用者シミュレーターと人の現実感の差を測る。
Google ResearchはIRI、ERQなどの心理質問票を改変した状況判断テスト(SJT)で、実際のユーザー・助手の場面の行動傾向が人の共通認識に合うか評価する枠組みを提案した。
Google Research は『Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation』で評価項目数と項目ごとの注釈者数を比較した。一般的な1人、3人、5人では足りないことが多く、人の意見の違いを反映するには10人超が必要な場合が多い。
GoogleとCornellはGPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM、独自RAGに高温超伝導の専門問題67問を解かせた。12人の国際専門家がバランス、網羅性、簡潔性、証拠、画像の関連性、定性的意見の6指標で盲検評価した。研究はPNASに掲載された。
Mistralはjudge LLMがgenerator LLMの回答を数値、二値、定性的尺度で採点し、評価データの加重平均を取るRAG評価を提案した。