Hugging Face、多言語 TTS と音声クローンの拡張可能な評価基盤 Open TTS Leaderboard を公開
Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。
Hugging Face は、客観的指標でオープンソース TTS モデルを評価する Open TTS Leaderboard を公開し、数週間の投票による評価を数時間に短縮する。Qwen3 ASR で WER/CER を算出し、H200 GPU で RTFx と TTFA を測定、WavLM 埋め込みで話者類似度 SIM を求め、多言語と音声クローンの比較に対応する。
NVIDIAはオープンソースの表形式基盤モデルKumo Tabularを公開した。ラベル付きの表の行を入力すると、学習、調整、特徴量設計なしに、単一の順伝播で新しい行のラベルを予測し、分類と回帰に対応する。28M〜215Mの3サイズを提供し、人工合成の表のみで事前学習した。商用利用可能なOpenMDW-1.1ライセンスを採用し、TabArena、BeyondArena、TALENT、ScoringBenchの4ベンチマークで首位だった。
Hugging FaceはMCPエージェント向けの生成後検証層ProvenanceGuardの論文を公開した。ツール出力の出所を保持し、「事実は正しいが帰属先が違う」情報源間の混同を検出する。医療エージェントの実際の281トレースで、専門家が阻止すべきと判断した139主張のうち138件を阻止した。出所識別の正確さは約86%で、4種類の検証器との比較で最高得点だった。
HはHolo4エージェントモデル群を公開した。27Bのdenseと35B-A3BのMoEの2規模がH Models APIで利用可能で、Hugging FaceではBF16、FP8、NVFP4、4-bit GGUF形式のウェイトを公開している。
Liquid AIは視覚言語モデルLFM2.5-VL-3B向けの実験的DSpark草稿モデルLFM2.5-VL-DSparkを公開した。投機的デコードで品質を変えずに高速化し、デコードは端末で最大3.13倍、H100で2.66倍、全工程はそれぞれ最大2.62倍、2.27倍になる。
英国AI Security Institute(AISI)は評価の科学的再現性を高めるため、EvalEvalのEvery Eval EverスキーマとEvaluation Cardsで結果を公開共有している。
oMLX作者・保守担当Jun KimがHugging Faceに参加し、MLXコミュニティーに専念する。oMLXは副業から資金付き長期事業へ移り、Apache 2.0を維持してJunが率い、安定性と開発速度を高める。
Hugging FaceはtransformersにGGUF対応を追加した。Hubから量子化チェックポイントを選び、from_pretrainedにgguf_fileを渡すだけで、追加設定なしにローカル生成を実行できる。
Hugging Faceはtokenizers v1を公開した。トークンID、API、語彙、merge ranksはv0.23と同一だが、速度は最大で数十倍になる。
IBMの研究チームはALTK-Evolveに一貫性ガイドを追加した。Consistency Analyzerを使い、エージェントのトレース内で判断が反転しやすい箇所を診断する。
TRL v1.14のAsyncGRPOTrainerはLoRAアダプターだけを学習してvLLMへ同期するよう対応した。rank-1は数MBで、各JobにマウントしたStorage Bucketで転送でき、NCCLは不要だ。
Hugging Face チームは Gradio Workflow で AUTOMATIC1111 の機能の大半を一つの Workflow1111 キャンバスに再構築した。11本のメディアパイプラインと73ノードで、テキストから画像、高解像度修復、画像から画像、プロンプト行列、VLM による逆解析、検出からの inpaint マスク生成、ControlNet 型アノテーター、背景除去、PNG Info、画像から動画を扱う。
Hugging Faceは260Mと800MのNeoMMEを公開した。単一の双方向Transformerで文字トークンと32×32画像パッチを処理する。マスク付き離散拡散の目的関数でゼロから学習し、事前学習済み視覚タワーや因果言語モデルに依存しない。
Hugging FaceはClaude Code、Codex、pi、Hermesなどに永続メモリーを提供するfunesを公開した。ローカルの既存セッションから索引を作り、既定では埋め込みと再ランキングもローカルで行う。
公開された低費用手法はTRLのGRPOで約500例、100ステップの微調整を行い、IFStructを22.6%から29.7%に高めた。無料ColabかKaggle GPUで学習し、MacBookのllama.cppで評価できる。コードはGitHub公開済みだ。
Hugging Face のブログ筆者は、Surya Narreddi の言語モデルで水彩画を描く発想を TRL と OpenEnv で再現した。モデルは p5.brush で約150行の JavaScript を書いて描画する。データセット、RL 環境、訓練スクリプト、モデルをすべて公開する。
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
Hugging FaceのWebAIチームは、Hubから最適化済みWebGPUカーネルを読み込み実行する軽量ライブラリ@huggingface/kernelsを公開した。初期の207カーネルも、それぞれ独立したリポジトリでApache-2.0ライセンスにより公開した。
Google Researchは初めて多変量予測を標準の事前学習で扱うTimesFM-3を公開した。3億3000万パラメーターで、1兆超の時点を学習した。
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
Sentence Transformers v6.0 は第4のモデル型 MultiVectorEncoder を追加した。ColBERT 型の遅延相互作用検索に用い、完全な訓練手順も提供する。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Hugging FaceはGradioにgr.Workflowを導入した。複数段階のAIパイプラインを型付きノードのグラフで表し、ドラッグ可能な画面を提供する。各ノードを実行でき、中間結果もすべて見える。
Papers with Codeはハイブリッド検索を使う。Hugging Face Jobsで埋め込みを一括生成し、Storage Bucketsで永続的に中継し、Inference Endpointsでオンライン検索の低遅延埋め込みを提供する。arXivとDaily Papersの11万件超を対象とする。
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
Liquid AIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けDSparkドラフトモデルのチェックポイントを公開した。投機的デコーディングで出力品質を変えずに復号速度を上げ、GPUの処理量を最大3.18倍、端末上で最大2.87倍にした。
IBM Research は Hugging Face ブログで ALTK-Evolve の研究を公開した。AppWorld の585の複数ステップ課題で八つのモデルをテストし、エージェント記憶はオン・オフのスイッチではなく、モデル別に量を調整すべきものだと分かった。
Sentence Transformers v6.0は4番目のモデル形式MultiVectorEncoderを追加した。ColBERT型の後期相互作用検索向けで、PyLate、Stanford-NLPのColBERTチェックポイント、colpali-engineの視覚文書検索モデルを直接読み込める。
Hugging Face ブログは、同じハードウェアと負荷で FIFO と比較した制約対応 GPU 割り当てを紹介した。実際の五つの競合場面で GPU 利用率は52~85%から72~88%になり、優先度で重み付けした成果は24.6~105.1%、平均52%向上した。
Hugging Face は2026年1~8月の観測レポートを公開した。Hub データでは、多くの月で中国の研究所が公開した最大モデルのパラメーター数が米国を上回る。中国の月間上限は7,540億~2兆7,800億パラメーター、米国は7か月中5か月が1,300億未満だった。
Hugging FaceのブログはStrands Robotsのストリーミングデータ循環のチュートリアルを公開した。同じRobot()オブジェクトで実演を記録し、Storage Bucketへ同期し、Hubからストリーミングで読み込んで学習し、チェックポイントをハードウェアへ戻して配置する。全工程でLeRobotのディスク形式は変えない。
Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。
OlmoEarth Studioは埋め込みの計算と出力に対応した。UIかAPIで地域、時期、エンコーダー版、解像度を選び、Cloud-Optimized GeoTIFF(COG)を得られる。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
Multiverse Computing は論文『Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss』を公開した。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
BasetenがHugging Face HubのInference Providerに加わった。初期は会話と文字生成に対応し、Kimi K3、DeepSeek V4 Flash、GLM-5.2などのオープンウェイトモデルを利用できる。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Hugging FaceはDiffusersにNunchaku Liteを導入した。from_pretrained()で量子化チェックポイントを直接読み込み、独自パイプラインやローカルのCUDAコンパイルを必要としない。