Open ASR Leaderboard、グローバルサウスの言語を初めて扱う Monsoon 評価データを追加
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
MistralとHUMAINはAI基盤、先進モデル、実装の提携を発表した。当初はサイバー安全と音声に注力し、アラビア語に強い最先端モデルを作る。数億ユーロ規模で、MistralはHUMAINデータセンターの利用を検討し、サウジの規制業界向け共同市場戦略も計画する。
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
Liquid AIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けDSparkドラフトモデルのチェックポイントを公開した。投機的デコーディングで出力品質を変えずに復号速度を上げ、GPUの処理量を最大3.18倍、端末上で最大2.87倍にした。
Microsoft Researchは深層学習DFT汎関数Skala 1.1を公開した。学習データは旧公開版の2.5倍で、GMTKN55の55分類中32で首位、加重平均誤差は2.8 kcal/molだった。CP2Kで使え、Psi4、FHI-aims、ORCA、VASPに統合中だ。各版の計算性能を追うliving benchmarkも開始した。
Sentence Transformers v6.0は4番目のモデル形式MultiVectorEncoderを追加した。ColBERT型の後期相互作用検索向けで、PyLate、Stanford-NLPのColBERTチェックポイント、colpali-engineの視覚文書検索モデルを直接読み込める。
Hugging Face は2026年1~8月の観測レポートを公開した。Hub データでは、多くの月で中国の研究所が公開した最大モデルのパラメーター数が米国を上回る。中国の月間上限は7,540億~2兆7,800億パラメーター、米国は7か月中5か月が1,300億未満だった。
Hugging FaceのブログはStrands Robotsのストリーミングデータ循環のチュートリアルを公開した。同じRobot()オブジェクトで実演を記録し、Storage Bucketへ同期し、Hubからストリーミングで読み込んで学習し、チェックポイントをハードウェアへ戻して配置する。全工程でLeRobotのディスク形式は変えない。
Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。
MistralはAI主権を進める3施策を発表した。Regional Endpointsは正式提供となり、欧州か米国で推論するか選べる。Priority Tierは公開プレビューで、重要業務向けに確約サービス水準、独自の速度制限、稼働率SLAを提供する。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
Multiverse Computing は論文『Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss』を公開した。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
Google DeepMind は WeatherNext AI モデルを公開した。サイクロンの進路、強度、風の構造の予報で最先端性能に達し、平均で警報を1日早く出せる。気象分野の約10年分の進歩に相当する。
Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。
Microsoft ResearchはオープンソースのOrchardフレームワークを公開した。中心はKubernetes環境サービスOrchard Envで、タスク間で環境、データパイプライン、評価手順を再利用し、Codex、OpenClaw、ZeroClawなどの実際の配置フレームワーク内で直接エージェントを学習できる。
Toronto 大学、Vector Institute、Cambridge 大学、ServiceNow の研究者は AI ワームの試作を構築した。侵入済みの機械の GPU で公開ウェイト LLM を動かし、自律的に脆弱性を見つけて攻撃する。監視や取り消しが可能な企業 API を一切必要としない。
Microsoft Researchはコンピューター操作エージェント向けに12の学習世界を構築するEchoverseを提案した。10の深い分野別世界と2つの能力別世界からなり、うち4世界のコード、データ、採点器を公開する。
Berkeley AI ResearchとIBM Researchは進化的カーネル探索のK-SearchをMLXに拡張した。構造化したCUDA-to-MLX変換層で、既存のCUDAカーネル知識をApple Siliconに移す。
EpochとMETRは、人なら長時間かかるコーディング課題をAIが完遂する能力を測るMirrorCodeを公開した。4月に初発表し、追加テスト後に正式公開した。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Hugging FaceはDiffusersにNunchaku Liteを導入した。from_pretrained()で量子化チェックポイントを直接読み込み、独自パイプラインやローカルのCUDAコンパイルを必要としない。
Hugging Face は Grabette を公開した。手持ちグリッパーと2台のカメラで操作の手本を記録し、ロボットや遠隔操作装置なしでロボットに使えるデータセットを作る。手持ち機の部材費は約490ユーロ、対応する電動グリッパー Gripette は約120ユーロ。ハードウェア CAD、Raspberry Pi の収集ソフト、ブラウザー処理の手順をすべて公開する。
英国AISIによると、オープンウェイトと最先端非公開モデルのサイバー能力差は縮まる。GLM-5.2とDeepSeek V4-Proは4~7か月前の非公開モデルに近く、2025年の大半で観測した6~10か月より狭い。
Hugging Faceは今週、本番インフラの一部への侵入を検出したと公表した。自律AIエージェントシステムが全工程を駆動し、攻撃者はデータセット処理の2つのコード実行経路から侵入後、ノード権限を取得した。クラウドとクラスターの認証情報を盗み、週末に複数の内部クラスターへ横展開した。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Hugging Faceは、vLLMのtransformersモデリングバックエンドが複数のLLM構造で、vLLMの手書きネイティブ実装と同等以上の処理速度に達したと発表した。torch.fxによる静的グラフ解析とastによるソース書き換えで、推論向けの層融合を実行時に動的適用し、専用コードと同等の性能を実現する。
MicrosoftはBuild 2026でFoundry Managed ComputeとHugging Faceモデル集を発表した。Hugging Faceのオープンウェイトモデルを毎週更新し、FoundryのマネージドGPU基盤へワンクリックで配置できる。
Hugging FaceはLeRobot v0.6.0を公開し、ロボット学習の循環に向け、世界モデル方策VLA-JEPA、FastWAM、LingBot-VA、新たなVLA群GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT、統一報酬モデルAPIのRobometerとTOPRewardを導入した。
Hugging Face と SkyPilot は連携を公開した。hf:// URL と既存の HF_TOKEN で Hugging Face Bucket または任意のモデル・データセット・Space リポジトリーを SkyPilot の作業にマウントし、20超のクラウド、Kubernetes、Slurm、ローカル環境で実行できる。
Hugging FaceはPRXシリーズ第4部でデータ戦略を詳述した。公開・内部データを混ぜ、VLMで画像の長い説明を再生成し、ストリーミング学習用に変換する。Lanceで構築・選別、MDSでストリーミング学習を行う。Qwen3-VLへの変更後は学習中に文字のlatentを計算し、実測の処理量低下は約3~4%で、30日の学習が約1日延びる。
Hugging Face は Kernels に「kernel」という新リポジトリー型と、信頼できる公開者・コード署名を導入した。既定では信頼できる公開者の kernel のみ読み込み、他の出典には trust_remote_code=True の明示設定が必要だ。
MistralはApache-2.0のLeanstral 1.5を公開した。総パラメーター119B、稼働パラメーター6Bで形式検証を大幅強化した。miniF2Fで100%、PutnamBenchの672問中587問を解き、FATE-Hで87%、FATE-Xで34%の現時点の最高成績を達成した。
Hugging Face と Cerebras はリアルタイム音声対音声パイプラインを共同で実演した。Cerebras で Gemma 4 31B の推論を加速し、Nvidia Parakeet の音声認識と Alibaba Qwen3TTS の音声合成をつなぐ。
Every Eval Ever(EEE)と Hugging Face Community Evals は相互接続し、評価結果を双方に公開して完全な記録へリンクできる。EEE には31の報告形式から、22,000超のモデルと2,200基準にまたがる約229,000の結果がある。
Google DeepMindは実験的オープンソースモデルDiffusionGemmaを公開した。テキスト拡散で文章の塊を並列生成し、専用GPUで推論速度を最大4倍に高める。
Google DeepMindはノートパソコンでのローカル実行向けマルチモーダルモデルGemma 4 12Bを公開した。エッジ向けE4Bと26B MoEの中間に位置し、エンコーダーを使わない統一構造で、視覚・音声入力をLLMの本体へ直接渡す。
Google Researchは水文モデリング枠組みをGitHubでApache 2.0として公開した。各国の気象・水文機関がAI洪水予測を業務に組み込める。PyTorchを使うPythonパッケージで、LSTMを採用し、Caravanデータで学習・微調整できる。対話型のチュートリアルnotebookと動画も付属する。