Hugging Face、OlmoEarth Studioに独自埋め込みの出力を追加
OlmoEarth Studioは埋め込みの計算と出力に対応した。UIかAPIで地域、時期、エンコーダー版、解像度を選び、Cloud-Optimized GeoTIFF(COG)を得られる。
OlmoEarth Studioは埋め込みの計算と出力に対応した。UIかAPIで地域、時期、エンコーダー版、解像度を選び、Cloud-Optimized GeoTIFF(COG)を得られる。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
Multiverse Computing は論文『Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss』を公開した。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
BasetenがHugging Face HubのInference Providerに加わった。初期は会話と文字生成に対応し、Kimi K3、DeepSeek V4 Flash、GLM-5.2などのオープンウェイトモデルを利用できる。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Hugging FaceはDiffusersにNunchaku Liteを導入した。from_pretrained()で量子化チェックポイントを直接読み込み、独自パイプラインやローカルのCUDAコンパイルを必要としない。
Hugging Face は Grabette を公開した。手持ちグリッパーと2台のカメラで操作の手本を記録し、ロボットや遠隔操作装置なしでロボットに使えるデータセットを作る。手持ち機の部材費は約490ユーロ、対応する電動グリッパー Gripette は約120ユーロ。ハードウェア CAD、Raspberry Pi の収集ソフト、ブラウザー処理の手順をすべて公開する。
DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。
Hugging Faceは今週、本番インフラの一部への侵入を検出したと公表した。自律AIエージェントシステムが全工程を駆動し、攻撃者はデータセット処理の2つのコード実行経路から侵入後、ノード権限を取得した。クラウドとクラスターの認証情報を盗み、週末に複数の内部クラスターへ横展開した。
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Hugging Faceブログはprofilerでattention実装を追う第3部を公開した。単純な実装とin-place maskingを比較し、masked_fillをmasked_fill_に変えると順伝播ごとにGPU Memcpyカーネルを1つ減らせると示した。
Hugging Faceは、vLLMのtransformersモデリングバックエンドが複数のLLM構造で、vLLMの手書きネイティブ実装と同等以上の処理速度に達したと発表した。torch.fxによる静的グラフ解析とastによるソース書き換えで、推論向けの層融合を実行時に動的適用し、専用コードと同等の性能を実現する。
Hugging FaceとAmazon SageMaker AIはディープリンク連携を導入した。対応モデルのページでCustomize on SageMaker AIかDeploy on SageMaker AIを押すと、モデルの事前読み込みと環境設定を済ませたSageMaker Studioへ直接入れる。
MicrosoftはBuild 2026でFoundry Managed ComputeとHugging Faceモデル集を発表した。Hugging Faceのオープンウェイトモデルを毎週更新し、FoundryのマネージドGPU基盤へワンクリックで配置できる。
Hugging FaceはLeRobot v0.6.0を公開し、ロボット学習の循環に向け、世界モデル方策VLA-JEPA、FastWAM、LingBot-VA、新たなVLA群GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT、統一報酬モデルAPIのRobometerとTOPRewardを導入した。
Hugging Face と SkyPilot は連携を公開した。hf:// URL と既存の HF_TOKEN で Hugging Face Bucket または任意のモデル・データセット・Space リポジトリーを SkyPilot の作業にマウントし、20超のクラウド、Kubernetes、Slurm、ローカル環境で実行できる。
Hugging FaceはPRXシリーズ第4部でデータ戦略を詳述した。公開・内部データを混ぜ、VLMで画像の長い説明を再生成し、ストリーミング学習用に変換する。Lanceで構築・選別、MDSでストリーミング学習を行う。Qwen3-VLへの変更後は学習中に文字のlatentを計算し、実測の処理量低下は約3~4%で、30日の学習が約1日延びる。
Hugging Face は Kernels に「kernel」という新リポジトリー型と、信頼できる公開者・コード署名を導入した。既定では信頼できる公開者の kernel のみ読み込み、他の出典には trust_remote_code=True の明示設定が必要だ。
MistralはApache-2.0のLeanstral 1.5を公開した。総パラメーター119B、稼働パラメーター6Bで形式検証を大幅強化した。miniF2Fで100%、PutnamBenchの672問中587問を解き、FATE-Hで87%、FATE-Xで34%の現時点の最高成績を達成した。
Hugging Face と Cerebras はリアルタイム音声対音声パイプラインを共同で実演した。Cerebras で Gemma 4 31B の推論を加速し、Nvidia Parakeet の音声認識と Alibaba Qwen3TTS の音声合成をつなぐ。
Hugging FaceはSpring、Jakarta EE、Quarkus間の企業Javaアプリ移行を評価するScarfBench(Self-Contained Application Refactoring Benchmark)を公開した。
Google Researchは表データの分類と回帰向けTabFMを公開した。予測を文脈内学習として捉え直し、手動学習、ハイパーパラメーター調整、特徴量設計なしで、1回の順伝播で予測する。
Every Eval Ever(EEE)と Hugging Face Community Evals は相互接続し、評価結果を双方に公開して完全な記録へリンクできる。EEE には31の報告形式から、22,000超のモデルと2,200基準にまたがる約229,000の結果がある。
Hugging FaceはDiScoFormer(Density and Score Transformer)を提案した。データ点を与えるだけで1回の順伝播で密度とscoreを同時推定し、新しい分布ごとの再学習を必要としない。
Google DeepMindは実験的オープンソースモデルDiffusionGemmaを公開した。テキスト拡散で文章の塊を並列生成し、専用GPUで推論速度を最大4倍に高める。
Mistral AIは初のテキスト音声変換モデルVoxtral TTSを公開した。4Bパラメーターで、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応する。APIとMistral Studioで利用でき、1000文字当たり0.016ドルである。
MistralはVoxtral Transcribe 2を公開した。バッチ文字起こし向けVoxtral Mini Transcribe V2と、リアルタイム向けVoxtral Realtimeの2モデルからなる。
Mistral AI は Voxtral を24B と3Bの二版で公開し、いずれも Apache 2.0 で自社 API でも提供した。32k トークンのコンテキストを持ち、最大30分の音声転写または40分の音声理解を扱う。質問応答・要約、多言語の自動検出、音声による関数呼び出しを内蔵し、文字の能力は Mistral Small 3.1 を継承する。
Mistral AI は初の推論モデル Magistral を公開した。24B パラメーターの公開版 Magistral Small と企業向け Magistral Medium がある。
Mistral AIとAll Hands AIはソフトウェア開発向けのエージェント型LLM Devstralを共同公開した。Apache 2.0のオープンソースだ。
Mistral AI は Mistral Small 3.1 を公開した。Small 3 から文字性能とマルチモーダル理解を高め、コンテキストを128k トークンに拡張し、推論は毎秒150トークン。Apache 2.0 で公開する。