Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
Google Research は Swin-S transformer ベースの MAPL-EMIT を提案した。NASA EMIT のハイパースペクトル衛星データからメタンのプルームを自動検出し、増加量を予測し、位置を特定する。専門家が注釈したプルームで再現率84%だった。
Google DeepMindはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteにエージェント型動画理解を導入した。動画分析のトークン消費を最大88%、費用を最大66%削減し、正確さを最大7%高める。
Hugging FaceのWebAIチームは、Hubから最適化済みWebGPUカーネルを読み込み実行する軽量ライブラリ@huggingface/kernelsを公開した。初期の207カーネルも、それぞれ独立したリポジトリでApache-2.0ライセンスにより公開した。
Google Researchは初めて多変量予測を標準の事前学習で扱うTimesFM-3を公開した。3億3000万パラメーターで、1兆超の時点を学習した。
Microsoft ResearchはGigaPath-FlashとGigaTIME-Flashを公開した。10億パラメーターのGigaPathから蒸留した22MのViT-Sを基盤に、病理分析の計算量を大幅に削減し、Apache 2.0で公開する。
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
Google ResearchはGoogle Earth AIに実験的研究機能Planetary Prediction Engine(PPE)を導入した。自然言語の質問に基づき、地理空間データの発見、特徴量設計、モデル学習と評価を自律的に進め、報告を生成する。数週間の手作業を要したデータ処理を数分に縮める。
Google DeepMind は Gemini Omni 1.1 Flash を公開した。動画生成の制御性を高め、Google AI Studio の Gemini API から開発者に提供する。
Google DeepMindは、専有のフロンティア級AIモデルを対象とする世界初の二重盲検評価を発表した。外部評価を暗号技術で隔離した環境に限定し、モデルが事前に試験問題へ接触することを防ぐ。シンガポールのAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、プライバシーを保護した環境で非公開ベンチマークを使いGemini Flash Liteを評価する。
Googleは遅い血糖傾向と短期変動を分ける自己教師モデルGlucoFMを公開した。109066時間の未注釈CGMで事前学習し、4コホート、7臨床タスクの14評価でPR-AUCは最良GluFormerより平均5.8ポイント高かった。食後血糖予測でも最小MAEを達成した。
Google DeepMindはGemini 3.5 Transcribeを公開し、現在最も正確な音声文字起こしモデルと説明した。生の音声を直接、正確で整形済みの文字に変換する。
Sentence Transformers v6.0 は第4のモデル型 MultiVectorEncoder を追加した。ColBERT 型の遅延相互作用検索に用い、完全な訓練手順も提供する。
GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Hugging FaceはGradioにgr.Workflowを導入した。複数段階のAIパイプラインを型付きノードのグラフで表し、ドラッグ可能な画面を提供する。各ノードを実行でき、中間結果もすべて見える。
MistralとHUMAINはAI基盤、先進モデル、実装の提携を発表した。当初はサイバー安全と音声に注力し、アラビア語に強い最先端モデルを作る。数億ユーロ規模で、MistralはHUMAINデータセンターの利用を検討し、サウジの規制業界向け共同市場戦略も計画する。
Googleは、人の監督の下で候補バイオマーカーの優先付けを反復研究として進める複数エージェントのBiomarker Discovery Frameworkを公開した。3コホートの計9279観測から、精神的健康の候補41件と代謝の候補25件を自動発見した。睡眠時間の変動とPHQ-8重症度の関係(ρ = 0.252)などを含む。
Google DeepMindとFenris CreationsはEVE Onlineを含むEVE UniverseでAIによる新たな遊びの試作を探る研究協力を結んだ。
Google Research は Mobility-Embedded POIs(ME-POIs)を提案した。匿名化した移動パターンと文字説明を組み合わせ、場所の属性と動的な機能をともに符号化する埋め込みを作る。
Papers with Codeはハイブリッド検索を使う。Hugging Face Jobsで埋め込みを一括生成し、Storage Bucketsで永続的に中継し、Inference Endpointsでオンライン検索の低遅延埋め込みを提供する。arXivとDaily Papersの11万件超を対象とする。
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
Liquid AIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けDSparkドラフトモデルのチェックポイントを公開した。投機的デコーディングで出力品質を変えずに復号速度を上げ、GPUの処理量を最大3.18倍、端末上で最大2.87倍にした。
Microsoft Researchは深層学習DFT汎関数Skala 1.1を公開した。学習データは旧公開版の2.5倍で、GMTKN55の55分類中32で首位、加重平均誤差は2.8 kcal/molだった。CP2Kで使え、Psi4、FHI-aims、ORCA、VASPに統合中だ。各版の計算性能を追うliving benchmarkも開始した。
Mistralは複数段階の検索ループで情報を探し、調べ、検証する検索層Agentic Searchを公開した。Mistral Search Toolkitで提供し、StudioとVibeのLibrariesにも組み込む。
IBM Research は Hugging Face ブログで ALTK-Evolve の研究を公開した。AppWorld の585の複数ステップ課題で八つのモデルをテストし、エージェント記憶はオン・オフのスイッチではなく、モデル別に量を調整すべきものだと分かった。
Sentence Transformers v6.0は4番目のモデル形式MultiVectorEncoderを追加した。ColBERT型の後期相互作用検索向けで、PyLate、Stanford-NLPのColBERTチェックポイント、colpali-engineの視覚文書検索モデルを直接読み込める。
Hugging Face ブログは、同じハードウェアと負荷で FIFO と比較した制約対応 GPU 割り当てを紹介した。実際の五つの競合場面で GPU 利用率は52~85%から72~88%になり、優先度で重み付けした成果は24.6~105.1%、平均52%向上した。
Google Researchは、普通の2Dスマートフォン写真から体脂肪率、A/G比、V/S比を推定し、インスリン抵抗性を予測する深層学習フレームワークPhotoScanを提案した。
Hugging Face は2026年1~8月の観測レポートを公開した。Hub データでは、多くの月で中国の研究所が公開した最大モデルのパラメーター数が米国を上回る。中国の月間上限は7,540億~2兆7,800億パラメーター、米国は7か月中5か月が1,300億未満だった。
Hugging FaceのブログはStrands Robotsのストリーミングデータ循環のチュートリアルを公開した。同じRobot()オブジェクトで実演を記録し、Storage Bucketへ同期し、Hubからストリーミングで読み込んで学習し、チェックポイントをハードウェアへ戻して配置する。全工程でLeRobotのディスク形式は変えない。
Google DeepMind は Gemini 3.7 Flash を公開し、コーディングとエージェント向けの最強の主力モデルと位置付けた。Gemini 3.6 Flash 公開からわずか3週間だ。
Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。
OlmoEarth Studioは埋め込みの計算と出力に対応した。UIかAPIで地域、時期、エンコーダー版、解像度を選び、Cloud-Optimized GeoTIFF(COG)を得られる。
Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。
Google DeepMind は多言語手話からテキストへのモデル SL2T を公開し、初めて消費者製品に導入した。Pixel 11 の Gboard と Live Transcribe で米国手話(ASL)を英語テキストに変換し、今後さらに多くの端末と言語へ拡大する。
Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。