Google Research、長尺動画研究を公開、AI 動画共同監督と四つのエージェントの枠組み
Google Research は長尺動画生成の研究を公開し、AI 動画共同監督という複数エージェントの編成フレームワークを提案した。Gemini と Veo を基盤に、複数ショットの物語で視覚的一貫性を計画する。
Google Research は長尺動画生成の研究を公開し、AI 動画共同監督という複数エージェントの編成フレームワークを提案した。Gemini と Veo を基盤に、複数ショットの物語で視覚的一貫性を計画する。
Google Research
Microsoft Researchは移動マニピュレーションロボットのワークロードを体系的に測定し、物理AI推論をロボット上のGPUからエッジやクラウドのGPUへ移すことで、タスク成功率の向上、大規模モデルの利用、稼働時間の延長が可能だと示した。
Microsoft Research
IBMの研究チームはALTK-Evolveに一貫性ガイドを追加した。Consistency Analyzerを使い、エージェントのトレース内で判断が反転しやすい箇所を診断する。
Hugging Face Blog
Google DeepMindはヒトゲノムの90億の一塩基変異の効果予測を収めたAlphaGenome Atlasを公開した。規模は1PBで、AlphaFold Databaseの30倍以上に達する。
Google DeepMind
Google ResearchはHHMI Janelia、ケンブリッジ大学などと協力し、Cellに論文を発表して、雄ショウジョウバエの脳と中枢神経系の完全なコネクトームを公開した。166,000超のニューロンと1.25億のシナプス結合を含み、ニューロン数ではこれまでで最大の脳地図である。
Google Research
Voice Arena と Hugging Face は Open ASR Leaderboard に Monsoon en-IN と Monsoon hi-IN を追加した。Hindi はこの多言語ランキング初のインド言語となる。
Hugging Face Blog
Google ResearchはGoogle Earth AIに実験的研究機能Planetary Prediction Engine(PPE)を導入した。自然言語の質問に基づき、地理空間データの発見、特徴量設計、モデル学習と評価を自律的に進め、報告を生成する。数週間の手作業を要したデータ処理を数分に縮める。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Hugging Face Blog
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
Hugging Face Blog
Google Researchは、普通の2Dスマートフォン写真から体脂肪率、A/G比、V/S比を推定し、インスリン抵抗性を予測する深層学習フレームワークPhotoScanを提案した。
Google Research
Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。
Hugging Face Blog
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
Google Research
Microsoft Researchはコンピューター操作エージェント向けに12の学習世界を構築するEchoverseを提案した。10の深い分野別世界と2つの能力別世界からなり、うち4世界のコード、データ、採点器を公開する。
Microsoft Research
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Berkeley AI ResearchとIBM Researchは進化的カーネル探索のK-SearchをMLXに拡張した。構造化したCUDA-to-MLX変換層で、既存のCUDAカーネル知識をApple Siliconに移す。
Berkeley AI Research
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
Google Research
Google ResearchはNatureに研究を発表し、量子誤り訂正の検出イベントからエージェントが継続学習する強化学習の枠組みを提案した。計算中に数千の制御パラメーターを動的に調整してドリフトに対処する。
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
Hugging Face Blog
Google ResearchとGoogle DeepMindは、ラベルなしのウェアラブルデータから直接学習する大型センサー基盤モデルSensorFMを提案した。500万人の同意済み参加者による1兆分超のマルチモーダル信号で事前学習し、100か国以上、20機種以上のFitbitとPixel Watchを対象とする。
Google Research
Google DeepMindはシエラレオネの事前登録済み無作為化比較試験の結果を公開した。8週間の試験でGuided Learning利用者の数学成績が対照群より0.258標準偏差高まり、通常の学習1.2~1.7年分に相当した。
Google DeepMind