Meta、ローカルエージェント向けのオープンソース多モーダルモデルMuse Glimmer 30Bを公開
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
Microsoft ResearchはオープンソースのOrchardフレームワークを公開した。中心はKubernetes環境サービスOrchard Envで、タスク間で環境、データパイプライン、評価手順を再利用し、Codex、OpenClaw、ZeroClawなどの実際の配置フレームワーク内で直接エージェントを学習できる。
Toronto 大学、Vector Institute、Cambridge 大学、ServiceNow の研究者は AI ワームの試作を構築した。侵入済みの機械の GPU で公開ウェイト LLM を動かし、自律的に脆弱性を見つけて攻撃する。監視や取り消しが可能な企業 API を一切必要としない。
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Microsoft Researchはコンピューター操作エージェント向けに12の学習世界を構築するEchoverseを提案した。10の深い分野別世界と2つの能力別世界からなり、うち4世界のコード、データ、採点器を公開する。
Google DeepMind は Gemini Robotics ER 2 を公開した。ロボットの高位の頭脳として、動画理解、複数段階の作業計画、複数ロボットの協働に対応し、動作実行を下位の VLA モデルへ任せられる。
Google DeepMind は次世代ロボット知能層 Gemini Robotics 2 を公開した。初めて人型ロボット全体の全身制御を実現し、両手とグリッパーの精密操作に対応する。
EpochとMETRは、人なら長時間かかるコーディング課題をAIが完遂する能力を測るMirrorCodeを公開した。4月に初発表し、追加テスト後に正式公開した。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
Google DeepMindはGemini 3.6 Flash、3.5 Flash-Lite、サイバーセキュリティー向け3.5 Flash Cyberの3モデルを公開した。
英国AISIによると、オープンウェイトと最先端非公開モデルのサイバー能力差は縮まる。GLM-5.2とDeepSeek V4-Proは4~7か月前の非公開モデルに近く、2025年の大半で観測した6~10か月より狭い。
Google DeepMindは3.5 Flashを微調整した軽量サイバーセキュリティモデルGemini 3.5 Flash Cyberを公開した。脆弱性を素早く発見、検証、修正し、CyberGymなどでは複数回の呼び出しにより大規模モデルに近い成績を示す。
Hugging Faceは今週、本番インフラの一部への侵入を検出したと公表した。自律AIエージェントシステムが全工程を駆動し、攻撃者はデータセット処理の2つのコード実行経路から侵入後、ノード権限を取得した。クラウドとクラスターの認証情報を盗み、週末に複数の内部クラスターへ横展開した。
IBM Research は Hugging Face ブログで、エージェントシステムへのモデルルーティング導入経験を共有した。多くの方式はモデル選択を分類問題と見なすが、実際にはシステム最適化の問題だという。
Mistral Studio は Prompts と Skills の集中管理を顧客に提供した。各資産には版の履歴、明確な責任者、追跡可能性がある。不変版、ロールバック、分類タグ、監査ログで AI の行動を管理・発見でき、Observability で本番出力を該当版まで追える。Skills は Studio から MCP サーバーとして直接呼び出せ、本番で同じ管理対象資産が実行される。
Google ResearchとGoogle DeepMindは、ラベルなしのウェアラブルデータから直接学習する大型センサー基盤モデルSensorFMを提案した。500万人の同意済み参加者による1兆分超のマルチモーダル信号で事前学習し、100か国以上、20機種以上のFitbitとPixel Watchを対象とする。
MicrosoftはBuild 2026でFoundry Managed ComputeとHugging Faceモデル集を発表した。Hugging Faceのオープンウェイトモデルを毎週更新し、FoundryのマネージドGPU基盤へワンクリックで配置できる。
推論費用が2023年初めの GPT-4 級の100万トークン約30ドルから、現在は1ドル未満、一部企業では0.10ドル未満に下がるなか、UC Berkeley の Aditya G. Parameswaran らはエージェント時代のデータシステムに For Agents、Of Agents、By Agents の三方向を提案した。
Hugging FaceはLeRobot v0.6.0を公開し、ロボット学習の循環に向け、世界モデル方策VLA-JEPA、FastWAM、LingBot-VA、新たなVLA群GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT、統一報酬モデルAPIのRobometerとTOPRewardを導入した。
Import AI 464はFableがKernelBench-Megaで、保守担当に初の真正かつ最速と呼ばれたmegakernelを作ったと報告した。RTX PRO 6000 BlackwellのCUDAで18.71倍高速化し、Claude Opus 4.8の14.4倍、GLM-5.2の11.14倍、GPT 5.5の4.34倍を上回った。
Hugging FaceはSpring、Jakarta EE、Quarkus間の企業Javaアプリ移行を評価するScarfBench(Self-Contained Application Refactoring Benchmark)を公開した。
NVIDIAのENPIREはコーディングエージェントで実際のロボットアームの実験・改善を自動化する。双YAMアームとRTX 5090でPushT、ピン整理、カッターで結束バンドを切る課題に99%成功した。GPT-5.5/CodexとOpus 4.7/Claude Codeは互いに勝敗があり、Kimi-2.6は劣った。8エージェントに増やすと良い解を速く見つけた。
Google DeepMindはcomputer useをGemini 3.5 Flashの内蔵ツールとして統合した。従来は独立したGemini 2.5 computer useモデルとしてのみ提供していた。
Mistral AIはConnectorsに新機能を追加した。ワークスペース・組織別のアクセス権と個別ツールの有効・無効を設定する管理制御、およびコネクタースコープ付きAPIキーは一般提供となった。
Google DeepMind は英国政府、Google Cloud、Faculty、Barnet・Camden・Dorset の地域計画部門と AI 計画許可ツールの試作を共同開発すると発表した。担当者が住宅所有者の計画申請を処理する時間を50%短縮することを目指す。
Google DeepMindはGoogle内部で使う高度なAIの構築と管理に向け、AI Control Roadmapを公開した。多層防御の考え方でモデルのアラインメントに加えてシステム単位の安全層を設け、アラインメントが不完全でも保護を提供する。
Google DeepMind は Schmidt Sciences、Cooperative AI Foundation、ARIA と共同で、Google.org の支援を受け、最大1,000万ドルの世界的技術研究助成を開始した。大規模複数エージェント AI の集団行動と安全リスクに焦点を当てる。
Import AIは3研究をまとめる。King's College London、復旦、Alan Turing InstituteのSocioHackは72の社会サンドボックスで、規則を守りながら制度の隙間を突くRLを試す。修正済みの歴史的な欠陥を再発見する再現率は61.25%、適合率は90.85%だった。
Google は Gemini Enterprise Agent Platform で Agentic RAG による複数コーパス検索の公開プレビューを始めた。Orchestrator、Planner、Query Rewriter、Search Fanout、Sufficient Context Agent などが協働し、複数情報源をまたぐ多段階クエリーを処理する。
Google ResearchはI/O 2026でGemini for Scienceの実験ツール群を公開した。ERAとAlphaEvolveのComputational Discovery、Co-ScientistのHypothesis Generation、NotebookLMのLiterature Insightsを含む。
MistralはAI Now Summit 2026で産業工学向けAIスタックを公開した。Airbus、BMW、ASMLと協力し、独自データと知的財産の管理を維持しながら、設計、シミュレーション、生産を最適化する。
Mistral は Le Chat を仕事とコーディング向けの統合 AI エージェント Vibe に更新した。従来の会話、設定、サブスクリプションプランはすべて維持する。
Mistralは指示への追従、推論、コーディングを初めて統合した128Bの稠密モデルMistral Medium 3.5を公開した。修正版MITライセンスで重みを公開し、256kコンテキストに対応する。GPU4基以上で自社ホスティングが可能だ。
MistralはStudioにConnectorsを公開した。内蔵コネクターと独自MCPをAPI/SDK経由で全モデルとエージェント呼び出しに使える。現在は公開プレビューだ。
GoogleはGeminiで科学コードを作成・最適化する研究ツールEmpirical Research Assistance(ERA)を公開した。関連論文は本日Natureに掲載され、Gemini for Scienceの一部として世界の科学者に提供される。
Co-Scientistは数万の論文を調べ、試験可能な新しい遺伝要因を20以上提案して細胞老化逆転の研究を加速している。一部は実験室で細胞を若い状態へ導き、全体的な機能を改善すると確認された。従来6か月かかったスクリーニングデータの分析も数日に縮める。
Google DeepMindは実験的プロトタイプProject GenieにStreet View groundingを導入した。Mapsのピンで米国内の実在地点を選び、スタイルとキャラクターを指定すると、Genieが実写を出発地点の基準にした操作可能な世界を生成する。
Google DeepMind は Gemini for Science を公開し、Google Labs に三つの実験ツールを導入した。Co-Scientist に基づく Hypothesis Generation。