Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
テキスト以外の能力:画像理解、画像とテキストの混在、音声と動画の入出力に関するモデルとプロダクト。
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
Microsoft Researchは生物学の複雑さを扱うAI研究システムQuineを公開した。配列、構造、機能、細胞状態、画像などのマルチモーダルデータで学習した生物世界モデルと、モデル、科学ツール、文献、実験担当者をつなぐ対話型ハーネスから構成される。
Latent SpaceのAINewsは9/24~9/25の動向をまとめ、今週公開されたOpus 5.5へのコミュニティーの反応は好意的で、特にコードで解説動画を生成する能力が優れているとした。
AMDは李飛飛が共同設立したAI研究所World Labsを約82億ドルの全額株式交換で買収すると発表した。年末までに完了する見込みだ。World Labsは2024年に設立され、数か月で評価額10億ドルに達した。2025年には初の商用製品Marbleを公開し、プロンプトから操作可能な3D世界を生成できる。
Google Research は長尺動画生成の研究を公開し、AI 動画共同監督という複数エージェントの編成フレームワークを提案した。Gemini と Veo を基盤に、複数ショットの物語で視覚的一貫性を計画する。
Google DeepMindはGemini 3.8 Live with Live Avatarを公開した。ネイティブなリアルタイム対話モデルにほぼリアルタイムの動画生成を加え、聞く、見る、話すことのできる動的な視覚アバターを実現し、本日からGemini Enterpriseで提供する。
Meta は Connect 2026 で Muse を個人エージェントとして位置付け、その周辺のハードウェアと機能を更新した。音声とリアルタイム動画に対応し、バックグラウンドで作業を実行し、すべての Meta 眼鏡に導入される。各 Muse は独立したメールアドレスを持ち、Mac 版は computer use に対応し、コネクタープラットフォームには1,500超のアプリがある。
Google DeepMindは音声生成モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。前者はキャラクター設計と行ごとの演技指示、後者は同時処理数の多い吹き替えと音声エージェント向けである。
Xiaomiは全モーダルモデルMiMo-V2.6-ProとMiMo-V2.6-Flashを含むMiMo-V2.6シリーズを公開し、出力速度を最大20倍に高めるMiMo-V2.6-Pro-UltraSpeedも発表した。
Google DeepMind と Google Research は WeatherNext 3 を公開し、現時点で最も高度で正確な全球天気モデルとした。リアルタイムの静止地球観測衛星データから直接学習し、毎時予報を生成する。主要地表変数の解像度は5 kmで、全体では WeatherNext 2 の約5倍鮮明だ。
Google DeepMindはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteにエージェント型動画理解を導入した。動画分析のトークン消費を最大88%、費用を最大66%削減し、正確さを最大7%高める。
Google DeepMind は Gemini Omni 1.1 Flash を公開した。動画生成の制御性を高め、Google AI Studio の Gemini API から開発者に提供する。
Google Researchは、普通の2Dスマートフォン写真から体脂肪率、A/G比、V/S比を推定し、インスリン抵抗性を予測する深層学習フレームワークPhotoScanを提案した。
Google DeepMind は多言語手話からテキストへのモデル SL2T を公開し、初めて消費者製品に導入した。Pixel 11 の Gboard と Live Transcribe で米国手話(ASL)を英語テキストに変換し、今後さらに多くの端末と言語へ拡大する。
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。
Google DeepMind は Gemini Robotics ER 2 を公開した。ロボットの高位の頭脳として、動画理解、複数段階の作業計画、複数ロボットの協働に対応し、動作実行を下位の VLA モデルへ任せられる。
Google DeepMind は次世代ロボット知能層 Gemini Robotics 2 を公開した。初めて人型ロボット全体の全身制御を実現し、両手とグリッパーの精密操作に対応する。