Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
Condé NastはAWS生成AIイノベーションセンター(GenAIIC)と協力し、Amazon BedrockとAmazon OpenSearch Serviceを基盤にマルチモーダル動画検索を構築した。映像、音声、文字起こしを一緒に符号化するため、TwelveLabs Marengo埋め込みモデルを採用した。
Microsoft Researchは生物学の複雑さを扱うAI研究システムQuineを公開した。配列、構造、機能、細胞状態、画像などのマルチモーダルデータで学習した生物世界モデルと、モデル、科学ツール、文献、実験担当者をつなぐ対話型ハーネスから構成される。
Microsoft初の東南アジア研究所であるMSRA – Singaporeは、設立以来1年間、次世代AIモデルとエージェントシステム、分野別AI、AIネイティブな研究実践、人材のエコシステムの4分野に注力した。シンガポールの医療関係者とマルチモーダル医療AIや自己進化する診断エージェントを研究し、EDBと2026年2月に物流・交通AIの幹部円卓会議を開催した。
Amazon SageMaker HyperPodでオープンソースRLフレームワークSkyRLを使い、GRPOで視覚言語モデルQwen3-VL-8Bをマルチモーダル強化学習によって追加学習した。固定の64迷路評価セットで、迷路の成功率を43.75%から95%超へ引き上げた。
Google Research は長尺動画生成の研究を公開し、AI 動画共同監督という複数エージェントの編成フレームワークを提案した。Gemini と Veo を基盤に、複数ショットの物語で視覚的一貫性を計画する。
Google DeepMindはGemini 3.8 Live with Live Avatarを公開した。ネイティブなリアルタイム対話モデルにほぼリアルタイムの動画生成を加え、聞く、見る、話すことのできる動的な視覚アバターを実現し、本日からGemini Enterpriseで提供する。
Liquid AIは視覚言語モデルLFM2.5-VL-3B向けの実験的DSpark草稿モデルLFM2.5-VL-DSparkを公開した。投機的デコードで品質を変えずに高速化し、デコードは端末で最大3.13倍、H100で2.66倍、全工程はそれぞれ最大2.62倍、2.27倍になる。
Google DeepMindは音声生成モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。前者はキャラクター設計と行ごとの演技指示、後者は同時処理数の多い吹き替えと音声エージェント向けである。
NVIDIA は Singapore AI Day で協力企業と東南アジアの AI 導入の進展を展示した。Singapore の HTX は Nemotron 3 Super と Nemotron 3 Nano Omni を使い、公共安全 AI を研究している。
Google DeepMind と Google Research は WeatherNext 3 を公開し、現時点で最も高度で正確な全球天気モデルとした。リアルタイムの静止地球観測衛星データから直接学習し、毎時予報を生成する。主要地表変数の解像度は5 kmで、全体では WeatherNext 2 の約5倍鮮明だ。
Hugging Faceは260Mと800MのNeoMMEを公開した。単一の双方向Transformerで文字トークンと32×32画像パッチを処理する。マスク付き離散拡散の目的関数でゼロから学習し、事前学習済み視覚タワーや因果言語モデルに依存しない。
Google DeepMindはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteにエージェント型動画理解を導入した。動画分析のトークン消費を最大88%、費用を最大66%削減し、正確さを最大7%高める。
Google DeepMind は Gemini Omni 1.1 Flash を公開した。動画生成の制御性を高め、Google AI Studio の Gemini API から開発者に提供する。
GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。
Google Researchは、普通の2Dスマートフォン写真から体脂肪率、A/G比、V/S比を推定し、インスリン抵抗性を予測する深層学習フレームワークPhotoScanを提案した。
OlmoEarth Studioは埋め込みの計算と出力に対応した。UIかAPIで地域、時期、エンコーダー版、解像度を選び、Cloud-Optimized GeoTIFF(COG)を得られる。
Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。
Google DeepMind は多言語手話からテキストへのモデル SL2T を公開し、初めて消費者製品に導入した。Pixel 11 の Gboard と Live Transcribe で米国手話(ASL)を英語テキストに変換し、今後さらに多くの端末と言語へ拡大する。
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。
NVIDIAは3億6400万パラメーターのオープンウェイト音声合成モデルMagpie TTS Multilingualを公開した。英語、スペイン語、フランス語、ドイツ語、イタリア語、ベトナム語、中国語、ヒンディー語、日本語に加え、新たな現代標準アラビア語、韓国語、ブラジルポルトガル語の計12言語に対応する。
MetaはMuseから30Bパラメーターへ蒸留したマルチモーダルモデルMuse GlimmerをApache 2.0で公開した。コーディング、文書分析、個人アシスタントなどのローカルエージェント用途を主に想定する。
Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。
Google DeepMind は Gemini Robotics ER 2 を公開した。ロボットの高位の頭脳として、動画理解、複数段階の作業計画、複数ロボットの協働に対応し、動作実行を下位の VLA モデルへ任せられる。
Google DeepMind は次世代ロボット知能層 Gemini Robotics 2 を公開した。初めて人型ロボット全体の全身制御を実現し、両手とグリッパーの精密操作に対応する。
NVIDIAは手術ロボット向けの動作条件付きリアルタイム生成シミュレーターCosmos-H-Dreamsを公開した。FlashDreams推論ライブラリーでRTX PRO 6000 GPU1枚で動き、人と方策による閉ループの操作に対応する。
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
Google DeepMindはGemini 3.6 Flash、3.5 Flash-Lite、サイバーセキュリティー向け3.5 Flash Cyberの3モデルを公開した。
DharmaOCR は Portuguese OCR 評価で0.925を記録し、Mistral OCR4 の0.798と Unlimited-OCR の0.7587を上回った。Portuguese コーパスで教師あり微調整を行い、次に DPO で推論の安定性を高める二段階訓練で特化した。筆者は、新構造が続々現れても単一言語にパラメーターを集中する戦略には構造的利点があるとする。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Mistral AI は初の具身ナビゲーションモデル Robostral Navigate を公開した。8B モデルで、一般的な RGB カメラ1台だけを使い LiDAR や深度センサーを必要としない。R2R-CE 検証セットの未見環境で成功率76.6%を達成し、最良の単眼方式を9.7ポイント、深度や複数カメラを使う最良システムを4.5ポイント上回った。
Hugging Face と Cerebras はリアルタイム音声対音声パイプラインを共同で実演した。Cerebras で Gemma 4 31B の推論を加速し、Nvidia Parakeet の音声認識と Alibaba Qwen3TTS の音声合成をつなぐ。
Google DeepMindはNano Banana 2 Lite(gemini-3.1-flash-lite-image)とGemini Omni Flash(gemini-omni-flash-preview)の2モデルを公開した。
Mistral は OCR 4 を公開した。文字抽出に加え、境界ボックス、ブロック種別、ページ・単語ごとの信頼度を返す。170言語に対応し、単一コンテナで自社運用できる。600超の文書で独立した評価者による盲検評価を行い、平均72%が OCR 4 を好んだとする。OlmOCRBench は85.20、OmniDocBench は93.07だが、両基準の採点方式には既知の限界があると注意する。
Google ResearchはFarmscapes 2020の高解像度ラスターマップを、生け垣、石垣、低木林の扱いやすい一覧に変えたベクトルデータを公開した。英国の13万平方キロメートル超を対象とする。世界の衛星画像3億枚超で事前学習したRSF Vision-Transformerを約247平方キロメートルの注釈で微調整し、Polsby–Popperコンパクト性スコアで森林、木の集まり、生け垣を区別する。線状特性の閾値は0.5未満だ。
Google は二つの研究を公表した。2,345人の調査では、AI を使った参加者の62%超が皮膚の状態の名前を挙げようとし、対照群は41%だった。正解率は23%で、対照群の8%の約3倍。もう一つの混合手法研究は、自分の皮膚の問題にツールを使う方法、理解の変化、医師との対話の違いを調べた。一方、次の受診行動を判断する支援は限定的だった。
Google DeepMind は Gemini 3.5 Live Translate を公開した。70超の言語に対応するほぼリアルタイムの音声対音声翻訳モデルで、言語を自動検出し、話者の抑揚、リズム、声の高さを保つ。
Google DeepMindはノートパソコンでのローカル実行向けマルチモーダルモデルGemma 4 12Bを公開した。エッジ向けE4Bと26B MoEの中間に位置し、エンコーダーを使わない統一構造で、視覚・音声入力をLLMの本体へ直接渡す。
Google ResearchはNatureにPHRMシステムの研究を発表した。顔認証によるロック解除後の数秒間に前面カメラで動画を撮影し、深層学習で心拍数と安静時心拍数をバックグラウンド推定する。