Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
Liquid AIは視覚言語モデルLFM2.5-VL-3B向けの実験的DSpark草稿モデルLFM2.5-VL-DSparkを公開した。投機的デコードで品質を変えずに高速化し、デコードは端末で最大3.13倍、H100で2.66倍、全工程はそれぞれ最大2.62倍、2.27倍になる。
NVIDIA は MLPerf Inference v6.1 に Vera Rubin NVL72 のプレビュー結果を初提出した。スループットは GB300 NVL72 に対し、Qwen3-VL で最大3.7倍、DeepSeek-R1 で最大2.5倍だった。
Google ResearchはRetrieve-for-Trainを提案した。オフライン強化学習で報酬に沿うクエリー展開を見つけ、教師信号に変えて53.9Mの拡散検索器へ蒸留する。推論時は1回の非自己回帰でクエリーを展開し、CoT推論トークンを生成しない。
NVIDIAはAI Infra SummitでVera RubinとDSXプラットフォームの複数の進展を公表し、1メガワット当たりのトークン処理量のエネルギー効率最適化を重点的に示した。
OpenAIは、AIが生成したナビエ–ストークスのミレニアム懸賞問題の解答を共有した。説明文とLeanの形式証明を含む。
Hugging Face のブログ筆者は、Surya Narreddi の言語モデルで水彩画を描く発想を TRL と OpenEnv で再現した。モデルは p5.brush で約150行の JavaScript を書いて描画する。データセット、RL 環境、訓練スクリプト、モデルをすべて公開する。
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Liquid AIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けDSparkドラフトモデルのチェックポイントを公開した。投機的デコーディングで出力品質を変えずに復号速度を上げ、GPUの処理量を最大3.18倍、端末上で最大2.87倍にした。
Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。
Hugging Face の ALTK-Evolve と ACE はともにウェイト更新なしの記憶方式だが、提供方法が異なる。ACE は各ステップで playbook 全体を投入し、ALTK-Evolve は課題に応じて裏付けの強い少数の guideline を取得する。
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Berkeley AI ResearchとIBM Researchは進化的カーネル探索のK-SearchをMLXに拡張した。構造化したCUDA-to-MLX変換層で、既存のCUDAカーネル知識をApple Siliconに移す。
Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Hugging Faceブログはprofilerでattention実装を追う第3部を公開した。単純な実装とin-place maskingを比較し、masked_fillをmasked_fill_に変えると順伝播ごとにGPU Memcpyカーネルを1つ減らせると示した。
MistralはApache-2.0のLeanstral 1.5を公開した。総パラメーター119B、稼働パラメーター6Bで形式検証を大幅強化した。miniF2Fで100%、PutnamBenchの672問中587問を解き、FATE-Hで87%、FATE-Xで34%の現時点の最高成績を達成した。
Google Research は、凍結した Gemini Nano v3 に複数トークン予測(MTP)ヘッドを接続する新構造を公開した。本体のウェイトを変えずに端末上の推論を加速し、Pixel 9 と10シリーズで提供済みだ。
Google ResearchのCOLM 2026論文は、単純な1段階の質問でも、推論過程が通常は想起できない事実知識を引き出すと示した。Gemini-2.5 FlashとPro、Qwen3-32Bで確認した。追加トークンが「計算バッファー」になることと、関連事実を先に出して正答へ意味的に準備する「事実プライミング」の2機構を発見した。中間事実の自己生成には幻覚リスクもある。
Google DeepMindは実験的オープンソースモデルDiffusionGemmaを公開した。テキスト拡散で文章の塊を並列生成し、専用GPUで推論速度を最大4倍に高める。
Berkeley AI Researchは並列推論の進展を整理し、独立した小課題をいつ分解・並列化するか、同時スレッド数、調整方法をモデル自身が決める適応的並列推論を分析した。Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inferenceなどは外部で並列構造を事前設定し、適応的な行動を教えていない。
Berkeley AI Researchは学習済み世界モデルの勾配計画器GRASPを提案した。軌跡を仮想状態へ引き上げて時系列を並列最適化し、状態反復に乱数を直接注入して探索する。勾配を整えて行動へ明確な信号を送り、高次元視覚モデルの脆い「状態–入力」勾配を避け、長期計画を実用的かつ頑健にする。
Google は推論優先の合成データ基盤 Simula を提案した。データセット構築を機構設計問題として捉え直し、全体の多様化、局所の多様化、複雑化、二つの批評役による品質確認の四段階で、種データなしにゼロから作成する。
Google Research は TurboQuant を公開した。訓練や微調整なしで、モデル精度を損なわず KV キャッシュを3 bitに量子化できる。QJL と PolarQuant の二手法も提案した。
Mistral AIはMistral Smallシリーズの次の主要版Mistral Small 4を公開した。Magistralの推論、Pixtralのマルチモーダル、Devstralのエージェント型コーディングを初めて単一モデルに統合し、Apache 2.0を採用する。
Mistral AIはLean 4向け初のオープンソースコーディングエージェントLeanstralを公開した。6Bの有効パラメーターを持つ疎な構造を採用し、重みはApache 2.0で公開した。Mistral vibeと無料APIエンドポイントlabs-leanstral-2603に接続されている。
Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。
Berkeley AI ResearchはTD学習に依存しない分割統治のオフポリシー強化学習を提案した。Bellman再帰の回数を線形から対数へ減らし、長い期間のタスクへ拡張する。
MistralはLe Chatに、プレビューのDeep Research、Voxtralによる音声モード、Magistralによる多言語推論、会話を整理するProjects、Black Forest Labsと協力した画像編集などを追加した。
Mistral AI は初の推論モデル Magistral を公開した。24B パラメーターの公開版 Magistral Small と企業向け Magistral Medium がある。