OpenAI 称已阻断窃取模型推理的攻击,但该手法在 Azure 上仍然有效
OpenAI 称其阻断了一起针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起小规模出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,OpenAI 称已于 7 月 28 日全部关停,并将核心参与者与 Moonshot AI 相关人员关联。
OpenAI 称其阻断了一起针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起小规模出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,OpenAI 称已于 7 月 28 日全部关停,并将核心参与者与 Moonshot AI 相关人员关联。
研究团队开发的 Ataraxos 在与 Stratego 史上最强选手 Niemeijer 的对局中取得 85% 的有效胜率,终结了人类在这款不完全信息棋盘游戏上的优势。
Google DeepMindがGemini 4 Argonを発表。コーディング、企業のナレッジワーク、サイバー防御向けで、まずFairwind Programの政府ユーザーと信頼されたサイバー防御担当者に開放し、その後開発者、企業、消費者向けに開放する。
Googleは新たなフロンティアモデルGemini 4 Argonを発表した。一部のベンチマークではOpenAIやAnthropicの競合製品を上回るが、明確なリードは得ていない。このモデルはまずFairwindプログラムの「信頼できるサイバー防御者」とGoogle社内チームに公開され、その後開発者、企業、消費者向けに提供される予定で、日付は未公表。導入価格は入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで、キャッシュ入力は95%安い。
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
Liquid AIは視覚言語モデルLFM2.5-VL-3B向けの実験的DSpark草稿モデルLFM2.5-VL-DSparkを公開した。投機的デコードで品質を変えずに高速化し、デコードは端末で最大3.13倍、H100で2.66倍、全工程はそれぞれ最大2.62倍、2.27倍になる。
TypeSafe AI は先週 Jev を公開し、新しい「System One モデル」の最初の例としたが、筆者は「意思決定モデル」の呼び名を好む。文字を入力し、分類、はい・いいえ、点数に対応する浮動小数と信頼度を返す。入力だけに課金し、初モデルは100万トークン当たり0.042ドル。筆者は迷惑メール検出、タグ付け、順位付けに適すると考え、検索の再ランキングにも試した一方、数字、日付、敵対的内容は苦手と指摘する。
TypeSafe AI 創業者兼 CEO の Diogo Almeida は Latent Space ポッドキャストで新モデル Jev を紹介し、ソフトウェアでの利用向けの System One 大規模モデルと説明した。
NVIDIA は MLPerf Inference v6.1 に Vera Rubin NVL72 のプレビュー結果を初提出した。スループットは GB300 NVL72 に対し、Qwen3-VL で最大3.7倍、DeepSeek-R1 で最大2.5倍だった。
TypeSafeはRLCDで学習した非自己回帰モデルJevを公開した。意思決定、分類、ルーティング、採点のみを行う。公式には小型最先端LLMより20~200倍高速、40~400倍安価で、出力トークンは無料だ。
Google ResearchはRetrieve-for-Trainを提案した。オフライン強化学習で報酬に沿うクエリー展開を見つけ、教師信号に変えて53.9Mの拡散検索器へ蒸留する。推論時は1回の非自己回帰でクエリーを展開し、CoT推論トークンを生成しない。
NVIDIAはAI Infra SummitでVera RubinとDSXプラットフォームの複数の進展を公表し、1メガワット当たりのトークン処理量のエネルギー効率最適化を重点的に示した。
OpenAIは、AIが生成したナビエ–ストークスのミレニアム懸賞問題の解答を共有した。説明文とLeanの形式証明を含む。
Hugging Face のブログ筆者は、Surya Narreddi の言語モデルで水彩画を描く発想を TRL と OpenEnv で再現した。モデルは p5.brush で約150行の JavaScript を書いて描画する。データセット、RL 環境、訓練スクリプト、モデルをすべて公開する。
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
IBM Granite チームは初の dense・decoder-only 推論モデル群 Granite 4.2 を公開した。3B、8B、30Bの三サイズを、すべて Apache 2.0 で提供する。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Liquid AIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けDSparkドラフトモデルのチェックポイントを公開した。投機的デコーディングで出力品質を変えずに復号速度を上げ、GPUの処理量を最大3.18倍、端末上で最大2.87倍にした。
Import AI 469は、ルールと目標を隠し、対話的探索で発見する70ゲームのDiG-benchを紹介した。Claude Codeと組み合わせたOpus 5とFable 5が最良で、この2モデルだけがTier 7の一部を攻略した。人は100%攻略できる。
Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。
Hugging Face の ALTK-Evolve と ACE はともにウェイト更新なしの記憶方式だが、提供方法が異なる。ACE は各ステップで playbook 全体を投入し、ALTK-Evolve は課題に応じて裏付けの強い少数の guideline を取得する。
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Berkeley AI ResearchとIBM Researchは進化的カーネル探索のK-SearchをMLXに拡張した。構造化したCUDA-to-MLX変換層で、既存のCUDAカーネル知識をApple Siliconに移す。
Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。
Thinking Machines は Hugging Face で Inkling を公開した。約1兆パラメーター、100万コンテキストのマルチモーダル MoE モデルで、画像、テキスト、音声を直接受け取る。同時に総2,760億・稼働120億パラメーターの Inkling-Small も公開した。
Hugging Faceブログはprofilerでattention実装を追う第3部を公開した。単純な実装とin-place maskingを比較し、masked_fillをmasked_fill_に変えると順伝播ごとにGPU Memcpyカーネルを1つ減らせると示した。
Import AI 464はFableがKernelBench-Megaで、保守担当に初の真正かつ最速と呼ばれたmegakernelを作ったと報告した。RTX PRO 6000 BlackwellのCUDAで18.71倍高速化し、Claude Opus 4.8の14.4倍、GLM-5.2の11.14倍、GPT 5.5の4.34倍を上回った。
MistralはApache-2.0のLeanstral 1.5を公開した。総パラメーター119B、稼働パラメーター6Bで形式検証を大幅強化した。miniF2Fで100%、PutnamBenchの672問中587問を解き、FATE-Hで87%、FATE-Xで34%の現時点の最高成績を達成した。
Google Research は、凍結した Gemini Nano v3 に複数トークン予測(MTP)ヘッドを接続する新構造を公開した。本体のウェイトを変えずに端末上の推論を加速し、Pixel 9 と10シリーズで提供済みだ。
Google ResearchのCOLM 2026論文は、単純な1段階の質問でも、推論過程が通常は想起できない事実知識を引き出すと示した。Gemini-2.5 FlashとPro、Qwen3-32Bで確認した。追加トークンが「計算バッファー」になることと、関連事実を先に出して正答へ意味的に準備する「事実プライミング」の2機構を発見した。中間事実の自己生成には幻覚リスクもある。
Google DeepMindは実験的オープンソースモデルDiffusionGemmaを公開した。テキスト拡散で文章の塊を並列生成し、専用GPUで推論速度を最大4倍に高める。
Import AIは3研究をまとめる。King's College London、復旦、Alan Turing InstituteのSocioHackは72の社会サンドボックスで、規則を守りながら制度の隙間を突くRLを試す。修正済みの歴史的な欠陥を再発見する再現率は61.25%、適合率は90.85%だった。
Berkeley AI Researchは並列推論の進展を整理し、独立した小課題をいつ分解・並列化するか、同時スレッド数、調整方法をモデル自身が決める適応的並列推論を分析した。Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inferenceなどは外部で並列構造を事前設定し、適応的な行動を教えていない。
Berkeley AI Researchは学習済み世界モデルの勾配計画器GRASPを提案した。軌跡を仮想状態へ引き上げて時系列を並列最適化し、状態反復に乱数を直接注入して探索する。勾配を整えて行動へ明確な信号を送り、高次元視覚モデルの脆い「状態–入力」勾配を避け、長期計画を実用的かつ頑健にする。
Google は推論優先の合成データ基盤 Simula を提案した。データセット構築を機構設計問題として捉え直し、全体の多様化、局所の多様化、複雑化、二つの批評役による品質確認の四段階で、種データなしにゼロから作成する。
Google Research は TurboQuant を公開した。訓練や微調整なしで、モデル精度を損なわず KV キャッシュを3 bitに量子化できる。QJL と PolarQuant の二手法も提案した。
Mistral AIはMistral Smallシリーズの次の主要版Mistral Small 4を公開した。Magistralの推論、Pixtralのマルチモーダル、Devstralのエージェント型コーディングを初めて単一モデルに統合し、Apache 2.0を採用する。
Mistral AIはLean 4向け初のオープンソースコーディングエージェントLeanstralを公開した。6Bの有効パラメーターを持つ疎な構造を採用し、重みはApache 2.0で公開した。Mistral vibeと無料APIエンドポイントlabs-leanstral-2603に接続されている。
Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。
Berkeley AI ResearchはTD学習に依存しない分割統治のオフポリシー強化学習を提案した。Bellman再帰の回数を線形から対数へ減らし、長い期間のタスクへ拡張する。