本文へ移動

#推論

今日 5 件

10月1日

木曜日今日5 件
  1. Google、Gemini 4 Argonを発表 OpenAIとAnthropicとの差を縮めるも明確なリードはならず

    Googleは新たなフロンティアモデルGemini 4 Argonを発表した。一部のベンチマークではOpenAIやAnthropicの競合製品を上回るが、明確なリードは得ていない。このモデルはまずFairwindプログラムの「信頼できるサイバー防御者」とGoogle社内チームに公開され、その後開発者、企業、消費者向けに提供される予定で、日付は未公表。導入価格は入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで、キャッシュ入力は95%安い。

  2. Google DeepMind、フロンティアモデル「Gemini 4 Argon」を発表

    Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。

9月24日

木曜日

9月22日

火曜日
  1. TypeSafe AI、System One の意思決定モデル Jev を公開

    TypeSafe AI は先週 Jev を公開し、新しい「System One モデル」の最初の例としたが、筆者は「意思決定モデル」の呼び名を好む。文字を入力し、分類、はい・いいえ、点数に対応する浮動小数と信頼度を返す。入力だけに課金し、初モデルは100万トークン当たり0.042ドル。筆者は迷惑メール検出、タグ付け、順位付けに適すると考え、検索の再ランキングにも試した一方、数字、日付、敵対的内容は苦手と指摘する。

9月16日

水曜日

9月8日

火曜日

9月3日

木曜日

9月2日

水曜日
  1. Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

    Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

8月25日

火曜日

8月21日

金曜日

8月17日

月曜日

8月13日

木曜日
  1. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

8月11日

火曜日

7月31日

金曜日

7月29日

水曜日

7月26日

日曜日
  1. Berkeley AI Research、信念状態の教師付けで長い対話を効率化する ABBEL

    Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。

7月15日

水曜日

7月10日

金曜日

7月6日

月曜日

7月2日

木曜日

6月27日

土曜日

6月25日

木曜日
  1. Google Research、推論がLLMのパラメトリック知識の想起を開く仕組みを研究

    Google ResearchのCOLM 2026論文は、単純な1段階の質問でも、推論過程が通常は想起できない事実知識を引き出すと示した。Gemini-2.5 FlashとPro、Qwen3-32Bで確認した。追加トークンが「計算バッファー」になることと、関連事実を先に出して正答へ意味的に準備する「事実プライミング」の2機構を発見した。中間事実の自己生成には幻覚リスクもある。

6月11日

木曜日

6月8日

月曜日

5月8日

金曜日
  1. 適応的並列推論:効率的な推論拡張の次の形

    Berkeley AI Researchは並列推論の進展を整理し、独立した小課題をいつ分解・並列化するか、同時スレッド数、調整方法をモデル自身が決める適応的並列推論を分析した。Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inferenceなどは外部で並列構造を事前設定し、適応的な行動を教えていない。

4月20日

月曜日
  1. GRASP、世界モデルの勾配に基づく長期計画手法

    Berkeley AI Researchは学習済み世界モデルの勾配計画器GRASPを提案した。軌跡を仮想状態へ引き上げて時系列を並列最適化し、状態反復に乱数を直接注入して探索する。勾配を整えて行動へ明確な信号を送り、高次元視覚モデルの脆い「状態–入力」勾配を避け、長期計画を実用的かつ頑健にする。

4月16日

木曜日

3月25日

水曜日

3月17日

火曜日

3月13日

金曜日
  1. Berkeley AI Research、LLM の重要な相互作用を大規模に特定する SPEX と ProxySPEX

    Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。

11月1日

土曜日