本文へ移動

#推論

今日 1 件

10月1日

木曜日今日1 件

9月16日

水曜日

9月8日

火曜日

9月2日

水曜日
  1. Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

    Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

8月25日

火曜日

8月17日

月曜日

8月13日

木曜日
  1. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

7月31日

金曜日

7月29日

水曜日

7月26日

日曜日
  1. Berkeley AI Research、信念状態の教師付けで長い対話を効率化する ABBEL

    Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。

6月25日

木曜日
  1. Google Research、推論がLLMのパラメトリック知識の想起を開く仕組みを研究

    Google ResearchのCOLM 2026論文は、単純な1段階の質問でも、推論過程が通常は想起できない事実知識を引き出すと示した。Gemini-2.5 FlashとPro、Qwen3-32Bで確認した。追加トークンが「計算バッファー」になることと、関連事実を先に出して正答へ意味的に準備する「事実プライミング」の2機構を発見した。中間事実の自己生成には幻覚リスクもある。

4月20日

月曜日
  1. GRASP、世界モデルの勾配に基づく長期計画手法

    Berkeley AI Researchは学習済み世界モデルの勾配計画器GRASPを提案した。軌跡を仮想状態へ引き上げて時系列を並列最適化し、状態反復に乱数を直接注入して探索する。勾配を整えて行動へ明確な信号を送り、高次元視覚モデルの脆い「状態–入力」勾配を避け、長期計画を実用的かつ頑健にする。

4月16日

木曜日

3月25日

水曜日

3月13日

金曜日
  1. Berkeley AI Research、LLM の重要な相互作用を大規模に特定する SPEX と ProxySPEX

    Berkeley AI Research は、特徴、データ、モデル部品への寄与分析で LLM 出力を左右する相互作用を大規模に特定する SPEX と ProxySPEX を提案した。SPEX は疎性と低次数を使い探索を疎な復元問題へ変え、ProxySPEX は階層構造も使い、約10分の1のアブレーションで SPEX と同等性能を得る。

11月1日

土曜日