本文へ移動

#エージェント

今日 0 件

9月29日

火曜日
  1. ProvenanceGuard:MCPエージェントの出所を考慮した事実確認

    Hugging FaceはMCPエージェント向けの生成後検証層ProvenanceGuardの論文を公開した。ツール出力の出所を保持し、「事実は正しいが帰属先が違う」情報源間の混同を検出する。医療エージェントの実際の281トレースで、専門家が阻止すべきと判断した139主張のうち138件を阻止した。出所識別の正確さは約86%で、4種類の検証器との比較で最高得点だった。

9月25日

金曜日

9月18日

金曜日

9月16日

水曜日

9月11日

金曜日

9月7日

月曜日

8月28日

金曜日
  1. Google Earth AI、地理空間モデリング全工程を自動化するPPEを導入

    Google ResearchはGoogle Earth AIに実験的研究機能Planetary Prediction Engine(PPE)を導入した。自然言語の質問に基づき、地理空間データの発見、特徴量設計、モデル学習と評価を自律的に進め、報告を生成する。数週間の手作業を要したデータ処理を数分に縮める。

8月26日

水曜日
  1. Google、XRエージェントの会話に空間的ジェスチャーを加えるAgentHandsを公開

    GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。

8月24日

月曜日
  1. Import AI 470:機械に権利は不要、SPADE の訓練環境生成、Hawkeye の GPU カーネル

    METR の研究では、AI の科学的発見への影響は一様でない。2026年の脆弱性報告は2025年より大幅に速く、数学はわずかな加速にとどまり、AI 研究自体のアルゴリズム進歩には有意な加速がない。複数大学のチームは LLM が実行可能な訓練環境の生成と解法を交互に行う SPADE を提案した。Qwen3-30B-A3B のゲーム環境平均点は58.3で、基準より8.1上がった。

8月22日

土曜日
  1. Google、ウェアラブルデータから候補を選ぶBiomarker Discovery Frameworkを公開

    Googleは、人の監督の下で候補バイオマーカーの優先付けを反復研究として進める複数エージェントのBiomarker Discovery Frameworkを公開した。3コホートの計9279観測から、精神的健康の候補41件と代謝の候補25件を自動発見した。睡眠時間の変動とPHQ-8重症度の関係(ρ = 0.252)などを含む。

8月17日

月曜日

8月13日

木曜日
  1. Hugging Face、ICML 2026再現ハッカソンを振り返る:2226論文、6816ログ

    Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。

8月12日

水曜日

8月3日

月曜日

7月31日

金曜日

7月27日

月曜日

7月26日

日曜日
  1. Berkeley AI Research、信念状態の教師付けで長い対話を効率化する ABBEL

    Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。

7月23日

木曜日

7月9日

木曜日
  1. Google、ウェアラブル健康データの汎用基盤モデルSensorFMを公開

    Google ResearchとGoogle DeepMindは、ラベルなしのウェアラブルデータから直接学習する大型センサー基盤モデルSensorFMを提案した。500万人の同意済み参加者による1兆分超のマルチモーダル信号で事前学習し、100か国以上、20機種以上のFitbitとPixel Watchを対象とする。

7月1日

水曜日

5月20日

水曜日

4月30日

木曜日
  1. Google DeepMind、医療研究計画AI co-clinicianを発表

    Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。

4月22日

水曜日

4月20日

月曜日
  1. GRASP、世界モデルの勾配に基づく長期計画手法

    Berkeley AI Researchは学習済み世界モデルの勾配計画器GRASPを提案した。軌跡を仮想状態へ引き上げて時系列を並列最適化し、状態反復に乱数を直接注入して探索する。勾配を整えて行動へ明確な信号を送り、高次元視覚モデルの脆い「状態–入力」勾配を避け、長期計画を実用的かつ頑健にする。

4月14日

火曜日
  1. Google、生成 AI で将来の技能を評価する Vantage を公開

    Google は、高校生・大学生の問題解決や協働を生成 AI の模擬対話で評価する研究実験 Vantage を公開した。Google Labs で英語の登録を受け付ける。Executive LLM が会話を動的に進め、AI Evaluator が評価表で採点する。NYU との米国18~25歳188人の研究では、AI と専門家の採点一致度は専門家同士に近かった。

4月9日

木曜日