本文へ移動

すべての AI 動向

今日 5 件

9月2日

水曜日
  1. Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

    Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

9月1日

火曜日
  1. Hugging Face、@huggingface/kernelsを公開:207のWebGPUカーネルとFleetベンチマーク

    Hugging FaceのWebAIチームは、Hubから最適化済みWebGPUカーネルを読み込み実行する軽量ライブラリ@huggingface/kernelsを公開した。初期の207カーネルも、それぞれ独立したリポジトリでApache-2.0ライセンスにより公開した。

8月28日

金曜日
  1. Google Earth AI、地理空間モデリング全工程を自動化するPPEを導入

    Google ResearchはGoogle Earth AIに実験的研究機能Planetary Prediction Engine(PPE)を導入した。自然言語の質問に基づき、地理空間データの発見、特徴量設計、モデル学習と評価を自律的に進め、報告を生成する。数週間の手作業を要したデータ処理を数分に縮める。

8月27日

木曜日
  1. Google DeepMind、世界初の二重盲検AI評価を試行

    Google DeepMindは、専有のフロンティア級AIモデルを対象とする世界初の二重盲検評価を発表した。外部評価を暗号技術で隔離した環境に限定し、モデルが事前に試験問題へ接触することを防ぐ。シンガポールのAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、プライバシーを保護した環境で非公開ベンチマークを使いGemini Flash Liteを評価する。

8月26日

水曜日
  1. Google、XRエージェントの会話に空間的ジェスチャーを加えるAgentHandsを公開

    GoogleはCHI 2026論文の研究試作AgentHandsを公開した。LLMの推論をXRヘッドセット内の音声と同期する手の動きに変え、3D空間で指示や物の操作を実演する。環境認識、ジェスチャー事象庫、埋め込み推論、ローカル同期実行の4モジュールで、指示、形の表現、感情表現に対応する。N=12の利用者研究では、音声だけより空間的な参照が有意に改善した。

8月25日

火曜日

8月22日

土曜日
  1. Google、ウェアラブルデータから候補を選ぶBiomarker Discovery Frameworkを公開

    Googleは、人の監督の下で候補バイオマーカーの優先付けを反復研究として進める複数エージェントのBiomarker Discovery Frameworkを公開した。3コホートの計9279観測から、精神的健康の候補41件と代謝の候補25件を自動発見した。睡眠時間の変動とPHQ-8重症度の関係(ρ = 0.252)などを含む。

8月21日

金曜日
  1. Hugging Face 研究、音声認識のベンチマーク最適化をどう測るか

    Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。

8月20日

木曜日

8月19日

水曜日

8月18日

火曜日

8月17日

月曜日

8月14日

金曜日
  1. Hugging Face、2026年夏のオープンソースモデル観測レポートを公開

    Hugging Face は2026年1~8月の観測レポートを公開した。Hub データでは、多くの月で中国の研究所が公開した最大モデルのパラメーター数が米国を上回る。中国の月間上限は7,540億~2兆7,800億パラメーター、米国は7か月中5か月が1,300億未満だった。

  2. Strands Agents、LeRobot、Hugging Face Storage Bucketsで記録・学習・配置を一巡させる

    Hugging FaceのブログはStrands Robotsのストリーミングデータ循環のチュートリアルを公開した。同じRobot()オブジェクトで実演を記録し、Storage Bucketへ同期し、Hubからストリーミングで読み込んで学習し、チェックポイントをハードウェアへ戻して配置する。全工程でLeRobotのディスク形式は変えない。

8月13日

木曜日
  1. Hugging Face、ICML 2026再現ハッカソンを振り返る:2226論文、6816ログ

    Hugging Faceは7月15日から8月2日までICML 2026オープン再現チャレンジを開催した。1221人のコミュニティーメンバーがClaude Code、Codex、Cursorなどのコーディングエージェントで論文を再現し、6816件のTrackioログを公開した。対象は大会論文の約3分の1に当たる2226件だった。

  2. MindTopo、Microsoft Research がマルチモーダル大規模モデルの位相推論を評価

    Microsoft Research は、接続、閉鎖、順序、分離、結び目の五つの位相関係の推論・計画を評価する MindTopo を公開した。現モデルは静止画認識が対話的計画より明らかに強く、失敗は知覚より計画で起こり、全体に人間を大幅に下回る。画像・動画生成は単一フレームで構造関係を保つ場合のみ有用で、複数操作後は位相を変えたり制約を破ったりしやすい。

8月12日

水曜日
  1. Google Research、大型モデルの事実の難点は記憶より想起と報告

    Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。

  2. Microsoft Research、臨床向け放射線VLM CARE-Xを公開、補助監督・報酬学習・ツール測定を統合

    Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。