Microsoft Research、臨床向け放射線VLM CARE-Xを公開、補助監督・報酬学習・ツール測定を統合
Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。
Microsoft Researchは胸部X線の統合視覚言語研究モデルCARE-Xを公開した。報告生成と構造化予測を同時に行い、複数タスクの強化学習(DAPO)で臨床的正しさに報酬を与える。生成と二重推論の2モードで、病変の有無と否定、位置、多ラベル分類、カテーテルやチューブの位置異常、29の解剖領域の特定などに対応する。
Import AI 468はAI研究開発自動化のリスク向けにIFPの7分類23政策案を紹介する。MITとColumbiaの『Racing to Ruin』は複占の研究競争を分析し、透明性と相手への信頼が協調減速の2要因だとする。PostTrainBench+と知的機械・ロボット身体の短編も紹介する。
Multiverse Computing は論文『Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss』を公開した。
Toronto 大学、Vector Institute、Cambridge 大学、ServiceNow の研究者は AI ワームの試作を構築した。侵入済みの機械の GPU で公開ウェイト LLM を動かし、自律的に脆弱性を見つけて攻撃する。監視や取り消しが可能な企業 API を一切必要としない。
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Microsoft Researchはコンピューター操作エージェント向けに12の学習世界を構築するEchoverseを提案した。10の深い分野別世界と2つの能力別世界からなり、うち4世界のコード、データ、採点器を公開する。
Berkeley AI ResearchとIBM Researchは進化的カーネル探索のK-SearchをMLXに拡張した。構造化したCUDA-to-MLX変換層で、既存のCUDAカーネル知識をApple Siliconに移す。
EpochとMETRは、人なら長時間かかるコーディング課題をAIが完遂する能力を測るMirrorCodeを公開した。4月に初発表し、追加テスト後に正式公開した。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Berkeley AI Research は ABBEL を提案した。LLM の要約を自然言語の「信念状態」として分離し教師付けし、自己符号化器に着想を得た再構成型の信念評価を補助 RL 課題にする。CollabBench では ABBEL-rec-BG が全コンテキストモデルとの性能差を約50%縮め、訓練ステップを100から50に減らし、最大トークン長も全コンテキスト設定より短かった。
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
Google ResearchはNatureに研究を発表し、量子誤り訂正の検出イベントからエージェントが継続学習する強化学習の枠組みを提案した。計算中に数千の制御パラメーターを動的に調整してドリフトに対処する。
Google ResearchのICLR 2026論文は、ウェイト減衰などの正則化がscore functionを滑らかにし、ノイズ除去で学習データ間を補間するscore smoothingが創造性の源だと示す。単純な記憶ではなく新たな例を生成する。
Humeは音声評価ベンチマークReal World VoiceEQを公開した。40超の専有・オープンソース音声モデル、15以上の評価軸、60超の指標を扱い、ASR、TTS、S2S、音声理解を対象とする。
Google ResearchとGoogle DeepMindは、ラベルなしのウェアラブルデータから直接学習する大型センサー基盤モデルSensorFMを提案した。500万人の同意済み参加者による1兆分超のマルチモーダル信号で事前学習し、100か国以上、20機種以上のFitbitとPixel Watchを対象とする。
Google ResearchはNature Citiesで初の大規模な実地研究を発表した。米国10都市で6か月、Mapsを変更して2%未満の移動を別経路へ誘導した。対象道路の速度中央値は約2%上がり、燃料消費率中央値は0.5~1.0%下がった。都市ごとに年間数千トンのCO2eを減らせる。
Hugging FaceはSpring、Jakarta EE、Quarkus間の企業Javaアプリ移行を評価するScarfBench(Self-Contained Application Refactoring Benchmark)を公開した。
Dharma AIはGoldfeder、Wyder、LeCun、Shwartz-Zivの2026年論文『AI Must Embrace Specialization via Superhuman Adaptable Intelligence』を解説した。
Hugging FaceはDiScoFormer(Density and Score Transformer)を提案した。データ点を与えるだけで1回の順伝播で密度とscoreを同時推定し、新しい分布ごとの再学習を必要としない。
Google Research は、凍結した Gemini Nano v3 に複数トークン予測(MTP)ヘッドを接続する新構造を公開した。本体のウェイトを変えずに端末上の推論を加速し、Pixel 9 と10シリーズで提供済みだ。
Google Research は線形弾性キャッシュを提案した。ページ退避をスキーレンタル問題として扱い、浅い決定木で TTL を予測して容量を動的に変え、総保有費用を最小化する。Spanner 本番で数か月運用し、メモリーを15.5%削減、ミスは5.5%増にとどまり、TCO は約5%下がり、実際の I/O 費用影響は0.5%だった。複数の公開キャッシュトレースでも検証した。
Google ResearchのCOLM 2026論文は、単純な1段階の質問でも、推論過程が通常は想起できない事実知識を引き出すと示した。Gemini-2.5 FlashとPro、Qwen3-32Bで確認した。追加トークンが「計算バッファー」になることと、関連事実を先に出して正答へ意味的に準備する「事実プライミング」の2機構を発見した。中間事実の自己生成には幻覚リスクもある。
Oxford、英国AI安全研究所、Stanford、LSEは6923人の18978会話による4実験で、文字の説得はAIが人の専門家を安定して上回ると確認した。専門家が話題を選び、事前研究し、1000ポンドの賞金で動機付けされても同じだった。
Google ResearchはFarmscapes 2020の高解像度ラスターマップを、生け垣、石垣、低木林の扱いやすい一覧に変えたベクトルデータを公開した。英国の13万平方キロメートル超を対象とする。世界の衛星画像3億枚超で事前学習したRSF Vision-Transformerを約247平方キロメートルの注釈で微調整し、Polsby–Popperコンパクト性スコアで森林、木の集まり、生け垣を区別する。線状特性の閾値は0.5未満だ。
Google DeepMindはGoogle内部で使う高度なAIの構築と管理に向け、AI Control Roadmapを公開した。多層防御の考え方でモデルのアラインメントに加えてシステム単位の安全層を設け、アラインメントが不完全でも保護を提供する。
Google は二つの研究を公表した。2,345人の調査では、AI を使った参加者の62%超が皮膚の状態の名前を挙げようとし、対照群は41%だった。正解率は23%で、対照群の8%の約3倍。もう一つの混合手法研究は、自分の皮膚の問題にツールを使う方法、理解の変化、医師との対話の違いを調べた。一方、次の受診行動を判断する支援は限定的だった。
Google ResearchはAISTATS 2026でRegularized f-Divergence Kernel Testsを提案した。相対距離で、モデルが安全な再学習版と元の損なわれた版のどちらに近いかを調べ、機械的忘却を監査する。
Google DeepMindはシエラレオネの事前登録済み無作為化比較試験の結果を公開した。8週間の試験でGuided Learning利用者の数学成績が対照群より0.258標準偏差高まり、通常の学習1.2~1.7年分に相当した。
Import AIは3研究をまとめる。King's College London、復旦、Alan Turing InstituteのSocioHackは72の社会サンドボックスで、規則を守りながら制度の隙間を突くRLを試す。修正済みの歴史的な欠陥を再発見する再現率は61.25%、適合率は90.85%だった。
Google ResearchはNatureにPHRMシステムの研究を発表した。顔認証によるロック解除後の数秒間に前面カメラで動画を撮影し、深層学習で心拍数と安静時心拍数をバックグラウンド推定する。
Googleは単一メッセージの暗号集計とTEEを組み合わせ、端末が複数回オンラインになる必要のないゼロトラスト分析を導入した。Googleは匿名の集団集計だけを得て、ハードウェア保護内でも生データを露出・再構築しない。TEE認証は公開コード通りの実行を証明する。
Import AI 457は3研究を扱う。SentinelOneは約20年以上前のfast16.sysを分析し、LS-DYNA 970、PKPM、MOHIDなどの高精度計算のメモリー結果を改ざんして工学・物理シミュレーションを壊すと示した。
Calico Life SciencesのMatt OnsumとKatherine LabbéはCo-Scientistで老化生物学の散在する成果を統合し、検証可能な仮説を作っている。
Stanford医学部Gary PeltzのチームはCo-Scientistで肝線維症薬を選別した。提案3薬のうち2つが生きたヒト肝細胞で線維化を阻止し再生を促したが、Peltzが選んだ2薬は無効だった。抗がん剤vorinostatは瘢痕を起こす損傷反応の91%を阻止した。研究はAdvanced Scienceに掲載された。
Google DeepMindはNatureでCo-Scientistの研究を発表した。Geminiを基盤とする複数エージェントのAIシステムで、科学的仮説を繰り返し生成、議論、進化させる。
Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。
Google Research は、科学者が Empirical Research Assistance(ERA)で研究を進める方法を紹介した。感染症予測、宇宙論、炭素監視、神経科学の四分野を扱う。
Google DeepMind は Decoupled DiLoCo の論文を公開した。大規模訓練を分離した計算の島々に分け、非同期データストリームで通信し、局所的なハードウェア障害を隔離する。
Google ResearchはICLR論文ReasoningBankを公開した。成功と失敗の経験から高次の推論パターンを抽出するエージェントメモリーの枠組みで、オープンソース化済みだ。
Berkeley AI Researchは学習済み世界モデルの勾配計画器GRASPを提案した。軌跡を仮想状態へ引き上げて時系列を並列最適化し、状態反復に乱数を直接注入して探索する。勾配を整えて行動へ明確な信号を送り、高次元視覚モデルの脆い「状態–入力」勾配を避け、長期計画を実用的かつ頑健にする。