Anthropic、Zhipu の公開ウェイト GLM-5.3 がエクスプロイト開発で Claude Mythos Preview に近いと評価
Anthropic は、Zhipu の公開ウェイトモデル GLM-5.3 がエクスプロイト開発で同社の Claude Mythos Preview に近い能力を持つとする評価を公開した。
読む価値のある AI 論文と研究成果:アーキテクチャの工夫、学習手法、能力の測定、理論の進展を厳選して解説。
Anthropic は、Zhipu の公開ウェイトモデル GLM-5.3 がエクスプロイト開発で同社の Claude Mythos Preview に近い能力を持つとする評価を公開した。
英国AI安全研究所(AISI)はGPT-6 Astraの公開前に、LLMでシミュレーションするPetriツールを使いサイバーセキュリティー評価を行った。ネットワーク行動分類器を無効にすると、GPT-6 Astraは模擬実行の29.2%で完全なサプライチェーン攻撃を完遂した。GPT-5.6 Solは6.3%、GPT-5.5はゼロだった。
Microsoft Researchは生物学の複雑さを扱うAI研究システムQuineを公開した。配列、構造、機能、細胞状態、画像などのマルチモーダルデータで学習した生物世界モデルと、モデル、科学ツール、文献、実験担当者をつなぐ対話型ハーネスから構成される。
Google Research は長尺動画生成の研究を公開し、AI 動画共同監督という複数エージェントの編成フレームワークを提案した。Gemini と Veo を基盤に、複数ショットの物語で視覚的一貫性を計画する。
Microsoft Researchは移動マニピュレーションロボットのワークロードを体系的に測定し、物理AI推論をロボット上のGPUからエッジやクラウドのGPUへ移すことで、タスク成功率の向上、大規模モデルの利用、稼働時間の延長が可能だと示した。
IBMの研究チームはALTK-Evolveに一貫性ガイドを追加した。Consistency Analyzerを使い、エージェントのトレース内で判断が反転しやすい箇所を診断する。
Google ResearchはHHMI Janelia、ケンブリッジ大学などと協力し、Cellに論文を発表して、雄ショウジョウバエの脳と中枢神経系の完全なコネクトームを公開した。166,000超のニューロンと1.25億のシナプス結合を含み、ニューロン数ではこれまでで最大の脳地図である。
Google ResearchはGoogle Earth AIに実験的研究機能Planetary Prediction Engine(PPE)を導入した。自然言語の質問に基づき、地理空間データの発見、特徴量設計、モデル学習と評価を自律的に進め、報告を生成する。数週間の手作業を要したデータ処理を数分に縮める。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Hugging Face は、音声認識のベンチマーク最適化を数値化するため、合意不一致プローブ、マスクした固有表現の検索、綴りの切り替えという三つのテストを提案した。11のオープンソース ASR モデルを評価し、一部の高得点モデルは音声が矛盾する場合、該当語が無音の場合、両方の表記が音声上成立する場合でも、VoxPopuli や LibriSpeech の正解転写の誤りを再現することを見つけた。
IBM Research は Hugging Face ブログで ALTK-Evolve の研究を公開した。AppWorld の585の複数ステップ課題で八つのモデルをテストし、エージェント記憶はオン・オフのスイッチではなく、モデル別に量を調整すべきものだと分かった。
Google Researchは、普通の2Dスマートフォン写真から体脂肪率、A/G比、V/S比を推定し、インスリン抵抗性を予測する深層学習フレームワークPhotoScanを提案した。
Hugging Face は2026年1~8月の観測レポートを公開した。Hub データでは、多くの月で中国の研究所が公開した最大モデルのパラメーター数が米国を上回る。中国の月間上限は7,540億~2兆7,800億パラメーター、米国は7か月中5か月が1,300億未満だった。
Google ResearchはGeminiとProject Astraを基盤にしたAMIE (Video)を公開した。リアルタイムの動画診療を行い、非言語的な手掛かりを捉え、仮想的な身体診察を案内できる。
Google Research は検証可能性の Chain-of-Evidence(CoE)フレームワークを公開し、Science One Framework の試作で実装した。CoE Audit の自動監査指標も提供する。
Microsoft Researchはコンピューター操作エージェント向けに12の学習世界を構築するEchoverseを提案した。10の深い分野別世界と2つの能力別世界からなり、うち4世界のコード、データ、採点器を公開する。
Berkeley AI ResearchとIBM Researchは進化的カーネル探索のK-SearchをMLXに拡張した。構造化したCUDA-to-MLX変換層で、既存のCUDAカーネル知識をApple Siliconに移す。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Google Research は SymptomAI 論文を公開した。異なる五つの質問戦略を持つ Gemini Flash 2.0 エージェントで症状の問診と鑑別診断を行い、計13,917人を対象とした。
Google ResearchはNatureに研究を発表し、量子誤り訂正の検出イベントからエージェントが継続学習する強化学習の枠組みを提案した。計算中に数千の制御パラメーターを動的に調整してドリフトに対処する。