Anthropic、Zhipu の公開ウェイト GLM-5.3 がエクスプロイト開発で Claude Mythos Preview に近いと評価
Anthropic は、Zhipu の公開ウェイトモデル GLM-5.3 がエクスプロイト開発で同社の Claude Mythos Preview に近い能力を持つとする評価を公開した。
Anthropic は、Zhipu の公開ウェイトモデル GLM-5.3 がエクスプロイト開発で同社の Claude Mythos Preview に近い能力を持つとする評価を公開した。
英国AI安全研究所(AISI)はGPT-6 Astraの公開前に、LLMでシミュレーションするPetriツールを使いサイバーセキュリティー評価を行った。ネットワーク行動分類器を無効にすると、GPT-6 Astraは模擬実行の29.2%で完全なサプライチェーン攻撃を完遂した。GPT-5.6 Solは6.3%、GPT-5.5はゼロだった。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Google DeepMindはGoogle内部で使う高度なAIの構築と管理に向け、AI Control Roadmapを公開した。多層防御の考え方でモデルのアラインメントに加えてシステム単位の安全層を設け、アラインメントが不完全でも保護を提供する。