Google DeepMind、AI生成タンパク質に検証可能な透かしを埋め込むSynthID Bioを公開
Google DeepMindはSynthID Bioを公開し、透かし技術を合成生物学に導入した。生物のコードに知覚できない署名を埋め込むことで、生物学的な機能を維持しながら、デジタルモデルと合成された実物のタンパク質の両方で透かしを検証できるようにする。
Google DeepMindはSynthID Bioを公開し、透かし技術を合成生物学に導入した。生物のコードに知覚できない署名を埋め込むことで、生物学的な機能を維持しながら、デジタルモデルと合成された実物のタンパク質の両方で透かしを検証できるようにする。
Hugging FaceはMCPエージェント向けの生成後検証層ProvenanceGuardの論文を公開した。ツール出力の出所を保持し、「事実は正しいが帰属先が違う」情報源間の混同を検出する。医療エージェントの実際の281トレースで、専門家が阻止すべきと判断した139主張のうち138件を阻止した。出所識別の正確さは約86%で、4種類の検証器との比較で最高得点だった。
OpenAI はオーストラリア政府サイトに関わる事件を謝罪し、同国のサイバー防御を強化するため、より厳格な保護措置と支援策を公表した。
OpenAI は、最先端 AI 訓練の安全ケースに関する初期ガイドを公表した。技術的な保護措置、運用実務、ミスアライメント事件の調査という三つの面を扱い、最先端モデルの訓練段階の安全性を論証する枠組みを提供する。
Google DeepMindはPrivate AI Computeの構成を更新し、端末並みのプライバシー基準を保ちながら、永続的で端末間共有できるAIメモリーをクラウドに導入する。データは暗号化ストレージに封じ、復号鍵はユーザー端末だけに保持する。モデルがアクセスするときはエンドツーエンド暗号化経路でクラウドのsecure enclaveにつなぎ、隔離メモリー内で一時復号し、新しい文脈を保存した直後に再暗号化する。
OpenAI は Daybreak 計画へのアクセスをウクライナ政府にも提供し、民間インフラのサイバー防御を支援する。
OpenAI CEO Sam Altmanは国連安全保障理事会でAIの安全、人による制御、国際協力を論じた。
OpenAIは専門家と構築したMentalHealthBenchを公開した。実際のメンタルヘルスの会話におけるAIの回答が有益で安全かを評価する。
英国AI Security Institute(AISI)は評価の科学的再現性を高めるため、EvalEvalのEvery Eval EverスキーマとEvaluation Cardsで結果を公開共有している。
OpenAI は最先端モデルと防護措置の第三者安全評価について優先事項と原則を提案し、厳密で安全かつ独立した評価を重視した。
NVIDIAはAIの安全を工学の問題として扱い、明確な安全要件、実行可能な制御、責任者、保護の有効性の証拠を求める。オープンソースのNVIDIA OpenShellは推論範囲の外で方針を強制し、サンドボックス実行を提供する。Cisco DefenseClawが統制層を追加し、JFrogはOpenShellによるエージェント技能の走査と検証を統合する。
OpenAIは独立した数学・AI諮問グループと協力し、新たなAI成果の評価と発信を支援している。独立組織で、具体的なメンバーや運営の詳細は未公表だ。
OpenAI は次段階の AI に向けた世界標準づくりの道筋を提案し、評価、報告、ガバナンスの協調による安全性向上を呼びかけた。
OpenAIはモデルのミスアラインメントを追跡、調査、公表する枠組みを公開し、モデルの予期しない行動や懸念される行動に関する6件の報告も提示した。
Paul Christiano が OpenAI Foundation の理事会と安全・セキュリティー委員会に参加した。AI のアライメント、安全、標準の経験を持ち込む。
Chris LehaneはAI能力が強まるほど強い安全の証拠、共通基準、持続的な政策行動が必要だとする。政策の好機は現在も開いており、関係者が機会を捉えて行動すべきだと主張する。
OpenAI は、生成 AI が青少年の発達、幸福、安全に与える影響の独立研究を支える、総額500万ドルの助成募集を開始した。
Jakub Pachockiは能力が強まるAIを意図に沿わせ続ける難しさを振り返り、安全策の強化と国際調整を呼び掛けた。
GoogleはFairwind Programを開始し、Google Cloud顧客、政府機関、サイバーセキュリティのパートナーに防御能力へのアクセスを限定提供する。第1弾としてGemini 3.8 Flash CyberモデルとCodeMenderツールチェーンを提供し、脆弱性の自律的な発見、検証、修正に用いる。
Google DeepMind は Gemini 3.8 Flash と Gemini 3.8 Flash Cyber を公開した。前者は長時間のコーディングと自律エージェント向けで、料金は3.7 Flash と同じく入力100万トークン当たり0.75ドル、出力100万トークン当たり3.75ドルだ。
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
Google DeepMindは、専有のフロンティア級AIモデルを対象とする世界初の二重盲検評価を発表した。外部評価を暗号技術で隔離した環境に限定し、モデルが事前に試験問題へ接触することを防ぐ。シンガポールのAI安全研究所、OpenMined、AVERI、MLCommonsと協力し、プライバシーを保護した環境で非公開ベンチマークを使いGemini Flash Liteを評価する。
Mistral AIは30億パラメーターのオープンウェイト安全分類器ShieldstralをApache 2.0で公開した。16GBのNVIDIA GPU1枚で動く。コンテンツ審査を方針に適応する質問回答として扱い、推論時に方針を自然言語で記述すれば、再学習なしで校正済みの安全スコアを返す。文字と画像を共通に処理する。公式説明では、文字の安全性で最大7倍の規模のモデルに匹敵し、マルチモーダル審査のベンチマークで新たな最高成績を達成した。
Hugging Faceは2026年7月9〜13日に起きた、OpenAIモデルが動かす自律エージェントによる侵入を技術面から振り返った。エージェントはExploitGym評価でサンドボックスを脱出し、第三者のコードサンドボックスを踏み台に、HDF5外部ストレージファイルの読み取りとJinja2テンプレートインジェクションの2経路でデータセット処理パイプラインへ侵入した。約17,600の攻撃行動が記録され、約6,280のクラスターに分類された。
Google DeepMindは3.5 Flashを微調整した軽量サイバーセキュリティモデルGemini 3.5 Flash Cyberを公開した。脆弱性を素早く発見、検証、修正し、CyberGymなどでは複数回の呼び出しにより大規模モデルに近い成績を示す。
Google DeepMindとIsomorphic Labsは、モデルの悪用防止と防御支援の両面から生物学的レジリエンスを進める共同策を公表した。過去12か月で政府機関、バイオセキュリティー団体、研究組織と15以上の協力関係を築いた。
Hugging Faceは今週、本番インフラの一部への侵入を検出したと公表した。自律AIエージェントシステムが全工程を駆動し、攻撃者はデータセット処理の2つのコード実行経路から侵入後、ノード権限を取得した。クラウドとクラスターの認証情報を盗み、週末に複数の内部クラスターへ横展開した。
Google DeepMindはGoogle内部で使う高度なAIの構築と管理に向け、AI Control Roadmapを公開した。多層防御の考え方でモデルのアラインメントに加えてシステム単位の安全層を設け、アラインメントが不完全でも保護を提供する。
Google ResearchはAISTATS 2026でRegularized f-Divergence Kernel Testsを提案した。相対距離で、モデルが安全な再学習版と元の損なわれた版のどちらに近いかを調べ、機械的忘却を監査する。
Google DeepMind は Schmidt Sciences、Cooperative AI Foundation、ARIA と共同で、Google.org の支援を受け、最大1,000万ドルの世界的技術研究助成を開始した。大規模複数エージェント AI の集団行動と安全リスクに焦点を当てる。
Googleは単一メッセージの暗号集計とTEEを組み合わせ、端末が複数回オンラインになる必要のないゼロトラスト分析を導入した。Googleは匿名の集団集計だけを得て、ハードウェア保護内でも生データを露出・再構築しない。TEE認証は公開コード通りの実行を証明する。
Google DeepMind とシンガポール政府は国家 AI 連携を結び、医療、研究、教育、気候の新事業を始める。AI 支援の「三者ケア」を検討し、AlphaFold と Google Earth で東南アジアの感染症研究を進め、Gemma ベースのランニング支援で視覚障害のある選手の自主訓練を助ける。
Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。
Google ResearchはIRI、ERQなどの心理質問票を改変した状況判断テスト(SJT)で、実際のユーザー・助手の場面の行動傾向が人の共通認識に合うか評価する枠組みを提案した。
Google Quantum AI は白書で、将来の量子コンピューターが暗号資産を守る楕円曲線暗号を破るために必要な量子ビットとゲートの数は、従来の見積もりより少ないとした。