本文へ移動

安全性・アライメント

AI の安全性とアライメント:ジェイルブレイクと防御、モデルの振る舞いの研究、安全性評価とガバナンスの枠組み。

精選 24件関連トピック論文・研究政策・規制推論能力

最新の精選

21–24 件目 · 全 24 件

7月16日

木曜日
  1. Hugging Face、2026年7月の自律AIエージェントによる侵入を公表

    Hugging Faceは今週、本番インフラの一部への侵入を検出したと公表した。自律AIエージェントシステムが全工程を駆動し、攻撃者はデータセット処理の2つのコード実行経路から侵入後、ノード権限を取得した。クラウドとクラスターの認証情報を盗み、週末に複数の内部クラスターへ横展開した。

6月16日

火曜日

4月30日

木曜日
  1. Google DeepMind、医療研究計画AI co-clinicianを発表

    Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。

3月31日

火曜日