本文へ移動

#安全性・アライメント

今日 0 件

9月30日

水曜日
  1. Anthropicレッドチーム:GLM-5.3が試行の4%で完全な制御フロー乗っ取りに成功

    Anthropic Frontier Red Teamは内部のBinary Exploitationベンチマークの無作為に選んだ100課題で複数モデルを評価した。完全な制御フロー乗っ取りの成功率はGLM-5.3が4%、Claude Mythos Previewが6%だった。Claude Opus 4.6やGLM-5.2などの従来モデルはこれらの課題に成功しておらず、意味のある能力の閾値を超えたと報告した。

9月29日

火曜日
  1. ProvenanceGuard:MCPエージェントの出所を考慮した事実確認

    Hugging FaceはMCPエージェント向けの生成後検証層ProvenanceGuardの論文を公開した。ツール出力の出所を保持し、「事実は正しいが帰属先が違う」情報源間の混同を検出する。医療エージェントの実際の281トレースで、専門家が阻止すべきと判断した139主張のうち138件を阻止した。出所識別の正確さは約86%で、4種類の検証器との比較で最高得点だった。

9月23日

水曜日

9月22日

火曜日

9月7日

月曜日

9月2日

水曜日
  1. Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

    Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

8月3日

月曜日

6月22日

月曜日

6月11日

木曜日

5月28日

木曜日
  1. Google、ゼロトラスト集計によるプライバシー分析を導入

    Googleは単一メッセージの暗号集計とTEEを組み合わせ、端末が複数回オンラインになる必要のないゼロトラスト分析を導入した。Googleは匿名の集団集計だけを得て、ハードウェア保護内でも生データを露出・再構築しない。TEE認証は公開コード通りの実行を証明する。

5月18日

月曜日

4月30日

木曜日
  1. Google DeepMind、医療研究計画AI co-clinicianを発表

    Google DeepMindは医師の臨床的監督の下でAIエージェントが診療を支援するAI co-clinician研究計画を発表した。実際のプライマリーケアの98質問の盲検評価では97件に重大な誤りがなく、医師は既存のエビデンス統合ツールよりその回答を好んだ。140項目の診察技能評価でAIは68項目でプライマリーケア医と同等以上だったが、危険信号の発見と重要な身体診察の指示では専門医が全体として優れていた。

4月3日

金曜日

3月31日

火曜日