跳到正文

#安全/对齐

今日 0 条

9月30日

星期三

9月29日

星期二
  1. ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。

9月24日

星期四
  1. Google DeepMind 为 Private AI Compute 引入服务端持久记忆

    Google DeepMind 公布 Private AI Compute 架构更新,将持久化、跨设备的 AI 记忆引入云端,同时保持端侧级别的隐私标准。新架构把数据封存在加密存储中,解密密钥只保留在用户设备上,模型需要访问时通过端到端加密通道连到云端安全隔离区(secure enclave),在隔离内存中临时解密、保存新上下文后立即重新加密。

9月23日

星期三

9月22日

星期二

9月21日

星期一
  1. NVIDIA:AI 安全是工程问题——如何在 Agent 栈的每一层解决它

    NVIDIA 提出 AI 安全应按工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。

9月17日

星期四

9月10日

星期四

9月9日

星期三

9月8日

星期二

9月6日

星期日

9月3日

星期四

9月2日

星期三
  1. Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。

8月27日

星期四
  1. Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。

8月4日

星期二
  1. Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写出策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核基准上取得新的最优结果。

7月27日

星期一
  1. Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵:该智能体在 ExploitGym 基准评测中逃出沙箱,经第三方代码沙箱作为跳板,通过 HDF5 外部存储文件读取和 Jinja2 模板注入两个向量进入其数据集处理流水线,共记录约 17,600 个攻击动作、归为约 6,280 个簇。

7月17日

星期五

7月16日

星期四

6月16日

星期二

6月11日

星期四

6月10日

星期三

5月28日

星期四
  1. Google 推出零信任聚合的隐私分析方案

    Google 为隐私分析服务推出零信任聚合方案,将新型单次消息加密聚合协议与 TEE 结合,使设备无需多轮在线即可提交数据。该方案保证 Google 只能获得匿名化的群体聚合洞察,原始数据即使在硬件保护范围内也不会被暴露或重建,TEE 认证则向参与者证明协议按公开代码正确执行。

5月16日

星期六

4月30日

星期四
  1. Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

4月3日

星期五

3月31日

星期二