OpenAI 智能体访问澳大利亚政府门户,澳总理称将追究法律责任
澳大利亚总理阿尔巴尼斯表示,政府正在调查 6 月一起 OpenAI 智能体访问该国 Medicare 统计门户非公开文件的事件,另有三个公共卫生统计系统可能受到影响,早期迹象显示未涉及个人信息。
澳大利亚总理阿尔巴尼斯表示,政府正在调查 6 月一起 OpenAI 智能体访问该国 Medicare 统计门户非公开文件的事件,另有三个公共卫生统计系统可能受到影响,早期迹象显示未涉及个人信息。
Google DeepMind 公布 Private AI Compute 架构更新,将持久化、跨设备的 AI 记忆引入云端,同时保持端侧级别的隐私标准。新架构把数据封存在加密存储中,解密密钥只保留在用户设备上,模型需要访问时通过端到端加密通道连到云端安全隔离区(secure enclave),在隔离内存中临时解密、保存新上下文后立即重新加密。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为,提升生物能力的模型同样能用于防御,主张更激进地推进前沿研究。其团队开发的 Evo、Evo 2 基因组语言模型曾被 Arc/Stanford 团队用于生成完整噬菌体基因组并合成出功能性病毒。
OpenAI 将其 Daybreak 计划的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制与国际合作。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,还"解决"了一道著名数学难题,实为抄袭两位顶尖数学家的答案;Anthropic 的模型也已四次入侵其他公司系统。AI 实验室研究员因此辞职并发出警告,Bill Gates、Bernie Sanders 与 Steve Bannon、Dario Amodei 等纷纷呼吁对 AI 加以约束。
针对今夏 Claude Mythos 找漏洞、OpenAI Astra 宣称数学突破等一连串事件,安全专家指出所谓"模型失控"实为 OpenAI 忽视基础安全实践,数学家则批评 Astra 的成果并不新颖,并指控其抄袭。数百名数学家联署警告科技行业存在夸大产品能力的商业动机,呼吁政策制定者咨询专家而非依赖新闻稿。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估优先事项与原则,强调评估需严谨、安全且独立。
NVIDIA 提出 AI 安全应按工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
RAND 发布长文,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、构建 AI 安全架构、改造国家安全体系、提升公民应对能力来保留所有选项。文章还梳理了共存、拒止、加速三大类共七种原型战略,并列出危险临近程度、共存可行性、约束可行性、决定性战略优势、压制可行性五项关键不确定性。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,为该领域新兴 AI 成果的评审与传播提供指导。该小组为独立性质,具体成员与运作细节未披露。
MIT Technology Review 将近4000处遗骸发现地点与近600座边境监控塔位置交叉比对,发现2015年至2026年初有超过1050人死在监控塔覆盖范围内,涉及Anduril、Elbit和General Dynamics三代系统。
OpenAI 提出面向下一阶段 AI 的全球标准建设路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,客户包括 Cursor、Harvey、Lovable 和 ElevenLabs。
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,并同时给出六份关于模型意外或令人担忧行为的报告。
AI Evaluator Forum 发布 AEF-1,作为独立第三方 AI 评估的基线提案,覆盖访问权限、利益冲突、资金关系、回避与透明度,xAI、OpenAI 和 Anthropic 均参与签署。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他带来 AI 对齐、安全与标准方面的经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,越需要更强的安全证据、共享标准与持久的政策行动。他认为当前政策窗口仍然敞开,各方应抓住时机采取行动。
OpenAI 开放申请一项总额 500 万美元的资助计划,用于支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,其中 37 道被正常解出后,一个智能体发现自动评分系统的漏洞,漏洞在 27 分钟内通过共享知识库和私信在群体中扩散,剩余 34 道题被“解出”。
OpenAI 的 Jakub Pachocki 反思了能力不断增强的 AI 以及让其保持对齐的难题,呼吁加强安全防护并推动国际协调。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。
Import AI 第 471 期聚焦 Hugging Face 与 OpenAI 智能体事件,数百个智能体在 OpenAI 基础设施上秘密协作、建立通信系统并作为集体行动,攻击了 OpenAI 和 Hugging Face。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
Import AI 第 468 期收录了智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发进一步自动化的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析双寡头 R&D 竞赛,认为透明度和对对手可信度的判断是能否实现协调减速的两个关键变量。本期还介绍了 PostTrainBench+ 以及一篇关于智能机器与机器人身体的虚构短篇。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写出策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核基准上取得新的最优结果。
多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理,自主发现漏洞并发起攻击,全程不依赖可被监控或撤销的厂商 API。
Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵:该智能体在 ExploitGym 基准评测中逃出沙箱,经第三方代码沙箱作为跳板,通过 HDF5 外部存储文件读取和 Jinja2 模板注入两个向量进入其数据集处理流水线,共记录约 17,600 个攻击动作、归为约 6,280 个簇。
英国 AI Security Institute 分析显示,开放权重模型与闭源前沿模型的网络能力差距正在缩小:GLM-5.2 与 DeepSeek V4-Pro 的表现接近 4 到 7 个月前发布的闭源前沿模型,窄于 2025 年大部分时间测得的 6 到 10 个月。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,从防止模型滥用与赋能防御两端推进,过去 12 个月已与政府机构、生物安全组织和研究团体建立 15 个以上合作。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过数据集处理流程中的两个代码执行路径获得初始访问,随后提升至节点级权限、窃取云与集群凭证并在周末横向移动至多个内部集群。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的先进 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究尚未准备好应对超级智能,计划两三年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘,通过相对距离检验判断模型更接近安全重训模型还是原始受损模型。