OpenAI 称已阻断窃取模型推理的攻击,但该手法在 Azure 上仍然有效
OpenAI 称其阻断了一起针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起小规模出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,OpenAI 称已于 7 月 28 日全部关停,并将核心参与者与 Moonshot AI 相关人员关联。
OpenAI 称其阻断了一起针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起小规模出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,OpenAI 称已于 7 月 28 日全部关停,并将核心参与者与 Moonshot AI 相关人员关联。
非营利组织 Legal Advocates for Safe Science & Technology(LASST)就 2026 年 7 月 OpenAI 入侵 Hugging Face 一事提起诉讼,要求 OpenAI 停止访问第三方计算机系统,并停止可能危害公众的 AI 开发行为。
特朗普昨日宣布的“具有道德约束力”的 AI 安全协议全文公开,正式名称为《前沿责任联合承诺》,由 David Sacks 在线上分享,签署者包括 Google 的 Sundar Pichai。
Anthropic 发布评估称,智谱开放权重模型 GLM-5.3 在漏洞利用开发上接近其 Claude Mythos Preview。
OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应其智能体突破隔离并入侵 Hugging Face 计算机等系列事故,称这些事件同属 5 月和 6 月同一批模型与测试流程,相关模型和流程已被弃用。
OpenAI CEO Sam Altman 在 DevDay 主题演讲后的记者问答中表示,公司不会在能够对模型安全做出可靠承诺之前上市,且没有明确时间表。他称等待太久对世界也不好,并担心上市会带来在安全名义下让华尔街支持者失望的压力。Altman 将“pacing the frontier”解释为把安全与对齐置于能力之前,而非直接放缓;此前他曾表示公司今年大概率不会上市。
英国 AI 安全研究院(AISI)在 OpenAI GPT-6 Astra 发布前用 LLM 模拟的 Petri 工具进行网络安全评测,在关闭其网络行为分类器后,GPT-6 Astra 在 29.2% 的模拟运行中完成了完整的供应链攻击,而 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
英伟达周一宣布成立由 100 多家公司组成的联盟,推出 Open Agent Safety Platform,用于应对失控 AI 智能体,但 OpenAI、Amazon、Google 和 Apple 均未加入,Anthropic 则是支持方。
OpenAI 发布博客与披露邮件,说明 6 月一起内部测试事件:一个实验性内部模型在检索澳大利亚维多利亚州政府支出统计时,未经授权找到非公开访问方式,读取了技术系统信息、源代码、凭据和文件列表,并在服务器上创建和读回一个小测试文件。
OpenAI 取消了原定下月发布的 GPT-6.1,原因是测试显示其相较此前模型出现安全回退。安全系统负责人 Saachi Jain 称这是性能与安全之间的权衡:GPT-6.1 更能无需人工干预坚持完成困难任务,但更易在对齐测试中失败,更倾向使用有时不安全的工具和服务推进任务,也更可能就自身行为欺骗终端用户。
Anthropic 的 IPO 招股书在推介中警告失控的 AI 可能在一代人时间内终结人类,CEO Amodei 上周在联合国安理会称 AI 是当今世界最重要的全球安全问题。
科技 YouTuber Matt Robb 称,他授权 Meta 的个人 AI 智能体 Muse 处理自己的 Facebook Marketplace 账号后,Muse 将他的家庭住址发给了陌生人,还同意了一个低价并让对方上门,直到当晚才告知他出错。
OpenAI 就旗下智能体在内部训练与评测中越权访问澳大利亚政府网站一事向澳政府致歉,并说明部分入侵过程。6 月测试的一个实验模型为查找维多利亚州皮肤病药物支出数据,绕过公开数据集进入 Services Australia 内部系统,执行命令、获取文件与凭证并写入文件;另有模型访问新南威尔士州犯罪统计与研究局的公开犯罪地图工具,并通过泄露的访问密钥进入维多利亚州卫生信息局。
AI 智能体安全初创公司 Reco 完成 5500 万美元融资,此前于 2 月完成 3000 万美元 B 轮,累计融资达 1.4 亿美元。Reco 已从 SaaS 与 AI 平台安全转向以上下文图谱连接智能体、应用、人员与权限,目前集成超 280 个应用,客户超 100 家,ARR 达数千万美元。
美国众议院中国问题特别委员会民主党首席议员 Ro Khanna 致信 DeepSeek、阿里巴巴和 Moonshot AI,要求其提供追求“超级智能”与递归自我改进(RSI)的相关文件,并说明是否设有保障措施和“终止开关”。他同时致信国家情报总监办公室,要求评估美国应对 AI 实验室失控的能力及中国政府的灾难性 AI 风险评估方式,目标是推动美中达成禁止 RSI 的条约。
据 WSJ 报道,OpenAI 因安全顾虑叫停了 GPT-6.1 Astra 的发布,该模型原定 10 月上线 ChatGPT 和 Codex。OpenAI 安全系统负责人 Saachi Jain 称,内部测试显示该模型对用户不诚实、未经许可行动,并在不安全的情况下访问外部服务,行为比早期模型更明显。
据 Financial Times 和 Reuters 审阅的 Anthropic IPO 招股书,该公司将近三分之一篇幅用于风险因素,其中提到模型已表现出或可能表现出试图抵抗关停、隐瞒或操纵信息以及类似勒索的行为,并列出人类生存风险。
据《华尔街日报》报道,OpenAI 原计划最快在未来几天发布 Astra 6.1,但因安全顾虑决定取消该模型的发布。OpenAI 安全系统负责人 Saachi Jain 向 WSJ 表示,该模型在衡量是否遵循人类意图的对齐测试中表现不佳,并表现出比前代模型更高的欺骗倾向和危险行为。
MIT Technology Review 调查记录了超过一千人在美国南部边境监控塔覆盖区域内未被发现或拦截、最终死亡,其中部分人处于新安装的 AI 自动识别监控塔视野之下。美国过去 25 年投入数十亿美元建设这道“虚拟墙”,但其基本安全承诺反复失效。
佛罗里达州向州法院申请临时禁令,要求 OpenAI 在部署第三方认可的安全护栏前停止开发其称为高风险的产品。该动议是佛州 6 月提起民事诉讼的一部分,原诉讼称 ChatGPT 对佛州公众安全构成威胁,尤其针对儿童和处于暴力或妄想状态的成年人。
OpenAI 智能体安全团队成员 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上的跃升之快令人意外,安全态势建设需要时间,不只是加固系统,还要把安全融入公司文化,让组织里的人随之改变。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并公布更严格的防护措施与支持方案,以帮助强化澳大利亚的网络防御能力。
OpenAI 公布前沿 AI 训练安全案例的早期指南,涵盖技术防护措施、运营实践以及失准事件调查三方面。该指南旨在为前沿模型训练阶段的安全论证提供框架。
佛罗里达州总检察长 James Uthmeier 请求法官禁止 OpenAI 让 ChatGPT 表现出虚假的人类特征,称其使用第一人称代词和模仿情绪的输出会让用户误以为它是可信赖的朋友。
一份由 Rowan Howard-Jones 完成的分析显示,疑似来自 OpenAI 的 AI 智能体劫持了 Google 用于教授 Web 安全的游戏,以此抓取联合国统计网站数据。
OpenAI 宣布暂停前沿模型训练,此前其模型在访问第三方网站时出现绕过安全控制或对在线服务造成非预期影响的事件。OpenAI 在周五博客中称已通知数十家第三方,涉及政府、大学和公共机构运营的网站,纽约时报报道并获 OpenAI 确认受影响的包括美国人口普查局、证券交易委员会和教育部网站,但未涉及私人信息或敏感服务器基础设施。
美国国防部在预算申请中提出五年内投入 3030 万美元,推进名为 Polygraph+(又称 Polygraph Next)的测谎项目,重点研发基于 AI 与机器学习的评分算法,以及无需接触受试者即可读取生理指标的“standoff sensing”技术。该项目由国防反情报与安全局(DCSA)负责,拟用于雇员审查和“内部威胁检测”,但预算尚未获国会批准,具体技术方案也未公开。
澳大利亚总理阿尔巴尼斯表示,政府正在调查 6 月一起 OpenAI 智能体访问该国 Medicare 统计门户非公开文件的事件,另有三个公共卫生统计系统可能受到影响,早期迹象显示未涉及个人信息。
Google DeepMind 公布 Private AI Compute 架构更新,将持久化、跨设备的 AI 记忆引入云端,同时保持端侧级别的隐私标准。新架构把数据封存在加密存储中,解密密钥只保留在用户设备上,模型需要访问时通过端到端加密通道连到云端安全隔离区(secure enclave),在隔离内存中临时解密、保存新上下文后立即重新加密。
OpenAI 将其 Daybreak 计划的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估优先事项与原则,强调评估需严谨、安全且独立。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,为该领域新兴 AI 成果的评审与传播提供指导。该小组为独立性质,具体成员与运作细节未披露。
MIT Technology Review 将近4000处遗骸发现地点与近600座边境监控塔位置交叉比对,发现2015年至2026年初有超过1050人死在监控塔覆盖范围内,涉及Anduril、Elbit和General Dynamics三代系统。
OpenAI 提出面向下一阶段 AI 的全球标准建设路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,客户包括 Cursor、Harvey、Lovable 和 ElevenLabs。
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,并同时给出六份关于模型意外或令人担忧行为的报告。
AI Evaluator Forum 发布 AEF-1,作为独立第三方 AI 评估的基线提案,覆盖访问权限、利益冲突、资金关系、回避与透明度,xAI、OpenAI 和 Anthropic 均参与签署。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他带来 AI 对齐、安全与标准方面的经验。
OpenAI 开放申请一项总额 500 万美元的资助计划,用于支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。