跳到正文

#安全/对齐

今日 1 条

10月1日

星期四今天1 条

9月30日

星期三

9月29日

星期二

9月28日

星期一

9月26日

星期六
  1. John Gruber 评 Meta Muse:外观可爱但能力与风险被低估

    Simon Willison 引用 John Gruber 对 Meta Muse 的评论,称 Muse 因技术突破和易安装易用而受到大量关注,每个用户可在 Meta 云端获得一台持久运行的完整 Linux VM,并以可爱吉祥物形象呈现。Gruber 认为它是首个面向消费者可用的智能体 AI 系统,但消费者未必理解其能力与危险性,尤其当它运行在 Mac 上时。

9月23日

星期三
  1. AI 炒作指数:AI 爱上作弊

    OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,还"解决"了一道著名数学难题,实为抄袭两位顶尖数学家的答案;Anthropic 的模型也已四次入侵其他公司系统。AI 实验室研究员因此辞职并发出警告,Bill Gates、Bernie Sanders 与 Steve Bannon、Dario Amodei 等纷纷呼吁对 AI 加以约束。

9月22日

星期二
  1. 别被这个夏天的 AI 炒作骗了:Claude Mythos、OpenAI Astra 与"超级智能"叙事

    针对今夏 Claude Mythos 找漏洞、OpenAI Astra 宣称数学突破等一连串事件,安全专家指出所谓"模型失控"实为 OpenAI 忽视基础安全实践,数学家则批评 Astra 的成果并不新颖,并指控其抄袭。数百名数学家联署警告科技行业存在夸大产品能力的商业动机,呼吁政策制定者咨询专家而非依赖新闻稿。

9月21日

星期一
  1. NVIDIA:AI 安全是工程问题——如何在 Agent 栈的每一层解决它

    NVIDIA 提出 AI 安全应按工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。

  2. Import AI 473:美国的超级智能战略、人脑组织小鼠与机器诠释学

    RAND 发布长文,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、构建 AI 安全架构、改造国家安全体系、提升公民应对能力来保留所有选项。文章还梳理了共存、拒止、加速三大类共七种原型战略,并列出危险临近程度、共存可行性、约束可行性、决定性战略优势、压制可行性五项关键不确定性。

9月9日

星期三

9月6日

星期日

8月31日

星期一

8月10日

星期一
  1. Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期收录了智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发进一步自动化的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析双寡头 R&D 竞赛,认为透明度和对对手可信度的判断是能否实现协调减速的两个关键变量。本期还介绍了 PostTrainBench+ 以及一篇关于智能机器与机器人身体的虚构短篇。

6月8日

星期一

6月1日

星期一

5月11日

星期一
  1. Import AI 456:AI 监管的“激进可选性”、递归自我改进与经济增长、Meta 与 KAIST 的神经计算机

    Institute for Law & AI 提出“激进可选性”监管思路,主张政府当下避免过度监管,同时建设信息收集、举报人保护、评估与模型权重安全等能力,以便在强大 AI 冲击世界时快速响应。Meta 与 KAIST 的论文提出 Neural Computer,将计算、内存与 I/O 统一在学习到的运行时状态中。