OpenAI 称已阻断窃取模型推理的攻击,但该手法在 Azure 上仍然有效
OpenAI 称其阻断了一起针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起小规模出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,OpenAI 称已于 7 月 28 日全部关停,并将核心参与者与 Moonshot AI 相关人员关联。
OpenAI 称其阻断了一起针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起小规模出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,OpenAI 称已于 7 月 28 日全部关停,并将核心参与者与 Moonshot AI 相关人员关联。
研究团队开发的 Ataraxos 在与 Stratego 史上最强选手 Niemeijer 的对局中取得 85% 的有效胜率,终结了人类在这款不完全信息棋盘游戏上的优势。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind Program 的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
Google 发布新前沿模型 Gemini 4 Argon,在部分基准上超过 OpenAI 和 Anthropic 的竞品,但未取得明显领先。该模型先面向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才向开发者、企业和消费者推出,尚未公布日期;介绍性价格为每百万输入 token 2 美元、输出 token 10 美元,缓存输入便宜 95%。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,通过投机解码在不改变输出质量的前提下提速,端侧解码最高 3.13x、H100 上最高 2.66x,端到端最高 2.62x 和 2.27x。
TypeSafe AI 上周发布 Jev,称其为“System One 模型”这一新类别模型的首个实例,作者更认同“决策模型”这一叫法。Jev 接受文本输入,输出的是对应类别、是/否问题、评分的浮点数及置信度,只按输入计费,首个模型输入价格为每百万 token 0.042 美元。作者认为它适合分类任务,如垃圾邮件检测、打标签、排序,也尝试用于搜索重排,并指出它不擅长数字、日期和对抗性内容。
TypeSafe AI 创始人兼 CEO Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,称其为面向软件消费的 System One 大模型。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
TypeSafe 发布 Jev,一个用 RLCD 训练、只做决策/分类/路由/打分的非自回归模型,官方称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 不计费。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需生成 CoT 推理 token。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,重点展示每兆瓦 token 吞吐的能效优化。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩画的创意,模型通过 p5.brush 编写约 150 行 JavaScript 作画,相关数据集、RL 环境、训练脚本和模型全部开源。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,Opus 5 和 Fable 5 配合 Claude Code 表现最佳,仅二者能在 Tier 7 通关部分任务,而人类可 100% 通关。
微软研究院推出 MindTopo 基准,用于评估多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧保留结构关系时有用,跨多步操作后常改变拓扑或违反任务约束。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Google Research 发布 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核知识迁移到 Apple Silicon。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,并同步推出 276B 总参数 12B 激活的 Inkling-Small。
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,用 profiler 追踪 attention 的实现细节。文章对比了朴素 attention 与原地(in-place)masking 版本,将 masked_fill 改为 masked_fill_ 后,每次前向传播可减少一个 GPU Memcpy kernel。
Import AI 第 464 期汇总多项进展:Fable 在 KernelBench-Mega 上写出被维护者称为首个真正且最快的 megakernel,在 RTX PRO 6000 Blackwell 上以 CUDA 实现 18.71 倍加速,对比 Claude Opus 4.8 的 14.4 倍、GLM-5.2 的 11.14 倍和 GPT 5.5 的 4.34 倍。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,总参数 119B、激活参数 6B,在形式化验证上大幅升级。它在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的当前最佳成绩。
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已随 Pixel 9 和 10 系列推出。
Google Research 在 COLM 2026 发表的论文揭示,推理轨迹能解锁 LLM 原本无法召回的事实性知识,即使问题只是简单的单跳问答。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:生成额外 token 充当"计算缓冲",以及"事实启动"——模型先输出相关事实为正确答案做语义预热。研究同时指出,模型自生成中间事实可能带来幻觉风险。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
本期 Import AI 汇总三项研究:伦敦国王学院、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,用 72 个沙盒社会环境测试 RL 模型能否在合规前提下钻制度空子,模型在历史子集上以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 多由外部预设并行结构,未教会模型自适应行为。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。
Google 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评家质量检查四个步骤,从零构建数据集,无需种子数据。
Google Research 发布 TurboQuant 压缩算法,可在不损失模型精度的情况下把 KV cache 量化到 3 bit,无需训练或微调,并配套提出 QJL 与 PolarQuant 两种方法。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的版本,采用 Apache 2.0 许可。
Mistral AI 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 与免费 API 端点 labs-leanstral-2603。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。
伯克利 AI 研究提出一种基于分治(divide and conquer)的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。