Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,通过投机解码在不改变输出质量的前提下提速,端侧解码最高 3.13x、H100 上最高 2.66x,端到端最高 2.62x 和 2.27x。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需生成 CoT 推理 token。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,重点展示每兆瓦 token 吞吐的能效优化。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩画的创意,模型通过 p5.brush 编写约 150 行 JavaScript 作画,相关数据集、RL 环境、训练脚本和模型全部开源。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
微软研究院推出 MindTopo 基准,用于评估多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧保留结构关系时有用,跨多步操作后常改变拓扑或违反任务约束。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Google Research 发布 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核知识迁移到 Apple Silicon。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,并同步推出 276B 总参数 12B 激活的 Inkling-Small。
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,用 profiler 追踪 attention 的实现细节。文章对比了朴素 attention 与原地(in-place)masking 版本,将 masked_fill 改为 masked_fill_ 后,每次前向传播可减少一个 GPU Memcpy kernel。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,总参数 119B、激活参数 6B,在形式化验证上大幅升级。它在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的当前最佳成绩。
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已随 Pixel 9 和 10 系列推出。
Google Research 在 COLM 2026 发表的论文揭示,推理轨迹能解锁 LLM 原本无法召回的事实性知识,即使问题只是简单的单跳问答。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:生成额外 token 充当"计算缓冲",以及"事实启动"——模型先输出相关事实为正确答案做语义预热。研究同时指出,模型自生成中间事实可能带来幻觉风险。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 多由外部预设并行结构,未教会模型自适应行为。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。
Google 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评家质量检查四个步骤,从零构建数据集,无需种子数据。
Google Research 发布 TurboQuant 压缩算法,可在不损失模型精度的情况下把 KV cache 量化到 3 bit,无需训练或微调,并配套提出 QJL 与 PolarQuant 两种方法。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的版本,采用 Apache 2.0 许可。
Mistral AI 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 与免费 API 端点 labs-leanstral-2603。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。
伯克利 AI 研究提出一种基于分治(divide and conquer)的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
Mistral 为 Le Chat 推出一批新功能,包括预览版 Deep Research 模式、由 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的图像编辑。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和面向企业的 Magistral Medium。