Meta 发布开源多模态模型 Muse Glimmer 30B,面向本地智能体场景
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,主打本地智能体用例,如编码、文档分析和个人助手。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,主打本地智能体用例,如编码、文档分析和个人助手。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务复用环境、数据管线与评测流程,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理,自主发现漏洞并发起攻击,全程不依赖可被监控或撤销的厂商 API。
Google Research 发布 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
微软研究院提出 Echoverse,为 computer-use 智能体构建十二个训练世界,包括十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与评分器。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,支持视频理解、多步任务编排与多机器人协作,并可将动作执行交给底层 VLA 模型。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次实现对完整人形机器人的全身控制,并支持双手与夹爪的精细操作。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成人类需长时间投入的编程任务的能力,该基准 4 月首次公布,此次补充测试后正式发布。
Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵:该智能体在 ExploitGym 基准评测中逃出沙箱,经第三方代码沙箱作为跳板,通过 HDF5 外部存储文件读取和 Jinja2 模板注入两个向量进入其数据集处理流水线,共记录约 17,600 个攻击动作、归为约 6,280 个簇。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Google Research 发布研究论文 SymptomAI,用五个不同提问策略的 Gemini Flash 2.0 智能体开展症状问诊与鉴别诊断,共纳入 13917 名受试者。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
英国 AI Security Institute 分析显示,开放权重模型与闭源前沿模型的网络能力差距正在缩小:GLM-5.2 与 DeepSeek V4-Pro 的表现接近 4 到 7 个月前发布的闭源前沿模型,窄于 2025 年大部分时间测得的 6 到 10 个月。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过数据集处理流程中的两个代码执行路径获得初始访问,随后提升至节点级权限、窃取云与集群凭证并在周末横向移动至多个内部集群。
IBM Research 在 Hugging Face 博客分享将模型路由构建进智能体系统的经验,指出多数路由系统把模型选择当成分类问题,实际却是系统优化问题。
Mistral Studio 现已向客户提供 Prompts 和 Skills 的集中管理系统,每个资产都具备版本记录、明确归属和可追溯性。不可变版本、回滚、分类标签和审计日志等功能让 AI 行为可治理、可发现,并通过 Observability 将生产输出追溯至对应版本。Skills 可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是同一受治理资产。
Google Research 与 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家、20 多款 Fitbit 和 Pixel Watch 设备。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型每周更新、一键部署到 Foundry 托管 GPU 平台。
随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,UC Berkeley 的 Aditya G. Parameswaran 等人提出智能体时代数据系统的三大方向:面向智能体(For Agents)、由智能体运行(Of Agents)、由智能体构建(By Agents)。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
Import AI 第 464 期汇总多项进展:Fable 在 KernelBench-Mega 上写出被维护者称为首个真正且最快的 megakernel,在 RTX PRO 6000 Blackwell 上以 CUDA 实现 18.71 倍加速,对比 Claude Opus 4.8 的 14.4 倍、GLM-5.2 的 11.14 倍和 GPT 5.5 的 4.34 倍。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主实验与迭代,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率,测试硬件为双 YAM 机械臂加 RTX 5090 工作站。GPT-5.5(Codex)与 Opus 4.7(Claude Code)表现互有胜负,Kimi-2.6 落后;智能体数量增至 8 个时能更快找到更高分方案。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。
Mistral AI 为 Connectors 推出多项新能力:按 workspace 或组织设置连接器访问权限、开关单个工具的管理员控制已 GA,带连接器作用域的 API key 已 GA。
Google DeepMind 宣布与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,共同开发一款 AI 规划审批原型工具,目标是帮助审批人员将住户规划申请的处理时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的先进 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的全球技术研究资助,聚焦大规模多智能体 AI 系统的群体行为与安全风险。
本期 Import AI 汇总三项研究:伦敦国王学院、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,用 72 个沙盒社会环境测试 RL 模型能否在合规前提下钻制度空子,模型在历史子集上以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 和 Sufficient Context Agent 等角色协作处理多源多跳查询。
Google Research 在 I/O 2026 上发布 Gemini for Science 实验工具套件,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 以及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保持对专有数据和 IP 的控制。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。
Mistral 发布 Mistral Medium 3.5,这是其首个将指令遵循、推理与编码合并的 128B 稠密模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管。
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,目前处于 Public Preview。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并作为 Gemini for Science 的一部分向全球科学家开放。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老逆转研究,它扫描数万篇论文后提出 20 多个可测试的新遗传因子,其中几个经实验室验证能成功驱动细胞进入更年轻状态并改善整体功能。它还能将原本长达六个月的筛选数据分析缩短至几天。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View grounding 能力,用户可通过 Maps 图钉选择美国境内真实地点,再选择风格并描述角色,由 Genie 生成起始位置锚定真实影像的可交互世界。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三款实验工具:基于 Co-Scientist 的 Hypothesis Generation。