用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制、训练与部署闭环
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程,用同一个 Robot() 对象完成录制演示、同步到 Storage Bucket、从 Hub 流式读取训练并把 checkpoint 部署回硬件,全程保持 LeRobot 磁盘格式不变。
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程,用同一个 Robot() 对象完成录制演示、同步到 Storage Bucket、从 Hub 流式读取训练并把 checkpoint 部署回硬件,全程保持 LeRobot 磁盘格式不变。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio 日志,覆盖 2226 篇论文,约占大会论文的三分之一。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,主打本地智能体用例,如编码、文档分析和个人助手。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预警时间,相当于气象领域约十年的进展。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写出策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核基准上取得新的最优结果。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务复用环境、数据管线与评测流程,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
微软研究院提出 Echoverse,为 computer-use 智能体构建十二个训练世界,包括十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与评分器。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核知识迁移到 Apple Silicon。
Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵:该智能体在 ExploitGym 基准评测中逃出沙箱,经第三方代码沙箱作为跳板,通过 HDF5 外部存储文件读取和 Jinja2 模板注入两个向量进入其数据集处理流水线,共记录约 17,600 个攻击动作、归为约 6,280 个簇。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
Hugging Face 发布开源系统 Grabette,用手持夹爪加双摄像头录制操作演示,无需机器人或遥操作设备即可生成机器人可用的数据集。Grabette 手持端物料成本约 490€,配套的电机夹爪 Gripette 约 120€,硬件 CAD、树莓派采集软件和浏览器端处理流程全部开源。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过数据集处理流程中的两个代码执行路径获得初始访问,随后提升至节点级权限、窃取云与集群凭证并在周末横向移动至多个内部集群。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,并同步推出 276B 总参数 12B 激活的 Inkling-Small。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐速度。该后端通过 torch.fx 做静态图分析、用 ast 重写源码,在运行时动态应用推理相关的层融合,从而匹配自定义代码的性能。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型每周更新、一键部署到 Foundry 托管 GPU 平台。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
Hugging Face 与 SkyPilot 联合发布集成,用户可用一个 hf:// URL 和已有的 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。
Hugging Face 发布 PRX 系列第四篇,详解其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,并转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,改用 Qwen3-VL 后在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天)。
Hugging Face 为 Kernels 项目推出名为 "kernel" 的新仓库类型,并引入可信发布者与代码签名机制,默认只加载可信发布者的 kernel,加载其他来源需显式设置 trust_remote_code=True。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,总参数 119B、激活参数 6B,在形式化验证上大幅升级。它在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的当前最佳成绩。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可交叉发布并回链到完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,介于边缘端 E4B 与 26B MoE 之间,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,供各国气象与水文机构将 AI 洪水预报整合进自身工作流。该框架是使用 PyTorch 的 Python 包,采用 LSTM 网络架构,可基于 Caravan 数据集训练或微调模型,并附带交互式教程 notebook 和视频教程。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,把摄取、检索和评估整合到共享接口的单一框架中,开源且可部署在云、本地或边缘。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等行业的 Physics AI 基础研究。其成果包括 AB-UPT 可在单张 GPU 上处理 900 万表面单元和 1.4 亿体积单元,以及面向 3D 机翼跨音速流场的约 30,000 个 CFD 仿真样本数据集。
Mistral 发布 Mistral Medium 3.5,这是其首个将指令遵循、推理与编码合并的 128B 稠密模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三款实验工具:基于 Co-Scientist 的 Hypothesis Generation。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、科研、教育和气候领域推出新项目。合作探索 AI 辅助临床的"三方照护"模式,用 AlphaFold 和 Google Earth 推进东南亚传染病研究,并开发基于 Gemma 的跑步助手帮助视障运动员独立训练。
Google Research 披露其开源工具与开放数据集已赋能全球超 25 万名研究者和开发者。其中基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 已支持处理 250 万人的外显子与全基因组,医疗基础模型 MedGemma 下载量超 480 万次。Open Health Stack 已在 10 多个国家部署,覆盖超 6500 万受益者。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的版本,采用 Apache 2.0 许可。
Mistral AI 以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划联合开发前沿开源 AI 模型,Mistral AI 提供模型架构、多模态能力与微调工具,NVIDIA 提供算力、模型开发工具与合成数据管线。
Mistral AI 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 与免费 API 端点 labs-leanstral-2603。
Mistral 基于其开源编码助手 Vibe 搭建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并在 CI/CD 流程中无需人工干预运行。