Aniimo 首发登陆 GeForce NOW,007 First Light 新增路径追踪
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 及新支持的 Firefox 浏览器上串流游玩。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 及新支持的 Firefox 浏览器上串流游玩。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调节用电。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单个八 GPU 节点上仅用两天完成训练。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算下提升 AI 工厂的 token 吞吐。Lambda 在五机架 19 节点 HGX B200 集群上验证 DSX MaxLPS,以 19 节点运行在 16 节点满功耗的同一预算内,集群 token 吞吐提升 24%,从约每秒 400 万 token 增至 500 万,每瓦性能提升 23%。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,重点展示每兆瓦 token 吞吐的能效优化。
费城儿童医院(CHOP)基于 NVIDIA 联合创办的开源医学影像框架 MONAI,将儿童心脏建模从耗时四小时缩短到数秒,并已用于复杂心室间隔缺损手术规划。CHOP 正与 NVIDIA 合作,把基于 NVIDIA Warp 的开源物理引擎 Newton 接入 SlicerHeart,将心脏器械仿真从最长四小时降至近实时。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营做成自动化流水线:以 GitHub Issue 为工作单元,Issue forms 收集结构化字段,label 触发 GitHub Actions 工作流,自动生成 UTM 链接、落地页、邀请邮件和报名者名单清洗。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于满足 ChatGPT 在线存储的规模化需求。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,同时保有数据和由此产生的智能的所有权。Cloudera 平台上运行着 30 exabytes 的客户管理数据。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载到各 Job 的 Storage Bucket 传输,无需 NCCL。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,费用按各模型实际消耗的 token 标准价计。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,从零以掩码离散扩散目标训练,不依赖预训练视觉塔或因果语言模型。
Hugging Face WebAI 团队发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的轻量库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Papers with Code 的论文搜索采用混合检索架构,由 Hugging Face Jobs 批量生成嵌入向量、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前覆盖 arXiv 与 Daily Papers 的逾 11 万篇论文。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和相同负载下对比 FIFO 调度器,五个真实争用场景中 GPU 利用率从 52–85% 提升到 72–88%,优先级加权产出提升 24.6%–105.1%、平均 52%。
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程,用同一个 Robot() 对象完成录制演示、同步到 Storage Bucket、从 Hub 流式读取训练并把 checkpoint 部署回硬件,全程保持 LeRobot 磁盘格式不变。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Baseten 成为 Hugging Face Hub 新增的 Inference Provider,首批上线对话与文本生成任务,可访问 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是 GPU 利用率:GPU 按日历小时计费,却只在计算小时产出,与航空业飞机停场成本结构相同。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
IBM Research 在 Hugging Face 博客分享将模型路由构建进智能体系统的经验,指出多数路由系统把模型选择当成分类问题,实际却是系统优化问题。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Atal Tinkering Labs 教育者提供 24/7 备课与培训助手,首批覆盖 100 所试点学校。
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,用 profiler 追踪 attention 的实现细节。文章对比了朴素 attention 与原地(in-place)masking 版本,将 masked_fill 改为 masked_fill_ 后,每次前向传播可减少一个 GPU Memcpy kernel。
Mistral Studio 现已向客户提供 Prompts 和 Skills 的集中管理系统,每个资产都具备版本记录、明确归属和可追溯性。不可变版本、回滚、分类标签和审计日志等功能让 AI 行为可治理、可发现,并通过 Observability 将生产输出追溯至对应版本。Skills 可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是同一受治理资产。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐速度。该后端通过 torch.fx 做静态图分析、用 ast 重写源码,在运行时动态应用推理相关的层融合,从而匹配自定义代码的性能。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,即可一键进入 SageMaker Studio,模型已预加载、环境自动配置。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至替代路线,在美国 10 座城市测试六个月。结果显示目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型每周更新、一键部署到 Foundry 托管 GPU 平台。
随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,UC Berkeley 的 Aditya G. Parameswaran 等人提出智能体时代数据系统的三大方向:面向智能体(For Agents)、由智能体运行(Of Agents)、由智能体构建(By Agents)。
Hugging Face 与 SkyPilot 联合发布集成,用户可用一个 hf:// URL 和已有的 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。
Hugging Face 为 Kernels 项目推出名为 "kernel" 的新仓库类型,并引入可信发布者与代码签名机制,默认只加载可信发布者的 kernel,加载其他来源需显式设置 trust_remote_code=True。
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已随 Pixel 9 和 10 系列推出。
Google Research 提出线性弹性缓存,将缓存页面淘汰建模为滑雪租赁问题,用浅层决策树预测每个页面的 TTL,动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境运行数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 下降约 5%,实际 I/O 成本影响仅 0.5%。该方案还在多个公开缓存 trace 上做了验证。