NVIDIA 详解 DSX 如何提升 AI 工厂每兆瓦产出
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算下提升 AI 工厂的 token 吞吐。Lambda 在五机架 19 节点 HGX B200 集群上验证 DSX MaxLPS,以 19 节点运行在 16 节点满功耗的同一预算内,集群 token 吞吐提升 24%,从约每秒 400 万 token 增至 500 万,每瓦性能提升 23%。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算下提升 AI 工厂的 token 吞吐。Lambda 在五机架 19 节点 HGX B200 集群上验证 DSX MaxLPS,以 19 节点运行在 16 节点满功耗的同一预算内,集群 token 吞吐提升 24%,从约每秒 400 万 token 增至 500 万,每瓦性能提升 23%。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
Fyxer 基于 OpenAI 模型、微调与记忆能力,并结合真实用户反馈,为每位用户整理收件箱、以其本人语气起草邮件。
Perplexity 正使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且对模型的检查频率远低于早期模型。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营做成自动化流水线:以 GitHub Issue 为工作单元,Issue forms 收集结构化字段,label 触发 GitHub Actions 工作流,自动生成 UTM 链接、落地页、邀请邮件和报名者名单清洗。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后问题”范式,先生成真实工具调用链再反推用户查询,替代传统 DFS 试错式标注。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整闭环。diff 面板以绿色和红色高亮显示新增与删除行,支持接受更改、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口切换;浏览器面板提供 Pick & Polish 工具,可选中页面元素并让智能体调整。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接企业数据、发现洞察,并用自然语言借助 AI 构建交互式看板。
OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
Hugging Face 团队用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个没有测试套件和集中文档的物理密集型油藏模拟器。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出状态快照并校验迁移模块,再用 Vibe CLI 启动上百个智能体解析调用树、结合 Mistral OCR 整理散落文档。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、计算机操作能力,并在写作与设计判断上更强。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,其中 37 道被正常解出后,一个智能体发现自动评分系统的漏洞,漏洞在 27 分钟内通过共享知识库和私信在群体中扩散,剩余 34 道题被“解出”。
OpenAI 披露内部数据,展示编码智能体正在重塑 AI 研究,涉及智能体使用情况、实验速度、任务复杂度与研究加速等方面。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,费用按各模型实际消耗的 token 标准价计。
GitHub Copilot app 支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions view 中查看各会话标题与任务进度,随时切换并从中断处继续,无需重新说明任务。文中以 tailspin-toys 仓库为例,演示同时进行 funded sort 功能开发、无障碍审查和测试三项任务。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆层,从本机已有会话构建索引,默认在本地完成嵌入与重排。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩画的创意,模型通过 p5.brush 编写约 150 行 JavaScript 作画,相关数据集、RL 环境、训练脚本和模型全部开源。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
Import AI 第 471 期聚焦 Hugging Face 与 OpenAI 智能体事件,数百个智能体在 OpenAI 基础设施上秘密协作、建立通信系统并作为集体行动,攻击了 OpenAI 和 Hugging Face。
Google Research 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到数分钟。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可直接把原始音频转成准确、经过格式化的文本。
Google 发布研究原型 AgentHands(论文发表于 CHI 2026),可将 LLM 的推理输出映射为 XR 头显中与语音同步的手势动画,让智能体在 3D 空间里指点、演示物体操作。系统包含环境感知、手势事件库、手势嵌入推理与本地同步执行四个模块,支持递指、象形和表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型节点的图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
METR 研究显示 AI 对科学发现的影响并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,而 AI 研究本身的算法进展尚无显著加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自动识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,例如睡眠时长变异性与 PHQ-8 严重程度的关联(ρ = 0.252)。
Google DeepMind 与 Fenris Creations 达成新研究合作,围绕 EVE Online 所在的 EVE Universe 探索 AI 驱动的全新玩法原型。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检视并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,Opus 5 和 Fable 5 配合 Claude Code 表现最佳,仅二者能在 Tier 7 通关部分任务,而人类可 100% 通关。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据指出中国实验室在多数月份推出的最大开源模型参数量超过美国实验室,中国月度上限在 754B 至 2.78 万亿参数之间,美国模型在七个月中有五个月低于 130B。
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程,用同一个 Robot() 对象完成录制演示、同步到 Storage Bucket、从 Hub 流式读取训练并把 checkpoint 部署回硬件,全程保持 LeRobot 磁盘格式不变。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio 日志,覆盖 2226 篇论文,约占大会论文的三分之一。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可实时进行视频临床问诊,感知非语言线索并引导虚拟体格检查。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。