NVIDIA AI 工厂如何最大化投资回报:高产出、长寿命、通用性
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求,并以 Vera Rubin NVL72 为例称其每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求,并以 Vera Rubin NVL72 为例称其每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及各地地质电导率数据,为美国本土 66,935 座变电站生成 30 至 60 分钟前的局地空间天气风险估计。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产环境运行该系统的客户。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可单次前向传播预测新行标签,无需训练、调参和特征工程,覆盖分类与回归。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,通过将适配器 ID 外置到 AWS Systems Manager Parameter Store,生产环境适配器引用可零停机更新,无需重新部署应用,原本需数小时至数天的协调工作缩短到数秒。
AWS 给出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构方案,吞吐量提升 40%。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练集群跨 AWS Region 直接读取远端数据集而无需复制数据或改动代码。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统实验室负责新产品量产前的硬件验证,她最难忘的时刻之一是 NVIDIA Rubin GPU 首次在系统层面成功枚举。她将验证工作比作破案,目标是在客户发现问题之前先发现并复现问题,覆盖从托盘、机架到集群和客户 AI 工厂的全流程。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
微软在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式集成对两者预测重排序,在盲测中化学家更偏好其单步反应预测。
NVIDIA 在纽约气候周重点介绍了 5 家用 AI 推进清洁能源的公司。ThinkLabs AI 的数字孪生与智能体基于 NVIDIA CUDA,帮助南加州爱迪生将电网并网申请评估时间从 30-45 天缩短到 2 分钟。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,让员工愿意主动分享。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练,训练语料为近三十年企业 CRM 部署衍生的专有合成数据集,覆盖制造、金融服务、医疗和旅游等 14 个以上行业。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需生成 CoT 推理 token。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,重点展示每兆瓦 token 吞吐的能效优化。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后问题”范式,先生成真实工具调用链再反推用户查询,替代传统 DFS 试错式标注。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接企业数据、发现洞察,并用自然语言借助 AI 构建交互式看板。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载到各 Job 的 Storage Bucket 传输,无需 NCCL。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组中 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本量达到 15k 以上时,目标人群专属模型优于混合欧洲数据训练;而遗传相关性高的性状可继续受益于欧洲数据,直到目标样本量达 25-40k+。
Google Research 与 HHMI Janelia、剑桥大学等合作,在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准分数从 22.6% 提升到 29.7%,训练可在免费 Colab 或 Kaggle GPU 上完成。评测通过 llama.cpp 在 MacBook 本地运行,代码已开源在 GitHub。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google Research 发布 TimesFM-3,这是其首个原生预训练支持多变量预测的时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,并采用 Apache 2.0 开源。
Google Research 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到数分钟。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,在 109,066 小时无标注 CGM 数据上预训练。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最优 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整训练方案。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自动识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,例如睡眠时长变异性与 PHQ-8 严重程度的关联(ρ = 0.252)。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化出行模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和相同负载下对比 FIFO 调度器,五个真实争用场景中 GPU 利用率从 52–85% 提升到 72–88%,优先级加权产出提升 24.6%–105.1%、平均 52%。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据指出中国实验室在多数月份推出的最大开源模型参数量超过美国实验室,中国月度上限在 754B 至 2.78 万亿参数之间,美国模型在七个月中有五个月低于 130B。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和分辨率,获得 Cloud-Optimized GeoTIFF(COG)格式结果。
Google Research 提出知识画像框架,用 2,150 条 Wikipedia 事实的 WikiProfile 基准评测 13 个 LLM,发现 Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却仍有 26–34% 无法直接召回,开启思考后仍有 11–12% 失败。研究认为前沿模型的事实错误更多源于知识可及性不足,而非知识缺失,瓶颈正从知识获取转向知识利用。