Hugging Face 发布 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,把评测周期从数周投票缩短到数小时。榜单以 Qwen3 ASR 计算 WER/CER,在 H200 GPU 上测 RTFx 与 TTFA,并用 WavLM 嵌入算说话人相似度 SIM,支持多语言与声音克隆对比。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,把评测周期从数周投票缩短到数小时。榜单以 Qwen3 ASR 计算 WER/CER,在 H200 GPU 上测 RTFx 与 TTFA,并用 WavLM 嵌入算说话人相似度 SIM,支持多语言与声音克隆对比。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组中 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
Google Research 与 HHMI Janelia、剑桥大学等合作,在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,印地语成为该多语言榜单上的首个印度语言。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三项测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio 日志,覆盖 2226 篇论文,约占大会论文的三分之一。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》。
多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理,自主发现漏洞并发起攻击,全程不依赖可被监控或撤销的厂商 API。
微软研究院提出 Echoverse,为 computer-use 智能体构建十二个训练世界,包括十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与评分器。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核知识迁移到 Apple Silicon。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成人类需长时间投入的编程任务的能力,该基准 4 月首次公布,此次补充测试后正式发布。
Google Research 发布 WAXAL 大规模开放语音数据集,初期覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,以 CC-BY-4.0 许可开放。