跳到正文

#数据/训练

今日 2 条

8月25日

星期二

8月24日

星期一
  1. Import AI 470:机器不应享有权利;用 SPADE 自动生成训练环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学发现的影响并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,而 AI 研究本身的算法进展尚无显著加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月22日

星期六
  1. Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中筛选候选生物标志物

    Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自动识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,例如睡眠时长变异性与 PHQ-8 严重程度的关联(ρ = 0.252)。

8月21日

星期五
  1. 微软 Skala 1.1 发布:训练数据增 2.5 倍,已集成进 CP2K

    微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。

8月19日

星期三

8月18日

星期二

8月17日

星期一

8月14日

星期五

8月13日

星期四

8月12日

星期三
  1. Google Research 研究:召回而非编码是大模型事实性瓶颈

    Google Research 提出知识画像框架,用 2,150 条 Wikipedia 事实的 WikiProfile 基准评测 13 个 LLM,发现 Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却仍有 26–34% 无法直接召回,开启思考后仍有 11–12% 失败。研究认为前沿模型的事实错误更多源于知识可及性不足,而非知识缺失,瓶颈正从知识获取转向知识利用。

  2. 微软研究院推出 CARE-X:面向临床可用的放射学 VLM,融合辅助监督、奖励对齐学习与工具增强测量

    微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。CARE-X 支持生成与双推理两种模式,覆盖病灶有无与否定、定位、多标签分类、导管与管线异常位置检测及 29 个解剖区域定位等任务。

8月10日

星期一

8月6日

星期四

7月31日

星期五

7月30日

星期四

7月26日

星期日
  1. Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月22日

星期三

7月16日

星期四
  1. DharmaOCR 在巴西葡萄牙语 OCR 基准上超越 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过两阶段训练实现领域专精:先以葡萄牙语语料监督微调,再用 DPO 提升推理稳定性。作者认为,尽管新架构不断涌现,专注单一语言的参数集中策略仍构成结构性优势。

7月9日

星期四

7月7日

星期二

7月6日

星期一
  1. PRX Part 4:我们的数据策略

    Hugging Face 发布 PRX 系列第四篇,详解其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,并转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,改用 Qwen3-VL 后在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天)。

7月1日

星期三

6月30日

星期二

6月17日

星期三
  1. Google Earth AI 推出矢量化数据集,用深度学习绘制英国农田细尺度生态特征

    Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星影像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征阈值小于 0.5)区分林地、树丛与树篱。

6月8日

星期一

6月4日

星期四
  1. Google 开源洪水预报水文建模框架

    Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,供各国气象与水文机构将 AI 洪水预报整合进自身工作流。该框架是使用 PyTorch 的 Python 包,采用 LSTM 网络架构,可基于 Caravan 数据集训练或微调模型,并附带交互式教程 notebook 和视频教程。

5月27日

星期三
  1. Mistral 推出物理 AI:面向工业工程加速的基础模型能力

    Mistral 将 Emmi AI 并入后推出物理 AI 基础能力,用于 AI 原生工业工程,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。该模型从几何与边界条件直接预测物理场,单次前向传播在单 GPU 上以秒级完成,而传统 CFD/FEM 仿真每个设计变体需数小时至数周。它面向设计迭代提速,传统求解器仍保留用于验证和边缘场景。

5月23日

星期六
  1. Mistral 收购 Physics AI 公司 Emmi AI

    Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其面向工业企业的 AI 转型服务能力。Emmi AI 成立于奥地利,团队超过 30 名研究人员和工程师,专注大型工程模型,可将多日计算替换为实时仿真并构建数字孪生,其联合创始人及团队将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

5月20日

星期三

5月18日

星期一

5月16日

星期六
  1. 剑桥大学 Clare Bryant 用 Google Co-Scientist 寻找跨物种传染病的分子开关

    剑桥大学教授 Clare Bryant 使用 Google Co-Scientist 研究流感等病原体跨物种传播引发败血症的分子机制,该工具生成并排序的假说帮她锁定了一个此前未关注的蛋白,并逐步细化到具体氨基酸位点。她的团队正构建携带这些氨基酸突变的细胞系验证假说,原本需两到三年的实验工作预计可在六个月内完成。

  2. Google Co-Scientist 助力斯坦福团队发现肝纤维化候选药物

    斯坦福大学医学院 Gary Peltz 团队利用 Google Co-Scientist 筛选抗肝纤维化药物,其提出的 3 个候选药物中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自行挑选的 2 个药物均无效。其中抗癌药 vorinostat 阻断了 91% 可驱动肝瘢痕形成的损伤反应,相关研究已发表于 Advanced Science。

5月4日

星期一

5月2日

星期六
  1. Google Research 如何通过全球合作与开放资源推动科学影响

    Google Research 披露其开源工具与开放数据集已赋能全球超 25 万名研究者和开发者。其中基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 已支持处理 250 万人的外显子与全基因组,医疗基础模型 MedGemma 下载量超 480 万次。Open Health Stack 已在 10 多个国家部署,覆盖超 6500 万受益者。