跳到正文

#推理

今日 5 条

10月1日

星期四今天5 条
  1. Google 发布 Gemini 4 Argon,缩小与 OpenAI、Anthropic 的差距但未取得明显领先

    Google 发布新前沿模型 Gemini 4 Argon,在部分基准上超过 OpenAI 和 Anthropic 的竞品,但未取得明显领先。该模型先面向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才向开发者、企业和消费者推出,尚未公布日期;介绍性价格为每百万输入 token 2 美元、输出 token 10 美元,缓存输入便宜 95%。

9月24日

星期四

9月22日

星期二
  1. TypeSafe AI 发布 Jev,推出 System One 决策模型

    TypeSafe AI 上周发布 Jev,称其为“System One 模型”这一新类别模型的首个实例,作者更认同“决策模型”这一叫法。Jev 接受文本输入,输出的是对应类别、是/否问题、评分的浮点数及置信度,只按输入计费,首个模型输入价格为每百万 token 0.042 美元。作者认为它适合分类任务,如垃圾邮件检测、打标签、排序,也尝试用于搜索重排,并指出它不擅长数字、日期和对抗性内容。

9月16日

星期三

9月8日

星期二

9月3日

星期四

9月2日

星期三
  1. Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。

8月25日

星期二

8月21日

星期五

8月17日

星期一

8月13日

星期四
  1. MindTopo:微软研究院推出评估多模态大模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧保留结构关系时有用,跨多步操作后常改变拓扑或违反任务约束。

8月11日

星期二

7月31日

星期五

7月29日

星期三

7月26日

星期日
  1. Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月15日

星期三

7月10日

星期五

7月6日

星期一

7月2日

星期四

6月27日

星期六

6月25日

星期四
  1. Google Research 研究:推理如何解锁 LLM 的参数化知识召回

    Google Research 在 COLM 2026 发表的论文揭示,推理轨迹能解锁 LLM 原本无法召回的事实性知识,即使问题只是简单的单跳问答。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:生成额外 token 充当"计算缓冲",以及"事实启动"——模型先输出相关事实为正确答案做语义预热。研究同时指出,模型自生成中间事实可能带来幻觉风险。

6月11日

星期四

6月8日

星期一

5月8日

星期五
  1. 自适应并行推理:高效推理扩展的下一个范式

    伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 多由外部预设并行结构,未教会模型自适应行为。

4月20日

星期一
  1. GRASP:面向世界模型的基于梯度的长时程规划方法

    Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。

4月16日

星期四

3月25日

星期三

3月17日

星期二

3月13日

星期五

11月1日

星期六