跳到正文

#Hugging Face

今日 2 条

10月1日

星期四今天2 条
  1. FTC 对 OpenAI、Anthropic 等 AI 实验室启动消费者保护调查

    美国联邦贸易委员会正就潜在的消费者保护违规行为调查 OpenAI、Anthropic 等领先 AI 实验室。FTC 主席 Andrew Ferguson 计划通过具有法律约束力的“民事调查令”强制移交文件并质询高管,相关命令预计数周内发出。调查在 Hugging Face 遭黑客攻击事件之前就已启动,AI 安全机构 METR 也在审查范围内。

9月30日

星期三

9月29日

星期二
  1. NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可单次前向传播预测新行标签,无需训练、调参和特征工程,覆盖分类与回归。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。

  2. ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。

9月28日

星期一

9月24日

星期四

9月22日

星期二

9月21日

星期一

9月16日

星期三

9月10日

星期四

9月3日

星期四

9月2日

星期三
  1. Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。

9月1日

星期二

8月31日

星期一

8月28日

星期五

8月26日

星期三

8月25日

星期二

8月21日

星期五

8月19日

星期三

8月18日

星期二

8月14日

星期五

8月13日

星期四