跳到正文

#多模态

今日 1 条

10月1日

星期四今天1 条

9月29日

星期二
  1. 微软亚洲研究院新加坡分院成立一年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域 AI、AI 原生研究实践及生态人才四大方向。实验室与新加坡医疗生态合作探索多模态医疗 AI 与自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与交通 AI 高管圆桌会。

9月26日

星期六

9月25日

星期五

9月24日

星期四

9月23日

星期三

9月3日

星期四

9月2日

星期三

8月28日

星期五

8月26日

星期三
  1. Google 推出 AgentHands:为 XR 智能体对话生成空间化手势

    Google 发布研究原型 AgentHands(论文发表于 CHI 2026),可将 LLM 的推理输出映射为 XR 头显中与语音同步的手势动画,让智能体在 3D 空间里指点、演示物体操作。系统包含环境感知、手势事件库、手势嵌入推理与本地同步执行四个模块,支持递指、象形和表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。

8月17日

星期一

8月13日

星期四
  1. MindTopo:微软研究院推出评估多模态大模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧保留结构关系时有用,跨多步操作后常改变拓扑或违反任务约束。

8月12日

星期三
  1. 微软研究院推出 CARE-X:面向临床可用的放射学 VLM,融合辅助监督、奖励对齐学习与工具增强测量

    微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。CARE-X 支持生成与双推理两种模式,覆盖病灶有无与否定、定位、多标签分类、导管与管线异常位置检测及 29 个解剖区域定位等任务。

8月11日

星期二

8月10日

星期一

8月4日

星期二
  1. Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写出策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核基准上取得新的最优结果。

7月30日

星期四

7月28日

星期二

7月27日

星期一

7月23日

星期四

7月21日

星期二

7月16日

星期四
  1. DharmaOCR 在巴西葡萄牙语 OCR 基准上超越 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过两阶段训练实现领域专精:先以葡萄牙语语料监督微调,再用 DPO 提升推理稳定性。作者认为,尽管新架构不断涌现,专注单一语言的参数集中策略仍构成结构性优势。

7月15日

星期三

7月8日

星期三

7月1日

星期三

6月23日

星期二
  1. Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,其在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,但官方提示这两个基准的评分方式存在已知局限。

6月17日

星期三
  1. Google Earth AI 推出矢量化数据集,用深度学习绘制英国农田细尺度生态特征

    Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星影像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征阈值小于 0.5)区分林地、树丛与树篱。

6月13日

星期六
  1. Google 研究 AI 如何帮助用户理解皮肤问题

    Google 公布两项关于 AI 辅助皮肤问题理解的研究:一项针对 2,345 名参与者的调查显示,使用 AI 工具时参与者尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近对照组 8% 的三倍。另一项混合方法研究则考察人们如何用这类工具处理自身皮肤问题,以及由此获得的理解与医生沟通的差异。研究同时发现,AI 辅助对判断下一步就医措施帮助有限。

6月9日

星期二

6月5日

星期五