Thinking Machines 发布 Inkling 多模态开源模型及 Inkling-Small
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,并同步推出 276B 总参数 12B 激活的 Inkling-Small。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,并同步推出 276B 总参数 12B 激活的 Inkling-Small。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证集未见环境上取得 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,总参数 119B、激活参数 6B,在形式化验证上大幅升级。它在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的当前最佳成绩。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中完成预测。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,其在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,但官方提示这两个基准的评分方式存在已知局限。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话者的语调、节奏和音高。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,介于边缘端 E4B 与 26B MoE 之间,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
Mistral 发布 Mistral Medium 3.5,这是其首个将指令遵循、推理与编码合并的 128B 稠密模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言对话逐轮编辑视频。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
Google DeepMind 推出新一代文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表现力与音质,即日起面向开发者通过 Gemini API 和 Google AI Studio 预览、企业通过 Vertex AI 预览、Workspace 用户通过 Google Vids 使用。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取圆形压力表、液位指示器和数字读数。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的版本,采用 Apache 2.0 许可。
Mistral AI 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 与免费 API 端点 labs-leanstral-2603。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文本模型。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线自家 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音触发函数调用能力,文本能力继承 Mistral Small 3.1。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和面向企业的 Magistral Medium。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,在真实代码检索任务上表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/s,以 Apache 2.0 许可开源。