Google Research·· 2026-06-27
Google 用冻结多 Token 预测加速 Pixel 上的 Gemini Nano 模型
Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction
AI 导读
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已随 Pixel 9 和 10 系列推出。
入选记录
门槛 60官方一手第一次 58第二次 62
入选两次之和 120 ≥ 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:介绍Gemini Nano模型MTP加速技术
- 推荐理由
- Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何绕开独立草稿模型的内存开销。
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Google Research · research.google