Hugging Face Blog·· 2026-07-08
Hugging Face 发布原生速度的 vLLM transformers 建模后端
Native-speed vLLM transformers modeling backend
AI 导读
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐速度。该后端通过 torch.fx 做静态图分析、用 ast 重写源码,在运行时动态应用推理相关的层融合,从而匹配自定义代码的性能。
入选记录
门槛 60官方一手第一次 62第二次 62
入选两次之和 124 ≥ 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:vLLM推理后端与transformers模型集成
- 推荐理由
- 官方给出 transformers 后端与 vLLM 原生实现的速度对比和单 flag 启用方式,读者可据此判断是否省去自定义移植。
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Hugging Face Blog · huggingface.co