AWS Machine Learning Blog· Nilesh PS·· 5 天前
在 Amazon SageMaker HyperPod 上用 SkyRL 加速多模态 RL 训练
Accelerate multimodal RL training with SkyRL on Amazon SageMaker HyperPod
AI 导读
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
入选记录
门槛 60官方一手第一次 31第二次 22
未入选两次之和 53 < 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:多模态RL训练与模型部署教程
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:AWS Machine Learning Blog · aws.amazon.com