Hugging Face Blog·· 28 天前
用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出能力
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准分数从 22.6% 提升到 29.7%,训练可在免费 Colab 或 Kaggle GPU 上完成。评测通过 llama.cpp 在 MacBook 本地运行,代码已开源在 GitHub。
入选记录
门槛 60官方一手第一次 47第二次 34
未入选两次之和 81 < 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:微调350M模型提升结构化输出,AI技术实操
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Hugging Face Blog · huggingface.co