跳到正文
原文
Hugging Face Blog·· 28 天前

用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出能力

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准分数从 22.6% 提升到 29.7%,训练可在免费 Colab 或 Kaggle GPU 上完成。评测通过 llama.cpp 在 MacBook 本地运行,代码已开源在 GitHub。

入选记录

未入选两次之和 81 < 门槛的两倍 120

信源等级
官方一手,这一级的门槛是 60 分
预筛
通过:微调350M模型提升结构化输出,AI技术实操

评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。

来源:Hugging Face Blog · huggingface.co