本文へ移動
原文
Hugging Face Blog·· 29 日前

GRPO100ステップでLFM2.5-350Mの構造化出力を改善

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI による要約

公開された低費用手法はTRLのGRPOで約500例、100ステップの微調整を行い、IFStructを22.6%から29.7%に高めた。無料ColabかKaggle GPUで学習し、MacBookのllama.cppで評価できる。コードはGitHub公開済みだ。

入選の記録

入選せず二回の合計 81 < 基準の 2 倍 120

情報源の区分
公式・一次情報、この区分の基準は 60 点
予備審査
通過:微调350M模型提升结构化输出,AI技术实操

採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。

情報源:Hugging Face Blog · huggingface.co