Hugging Face Blog·· 29 日前
GRPO100ステップでLFM2.5-350Mの構造化出力を改善
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI による要約
公開された低費用手法はTRLのGRPOで約500例、100ステップの微調整を行い、IFStructを22.6%から29.7%に高めた。無料ColabかKaggle GPUで学習し、MacBookのllama.cppで評価できる。コードはGitHub公開済みだ。
入選の記録
基準 60公式・一次情報1 回目 472 回目 34
入選せず二回の合計 81 < 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:微调350M模型提升结构化输出,AI技术实操
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Hugging Face Blog · huggingface.co