Hugging Face Blog·· 28 天前AI 评分39
用 100 步 GRPO 微调 350M 模型提升结构化输出
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的轻量微调,在 IFStruct benchmark 上把合规率从基线 22.6% 提升到 29.7%。
来源:Hugging Face Blog · huggingface.co