使用 TRL 對大型語言模型進行強化學習微調 - SFT 用於指令微調,DPO 用於偏好對齊,PPO/GRPO 用於獎勵優化,以及獎勵…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl