使用TRL对大型语言模型进行强化学习微调——SFT用于指令微调,DPO用于偏好对齐,PPO/GRPO用于奖励优化,以及奖励…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl