TRL을 사용한 강화 학습으로 LLM 미세 조정 - 명령어 튜닝을 위한 SFT, 선호도 정렬을 위한 DPO, 보상 최적화를 위한 PPO/GRPO, 그리고 보상…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl