fine-tuning-with-trl
tarafından firecrawl
TRL ile pekiştirmeli öğrenme kullanarak LLM'leri ince ayar yapma - talimat ayarı için SFT, tercih hizalaması için DPO, ödül optimizasyonu için PPO/GRPO ve ödül…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl