fine-tuning-with-trl
द्वारा firecrawl
TRL का उपयोग करके सुदृढीकरण सीखने के माध्यम से LLM को फाइन-ट्यून करें - निर्देश ट्यूनिंग के लिए SFT, प्राथमिकता संरेखण के लिए DPO, पुरस्कार अनुकूलन के लिए PPO/GRPO, और पुरस्कार…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl