fine-tuning-with-trl
โดย firecrawl
ปรับแต่ง LLMs โดยใช้การเรียนรู้แบบเสริมกำลังด้วย TRL - SFT สำหรับการปรับแต่งตามคำสั่ง, DPO สำหรับการจัดแนวความชอบ, PPO/GRPO สำหรับการเพิ่มประสิทธิภาพรางวัล, และรางวัล…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl