fine-tuning-with-trl
oleh firecrawl
Sempurnakan LLM menggunakan pembelajaran penguatan dengan TRL - SFT untuk penyesuaian instruksi, DPO untuk penyelarasan preferensi, PPO/GRPO untuk optimalisasi imbalan, dan imbalan…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl