fine-tuning-with-trl
von firecrawl
LLMs mit TRL durch Reinforcement Learning feinabstimmen – SFT für Instruktionstuning, DPO für Präferenzausrichtung, PPO/GRPO zur Belohnungsoptimierung und Belohnungs…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl