fine-tuning-with-trl
par firecrawl
Affinez les LLMs par apprentissage par renforcement avec TRL - SFT pour l'ajustement par instructions, DPO pour l'alignement des préférences, PPO/GRPO pour l'optimisation des récompenses, et récompense…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl