fine-tuning-with-trl
por firecrawl
Ajuste fino de LLMs usando aprendizado por reforço com TRL - SFT para ajuste de instruções, DPO para alinhamento de preferências, PPO/GRPO para otimização de recompensa, e recompensa…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl