fine-tuning-with-trl
por firecrawl
Ajusta modelos de lenguaje grandes usando aprendizaje por refuerzo con TRL: SFT para ajuste por instrucciones, DPO para alineación de preferencias, PPO/GRPO para optimización de recompensas, y recompensa…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl