fine-tuning-with-trl
от firecrawl
Тонкая настройка LLM с использованием обучения с подкреплением через TRL — SFT для настройки по инструкциям, DPO для выравнивания предпочтений, PPO/GRPO для оптимизации вознаграждения и вознаграждение…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl