TRLを用いた強化学習によるLLMのファインチューニング - 指示チューニングのためのSFT、選好アライメントのためのDPO、報酬最適化のためのPPO/GRPO、および報酬…
npx skills add https://github.com/firecrawl/ai-research-skills --skill fine-tuning-with-trl