verl(Volcano Engine RL)を使用した強化学習によるLLMのトレーニングのガイダンスを提供します。RLHF、GRPO、PPO、またはその他のRLアルゴリズムを実装する際に使用します。
npx skills add https://github.com/firecrawl/ai-research-skills --skill verl-rl-training