verl(Volcano Engine RL)을 사용하여 LLM을 강화 학습으로 훈련하는 방법을 안내합니다. RLHF, GRPO, PPO 또는 기타 RL 알고리즘을 구현할 때 사용하세요.
npx skills add https://github.com/firecrawl/ai-research-skills --skill verl-rl-training