高性能なRLHFフレームワークで、RayとvLLMによる高速化を実現。大規模モデル(7B〜70B+)のPPO、GRPO、RLOO、DPOトレーニングに使用。Ray、vLLM、ZeRO-3をベースに構築。2倍…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training