고성능 RLHF 프레임워크로 Ray+vLLM 가속을 지원합니다. 대규모 모델(7B-70B+)의 PPO, GRPO, RLOO, DPO 학습에 사용됩니다. Ray, vLLM, ZeRO-3 기반으로 구축되었습니다. 2배…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training