高效能RLHF框架,採用Ray+vLLM加速。適用於大型模型(7B-70B+)的PPO、GRPO、RLOO、DPO訓練。基於Ray、vLLM、ZeRO-3構建。2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training