openrlhf-training

作者: firecrawl

基于Ray和vLLM加速的高性能RLHF框架,用于大模型(7B-70B+)的PPO、GRPO、RLOO、DPO训练。构建于Ray、vLLM、ZeRO-3之上。2×…

npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training