openrlhf-training

作者: firecrawl

高效能RLHF框架,採用Ray+vLLM加速。適用於大型模型(7B-70B+)的PPO、GRPO、RLOO、DPO訓練。基於Ray、vLLM、ZeRO-3構建。2×…

npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training

來自 firecrawl 的更多技能