openrlhf-training
tarafından firecrawl
Yüksek performanslı RLHF çerçevesi, Ray+vLLM hızlandırması ile. Büyük modellerin (7B-70B+) PPO, GRPO, RLOO, DPO eğitimi için kullanılır. Ray, vLLM, ZeRO-3 üzerine inşa edilmiştir. 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training