openrlhf-training
von firecrawl
Hochleistungs-RLHF-Framework mit Ray+vLLM-Beschleunigung. Verwendung für PPO-, GRPO-, RLOO-, DPO-Training großer Modelle (7B-70B+). Basierend auf Ray, vLLM, ZeRO-3. 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training