openrlhf-training
द्वारा firecrawl
उच्च-प्रदर्शन RLHF फ्रेमवर्क जिसमें Ray+vLLM त्वरण है। बड़े मॉडलों (7B-70B+) के PPO, GRPO, RLOO, DPO प्रशिक्षण के लिए उपयोग करें। Ray, vLLM, ZeRO-3 पर निर्मित। 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training