openrlhf-training
oleh firecrawl
Kerangka kerja RLHF berkinerja tinggi dengan akselerasi Ray+vLLM. Digunakan untuk pelatihan PPO, GRPO, RLOO, DPO model besar (7B-70B+). Dibangun di atas Ray, vLLM, ZeRO-3. 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training