openrlhf-training
por firecrawl
Marco de RLHF de alto rendimiento con aceleración Ray+vLLM. Úselo para entrenamiento PPO, GRPO, RLOO, DPO de modelos grandes (7B-70B+). Construido sobre Ray, vLLM, ZeRO-3. 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training