openrlhf-training
от firecrawl
Высокопроизводительный фреймворк RLHF с ускорением Ray+vLLM. Используется для обучения PPO, GRPO, RLOO, DPO больших моделей (7B-70B+). Построен на Ray, vLLM, ZeRO-3. 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training