openrlhf-training
bởi firecrawl
Khung RLHF hiệu suất cao với tăng tốc Ray+vLLM. Dùng cho huấn luyện PPO, GRPO, RLOO, DPO các mô hình lớn (7B-70B+). Xây dựng trên Ray, vLLM, ZeRO-3. 2×…
npx skills add https://github.com/firecrawl/ai-research-skills --skill openrlhf-training