slime-rl-training
โดย firecrawl
ให้คำแนะนำสำหรับการฝึกอบรมหลังการฝึกของ LLM ด้วย RL โดยใช้ slime ซึ่งเป็นเฟรมเวิร์ก Megatron+SGLang ใช้เมื่อฝึกโมเดล GLM, ดำเนินการสร้างข้อมูลที่กำหนดเอง…
npx skills add https://github.com/firecrawl/ai-research-skills --skill slime-rl-training