quantizing-models-bitsandbytes
โดย firecrawl
ปรับลดขนาด LLM เป็น 8 บิตหรือ 4 บิต เพื่อลดหน่วยความจำ 50-75% โดยสูญเสียความแม่นยำเพียงเล็กน้อย ใช้เมื่อหน่วยความจำ GPU มีจำกัด จำเป็นต้องรองรับโมเดลที่ใหญ่ขึ้น หรือต้องการ...
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes