awq-quantization
โดย firecrawl
การควอนไทซ์น้ำหนักที่คำนึงถึงการเปิดใช้งานสำหรับการบีบอัด LLM ขนาด 4 บิต ด้วยความเร็วที่เพิ่มขึ้น 3 เท่าและการสูญเสียความแม่นยำเพียงเล็กน้อย ใช้เมื่อปรับใช้โมเดลขนาดใหญ่ (7B-70B) บนทรัพยากรที่จำกัด…
npx skills add https://github.com/firecrawl/ai-research-skills --skill awq-quantization