quantizing-models-bitsandbytes
oleh firecrawl
Mengkuantisasi LLM menjadi 8-bit atau 4-bit untuk mengurangi memori sebesar 50-75% dengan kehilangan akurasi minimal. Gunakan saat memori GPU terbatas, perlu menyesuaikan model yang lebih besar, atau ingin...
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes