quantizing-models-bitsandbytes
tarafından firecrawl
LLM'leri 8-bit veya 4-bit'e niceleyerek %50-75 bellek azaltımı sağlar, doğruluk kaybı minimumdur. GPU belleği sınırlı olduğunda, daha büyük modeller sığdırmanız gerektiğinde veya istediğinizde kullanın.
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes