quantizing-models-bitsandbytes
von firecrawl
Quantisiert LLMs auf 8-Bit oder 4-Bit für 50-75% Speicherreduzierung bei minimalem Genauigkeitsverlust. Verwenden Sie, wenn der GPU-Speicher begrenzt ist, größere Modelle benötigt werden oder Sie…
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes