quantizing-models-bitsandbytes
por firecrawl
Quantiza LLMs para 8 ou 4 bits, reduzindo a memória em 50-75% com perda mínima de precisão. Use quando a memória da GPU for limitada, precisar encaixar modelos maiores ou quiser…
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes