quantizing-models-bitsandbytes
por firecrawl
Cuantiza LLMs a 8 o 4 bits para una reducción de memoria del 50-75% con una pérdida mínima de precisión. Úsalo cuando la memoria de la GPU sea limitada, necesites ajustar modelos más grandes o quieras…
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes