quantizing-models-bitsandbytes
от firecrawl
Квантует LLM до 8-битных или 4-битных значений для снижения потребления памяти на 50-75% с минимальной потерей точности. Используйте, когда объем памяти GPU ограничен, необходимо разместить более крупные модели или требуется…
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes