quantizing-models-bitsandbytes
par firecrawl
Quantifie les LLM en 8 bits ou 4 bits pour une réduction de mémoire de 50 à 75 % avec une perte de précision minimale. À utiliser lorsque la mémoire GPU est limitée, qu'il faut faire tenir des modèles plus grands, ou que l'on souhaite…
npx skills add https://github.com/firecrawl/ai-research-skills --skill quantizing-models-bitsandbytes