awq-quantization
par firecrawl
Quantification des poids sensible à l'activation pour la compression de LLM en 4 bits avec un gain de vitesse de 3x et une perte de précision minimale. À utiliser lors du déploiement de grands modèles (7B-70B) sur des ressources limitées…
npx skills add https://github.com/firecrawl/ai-research-skills --skill awq-quantization