awq-quantization
por firecrawl
Quantização de pesos com consciência de ativação para compressão de LLMs em 4 bits, com aceleração de 3x e perda mínima de precisão. Use ao implantar modelos grandes (7B-70B) em recursos limitados…
npx skills add https://github.com/firecrawl/ai-research-skills --skill awq-quantization