アクティベーションを考慮した重み量子化により、4ビットLLM圧縮を実現し、3倍の高速化と最小限の精度低下を達成。限られたリソースで大規模モデル(7B-70B)を展開する際に使用。
npx skills add https://github.com/firecrawl/ai-research-skills --skill awq-quantization