활성화 인식 가중치 양자화로 4비트 LLM을 압축하여 3배 속도 향상과 최소한의 정확도 손실을 제공합니다. 제한된 환경에서 대규모 모델(7B-70B)을 배포할 때 사용합니다.
npx skills add https://github.com/firecrawl/ai-research-skills --skill awq-quantization