LLMのためのキャリブレーションデータ不要な半二次量子化。キャリブレーションデータセットを必要とせずにモデルを4/3/2ビット精度に量子化する際に使用し、高速な…
npx skills add https://github.com/firecrawl/ai-research-skills --skill hqq-quantization