serving-llms-vllm
por firecrawl
Sirve LLMs con alto rendimiento utilizando PagedAttention y batching continuo de vLLM. Úselo al implementar APIs de LLM en producción, optimizando inferencia…
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm