serving-llms-vllm
par firecrawl
Sert les LLMs avec un haut débit en utilisant le PagedAttention et le batching continu de vLLM. À utiliser lors du déploiement d'API LLM en production, de l'optimisation de l'inférence…
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm