vLLMのPagedAttentionと連続バッチングを用いて、高いスループットでLLMを提供します。本番環境のLLM APIをデプロイする際や、推論を最適化する際に使用します。
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm