vLLM의 PagedAttention과 연속 배치를 사용하여 높은 처리량으로 LLM을 제공합니다. 프로덕션 LLM API를 배포하거나 추론을 최적화할 때 사용하세요.
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm