serving-llms-vllm
от firecrawl
Обслуживает LLM с высокой пропускной способностью, используя PagedAttention и непрерывную пакетную обработку vLLM. Используйте при развертывании производственных API LLM, оптимизации инференса…
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm