serving-llms-vllm
oleh firecrawl
Melayani LLM dengan throughput tinggi menggunakan PagedAttention dan continuous batching dari vLLM. Gunakan saat menerapkan API LLM produksi, mengoptimalkan inferensi…
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm