serving-llms-vllm
โดย firecrawl
ให้บริการ LLMs ด้วยปริมาณงานสูงโดยใช้ PagedAttention และ continuous batching ของ vLLM ใช้เมื่อปรับใช้ LLM APIs ในระบบผลิตจริง เพิ่มประสิทธิภาพการอนุมาน…
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm