serving-llms-vllm
द्वारा firecrawl
vLLM के PagedAttention और निरंतर बैचिंग का उपयोग करके उच्च थ्रूपुट के साथ LLMs की सेवा प्रदान करता है। प्रोडक्शन LLM APIs को तैनात करते समय, इन्फ्रेंस को अनुकूलित करने के लिए उपयोग करें…
npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm