serving-llms-vllm

作者: firecrawl

使用vLLM的PagedAttention和连续批处理技术,以高吞吐量服务大语言模型。适用于部署生产级LLM API、优化推理…

npx skills add https://github.com/firecrawl/ai-research-skills --skill serving-llms-vllm