quelllm-mcp
Consulte um catálogo de mais de 250 LLMs de pesos abertos — liste, compare, estime VRAM e custo de API versus auto-hospedagem — diretamente do Claude Code, Cursor ou qualquer cliente MCP.
Documentação
quelllm-mcp
Servidor MCP que expõe o catálogo quelllm.fr com mais de 190 LLMs de pesos abertos por meio de ferramentas do Model Context Protocol. Use-o a partir do Claude Code, Cursor, Continue ou qualquer cliente compatível com MCP para consultar modelos, compará-los, estimar VRAM e calcular custos entre API e auto-hospedagem.
Ferramentas expostas
| Ferramenta | Descrição |
|---|---|
list_models(filter_origin?, filter_family?, max_params_b?) | Lista modelos com filtros (código de origem, família, máx. de parâmetros em B) |
get_model(model_id) | Registro completo de um modelo (parâmetros, VRAM por quantização, janela de contexto, família, tags, licença, URLs) |
compare(model_a_id, model_b_id) | Comparação lado a lado com veredito |
estimate_vram(model_id, quant) | VRAM em GB na quantização escolhida + níveis recomendados de GPU/Mac |
estimate_cost(input_tokens_per_month, output_tokens_per_month, ...) | Custo em EUR — tabela completa de provedores de API vs. hardware auto-hospedado OU um ID específico |
search_models(query, limit?) | Busca difusa por nome, família, tag, autor |
Instalação
Instale a partir do código-fonte (ainda não está no PyPI):
pip install git+https://github.com/MGM-FALCON/quelllm-mcp.git
Ou execute sem instalar, usando uv:
uvx --from git+https://github.com/MGM-FALCON/quelllm-mcp.git quelllm-mcp
Para desenvolvimento local:
git clone https://github.com/MGM-FALCON/quelllm-mcp.git
cd quelllm-mcp
pip install -e .
Uso com Claude Code
Adicione ao ~/.claude.json ou ao .mcp.json de um projeto. Se você instalou com pip:
{
"mcpServers": {
"quelllm": {
"command": "quelllm-mcp"
}
}
}
Ou instalação zero com uvx:
{
"mcpServers": {
"quelllm": {
"command": "uvx",
"args": ["--from", "git+https://github.com/MGM-FALCON/quelllm-mcp.git", "quelllm-mcp"]
}
}
}
Uso com Claude Desktop
Edite o ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):
{
"mcpServers": {
"quelllm": {
"command": "quelllm-mcp"
}
}
}
Uso com Cursor / Continue / Cline
A maioria dos clientes MCP aceita a mesma configuração JSON:
{
"command": "quelllm-mcp"
}
Exemplos de consultas (a partir do seu cliente)
> Quels LLM Mistral peuvent tourner sur RTX 5070 Ti 16GB ?
→ list_models(filter_family='Mistral', max_params_b=24)
→ estimate_vram('mistral-small-24b', 'q4')
> Compare Llama 3.3 70B vs Qwen 2.5 32B
→ compare('llama33-70b', 'qwen25-32b')
> J'utilise 10M tokens input + 2.5M output / mois. Combien je paye chez OpenAI vs DeepSeek ?
→ estimate_cost(10_000_000, 2_500_000)
Fonte de dados
Todos os dados são obtidos de quelllm.fr/api/ (CC BY 4.0, sem chave, com CORS habilitado). Armazenados em cache localmente por 1h para evitar limitação de taxa.
Os dados de preços de API (GPT-5, Claude Opus 4.7, Gemini 2.5, DeepSeek, Mistral) e de hardware (série RTX 50, Mac M4) estão codificados manualmente com data de 2026-05 — verifique semestralmente.
Licença
MIT — consulte LICENSE.
Contribuição
Fonte: https://github.com/MGM-FALCON/quelllm-mcp Issues e PRs são bem-vindos. Especialmente:
- Atualizações de preços de API (semestrais)
- Adições de hardware (novas GPUs, série Mac Mx)
- Novas ferramentas (ex.:
find_alternatives_to(model_id),recommend_gpu(budget_eur))
Testes
Uma suíte de testes pytest está em tests/. Ela cobre todas as 6 ferramentas e os invariantes de saída da v1.1.0, nunca acessa a rede (fixture local + httpx simulado) e faz stub do SDK mcp quando ele não é importável — portanto, também roda em Python 3.9.
pip install -e ".[test]"
pytest
Autor
Mohamed Meguedmi — LinkedIn · Hugging Face Fundador da La Gazette IA e do QuelLLM.fr.