quelllm-mcp

Consulte um catálogo de mais de 250 LLMs de pesos abertos — liste, compare, estime VRAM e custo de API versus auto-hospedagem — diretamente do Claude Code, Cursor ou qualquer cliente MCP.

Documentação

quelllm-mcp

Servidor MCP que expõe o catálogo quelllm.fr com mais de 190 LLMs de pesos abertos por meio de ferramentas do Model Context Protocol. Use-o a partir do Claude Code, Cursor, Continue ou qualquer cliente compatível com MCP para consultar modelos, compará-los, estimar VRAM e calcular custos entre API e auto-hospedagem.

Ferramentas expostas

FerramentaDescrição
list_models(filter_origin?, filter_family?, max_params_b?)Lista modelos com filtros (código de origem, família, máx. de parâmetros em B)
get_model(model_id)Registro completo de um modelo (parâmetros, VRAM por quantização, janela de contexto, família, tags, licença, URLs)
compare(model_a_id, model_b_id)Comparação lado a lado com veredito
estimate_vram(model_id, quant)VRAM em GB na quantização escolhida + níveis recomendados de GPU/Mac
estimate_cost(input_tokens_per_month, output_tokens_per_month, ...)Custo em EUR — tabela completa de provedores de API vs. hardware auto-hospedado OU um ID específico
search_models(query, limit?)Busca difusa por nome, família, tag, autor

Instalação

Instale a partir do código-fonte (ainda não está no PyPI):

pip install git+https://github.com/MGM-FALCON/quelllm-mcp.git

Ou execute sem instalar, usando uv:

uvx --from git+https://github.com/MGM-FALCON/quelllm-mcp.git quelllm-mcp

Para desenvolvimento local:

git clone https://github.com/MGM-FALCON/quelllm-mcp.git
cd quelllm-mcp
pip install -e .

Uso com Claude Code

Adicione ao ~/.claude.json ou ao .mcp.json de um projeto. Se você instalou com pip:

{
  "mcpServers": {
    "quelllm": {
      "command": "quelllm-mcp"
    }
  }
}

Ou instalação zero com uvx:

{
  "mcpServers": {
    "quelllm": {
      "command": "uvx",
      "args": ["--from", "git+https://github.com/MGM-FALCON/quelllm-mcp.git", "quelllm-mcp"]
    }
  }
}

Uso com Claude Desktop

Edite o ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):

{
  "mcpServers": {
    "quelllm": {
      "command": "quelllm-mcp"
    }
  }
}

Uso com Cursor / Continue / Cline

A maioria dos clientes MCP aceita a mesma configuração JSON:

{
  "command": "quelllm-mcp"
}

Exemplos de consultas (a partir do seu cliente)

> Quels LLM Mistral peuvent tourner sur RTX 5070 Ti 16GB ?
→ list_models(filter_family='Mistral', max_params_b=24)
→ estimate_vram('mistral-small-24b', 'q4')

> Compare Llama 3.3 70B vs Qwen 2.5 32B
→ compare('llama33-70b', 'qwen25-32b')

> J'utilise 10M tokens input + 2.5M output / mois. Combien je paye chez OpenAI vs DeepSeek ?
→ estimate_cost(10_000_000, 2_500_000)

Fonte de dados

Todos os dados são obtidos de quelllm.fr/api/ (CC BY 4.0, sem chave, com CORS habilitado). Armazenados em cache localmente por 1h para evitar limitação de taxa.

Os dados de preços de API (GPT-5, Claude Opus 4.7, Gemini 2.5, DeepSeek, Mistral) e de hardware (série RTX 50, Mac M4) estão codificados manualmente com data de 2026-05 — verifique semestralmente.

Licença

MIT — consulte LICENSE.

Contribuição

Fonte: https://github.com/MGM-FALCON/quelllm-mcp Issues e PRs são bem-vindos. Especialmente:

  • Atualizações de preços de API (semestrais)
  • Adições de hardware (novas GPUs, série Mac Mx)
  • Novas ferramentas (ex.: find_alternatives_to(model_id), recommend_gpu(budget_eur))

Testes

Uma suíte de testes pytest está em tests/. Ela cobre todas as 6 ferramentas e os invariantes de saída da v1.1.0, nunca acessa a rede (fixture local + httpx simulado) e faz stub do SDK mcp quando ele não é importável — portanto, também roda em Python 3.9.

pip install -e ".[test]"
pytest

Autor

Mohamed Meguedmi — LinkedIn · Hugging Face Fundador da La Gazette IA e do QuelLLM.fr.