Multi-LLM-MCP

Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM: APIs em nuvem ou modelos locais, por meio de uma interface unificada.

Documentação

multi-llm-mcp

Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM — APIs de nuvem ou modelos locais — por meio de uma interface unificada.

Em vez de ficar limitado a um único modelo, seu agente de codificação pode chamar NVIDIA NIM, OpenRouter, Groq, DeepSeek ou um modelo Ollama local para uma segunda opinião, revisão de código ou tarefa especializada.


Recursos

  • 5 provedores prontos para uso — NVIDIA NIM, OpenRouter, Groq, DeepSeek, Ollama
  • Suporte a modelos locais — Use o Ollama para assistência de codificação totalmente offline e privada
  • Controle refinado — Defina temperature, max_tokens e system_prompt por chamada
  • Seguro por design — As chaves de API permanecem em variáveis de ambiente, nunca no código
  • Pool de conexões — Os clientes são armazenados em cache para chamadas de API rápidas e eficientes
  • Padrão MCP — Funciona com qualquer IDE compatível com MCP (Claude Desktop, VS Code, Cursor, Windsurf, etc.)

Provedores Suportados

ProvedorTipoModelos
OllamaLocalLlama 3, CodeLlama, Mistral, Gemma, etc.
NVIDIA NIMNuvemLlama 3.1 405B, Mixtral, Code Llama, etc.
OpenRouterNuvemClaude, GPT-4, Gemini, 200+ modelos
GroqNuvemLlama 3, Mixtral, Gemma (inferência ultra-rápida)
DeepSeekNuvemDeepSeek Coder, DeepSeek Chat

Início Rápido

1. Clonar e instalar

git clone https://github.com/arjunkr303/multi-llm-mcp.git cd multi-llm-mcp

python -m venv venv source venv/bin/activate # No Windows: venv\Scripts\activate

pip install -r requirements.txt

2. Configurar as chaves de API

cp .env.example .env

Edite o .env e adicione suas chaves de API. Você só precisa das chaves dos provedores que deseja usar. O Ollama não requer chave de API.

NVIDIA_API_KEY=sua_chave_nvidia_aqui OPENROUTER_API_KEY=sua_chave_openrouter_aqui GROQ_API_KEY=sua_chave_groq_aqui DEEPSEEK_API_KEY=sua_chave_deepseek_aqui

3. Conectar à sua IDE

Adicione isso à sua configuração MCP:

Claude Desktop (claude_desktop_config.json):

{ "mcpServers": { "multi-llm-gateway": { "command": "/path/to/multi-llm-mcp/venv/bin/python", "args": ["/path/to/multi-llm-mcp/server.py"] } } }

VS Code / Cursor (.vscode/mcp.json ou configurações MCP da IDE):

Substitua /path/to/multi-llm-mcp pelo caminho real onde você clonou o repositório.

4. Usar

Após a conexão, seu agente de IDE tem acesso à ferramenta ask_llm. Você pode invocá-la solicitando naturalmente ao seu agente. O agente chamará o servidor MCP nos bastidores.

Ferramenta: ask_llm

Delega uma pergunta de codificação, revisão de código ou tarefa de reescrita a um LLM externo.

Parâmetros:

ParâmetroPadrãoDescrição
prompt(obrigatório)A pergunta, trecho de código ou tarefa
system_prompt"You are a helpful coding assistant."Contexto de função para o modelo
provider"ollama"Qual provedor usar
model"llama3"Nome do modelo para esse provedor
temperature0.00.0 = determinístico, 1.0 = criativo
max_tokens4096Comprimento máximo da resposta

Exemplos de Prompts

Use estes prompts no chat da sua IDE para acionar a ferramenta MCP:

Reescrever código usando um modelo em nuvem:

Use NVIDIA's Llama 3.1 to rewrite the database query in db.py to use async/await.

Obter uma revisão de código de um LLM diferente:

Ask Groq's Llama 3 to review server.py for performance issues and suggest improvements.

Refatorar com um modelo local (Ollama):

Use Ollama to refactor the authentication logic in auth.py into smaller, testable functions.

Gerar testes usando DeepSeek:

Ask DeepSeek Coder to write unit tests for the parse_config function in utils.py.

Obter uma segunda opinião sobre arquitetura:

Use OpenRouter's Claude to evaluate whether the current project structure follows
best practices and suggest a better layout.

Usando com Ollama (Modelos Locais)

Para assistência de codificação totalmente privada e offline:

Instale o Ollama: https://ollama.com/download

ollama pull llama3 ollama pull codellama

Em seguida, use provider: "ollama" com qualquer nome de modelo baixado. Nenhuma chave de API é necessária.

Segurança

  • As chaves de API são carregadas apenas de variáveis de ambiente
  • O .env está no gitignore e nunca é enviado ao repositório
  • Nenhum segredo é codificado no código-fonte
  • Toda a comunicação com a API ocorre apenas no lado do servidor

Licença

MIT — consulte o LICENSE para obter detalhes.