Multi-LLM-MCP
Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM: APIs em nuvem ou modelos locais, por meio de uma interface unificada.
Documentação
multi-llm-mcp
Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM — APIs de nuvem ou modelos locais — por meio de uma interface unificada.
Em vez de ficar limitado a um único modelo, seu agente de codificação pode chamar NVIDIA NIM, OpenRouter, Groq, DeepSeek ou um modelo Ollama local para uma segunda opinião, revisão de código ou tarefa especializada.
Recursos
- 5 provedores prontos para uso — NVIDIA NIM, OpenRouter, Groq, DeepSeek, Ollama
- Suporte a modelos locais — Use o Ollama para assistência de codificação totalmente offline e privada
- Controle refinado — Defina
temperature,max_tokensesystem_promptpor chamada - Seguro por design — As chaves de API permanecem em variáveis de ambiente, nunca no código
- Pool de conexões — Os clientes são armazenados em cache para chamadas de API rápidas e eficientes
- Padrão MCP — Funciona com qualquer IDE compatível com MCP (Claude Desktop, VS Code, Cursor, Windsurf, etc.)
Provedores Suportados
| Provedor | Tipo | Modelos |
|---|---|---|
| Ollama | Local | Llama 3, CodeLlama, Mistral, Gemma, etc. |
| NVIDIA NIM | Nuvem | Llama 3.1 405B, Mixtral, Code Llama, etc. |
| OpenRouter | Nuvem | Claude, GPT-4, Gemini, 200+ modelos |
| Groq | Nuvem | Llama 3, Mixtral, Gemma (inferência ultra-rápida) |
| DeepSeek | Nuvem | DeepSeek Coder, DeepSeek Chat |
Início Rápido
1. Clonar e instalar
git clone https://github.com/arjunkr303/multi-llm-mcp.git cd multi-llm-mcp
python -m venv venv source venv/bin/activate # No Windows: venv\Scripts\activate
pip install -r requirements.txt
2. Configurar as chaves de API
cp .env.example .env
Edite o .env e adicione suas chaves de API. Você só precisa das chaves dos provedores que deseja usar. O Ollama não requer chave de API.
NVIDIA_API_KEY=sua_chave_nvidia_aqui OPENROUTER_API_KEY=sua_chave_openrouter_aqui GROQ_API_KEY=sua_chave_groq_aqui DEEPSEEK_API_KEY=sua_chave_deepseek_aqui
3. Conectar à sua IDE
Adicione isso à sua configuração MCP:
Claude Desktop (claude_desktop_config.json):
{ "mcpServers": { "multi-llm-gateway": { "command": "/path/to/multi-llm-mcp/venv/bin/python", "args": ["/path/to/multi-llm-mcp/server.py"] } } }
VS Code / Cursor (.vscode/mcp.json ou configurações MCP da IDE):
Substitua
/path/to/multi-llm-mcppelo caminho real onde você clonou o repositório.
4. Usar
Após a conexão, seu agente de IDE tem acesso à ferramenta ask_llm. Você pode invocá-la solicitando naturalmente ao seu agente. O agente chamará o servidor MCP nos bastidores.
Ferramenta: ask_llm
Delega uma pergunta de codificação, revisão de código ou tarefa de reescrita a um LLM externo.
Parâmetros:
| Parâmetro | Padrão | Descrição |
|---|---|---|
| prompt | (obrigatório) | A pergunta, trecho de código ou tarefa |
| system_prompt | "You are a helpful coding assistant." | Contexto de função para o modelo |
| provider | "ollama" | Qual provedor usar |
| model | "llama3" | Nome do modelo para esse provedor |
| temperature | 0.0 | 0.0 = determinístico, 1.0 = criativo |
| max_tokens | 4096 | Comprimento máximo da resposta |
Exemplos de Prompts
Use estes prompts no chat da sua IDE para acionar a ferramenta MCP:
Reescrever código usando um modelo em nuvem:
Use NVIDIA's Llama 3.1 to rewrite the database query in db.py to use async/await.
Obter uma revisão de código de um LLM diferente:
Ask Groq's Llama 3 to review server.py for performance issues and suggest improvements.
Refatorar com um modelo local (Ollama):
Use Ollama to refactor the authentication logic in auth.py into smaller, testable functions.
Gerar testes usando DeepSeek:
Ask DeepSeek Coder to write unit tests for the parse_config function in utils.py.
Obter uma segunda opinião sobre arquitetura:
Use OpenRouter's Claude to evaluate whether the current project structure follows
best practices and suggest a better layout.
Usando com Ollama (Modelos Locais)
Para assistência de codificação totalmente privada e offline:
Instale o Ollama: https://ollama.com/download
ollama pull llama3 ollama pull codellama
Em seguida, use provider: "ollama" com qualquer nome de modelo baixado. Nenhuma chave de API é necessária.
Segurança
- As chaves de API são carregadas apenas de variáveis de ambiente
- O
.envestá no gitignore e nunca é enviado ao repositório - Nenhum segredo é codificado no código-fonte
- Toda a comunicação com a API ocorre apenas no lado do servidor
Licença
MIT — consulte o LICENSE para obter detalhes.