Multi-LLM-MCP
Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM: APIs em nuvem ou modelos locais, por meio de uma interface unificada.
Documentação
multi-llm-mcp
Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM — APIs em nuvem ou modelos locais — por meio de uma interface unificada.
Em vez de ficar preso a um único modelo, seu agente de codificação pode chamar NVIDIA NIM, OpenRouter, Groq, DeepSeek ou um modelo local Ollama para uma segunda opinião, revisão de código ou tarefa especializada.
Recursos
- 5 provedores prontos para uso — NVIDIA NIM, OpenRouter, Groq, DeepSeek, Ollama
- Suporte a modelos locais — Use Ollama para assistência de codificação totalmente offline e privada
- Controle refinado — Defina
temperature,max_tokensesystem_promptpor chamada - Seguro por design — Chaves de API permanecem em variáveis de ambiente, nunca no código
- Pool de conexões — Clientes são armazenados em cache para chamadas de API rápidas e eficientes
- Padrão MCP — Funciona com qualquer IDE compatível com MCP (Claude Desktop, VS Code, Cursor, Windsurf, etc.)
Provedores Suportados
| Provedor | Tipo | Modelos |
|---|---|---|
| Ollama | Local | Llama 3, CodeLlama, Mistral, Gemma, etc. |
| NVIDIA NIM | Nuvem | Llama 3.1 405B, Mixtral, Code Llama, etc. |
| OpenRouter | Nuvem | Claude, GPT-4, Gemini, 200+ modelos |
| Groq | Nuvem | Llama 3, Mixtral, Gemma (inferência ultra-rápida) |
| DeepSeek | Nuvem | DeepSeek Coder, DeepSeek Chat |
Início Rápido
1. Clonar e instalar
git clone https://github.com/arjunkr303/multi-llm-mcp.git
cd multi-llm-mcp
python -m venv venv
source venv/bin/activate # On Windows: venv\Scripts\activate
pip install -e .
2. Configurar chaves de API
cp .env.example .env
Edite .env e adicione suas chaves de API. Você só precisa das chaves dos provedores que deseja usar. Ollama não requer chave de API.
NVIDIA_API_KEY=your_nvidia_key_here
OPENROUTER_API_KEY=your_openrouter_key_here
GROQ_API_KEY=your_groq_key_here
DEEPSEEK_API_KEY=your_deepseek_key_here
3. Conectar ao seu IDE
Adicione isto à sua configuração MCP:
Claude Desktop (claude_desktop_config.json):
{
"mcpServers": {
"multi-llm-gateway": {
"command": "/path/to/multi-llm-mcp/venv/bin/python",
"args": ["-m", "multi_llm_mcp"]
}
}
}
VS Code / Cursor (.vscode/mcp.json ou configurações MCP do IDE):
{
"mcpServers": {
"multi-llm-gateway": {
"command": "/path/to/multi-llm-mcp/venv/bin/python",
"args": ["-m", "multi_llm_mcp"]
}
}
}
Substitua
/path/to/multi-llm-mcppelo caminho real onde você clonou o repositório.
4. Usar
Uma vez conectado, seu agente de IDE tem acesso à ferramenta ask_llm. Você pode invocá-la solicitando ao seu agente de forma natural. O agente chamará o servidor MCP nos bastidores.
Ferramenta: ask_llm
Delega uma pergunta de codificação, revisão de código ou tarefa de reescrita a um LLM externo.
Parâmetros:
| Parâmetro | Padrão | Descrição |
|---|---|---|
prompt | (obrigatório) | A pergunta, trecho de código ou tarefa |
system_prompt | "You are a helpful coding assistant." | Contexto de papel para o modelo |
provider | "ollama" | Qual provedor usar |
model | "llama3" | Nome do modelo para esse provedor |
temperature | 0.0 | 0.0 = determinístico, 1.0 = criativo |
max_tokens | 4096 | Comprimento máximo da resposta |
Exemplos de Prompts
Use estes prompts no chat do seu IDE para acionar a ferramenta MCP:
Reescrever código usando um modelo em nuvem:
Use NVIDIA's Llama 3.1 to rewrite the database query in db.py to use async/await.
Obter uma revisão de código de um LLM diferente:
Ask Groq's Llama 3 to review src/multi_llm_mcp/server.py for performance issues and suggest improvements.
Refatorar com um modelo local (Ollama):
Use Ollama to refactor the authentication logic in auth.py into smaller, testable functions.
Gerar testes usando DeepSeek:
Ask DeepSeek Coder to write unit tests for the parse_config function in utils.py.
Obter uma segunda opinião sobre arquitetura:
Use OpenRouter's Claude to evaluate whether the current project structure follows
best practices and suggest a better layout.
Usando com Ollama (Modelos Locais)
Para assistência de codificação totalmente privada e offline:
# Install Ollama: https://ollama.com/download
ollama pull llama3
ollama pull codellama
Em seguida, use provider: "ollama" com qualquer nome de modelo baixado. Nenhuma chave de API é necessária.
Segurança
- Chaves de API são carregadas apenas de variáveis de ambiente
.envestá no gitignore e nunca é commitado- Nenhum segredo é codificado no código-fonte
- Toda comunicação com a API ocorre apenas no lado do servidor
Estrutura do Projeto
multi-llm-mcp/
├── src/multi_llm_mcp/ # MCP server package
│ ├── __init__.py
│ ├── __main__.py # entry point: python -m multi_llm_mcp
│ ├── server.py # FastMCP server & the ask_llm tool
│ └── providers.py # provider registry & client factory
├── tests/ # pytest suite
├── pyproject.toml
├── .env.example
└── LICENSE
Executando Testes
pip install -e . pytest
pytest
Licença
MIT — veja LICENSE para detalhes.