Multi-LLM-MCP

Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM: APIs em nuvem ou modelos locais, por meio de uma interface unificada.

Documentação

multi-llm-mcp

Um servidor MCP que permite que qualquer agente de IDE delegue tarefas de codificação a qualquer LLM — APIs em nuvem ou modelos locais — por meio de uma interface unificada.

Em vez de ficar preso a um único modelo, seu agente de codificação pode chamar NVIDIA NIM, OpenRouter, Groq, DeepSeek ou um modelo local Ollama para uma segunda opinião, revisão de código ou tarefa especializada.


Recursos

  • 5 provedores prontos para uso — NVIDIA NIM, OpenRouter, Groq, DeepSeek, Ollama
  • Suporte a modelos locais — Use Ollama para assistência de codificação totalmente offline e privada
  • Controle refinado — Defina temperature, max_tokens e system_prompt por chamada
  • Seguro por design — Chaves de API permanecem em variáveis de ambiente, nunca no código
  • Pool de conexões — Clientes são armazenados em cache para chamadas de API rápidas e eficientes
  • Padrão MCP — Funciona com qualquer IDE compatível com MCP (Claude Desktop, VS Code, Cursor, Windsurf, etc.)

Provedores Suportados

ProvedorTipoModelos
OllamaLocalLlama 3, CodeLlama, Mistral, Gemma, etc.
NVIDIA NIMNuvemLlama 3.1 405B, Mixtral, Code Llama, etc.
OpenRouterNuvemClaude, GPT-4, Gemini, 200+ modelos
GroqNuvemLlama 3, Mixtral, Gemma (inferência ultra-rápida)
DeepSeekNuvemDeepSeek Coder, DeepSeek Chat

Início Rápido

1. Clonar e instalar

git clone https://github.com/arjunkr303/multi-llm-mcp.git
cd multi-llm-mcp

python -m venv venv
source venv/bin/activate   # On Windows: venv\Scripts\activate

pip install -e .

2. Configurar chaves de API

cp .env.example .env

Edite .env e adicione suas chaves de API. Você só precisa das chaves dos provedores que deseja usar. Ollama não requer chave de API.

NVIDIA_API_KEY=your_nvidia_key_here
OPENROUTER_API_KEY=your_openrouter_key_here
GROQ_API_KEY=your_groq_key_here
DEEPSEEK_API_KEY=your_deepseek_key_here

3. Conectar ao seu IDE

Adicione isto à sua configuração MCP:

Claude Desktop (claude_desktop_config.json):

{
  "mcpServers": {
    "multi-llm-gateway": {
      "command": "/path/to/multi-llm-mcp/venv/bin/python",
      "args": ["-m", "multi_llm_mcp"]
    }
  }
}

VS Code / Cursor (.vscode/mcp.json ou configurações MCP do IDE):

{
  "mcpServers": {
    "multi-llm-gateway": {
      "command": "/path/to/multi-llm-mcp/venv/bin/python",
      "args": ["-m", "multi_llm_mcp"]
    }
  }
}

Substitua /path/to/multi-llm-mcp pelo caminho real onde você clonou o repositório.

4. Usar

Uma vez conectado, seu agente de IDE tem acesso à ferramenta ask_llm. Você pode invocá-la solicitando ao seu agente de forma natural. O agente chamará o servidor MCP nos bastidores.

Ferramenta: ask_llm

Delega uma pergunta de codificação, revisão de código ou tarefa de reescrita a um LLM externo.

Parâmetros:

ParâmetroPadrãoDescrição
prompt(obrigatório)A pergunta, trecho de código ou tarefa
system_prompt"You are a helpful coding assistant."Contexto de papel para o modelo
provider"ollama"Qual provedor usar
model"llama3"Nome do modelo para esse provedor
temperature0.00.0 = determinístico, 1.0 = criativo
max_tokens4096Comprimento máximo da resposta

Exemplos de Prompts

Use estes prompts no chat do seu IDE para acionar a ferramenta MCP:

Reescrever código usando um modelo em nuvem:

Use NVIDIA's Llama 3.1 to rewrite the database query in db.py to use async/await.

Obter uma revisão de código de um LLM diferente:

Ask Groq's Llama 3 to review src/multi_llm_mcp/server.py for performance issues and suggest improvements.

Refatorar com um modelo local (Ollama):

Use Ollama to refactor the authentication logic in auth.py into smaller, testable functions.

Gerar testes usando DeepSeek:

Ask DeepSeek Coder to write unit tests for the parse_config function in utils.py.

Obter uma segunda opinião sobre arquitetura:

Use OpenRouter's Claude to evaluate whether the current project structure follows
best practices and suggest a better layout.

Usando com Ollama (Modelos Locais)

Para assistência de codificação totalmente privada e offline:

# Install Ollama: https://ollama.com/download
ollama pull llama3
ollama pull codellama

Em seguida, use provider: "ollama" com qualquer nome de modelo baixado. Nenhuma chave de API é necessária.

Segurança

  • Chaves de API são carregadas apenas de variáveis de ambiente
  • .env está no gitignore e nunca é commitado
  • Nenhum segredo é codificado no código-fonte
  • Toda comunicação com a API ocorre apenas no lado do servidor

Estrutura do Projeto

multi-llm-mcp/
├── src/multi_llm_mcp/      # MCP server package
│   ├── __init__.py
│   ├── __main__.py         # entry point: python -m multi_llm_mcp
│   ├── server.py           # FastMCP server & the ask_llm tool
│   └── providers.py        # provider registry & client factory
├── tests/                  # pytest suite
├── pyproject.toml
├── .env.example
└── LICENSE

Executando Testes

pip install -e . pytest
pytest

Licença

MIT — veja LICENSE para detalhes.