Multi-LLM-MCP

Un servidor MCP que permite a cualquier agente de IDE delegar tareas de codificación a cualquier LLM: APIs en la nube o modelos locales, a través de una única interfaz unificada.

Documentación

multi-llm-mcp

Un servidor MCP que permite que cualquier agente de IDE delegue tareas de codificación a cualquier LLM — APIs en la nube o modelos locales — a través de una interfaz unificada.

En lugar de estar limitado a un solo modelo, tu agente de codificación puede llamar a NVIDIA NIM, OpenRouter, Groq, DeepSeek, o un modelo local de Ollama para una segunda opinión, revisión de código, o tareas especializadas.


Características

  • 5 proveedores listos para usar — NVIDIA NIM, OpenRouter, Groq, DeepSeek, Ollama
  • Soporte de modelos locales — Usa Ollama para asistencia de codificación totalmente offline y privada
  • Control detallado — Establece temperature, max_tokens, y system_prompt por llamada
  • Seguro por diseño — Las claves API permanecen en variables de entorno, nunca en el código
  • Agrupación de conexiones — Los clientes se almacenan en caché para llamadas API rápidas y eficientes
  • Estándar MCP — Funciona con cualquier IDE compatible con MCP (Claude Desktop, VS Code, Cursor, Windsurf, etc.)

Proveedores Soportados

ProveedorTipoModelos
OllamaLocalLlama 3, CodeLlama, Mistral, Gemma, etc.
NVIDIA NIMNubeLlama 3.1 405B, Mixtral, Code Llama, etc.
OpenRouterNubeClaude, GPT-4, Gemini, 200+ modelos
GroqNubeLlama 3, Mixtral, Gemma (inferencia ultra rápida)
DeepSeekNubeDeepSeek Coder, DeepSeek Chat

Inicio Rápido

1. Clonar e instalar

git clone https://github.com/arjunkr303/multi-llm-mcp.git
cd multi-llm-mcp

python -m venv venv
source venv/bin/activate   # On Windows: venv\Scripts\activate

pip install -e .

2. Configurar claves API

cp .env.example .env

Edita .env y agrega tus claves API. Solo necesitas las claves de los proveedores que quieras usar. Ollama no requiere clave API.

NVIDIA_API_KEY=your_nvidia_key_here
OPENROUTER_API_KEY=your_openrouter_key_here
GROQ_API_KEY=your_groq_key_here
DEEPSEEK_API_KEY=your_deepseek_key_here

3. Conectar a tu IDE

Agrega esto a tu configuración MCP:

Claude Desktop (claude_desktop_config.json):

{
  "mcpServers": {
    "multi-llm-gateway": {
      "command": "/path/to/multi-llm-mcp/venv/bin/python",
      "args": ["-m", "multi_llm_mcp"]
    }
  }
}

VS Code / Cursor (.vscode/mcp.json o configuración MCP del IDE):

{
  "mcpServers": {
    "multi-llm-gateway": {
      "command": "/path/to/multi-llm-mcp/venv/bin/python",
      "args": ["-m", "multi_llm_mcp"]
    }
  }
}

Reemplaza /path/to/multi-llm-mcp con la ruta real donde clonaste el repositorio.

4. Úsalo

Una vez conectado, tu agente IDE tiene acceso a la herramienta ask_llm. Puedes invocarla solicitándolo a tu agente de forma natural. El agente llamará al servidor MCP en segundo plano.

Herramienta: ask_llm

Delega una pregunta de codificación, revisión de código, o tarea de reescritura a un LLM externo.

Parámetros:

ParámetroPredeterminadoDescripción
prompt(requerido)La pregunta, fragmento de código, o tarea
system_prompt"You are a helpful coding assistant."Contexto de rol para el modelo
provider"ollama"Qué proveedor usar
model"llama3"Nombre del modelo para ese proveedor
temperature0.00.0 = determinista, 1.0 = creativo
max_tokens4096Longitud máxima de respuesta

Ejemplos de Prompts

Usa estos prompts en el chat de tu IDE para activar la herramienta MCP:

Reescribir código usando un modelo en la nube:

Use NVIDIA's Llama 3.1 to rewrite the database query in db.py to use async/await.

Obtener una revisión de código de un LLM diferente:

Ask Groq's Llama 3 to review src/multi_llm_mcp/server.py for performance issues and suggest improvements.

Refactorizar con un modelo local (Ollama):

Use Ollama to refactor the authentication logic in auth.py into smaller, testable functions.

Generar pruebas usando DeepSeek:

Ask DeepSeek Coder to write unit tests for the parse_config function in utils.py.

Obtener una segunda opinión sobre arquitectura:

Use OpenRouter's Claude to evaluate whether the current project structure follows
best practices and suggest a better layout.

Usando con Ollama (Modelos Locales)

Para asistencia de codificación totalmente privada y offline:

# Install Ollama: https://ollama.com/download
ollama pull llama3
ollama pull codellama

Luego usa provider: "ollama" con cualquier nombre de modelo descargado. No se necesita clave API.

Seguridad

  • Las claves API se cargan solo desde variables de entorno
  • .env está en gitignore y nunca se envía al repositorio
  • No hay secretos codificados en el código fuente
  • Toda la comunicación con la API ocurre solo en el lado del servidor

Estructura del Proyecto

multi-llm-mcp/
├── src/multi_llm_mcp/      # MCP server package
│   ├── __init__.py
│   ├── __main__.py         # entry point: python -m multi_llm_mcp
│   ├── server.py           # FastMCP server & the ask_llm tool
│   └── providers.py        # provider registry & client factory
├── tests/                  # pytest suite
├── pyproject.toml
├── .env.example
└── LICENSE

Ejecutando Pruebas

pip install -e . pytest
pytest

Licencia

MIT — consulta LICENSE para más detalles.