Multi-LLM-MCP
Un servidor MCP que permite a cualquier agente de IDE delegar tareas de codificación a cualquier LLM: APIs en la nube o modelos locales, a través de una única interfaz unificada.
Documentación
multi-llm-mcp
Un servidor MCP que permite que cualquier agente de IDE delegue tareas de codificación a cualquier LLM — APIs en la nube o modelos locales — a través de una interfaz unificada.
En lugar de estar limitado a un solo modelo, tu agente de codificación puede llamar a NVIDIA NIM, OpenRouter, Groq, DeepSeek, o un modelo local de Ollama para una segunda opinión, revisión de código, o tareas especializadas.
Características
- 5 proveedores listos para usar — NVIDIA NIM, OpenRouter, Groq, DeepSeek, Ollama
- Soporte de modelos locales — Usa Ollama para asistencia de codificación totalmente offline y privada
- Control detallado — Establece
temperature,max_tokens, ysystem_promptpor llamada - Seguro por diseño — Las claves API permanecen en variables de entorno, nunca en el código
- Agrupación de conexiones — Los clientes se almacenan en caché para llamadas API rápidas y eficientes
- Estándar MCP — Funciona con cualquier IDE compatible con MCP (Claude Desktop, VS Code, Cursor, Windsurf, etc.)
Proveedores Soportados
| Proveedor | Tipo | Modelos |
|---|---|---|
| Ollama | Local | Llama 3, CodeLlama, Mistral, Gemma, etc. |
| NVIDIA NIM | Nube | Llama 3.1 405B, Mixtral, Code Llama, etc. |
| OpenRouter | Nube | Claude, GPT-4, Gemini, 200+ modelos |
| Groq | Nube | Llama 3, Mixtral, Gemma (inferencia ultra rápida) |
| DeepSeek | Nube | DeepSeek Coder, DeepSeek Chat |
Inicio Rápido
1. Clonar e instalar
git clone https://github.com/arjunkr303/multi-llm-mcp.git
cd multi-llm-mcp
python -m venv venv
source venv/bin/activate # On Windows: venv\Scripts\activate
pip install -e .
2. Configurar claves API
cp .env.example .env
Edita .env y agrega tus claves API. Solo necesitas las claves de los proveedores que quieras usar. Ollama no requiere clave API.
NVIDIA_API_KEY=your_nvidia_key_here
OPENROUTER_API_KEY=your_openrouter_key_here
GROQ_API_KEY=your_groq_key_here
DEEPSEEK_API_KEY=your_deepseek_key_here
3. Conectar a tu IDE
Agrega esto a tu configuración MCP:
Claude Desktop (claude_desktop_config.json):
{
"mcpServers": {
"multi-llm-gateway": {
"command": "/path/to/multi-llm-mcp/venv/bin/python",
"args": ["-m", "multi_llm_mcp"]
}
}
}
VS Code / Cursor (.vscode/mcp.json o configuración MCP del IDE):
{
"mcpServers": {
"multi-llm-gateway": {
"command": "/path/to/multi-llm-mcp/venv/bin/python",
"args": ["-m", "multi_llm_mcp"]
}
}
}
Reemplaza
/path/to/multi-llm-mcpcon la ruta real donde clonaste el repositorio.
4. Úsalo
Una vez conectado, tu agente IDE tiene acceso a la herramienta ask_llm. Puedes invocarla solicitándolo a tu agente de forma natural. El agente llamará al servidor MCP en segundo plano.
Herramienta: ask_llm
Delega una pregunta de codificación, revisión de código, o tarea de reescritura a un LLM externo.
Parámetros:
| Parámetro | Predeterminado | Descripción |
|---|---|---|
prompt | (requerido) | La pregunta, fragmento de código, o tarea |
system_prompt | "You are a helpful coding assistant." | Contexto de rol para el modelo |
provider | "ollama" | Qué proveedor usar |
model | "llama3" | Nombre del modelo para ese proveedor |
temperature | 0.0 | 0.0 = determinista, 1.0 = creativo |
max_tokens | 4096 | Longitud máxima de respuesta |
Ejemplos de Prompts
Usa estos prompts en el chat de tu IDE para activar la herramienta MCP:
Reescribir código usando un modelo en la nube:
Use NVIDIA's Llama 3.1 to rewrite the database query in db.py to use async/await.
Obtener una revisión de código de un LLM diferente:
Ask Groq's Llama 3 to review src/multi_llm_mcp/server.py for performance issues and suggest improvements.
Refactorizar con un modelo local (Ollama):
Use Ollama to refactor the authentication logic in auth.py into smaller, testable functions.
Generar pruebas usando DeepSeek:
Ask DeepSeek Coder to write unit tests for the parse_config function in utils.py.
Obtener una segunda opinión sobre arquitectura:
Use OpenRouter's Claude to evaluate whether the current project structure follows
best practices and suggest a better layout.
Usando con Ollama (Modelos Locales)
Para asistencia de codificación totalmente privada y offline:
# Install Ollama: https://ollama.com/download
ollama pull llama3
ollama pull codellama
Luego usa provider: "ollama" con cualquier nombre de modelo descargado. No se necesita clave API.
Seguridad
- Las claves API se cargan solo desde variables de entorno
.envestá en gitignore y nunca se envía al repositorio- No hay secretos codificados en el código fuente
- Toda la comunicación con la API ocurre solo en el lado del servidor
Estructura del Proyecto
multi-llm-mcp/
├── src/multi_llm_mcp/ # MCP server package
│ ├── __init__.py
│ ├── __main__.py # entry point: python -m multi_llm_mcp
│ ├── server.py # FastMCP server & the ask_llm tool
│ └── providers.py # provider registry & client factory
├── tests/ # pytest suite
├── pyproject.toml
├── .env.example
└── LICENSE
Ejecutando Pruebas
pip install -e . pytest
pytest
Licencia
MIT — consulta LICENSE para más detalles.