Universal Image MCP

Servidor MCP universal para generación de imágenes con IA compatible con AWS Bedrock (Nova Canvas), OpenAI (GPT Image, DALL-E) y Google Gemini (Imagen 4). Genere, transforme y edite imágenes utilizando múltiples modelos de IA a través de una única interfaz de Protocolo de Contexto de Modelo.

Documentación

Universal Image MCP - Servidor de generación de imágenes IA multi-proveedor para Claude Desktop y clientes MCP

Servidor MCP universal para generación de imágenes IA que soporta AWS Bedrock (Nova Canvas), OpenAI (GPT Image, DALL-E) y Google Gemini (Imagen 4). Genera, transforma y edita imágenes usando múltiples modelos de IA a través de una única interfaz de Model Context Protocol.

Python
License: MIT
MCP

¿Qué es Universal Image MCP?

Universal Image MCP es un servidor de Model Context Protocol (MCP) que proporciona acceso unificado a múltiples proveedores de generación de imágenes IA. Ya sea que uses Claude Desktop, Kiro IDE o cualquier cliente compatible con MCP, este servidor te permite generar y transformar imágenes usando: n

  • AWS Bedrock - Amazon Nova Canvas para generación de imágenes de nivel empresarial
  • OpenAI - GPT Image 1.5, ChatGPT Image, modelos DALL-E
  • Google Gemini - Gemini 2.5 Flash Image, Imagen 4, Imagen 4 Ultra

Perfecto para desarrolladores que crean aplicaciones de IA, creadores de contenido y cualquier persona que necesite acceso programático a múltiples APIs de generación de imágenes a través de una única interfaz.

Ejemplos de salidas

Comparación de diagramas de arquitectura generados por diferentes modelos usando este servidor MCP:

EstiloModeloSalida
Diagrama técnicoOpenAI gpt-image-1.5Universal Image MCP Server Architecture Diagram - OpenAI GPT Image 1.5 - Multi-provider AI image generation with AWS Bedrock, OpenAI, Google Gemini integration
Diagrama técnicoGoogle gemini-2.5-flash-imageUniversal Image MCP Server Architecture Diagram - Google Gemini 2.5 Flash - Model Context Protocol for AI image generation
Diagrama técnicoAWS amazon.nova-canvas-v1:0Universal Image MCP Server Architecture Diagram - AWS Bedrock Nova Canvas - Enterprise AI image generation architecture
Arte de arcilla 3DGoogle gemini-2.5-flash-image3D Clay Art Style MCP Architecture - Google Gemini 2.5 Flash - AI-generated technical diagram in cute clay aesthetic
Arte de arcilla 3DOpenAI gpt-image-1.53D Clay Art Style MCP Architecture - OpenAI GPT Image 1.5 - AI image generation server in 3D clay art style
Arte de arcilla 3DAWS amazon.nova-canvas-v1:03D Clay Art Style MCP Architecture - AWS Nova Canvas - Multi-provider image generation in pastel clay aesthetic

Ver el prompt utilizado

Prompt del diagrama técnico:

Technical architecture diagram of a Universal Image MCP Server system. The diagram shows:

Top layer: MCP Client (Claude Desktop, Kiro IDE) connecting via Model Context Protocol

Middle layer: Universal Image MCP Server (FastMCP) with three main components:
1. Server Module (server.py) - handles list_models, generate_image, transform_image, prompt_guide tools
2. Provider Module (providers.py) - manages lazy initialization and provider abstraction
3. Configuration - environment variables for ENABLE_AWS, ENABLE_OPENAI, ENABLE_GEMINI

Bottom layer: Three provider boxes side by side:
- AWS Bedrock (boto3) - Amazon Nova Canvas, with AWS credentials and region config
- OpenAI API - GPT Image 1.5, ChatGPT Image Latest, with API key
- Google Gemini API - Gemini 2.5 Flash, Imagen 4, with API key

Data flow arrows showing:
- Client sends tool requests to Server
- Server routes to appropriate Provider based on model_id
- Providers make API calls to their respective services
- Image data flows back through the chain

Clean, professional software architecture diagram style with boxes, arrows, and labels. Use blue and gray color scheme. Modern technical documentation aesthetic. Isometric or layered view showing clear separation of concerns.

Prompt de arte de arcilla 3D:

Same technical architecture content as above, but rendered in:

3D clay art style with soft rounded shapes, pastel colors, cute minimalist aesthetic, soft studio lighting, clean composition with depth and shadows.

Nota: Las versiones de arte de arcilla 3D usaron s3tablearch.png como imagen de referencia para la guía de estilo.

Características principales

  • 🔄 Soporte multi-proveedor - Cambia entre AWS Bedrock, OpenAI y Google Gemini sin problemas
  • 🚀 Descubrimiento dinámico de modelos - Obtiene automáticamente los últimos modelos disponibles de cada API de proveedor
  • ⚡ Inicialización diferida - Los clientes de proveedores se cargan solo cuando es necesario para un rendimiento óptimo
  • 🎨 Soporte de imagen de referencia - Genera nuevas imágenes basadas en estilos de imagen existentes
  • 📐 Dimensiones configurables - Ancho/alto personalizado para modelos de IA compatibles
  • 📚 Guía de prompts integrada - Mejores prácticas para escribir prompts efectivos de generación de imágenes
  • 🔌 Protocolo MCP - Funciona con Claude Desktop, Kiro IDE y todos los clientes compatibles con MCP
  • 🐍 Python 3.11+ - Python moderno con sugerencias de tipo y soporte asíncrono

Instalación rápida

Instala vía pip:

pip install universal-image-mcp

O usa con uvx (recomendado para servidores MCP):

uvx universal-image-mcp@latest

Configuración del servidor MCP

Para Claude Desktop

Añade a tu archivo de configuración MCP de Claude Desktop:

macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
Windows: %APPDATA%\Claude\claude_desktop_config.json

{
  "mcpServers": {
    "universal-image-mcp": {
      "command": "uvx",
      "args": ["universal-image-mcp@latest"],
      "env": {
        "ENABLE_AWS": "true",
        "AWS_PROFILE": "default",
        "AWS_REGION": "us-east-1",
        
        "ENABLE_OPENAI": "true",
        "OPENAI_API_KEY": "sk-...",
        
        "ENABLE_GEMINI": "true",
        "GEMINI_API_KEY": "..."
      }
    }
  }
}

Para Kiro IDE

Añade a ~/.kiro/settings/mcp.json:

{
  "mcpServers": {
    "universal-image-mcp": {
      "command": "uvx",
      "args": ["universal-image-mcp@latest"],
      "env": {
        "ENABLE_AWS": "true",
        "ENABLE_OPENAI": "true",
        "OPENAI_API_KEY": "sk-...",
        "ENABLE_GEMINI": "true",
        "GEMINI_API_KEY": "..."
      }
    }
  }
}

Obtención de claves API y credenciales

Antes de usar este servidor MCP, necesitarás obtener credenciales para los proveedores que quieras usar.

Configuración de AWS Bedrock

AWS Bedrock usa tus credenciales locales de AWS. Tienes varias opciones:

  1. Configuración de AWS CLI (Recomendado)

  2. Archivo de credenciales de AWS

  3. Variables de entorno

Obtención de claves de acceso de AWS:

  • Inicia sesión en la Consola de AWS
  • Navega a IAM → Usuarios → Tu usuario → Credenciales de seguridad
  • Crea una nueva clave de acceso en "Claves de acceso"
  • Asegúrate de que tu usuario de IAM tenga permisos para Bedrock (por ejemplo, política AmazonBedrockFullAccess)

Clave API de OpenAI

  1. Crea una cuenta de OpenAI

  2. Genera una clave API

    • Ve a la página de claves API
    • Haz clic en "Crear nueva clave secreta"
    • Dale un nombre descriptivo (opcional)
    • Copia la clave inmediatamente (no podrás verla de nuevo)
  3. Añade información de facturación

    • OpenAI requiere información de pago para usar la API
    • Navega a Facturación para añadir detalles de pago

Documentación oficial: Guía de inicio rápido de OpenAI

Clave API de Google Gemini

  1. Obtén una clave API de Gemini

    • Visita Google AI Studio
    • Inicia sesión con tu cuenta de Google
    • Haz clic en "Obtener clave API" o "Crear clave API"
    • Crea un nuevo proyecto o selecciona uno existente
    • Copia tu clave API
  2. Alternativa: Clave API de Google Cloud

    • Para uso en producción, puedes usar Vertex AI en Google Cloud
    • Esto proporciona más funciones empresariales y controles de facturación

Documentación oficial: Inicio rápido de la API de Gemini

Variables de entorno

VariableRequeridoDescripción
ENABLE_AWSNoHabilitar proveedor de AWS Bedrock (true/false, predeterminado: false)
AWS_PROFILENoNombre del perfil de AWS (default, SSO o perfil con nombre)
AWS_REGIONNoRegión de AWS (predeterminado: us-east-1)
ENABLE_OPENAINoHabilitar proveedor de OpenAI (true/false, predeterminado: false)
OPENAI_API_KEYSi OpenAI está habilitadoClave API de OpenAI de platform.openai.com
ENABLE_GEMININoHabilitar proveedor de Google Gemini (true/false, predeterminado: false)
GEMINI_API_KEYSi Gemini está habilitadoClave API de Google Gemini de Google AI Studio

Referencia de API - Herramientas MCP

list_models()

Lista todos los modelos de generación de imágenes IA disponibles de los proveedores habilitados. Los modelos se obtienen dinámicamente de la API de cada proveedor, filtrando automáticamente los modelos obsoletos.

Devuelve: Lista formateada de IDs de modelos compatibles con generate_image() y transform_image()

Ejemplos de modelos:

  • AWS: amazon.nova-canvas-v1:0
  • OpenAI: gpt-image-1.5, chatgpt-image-latest
  • Gemini: models/gemini-2.5-flash-image, models/imagen-4.0-generate-001

generate_image(prompt, model_id, output_path, reference_image?, width?, height?)

Genera imágenes IA a partir de prompts de texto usando cualquier modelo compatible.

ParámetroRequeridoPor defectoDescripción
promptSí-Descripción textual detallada de la imagen. Sé específico sobre el sujeto, estilo, iluminación, colores, composición y ambiente.
model_idSí-ID de modelo de list_models(). Ejemplos: amazon.nova-canvas-v1:0, gpt-image-1.5, models/gemini-2.5-flash-image
output_pathSí-Ruta de archivo para guardar la imagen generada. Los directorios padre se crean automáticamente.
reference_imageNoNoneRuta a la imagen de referencia para guía de estilo/contenido
widthNo1024Ancho de la imagen en píxeles. Nota: Algunos modelos solo admiten tamaños específicos.
heightNo1024Alto de la imagen en píxeles. Nota: Algunos modelos solo admiten tamaños específicos.
### transform_image(image_path, prompt, model_id, output_path)

Transforma y edita imágenes existentes utilizando modificaciones impulsadas por IA basadas en prompts de texto.

ParámetroRequeridoDescripción
image_pathSíRuta a la imagen de origen para transformar (PNG, JPEG, etc.)
promptSíInstrucciones de transformación con IA (p. ej., "Hazlo en blanco y negro", "Añade un arcoíris", "Convierte a estilo acuarela")
model_idSíID de modelo de list_models()
output_pathSíRuta de archivo para guardar la imagen transformada

Casos de uso: Edición de imágenes, transferencia de estilo, manipulación de fotos con IA, transformaciones artísticas

prompt_guide()

Obtén las mejores prácticas de ingeniería de prompts de IA para la generación de imágenes. Devuelve pautas completas que cubren:

  • Estructura del prompt (Sujeto + Detalles + Estilo + Iluminación + Estado de ánimo + Composición)
  • Descripciones específicas vs genéricas
  • Palabras clave de estilo, iluminación y estado de ánimo
  • Ejemplos de prompts para diferentes casos de uso

Modelos de imagen de IA compatibles

Todos los modelos se descubren dinámicamente. Usa list_models() para ver las opciones actuales.

Modelos de AWS Bedrock

  • Amazon Nova Canvas (amazon.nova-canvas-v1:0) - Generación de imágenes de nivel empresarial con soporte de entrada de texto e imagen

Modelos de OpenAI

  • GPT Image 1.5 (gpt-image-1.5) - Último modelo de generación de imágenes de OpenAI
  • ChatGPT Image Latest (chatgpt-image-latest) - Generación de imágenes integrada con ChatGPT

Modelos de Google Gemini

  • Gemini 2.5 Flash Image (models/gemini-2.5-flash-image) - Generación de imágenes rápida y eficiente
  • Gemini 3 Pro Image (models/gemini-3-pro-image-preview) - Capacidades avanzadas de generación de imágenes
  • Imagen 4 (models/imagen-4.0-generate-001) - El modelo de imagen más avanzado de Google
  • Imagen 4 Ultra (models/imagen-4.0-ultra-generate-001) - Modelo Imagen de mayor calidad
  • Imagen 4 Fast (models/imagen-4.0-fast-generate-001) - Optimizado para velocidad

Casos de uso

  • Desarrollo de aplicaciones de IA - Integra múltiples proveedores de generación de imágenes en tus aplicaciones
  • Creación de contenido - Genera materiales de marketing, contenido para redes sociales, ilustraciones
  • Prototipado y diseño - Visualiza rápidamente conceptos e ideas de diseño
  • Automatización de edición de imágenes - Procesa y transforma imágenes por lotes con IA
  • Investigación y experimentación - Compara resultados entre diferentes modelos de IA
  • Flujos de trabajo de Claude Desktop - Mejora las conversaciones de Claude con generación de imágenes
  • Herramientas para desarrolladores - Construye herramientas y extensiones compatibles con MCP

Contribuciones

¡Las contribuciones son bienvenidas! No dudes en enviar un Pull Request. Para cambios importantes, abre primero un issue para discutir lo que te gustaría cambiar.

Proyectos relacionados

Palabras clave

mcp-server image-generation ai-images aws-bedrock openai google-gemini claude-desktop imagen nova-canvas python fastmcp model-context-protocol ai-art text-to-image image-transformation

Licencia

MIT