Vision MCP

Servidor MCP para análisis de imágenes - otorga a los LLMs visión a través de API visual externa (Qwen, GPT-4o, etc.)

Documentación

🖼️ Vision MCP

Permite que modelos sin capacidad nativa de reconocimiento de imágenes (como DeepSeek) también puedan "ver" — obteniendo descripciones de texto de las imágenes mediante una API visual externa.

Proporciona reconocimiento de imágenes para modelos sin visión nativa (p. ej., DeepSeek) — mediante llamadas a una API visual externa.


Documentación en español

MCP Server (recomendado)

Herramientas

HerramientaDescripciónNota
vision_analyzeAnalizar imágenes — ruta local o URL, 1-5 imágenes, prompt personalizadoSolo lectura
vision_get_configVer la configuración actual de la API (clave enmascarada)Solo lectura
vision_update_configActualizar clave de API / modelo / dirección

Inicio rápido

# 安装依赖(本地开发)
npm install
npm run build

# 或直接通过 npx 运行(无需安装)
npx -y @guorui99/vision-mcp

Configurar MCP (en Claude Desktop / claude.json):

{
  "mcpServers": {
    "vision": {
      "command": "npx",
      "args": ["-y", "@guorui99/vision-mcp"]
    }
  }
}

Configuración inicial

Tras el inicio, configura la clave de API mediante la herramienta MCP:

vision_update_config api_key="你的API Key"

O usa variables de entorno (sin escribir en el disco):

VISION_API_KEY=你的Key npx -y @guorui99/vision-mcp

Variables de entorno compatibles:

VariableDescripciónValor predeterminado
VISION_API_KEYClave de API
VISION_BASE_URLDirección de la APIhttps://dashscope.aliyuncs.com/compatible-mode/v1
VISION_MODELNombre del modeloqwen3.5-omni-plus
VISION_LANGUAGEIdiomazh

Servicios de visión compatibles

ServicioModeloNotas
Alibaba Cloud Bailian (recomendado)qwen3.5-omni-plus1 millón de tokens gratis para nuevos usuarios
Alibaba Cloud Bailianqwen-vl-maxIgual que arriba
OpenAIgpt-4o-miniRequiere pago en el extranjero
OtrosCualquier formato compatible con OpenAICambiar base_url + nombre del modelo

Formatos compatibles

jpg, jpeg, png, gif, webp, bmp (máximo 5 imágenes por solicitud, máximo 20 MB por archivo)

Cómo funciona

  1. Leer la imagen → codificar en base64
  2. Llamar a la API de visión compatible con OpenAI
  3. Devolver la descripción de texto

Modo CLI (heredado)

# 单张图片
node scripts/vision.cjs photo.jpg "描述这张图片"

# 网络图片
node scripts/vision.cjs --url https://example.com/img.png "这是什么?"

# 多张图片
node scripts/vision.cjs img1.jpg img2.jpg "比较这两张图"

# 配置
node scripts/vision.cjs --setup
node scripts/vision.cjs --config

Estructura del proyecto

vision-mcp/
├── src/                 # MCP Server 源码 (TypeScript)
├── dist/                # 编译产物
├── scripts/vision.cjs   # CLI 工具 (legacy)
├── config.json          # 共享配置文件
├── package.json
└── tsconfig.json

Requisitos del entorno

  • Node.js >= 18
  • Clave de API de un servicio de visión (Alibaba Cloud Bailian / OpenAI / etc.)

Documentación en inglés

MCP Server (recomendado)

Herramientas

HerramientaDescripciónNota
vision_analyzeAnalizar imagen(es) — ruta local o URL, 1-5 imágenes, prompt personalizadoSolo lectura
vision_get_configVer la configuración actual de la API (clave enmascarada)Solo lectura
vision_update_configActualizar clave de API / modelo / URL base

Inicio rápido

# Local development
npm install
npm run build

# Or run via npx directly (no install needed)
npx -y @guorui99/vision-mcp

Añadir a Claude Desktop / claude.json:

{
  "mcpServers": {
    "vision": {
      "command": "npx",
      "args": ["-y", "@guorui99/vision-mcp"]
    }
  }
}

Configuración inicial

Establece tu clave de API mediante la herramienta MCP:

vision_update_config api_key="your-api-key"

O usa variables de entorno (sin escrituras en el disco):

VISION_API_KEY=your-key npx -y @guorui99/vision-mcp

Variables de entorno:

VariableDescripciónValor predeterminado
VISION_API_KEYClave de API para el servicio de visión
VISION_BASE_URLURL base de la APIhttps://dashscope.aliyuncs.com/compatible-mode/v1
VISION_MODELNombre del modeloqwen3.5-omni-plus
VISION_LANGUAGEIdioma de respuesta (zh o en)zh

Servicios de visión compatibles

ServicioModeloNotas
Alibaba Cloud Bailian (recomendado)qwen3.5-omni-plus1 millón de tokens gratis para nuevos usuarios
Alibaba Cloud Bailianqwen-vl-maxIgual que arriba
OpenAIgpt-4o-miniRequiere pago en el extranjero
OtrosCualquier formato compatible con OpenAICambiar base_url + nombre del modelo

Formatos compatibles

jpg, jpeg, png, gif, webp, bmp (máximo 5 imágenes por solicitud, máximo 20 MB por archivo)

Cómo funciona

  1. Leer imagen → codificar en base64
  2. Llamar a la API de visión compatible con OpenAI
  3. Devolver descripción de texto

Modo CLI (heredado)

# Single image
node scripts/vision.cjs photo.jpg "Describe this image"

# Remote image
node scripts/vision.cjs --url https://example.com/img.png "What is this?"

# Multiple images
node scripts/vision.cjs img1.jpg img2.jpg "Compare these two"

# Setup / Config
node scripts/vision.cjs --setup
node scripts/vision.cjs --config

Estructura del proyecto

vision-mcp/
├── src/                 # MCP Server source (TypeScript)
├── dist/                # Compiled output
├── scripts/vision.cjs   # CLI tool (legacy)
├── config.json          # Shared config file
├── package.json
└── tsconfig.json

Requisitos

  • Node.js >= 18
  • Clave de API para un servicio de visión (Alibaba Cloud Bailian / OpenAI / etc.)