Vision MCP
Servidor MCP para análisis de imágenes - otorga a los LLMs visión a través de API visual externa (Qwen, GPT-4o, etc.)
Documentación
🖼️ Vision MCP
Permite que modelos sin capacidad nativa de reconocimiento de imágenes (como DeepSeek) también puedan "ver" — obteniendo descripciones de texto de las imágenes mediante una API visual externa.
Proporciona reconocimiento de imágenes para modelos sin visión nativa (p. ej., DeepSeek) — mediante llamadas a una API visual externa.
Documentación en español
MCP Server (recomendado)
Herramientas
| Herramienta | Descripción | Nota |
|---|---|---|
vision_analyze | Analizar imágenes — ruta local o URL, 1-5 imágenes, prompt personalizado | Solo lectura |
vision_get_config | Ver la configuración actual de la API (clave enmascarada) | Solo lectura |
vision_update_config | Actualizar clave de API / modelo / dirección | — |
Inicio rápido
# 安装依赖(本地开发)
npm install
npm run build
# 或直接通过 npx 运行(无需安装)
npx -y @guorui99/vision-mcp
Configurar MCP (en Claude Desktop / claude.json):
{
"mcpServers": {
"vision": {
"command": "npx",
"args": ["-y", "@guorui99/vision-mcp"]
}
}
}
Configuración inicial
Tras el inicio, configura la clave de API mediante la herramienta MCP:
vision_update_config api_key="你的API Key"
O usa variables de entorno (sin escribir en el disco):
VISION_API_KEY=你的Key npx -y @guorui99/vision-mcp
Variables de entorno compatibles:
| Variable | Descripción | Valor predeterminado |
|---|---|---|
VISION_API_KEY | Clave de API | — |
VISION_BASE_URL | Dirección de la API | https://dashscope.aliyuncs.com/compatible-mode/v1 |
VISION_MODEL | Nombre del modelo | qwen3.5-omni-plus |
VISION_LANGUAGE | Idioma | zh |
Servicios de visión compatibles
| Servicio | Modelo | Notas |
|---|---|---|
| Alibaba Cloud Bailian (recomendado) | qwen3.5-omni-plus | 1 millón de tokens gratis para nuevos usuarios |
| Alibaba Cloud Bailian | qwen-vl-max | Igual que arriba |
| OpenAI | gpt-4o-mini | Requiere pago en el extranjero |
| Otros | Cualquier formato compatible con OpenAI | Cambiar base_url + nombre del modelo |
Formatos compatibles
jpg, jpeg, png, gif, webp, bmp (máximo 5 imágenes por solicitud, máximo 20 MB por archivo)
Cómo funciona
- Leer la imagen → codificar en base64
- Llamar a la API de visión compatible con OpenAI
- Devolver la descripción de texto
Modo CLI (heredado)
# 单张图片
node scripts/vision.cjs photo.jpg "描述这张图片"
# 网络图片
node scripts/vision.cjs --url https://example.com/img.png "这是什么?"
# 多张图片
node scripts/vision.cjs img1.jpg img2.jpg "比较这两张图"
# 配置
node scripts/vision.cjs --setup
node scripts/vision.cjs --config
Estructura del proyecto
vision-mcp/
├── src/ # MCP Server 源码 (TypeScript)
├── dist/ # 编译产物
├── scripts/vision.cjs # CLI 工具 (legacy)
├── config.json # 共享配置文件
├── package.json
└── tsconfig.json
Requisitos del entorno
- Node.js >= 18
- Clave de API de un servicio de visión (Alibaba Cloud Bailian / OpenAI / etc.)
Documentación en inglés
MCP Server (recomendado)
Herramientas
| Herramienta | Descripción | Nota |
|---|---|---|
vision_analyze | Analizar imagen(es) — ruta local o URL, 1-5 imágenes, prompt personalizado | Solo lectura |
vision_get_config | Ver la configuración actual de la API (clave enmascarada) | Solo lectura |
vision_update_config | Actualizar clave de API / modelo / URL base | — |
Inicio rápido
# Local development
npm install
npm run build
# Or run via npx directly (no install needed)
npx -y @guorui99/vision-mcp
Añadir a Claude Desktop / claude.json:
{
"mcpServers": {
"vision": {
"command": "npx",
"args": ["-y", "@guorui99/vision-mcp"]
}
}
}
Configuración inicial
Establece tu clave de API mediante la herramienta MCP:
vision_update_config api_key="your-api-key"
O usa variables de entorno (sin escrituras en el disco):
VISION_API_KEY=your-key npx -y @guorui99/vision-mcp
Variables de entorno:
| Variable | Descripción | Valor predeterminado |
|---|---|---|
VISION_API_KEY | Clave de API para el servicio de visión | — |
VISION_BASE_URL | URL base de la API | https://dashscope.aliyuncs.com/compatible-mode/v1 |
VISION_MODEL | Nombre del modelo | qwen3.5-omni-plus |
VISION_LANGUAGE | Idioma de respuesta (zh o en) | zh |
Servicios de visión compatibles
| Servicio | Modelo | Notas |
|---|---|---|
| Alibaba Cloud Bailian (recomendado) | qwen3.5-omni-plus | 1 millón de tokens gratis para nuevos usuarios |
| Alibaba Cloud Bailian | qwen-vl-max | Igual que arriba |
| OpenAI | gpt-4o-mini | Requiere pago en el extranjero |
| Otros | Cualquier formato compatible con OpenAI | Cambiar base_url + nombre del modelo |
Formatos compatibles
jpg, jpeg, png, gif, webp, bmp (máximo 5 imágenes por solicitud, máximo 20 MB por archivo)
Cómo funciona
- Leer imagen → codificar en base64
- Llamar a la API de visión compatible con OpenAI
- Devolver descripción de texto
Modo CLI (heredado)
# Single image
node scripts/vision.cjs photo.jpg "Describe this image"
# Remote image
node scripts/vision.cjs --url https://example.com/img.png "What is this?"
# Multiple images
node scripts/vision.cjs img1.jpg img2.jpg "Compare these two"
# Setup / Config
node scripts/vision.cjs --setup
node scripts/vision.cjs --config
Estructura del proyecto
vision-mcp/
├── src/ # MCP Server source (TypeScript)
├── dist/ # Compiled output
├── scripts/vision.cjs # CLI tool (legacy)
├── config.json # Shared config file
├── package.json
└── tsconfig.json
Requisitos
- Node.js >= 18
- Clave de API para un servicio de visión (Alibaba Cloud Bailian / OpenAI / etc.)