Vision MCP

Servidor MCP para análise de imagens - fornece visão a LLMs via API visual externa (Qwen, GPT-4o, etc.)

Documentação

🖼️ Vision MCP

Permite que modelos sem capacidade nativa de reconhecimento de imagens (como DeepSeek) também "vejam" imagens — obtendo descrições textuais de imagens por meio de uma API visual externa.

Fornece reconhecimento de imagens para modelos sem visão nativa (ex.: DeepSeek) — por meio de uma API visual externa.


Documentação em Chinês

Servidor MCP (Recomendado)

Ferramentas

FerramentaDescriçãoAnotação
vision_analyzeAnalisa imagem(ns) — caminho local ou URL, 1-5 imagens, prompt personalizadoSomente leitura
vision_get_configExibe a configuração atual da API (chave mascarada)Somente leitura
vision_update_configAtualiza chave da API / modelo / endereço—

Início Rápido

# 安装依赖(本地开发)
npm install
npm run build

# 或直接通过 npx 运行(无需安装)
npx -y @guorui99/vision-mcp

Configurar MCP (adicionar no Claude Desktop / claude.json):

{
  "mcpServers": {
    "vision": {
      "command": "npx",
      "args": ["-y", "@guorui99/vision-mcp"]
    }
  }
}

Configuração Inicial

Após a inicialização, configure a chave da API por meio da ferramenta MCP:

vision_update_config api_key="你的API Key"

Ou use variáveis de ambiente (sem gravar em disco):

VISION_API_KEY=你的Key npx -y @guorui99/vision-mcp

Variáveis de ambiente suportadas:

VariávelDescriçãoPadrão
VISION_API_KEYChave da API—
VISION_BASE_URLEndereço da APIhttps://dashscope.aliyuncs.com/compatible-mode/v1
VISION_MODELNome do modeloqwen3.5-omni-plus
VISION_LANGUAGEIdiomazh

Serviços de Visão Suportados

ServiçoModeloObservações
Alibaba Cloud Bailian (recomendado)qwen3.5-omni-plus1 milhão de tokens grátis para novos usuários
Alibaba Cloud Bailianqwen-vl-maxIgual acima
OpenAIgpt-4o-miniRequer pagamento internacional
OutrosQualquer formato compatível com OpenAIAltere base_url + nome do modelo

Formatos Suportados

jpg, jpeg, png, gif, webp, bmp (máximo de 5 imagens por solicitação, máximo de 20MB por arquivo)

Como Funciona

  1. Ler imagem → codificar em base64
  2. Chamar API de visão compatível com OpenAI
  3. Retornar descrição textual

Modo CLI (legado)

# 单张图片
node scripts/vision.cjs photo.jpg "描述这张图片"

# 网络图片
node scripts/vision.cjs --url https://example.com/img.png "这是什么?"

# 多张图片
node scripts/vision.cjs img1.jpg img2.jpg "比较这两张图"

# 配置
node scripts/vision.cjs --setup
node scripts/vision.cjs --config

Estrutura do Projeto

vision-mcp/
├── src/                 # MCP Server 源码 (TypeScript)
├── dist/                # 编译产物
├── scripts/vision.cjs   # CLI 工具 (legacy)
├── config.json          # 共享配置文件
├── package.json
└── tsconfig.json

Requisitos de Ambiente

  • Node.js >= 18
  • Chave da API de visão (Alibaba Cloud Bailian / OpenAI / etc.)

Documentação em Inglês

Servidor MCP (Recomendado)

Ferramentas

FerramentaDescriçãoAnotação
vision_analyzeAnalisa imagem(ns) — caminho local ou URL, 1-5 imagens, prompt personalizadoSomente leitura
vision_get_configExibe a configuração atual da API (chave mascarada)Somente leitura
vision_update_configAtualiza chave da API / modelo / URL base—

Início Rápido

# Local development
npm install
npm run build

# Or run via npx directly (no install needed)
npx -y @guorui99/vision-mcp

Adicionar ao Claude Desktop / claude.json:

{
  "mcpServers": {
    "vision": {
      "command": "npx",
      "args": ["-y", "@guorui99/vision-mcp"]
    }
  }
}

Configuração Inicial

Defina sua chave de API por meio da ferramenta MCP:

vision_update_config api_key="your-api-key"

Ou use variáveis de ambiente (sem gravação em disco):

VISION_API_KEY=your-key npx -y @guorui99/vision-mcp

Variáveis de ambiente:

VariávelDescriçãoPadrão
VISION_API_KEYChave da API para o serviço de visão—
VISION_BASE_URLURL base da APIhttps://dashscope.aliyuncs.com/compatible-mode/v1
VISION_MODELNome do modeloqwen3.5-omni-plus
VISION_LANGUAGEIdioma da resposta (zh ou en)zh

Serviços de Visão Suportados

ServiçoModeloObservações
Alibaba Cloud Bailian (recomendado)qwen3.5-omni-plus1 milhão de tokens grátis para novos usuários
Alibaba Cloud Bailianqwen-vl-maxIgual acima
OpenAIgpt-4o-miniRequer pagamento internacional
OutrosQualquer compatível com OpenAIAltere base_url + nome do modelo

Formatos Suportados

jpg, jpeg, png, gif, webp, bmp (máximo de 5 imagens por solicitação, máximo de 20MB por arquivo)

Como Funciona

  1. Ler imagem → codificar em base64
  2. Chamar API de visão compatível com OpenAI
  3. Retornar descrição textual

Modo CLI (legado)

# Single image
node scripts/vision.cjs photo.jpg "Describe this image"

# Remote image
node scripts/vision.cjs --url https://example.com/img.png "What is this?"

# Multiple images
node scripts/vision.cjs img1.jpg img2.jpg "Compare these two"

# Setup / Config
node scripts/vision.cjs --setup
node scripts/vision.cjs --config

Estrutura do Projeto

vision-mcp/
├── src/                 # MCP Server source (TypeScript)
├── dist/                # Compiled output
├── scripts/vision.cjs   # CLI tool (legacy)
├── config.json          # Shared config file
├── package.json
└── tsconfig.json

Requisitos

  • Node.js >= 18
  • Chave de API para um serviço de visão (Alibaba Cloud Bailian / OpenAI / etc.)