Vision MCP
Servidor MCP para análise de imagens - fornece visão a LLMs via API visual externa (Qwen, GPT-4o, etc.)
Documentação
🖼️ Vision MCP
Permite que modelos sem capacidade nativa de reconhecimento de imagens (como DeepSeek) também "vejam" imagens — obtendo descrições textuais de imagens por meio de uma API visual externa.
Fornece reconhecimento de imagens para modelos sem visão nativa (ex.: DeepSeek) — por meio de uma API visual externa.
Documentação em Chinês
Servidor MCP (Recomendado)
Ferramentas
| Ferramenta | Descrição | Anotação |
|---|---|---|
vision_analyze | Analisa imagem(ns) — caminho local ou URL, 1-5 imagens, prompt personalizado | Somente leitura |
vision_get_config | Exibe a configuração atual da API (chave mascarada) | Somente leitura |
vision_update_config | Atualiza chave da API / modelo / endereço | — |
Início Rápido
# 安装依赖(本地开发)
npm install
npm run build
# 或直接通过 npx 运行(无需安装)
npx -y @guorui99/vision-mcp
Configurar MCP (adicionar no Claude Desktop / claude.json):
{
"mcpServers": {
"vision": {
"command": "npx",
"args": ["-y", "@guorui99/vision-mcp"]
}
}
}
Configuração Inicial
Após a inicialização, configure a chave da API por meio da ferramenta MCP:
vision_update_config api_key="你的API Key"
Ou use variáveis de ambiente (sem gravar em disco):
VISION_API_KEY=你的Key npx -y @guorui99/vision-mcp
Variáveis de ambiente suportadas:
| Variável | Descrição | Padrão |
|---|---|---|
VISION_API_KEY | Chave da API | — |
VISION_BASE_URL | Endereço da API | https://dashscope.aliyuncs.com/compatible-mode/v1 |
VISION_MODEL | Nome do modelo | qwen3.5-omni-plus |
VISION_LANGUAGE | Idioma | zh |
Serviços de Visão Suportados
| Serviço | Modelo | Observações |
|---|---|---|
| Alibaba Cloud Bailian (recomendado) | qwen3.5-omni-plus | 1 milhão de tokens grátis para novos usuários |
| Alibaba Cloud Bailian | qwen-vl-max | Igual acima |
| OpenAI | gpt-4o-mini | Requer pagamento internacional |
| Outros | Qualquer formato compatível com OpenAI | Altere base_url + nome do modelo |
Formatos Suportados
jpg, jpeg, png, gif, webp, bmp (máximo de 5 imagens por solicitação, máximo de 20MB por arquivo)
Como Funciona
- Ler imagem → codificar em base64
- Chamar API de visão compatível com OpenAI
- Retornar descrição textual
Modo CLI (legado)
# 单张图片
node scripts/vision.cjs photo.jpg "描述这张图片"
# 网络图片
node scripts/vision.cjs --url https://example.com/img.png "这是什么?"
# 多张图片
node scripts/vision.cjs img1.jpg img2.jpg "比较这两张图"
# 配置
node scripts/vision.cjs --setup
node scripts/vision.cjs --config
Estrutura do Projeto
vision-mcp/
├── src/ # MCP Server 源码 (TypeScript)
├── dist/ # 编译产物
├── scripts/vision.cjs # CLI 工具 (legacy)
├── config.json # 共享配置文件
├── package.json
└── tsconfig.json
Requisitos de Ambiente
- Node.js >= 18
- Chave da API de visão (Alibaba Cloud Bailian / OpenAI / etc.)
Documentação em Inglês
Servidor MCP (Recomendado)
Ferramentas
| Ferramenta | Descrição | Anotação |
|---|---|---|
vision_analyze | Analisa imagem(ns) — caminho local ou URL, 1-5 imagens, prompt personalizado | Somente leitura |
vision_get_config | Exibe a configuração atual da API (chave mascarada) | Somente leitura |
vision_update_config | Atualiza chave da API / modelo / URL base | — |
Início Rápido
# Local development
npm install
npm run build
# Or run via npx directly (no install needed)
npx -y @guorui99/vision-mcp
Adicionar ao Claude Desktop / claude.json:
{
"mcpServers": {
"vision": {
"command": "npx",
"args": ["-y", "@guorui99/vision-mcp"]
}
}
}
Configuração Inicial
Defina sua chave de API por meio da ferramenta MCP:
vision_update_config api_key="your-api-key"
Ou use variáveis de ambiente (sem gravação em disco):
VISION_API_KEY=your-key npx -y @guorui99/vision-mcp
Variáveis de ambiente:
| Variável | Descrição | Padrão |
|---|---|---|
VISION_API_KEY | Chave da API para o serviço de visão | — |
VISION_BASE_URL | URL base da API | https://dashscope.aliyuncs.com/compatible-mode/v1 |
VISION_MODEL | Nome do modelo | qwen3.5-omni-plus |
VISION_LANGUAGE | Idioma da resposta (zh ou en) | zh |
Serviços de Visão Suportados
| Serviço | Modelo | Observações |
|---|---|---|
| Alibaba Cloud Bailian (recomendado) | qwen3.5-omni-plus | 1 milhão de tokens grátis para novos usuários |
| Alibaba Cloud Bailian | qwen-vl-max | Igual acima |
| OpenAI | gpt-4o-mini | Requer pagamento internacional |
| Outros | Qualquer compatível com OpenAI | Altere base_url + nome do modelo |
Formatos Suportados
jpg, jpeg, png, gif, webp, bmp (máximo de 5 imagens por solicitação, máximo de 20MB por arquivo)
Como Funciona
- Ler imagem → codificar em base64
- Chamar API de visão compatível com OpenAI
- Retornar descrição textual
Modo CLI (legado)
# Single image
node scripts/vision.cjs photo.jpg "Describe this image"
# Remote image
node scripts/vision.cjs --url https://example.com/img.png "What is this?"
# Multiple images
node scripts/vision.cjs img1.jpg img2.jpg "Compare these two"
# Setup / Config
node scripts/vision.cjs --setup
node scripts/vision.cjs --config
Estrutura do Projeto
vision-mcp/
├── src/ # MCP Server source (TypeScript)
├── dist/ # Compiled output
├── scripts/vision.cjs # CLI tool (legacy)
├── config.json # Shared config file
├── package.json
└── tsconfig.json
Requisitos
- Node.js >= 18
- Chave de API para um serviço de visão (Alibaba Cloud Bailian / OpenAI / etc.)