Gemini Image and Audio generation

Servidor MCP para geração de imagens e áudio do Gemini

Documentação

Gemini Gen MCP

PyPI version License: MIT

Servidor MCP para geração de Imagem e Áudio Gemini usando os modelos de IA Gemini do Google.

Recursos

Este servidor MCP fornece ferramentas para:

  • Gerar imagens a partir de texto usando o modelo Flash Image do Gemini
  • Gerar áudio a partir de texto usando o modelo TTS Gemini 2.5 Flash Preview

Instalação

Via PyPI

pip install gemini-gen-mcp

Via Código-fonte

git clone https://github.com/ServiceStack/gemini-gen-mcp.git
cd gemini-gen-mcp
pip install -e .

Pré-requisitos

Você precisa de uma chave de API do Google Gemini para usar este servidor. Obtenha uma em Google AI Studio.

Variáveis de Ambiente

VariávelObrigatóriaPadrãoDescrição
GEMINI_API_KEYSim-Sua chave de API do Google Gemini
GEMINI_DOWNLOAD_PATHNão/tmp/gemini_gen_mcpDiretório onde os arquivos gerados são salvos

Defina as variáveis de ambiente:

export GEMINI_API_KEY='your-api-key-here'
export GEMINI_DOWNLOAD_PATH='/path/to/downloads'  # optional

Os arquivos gerados são organizados por tipo e data:

  • Imagens: $GEMINI_DOWNLOAD_PATH/images/YYYY-MM-DD/
  • Áudio: $GEMINI_DOWNLOAD_PATH/audios/YYYY-MM-DD/

Cada arquivo gerado inclui um arquivo .info.json complementar com metadados de geração.

Uso

Executando o Servidor

Execute o servidor MCP diretamente:

gemini-gen-mcp

Ou como um módulo Python:

python -m gemini_gen_mcp.server

Usando com Claude Desktop

Consulte CLAUDE_CONFIG.md para instruções detalhadas.

Adicione isso ao seu claude_desktop_config.json:

{
  "mcpServers": {
    "gemini-gen": {
      "description": "Gemini Image and Audio TTS generation",
      "command": "uvx",
      "args": [
        "gemini-gen-mcp"
      ],
      "env": {
        "GEMINI_API_KEY": "$GEMINI_API_KEY"
      }
    }
  }
}

Usando em llms .py

Ou cole a configuração do servidor em Servidores MCP do llms .py:

Nome: gemini-gen

{
  "description": "Gemini Image and Audio TTS generation",
  "command": "uvx",
  "args": [
    "gemini-gen-mcp"
  ],
  "env": {
    "GEMINI_API_KEY": "$GEMINI_API_KEY"
  }
}

Servidor de Desenvolvimento

Para desenvolvimento, você pode executar este servidor usando uv:

{
  "mcpServers": {
    {
      "command": "uv",
      "args": [
        "run",
        "--directory",
        "/path/to/ServiceStack/gemini-gen-mcp",
        "gemini-gen-mcp"
      ],
      "env": {
        "GEMINI_API_KEY": "$GEMINI_API_KEY"
      }
    }
  }
}

Ferramentas Disponíveis

text_to_image

Gere imagens a partir de descrições de texto usando os modelos de geração de imagem do Gemini.

Parâmetros:

  • prompt (string, obrigatório): Descrição em texto da imagem a ser gerada
  • model (string, opcional): Modelo Gemini a ser usado
    • gemini-2.5-flash-image (padrão)
    • gemini-3-pro-image-preview
  • aspect_ratio (string, opcional): Proporção de aspecto para a imagem gerada (padrão: "1:1")
    • Suportadas: 1:1, 2:3, 3:2, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
  • temperature (float, opcional): Temperatura de amostragem para geração de imagem (padrão: 1.0)
  • top_p (float, opcional): Parâmetro de amostragem de núcleo (opcional)

Exemplo:

{
  "prompt": "A serene mountain landscape at sunset with a lake",
  "model": "gemini-2.5-flash-image",
  "aspect_ratio": "16:9",
  "temperature": 1.0
}

text_to_audio

Gere áudio/fala a partir de texto usando os modelos TTS do Gemini. A saída é salva no formato WAV.

Parâmetros:

  • text (string, obrigatório): Texto para converter em fala
  • model (string, opcional): Modelo TTS Gemini a ser usado
    • gemini-2.5-flash-preview-tts (padrão)
    • gemini-2.5-pro-preview-tts
  • voice (string, opcional): Voz a ser usada para geração de fala (padrão: "Kore")

Vozes Disponíveis:

VozEstiloVozEstiloVozEstilo
ZephyrBrilhantePuckAnimadoCharonInformativo
KoreFirmeFenrirEmpolganteLedaJovial
OrusFirmeAoedeLeveCallirrhoeDescontraído
AutonoeBrilhanteEnceladusSuaveIapetusClaro
UmbrielDescontraídoAlgiebaMacioDespinaMacio
ErinomeClaroAlgenibGraveRasalgethiInformativo
LaomedeiaAnimadoAchernarSuaveAlnilamFirme
SchedarUniformeGacruxMaduroPulcherrimaDireto
AchirdAmigávelZubenelgenubiCasualVindemiatrixGentil
SadachbiaVivazSadaltagerConhecedorSulafatCaloroso

Exemplo:

{
  "text": "Hello, this is a test of the Gemini text to speech system.",
  "model": "gemini-2.5-flash-preview-tts",
  "voice": "Kore"
}

Desenvolvimento

Configurando o Ambiente de Desenvolvimento

# Clone the repository
git clone https://github.com/ServiceStack/gemini-gen-mcp.git
cd gemini-gen-mcp

# Install in editable mode with dependencies
pip install -e .

Executando Testes

# Install test dependencies
pip install pytest pytest-asyncio

# Run tests
```bash
# uv run pytest tests -v
npm test

Licença

Este projeto é licenciado sob a Licença MIT - consulte o arquivo LICENSE para detalhes.

Contribuindo

Contribuições são bem-vindas! Sinta-se à vontade para enviar um Pull Request.

Suporte

Para problemas e perguntas, use a página de Issues do GitHub.

Agradecimentos

Links