Gemini Image and Audio generation
Servidor MCP para geração de imagens e áudio do Gemini
Documentação
Gemini Gen MCP
Servidor MCP para geração de Imagem e Áudio Gemini usando os modelos de IA Gemini do Google.
Recursos
Este servidor MCP fornece ferramentas para:
- Gerar imagens a partir de texto usando o modelo Flash Image do Gemini
- Gerar áudio a partir de texto usando o modelo TTS Gemini 2.5 Flash Preview
Instalação
Via PyPI
pip install gemini-gen-mcp
Via Código-fonte
git clone https://github.com/ServiceStack/gemini-gen-mcp.git
cd gemini-gen-mcp
pip install -e .
Pré-requisitos
Você precisa de uma chave de API do Google Gemini para usar este servidor. Obtenha uma em Google AI Studio.
Variáveis de Ambiente
| Variável | Obrigatória | Padrão | Descrição |
|---|---|---|---|
GEMINI_API_KEY | Sim | - | Sua chave de API do Google Gemini |
GEMINI_DOWNLOAD_PATH | Não | /tmp/gemini_gen_mcp | Diretório onde os arquivos gerados são salvos |
Defina as variáveis de ambiente:
export GEMINI_API_KEY='your-api-key-here'
export GEMINI_DOWNLOAD_PATH='/path/to/downloads' # optional
Os arquivos gerados são organizados por tipo e data:
- Imagens:
$GEMINI_DOWNLOAD_PATH/images/YYYY-MM-DD/ - Áudio:
$GEMINI_DOWNLOAD_PATH/audios/YYYY-MM-DD/
Cada arquivo gerado inclui um arquivo .info.json complementar com metadados de geração.
Uso
Executando o Servidor
Execute o servidor MCP diretamente:
gemini-gen-mcp
Ou como um módulo Python:
python -m gemini_gen_mcp.server
Usando com Claude Desktop
Consulte CLAUDE_CONFIG.md para instruções detalhadas.
Adicione isso ao seu claude_desktop_config.json:
{
"mcpServers": {
"gemini-gen": {
"description": "Gemini Image and Audio TTS generation",
"command": "uvx",
"args": [
"gemini-gen-mcp"
],
"env": {
"GEMINI_API_KEY": "$GEMINI_API_KEY"
}
}
}
}
Usando em llms .py
Ou cole a configuração do servidor em Servidores MCP do llms .py:
Nome: gemini-gen
{
"description": "Gemini Image and Audio TTS generation",
"command": "uvx",
"args": [
"gemini-gen-mcp"
],
"env": {
"GEMINI_API_KEY": "$GEMINI_API_KEY"
}
}
Servidor de Desenvolvimento
Para desenvolvimento, você pode executar este servidor usando uv:
{
"mcpServers": {
{
"command": "uv",
"args": [
"run",
"--directory",
"/path/to/ServiceStack/gemini-gen-mcp",
"gemini-gen-mcp"
],
"env": {
"GEMINI_API_KEY": "$GEMINI_API_KEY"
}
}
}
}
Ferramentas Disponíveis
text_to_image
Gere imagens a partir de descrições de texto usando os modelos de geração de imagem do Gemini.
Parâmetros:
prompt(string, obrigatório): Descrição em texto da imagem a ser geradamodel(string, opcional): Modelo Gemini a ser usadogemini-2.5-flash-image(padrão)gemini-3-pro-image-preview
aspect_ratio(string, opcional): Proporção de aspecto para a imagem gerada (padrão: "1:1")- Suportadas:
1:1,2:3,3:2,3:4,4:3,4:5,5:4,9:16,16:9,21:9
- Suportadas:
temperature(float, opcional): Temperatura de amostragem para geração de imagem (padrão: 1.0)top_p(float, opcional): Parâmetro de amostragem de núcleo (opcional)
Exemplo:
{
"prompt": "A serene mountain landscape at sunset with a lake",
"model": "gemini-2.5-flash-image",
"aspect_ratio": "16:9",
"temperature": 1.0
}
text_to_audio
Gere áudio/fala a partir de texto usando os modelos TTS do Gemini. A saída é salva no formato WAV.
Parâmetros:
text(string, obrigatório): Texto para converter em falamodel(string, opcional): Modelo TTS Gemini a ser usadogemini-2.5-flash-preview-tts(padrão)gemini-2.5-pro-preview-tts
voice(string, opcional): Voz a ser usada para geração de fala (padrão: "Kore")
Vozes Disponíveis:
| Voz | Estilo | Voz | Estilo | Voz | Estilo |
|---|---|---|---|---|---|
| Zephyr | Brilhante | Puck | Animado | Charon | Informativo |
| Kore | Firme | Fenrir | Empolgante | Leda | Jovial |
| Orus | Firme | Aoede | Leve | Callirrhoe | Descontraído |
| Autonoe | Brilhante | Enceladus | Suave | Iapetus | Claro |
| Umbriel | Descontraído | Algieba | Macio | Despina | Macio |
| Erinome | Claro | Algenib | Grave | Rasalgethi | Informativo |
| Laomedeia | Animado | Achernar | Suave | Alnilam | Firme |
| Schedar | Uniforme | Gacrux | Maduro | Pulcherrima | Direto |
| Achird | Amigável | Zubenelgenubi | Casual | Vindemiatrix | Gentil |
| Sadachbia | Vivaz | Sadaltager | Conhecedor | Sulafat | Caloroso |
Exemplo:
{
"text": "Hello, this is a test of the Gemini text to speech system.",
"model": "gemini-2.5-flash-preview-tts",
"voice": "Kore"
}
Desenvolvimento
Configurando o Ambiente de Desenvolvimento
# Clone the repository
git clone https://github.com/ServiceStack/gemini-gen-mcp.git
cd gemini-gen-mcp
# Install in editable mode with dependencies
pip install -e .
Executando Testes
# Install test dependencies
pip install pytest pytest-asyncio
# Run tests
```bash
# uv run pytest tests -v
npm test
Licença
Este projeto é licenciado sob a Licença MIT - consulte o arquivo LICENSE para detalhes.
Contribuindo
Contribuições são bem-vindas! Sinta-se à vontade para enviar um Pull Request.
Suporte
Para problemas e perguntas, use a página de Issues do GitHub.
Agradecimentos
- Construído com FastMCP
- Desenvolvido com Google Gemini AI