cover-image-generation

Generar imágenes de portada para el programa de radio usando Gemini 3 Flash Image (con respaldo a Pro).

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill cover-image-generation

Image Generation Skill

This skill generates an appropriate cover image for the radio show based on a prompt, using the Gemini 3 Flash Image model, with a fallback to the Gemini 3 Pro Image model ("Nano Banana Pro") if needed.

Requirements

  • Python 3.10+
  • google-genai Python package (>= 2.0.1)

Instructions

  1. Generate an image (Recommended: use the metadata file directly):

    python3 skills/cover-image-generation/scripts/generate_image.py \
      --workspace ./workspace \
      --metadata ./workspace/data/show_notes.json
    

    Note: Using --metadata will automatically extract the show title and apply a random, high-quality prompt template. This is the preferred method.

    Alternative (Manual prompt):

    python3 skills/cover-image-generation/scripts/generate_image.py \
      --workspace ./workspace \
      --prompt "A prompt describing the image"
    
  2. Output:

    • The image will be saved to {workspace}/images/cover.png.

Model

  • Primary Model: gemini-3-flash-image-preview
  • Fallback Model: gemini-3-pro-image-preview
  • Resolution: 1:1 (default)

Prompting rules

When using the --metadata option, this skill uses a set of predefined prompt templates and selects one at random to generate cover images. It dynamically inserts the show title into the selected template.

  • Example Prompt: "A professional podcast cover image for a show titled 'AI Talk Radio' on the 'AI Talk Radio' station. The design features the text 'AI Talk Radio' in a bold, stylish white font centered on the cover. The background is a vibrant purple with a textured water ripple effect that covers the entire frame, creating a dynamic and clean aesthetic."

If you choose to use the --prompt option instead, you must construct the prompt yourself. In that case, follow these rules:

Forbidden themes

  • Do not ask for futuristic, cyberpunk or neon themes
  • Do not include any text other than the show title

Más skills de google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Guía para usar la herramienta CLI de la API de Gemini. Úsala cuando necesites interactuar con la API de Gemini a través de la línea de comandos, gestionar agentes o generar contenido multimedia (imágenes,…
behavioral-evals
google-gemini
Guía para crear, ejecutar, corregir y promover evaluaciones conductuales. Úsese al verificar la lógica de decisión del agente, depurar fallos, depurar indicaciones…
gemini-live-api-dev
google-gemini
Transmisión bidireccional en tiempo real con Gemini a través de WebSockets para conversaciones de audio, video y texto. Admite entrada/salida de audio (PCM de 16 kHz), fotogramas de video, texto y transcripciones automáticas con detección de actividad de voz para manejo de interrupciones. Incluye funciones de audio nativas: diálogo afectivo, audio proactivo y modo de pensamiento; llamada a funciones para uso sincrónico y asincrónico de herramientas; y fundamentación con Google Search. Ofrece gestión de sesiones con compresión de contexto, reanudación y...
gemini-omni-flash-api
google-gemini
Usa esta habilidad para edición generativa de video, texto a video, generación de video con referencia de imagen y animaciones de transición de primer fotograma a video utilizando el…
gemini-api-dev
google-gemini
Crea aplicaciones con los modelos Gemini de Google, compatible con contenido multimodal, llamadas a funciones y salidas estructuradas en Python, JavaScript, Go y Java. Accede a los modelos actuales Gemini 3 (Pro, Flash, Pro Image) con contexto de 1 millón de tokens; los modelos heredados Gemini 2.x y 1.5 están obsoletos. Admite generación de texto, comprensión de imágenes/audio/video, llamadas a funciones, salida JSON estructurada, ejecución de código, almacenamiento en caché de contexto y embeddings. SDKs oficiales disponibles: google-genai (Python),...
gemini-interactions-api
google-gemini
Interfaz unificada para modelos y agentes Gemini con estado del lado del servidor, transmisión y orquestación de herramientas. Soporta múltiples modelos actuales (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) y el agente Deep Research; sustituye automáticamente IDs de modelos obsoletos por alternativas actuales. Descarga el historial de conversación al servidor mediante previous_interaction_id para interacciones multi-turno con estado sin gestión manual del historial. Orquestación de herramientas integrada que incluye...
deliver
google-gemini
Publica una versión condensada del informe en un webhook entrante de Google Chat o Slack, de modo que el resumen diario se entregue solo — se omite silenciosamente cuando no hay un webhook…