cover-image-generation

Erstelle Coverbilder für die Radiosendung mit Gemini 3 Flash Image (mit Fallback auf Pro).

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill cover-image-generation

Image Generation Skill

This skill generates an appropriate cover image for the radio show based on a prompt, using the Gemini 3 Flash Image model, with a fallback to the Gemini 3 Pro Image model ("Nano Banana Pro") if needed.

Requirements

  • Python 3.10+
  • google-genai Python package (>= 2.0.1)

Instructions

  1. Generate an image (Recommended: use the metadata file directly):

    python3 skills/cover-image-generation/scripts/generate_image.py \
      --workspace ./workspace \
      --metadata ./workspace/data/show_notes.json
    

    Note: Using --metadata will automatically extract the show title and apply a random, high-quality prompt template. This is the preferred method.

    Alternative (Manual prompt):

    python3 skills/cover-image-generation/scripts/generate_image.py \
      --workspace ./workspace \
      --prompt "A prompt describing the image"
    
  2. Output:

    • The image will be saved to {workspace}/images/cover.png.

Model

  • Primary Model: gemini-3-flash-image-preview
  • Fallback Model: gemini-3-pro-image-preview
  • Resolution: 1:1 (default)

Prompting rules

When using the --metadata option, this skill uses a set of predefined prompt templates and selects one at random to generate cover images. It dynamically inserts the show title into the selected template.

  • Example Prompt: "A professional podcast cover image for a show titled 'AI Talk Radio' on the 'AI Talk Radio' station. The design features the text 'AI Talk Radio' in a bold, stylish white font centered on the cover. The background is a vibrant purple with a textured water ripple effect that covers the entire frame, creating a dynamic and clean aesthetic."

If you choose to use the --prompt option instead, you must construct the prompt yourself. In that case, follow these rules:

Forbidden themes

  • Do not ask for futuristic, cyberpunk or neon themes
  • Do not include any text other than the show title

Mehr Skills von google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Anleitung zur Verwendung des Gemini API CLI-Tools. Verwenden Sie es, wenn Sie über die Befehlszeile mit der Gemini API interagieren, Agents verwalten oder Medien (Bilder, …) erstellen müssen.
behavioral-evals
google-gemini
Anleitung zum Erstellen, Ausführen, Beheben und Fördern von Verhaltensevaluierungen. Verwenden Sie dies zur Überprüfung der Entscheidungslogik von Agenten, zum Debuggen von Fehlern, zum Debuggen von Prompts…
gemini-live-api-dev
google-gemini
Echtzeit-bidirektionales Streaming mit Gemini über WebSockets für Audio-, Video- und Textgespräche. Unterstützt Audio-Eingabe/-Ausgabe (16 kHz PCM), Videobilder, Text und automatische Transkriptionen mit Spracherkennung zur Unterbrechungsverwaltung. Enthält native Audiofunktionen: affektiven Dialog, proaktives Audio und Denkmodus; Funktionsaufrufe für synchrone und asynchrone Werkzeugnutzung; sowie Google Search Grounding. Bietet Sitzungsverwaltung mit Kontextkomprimierung, Wiederaufnahme und...
gemini-omni-flash-api
google-gemini
Nutzen Sie diese Fähigkeit für generative Videobearbeitung, Text-zu-Video, bildreferenzierte Videogenerierung und Übergangsanimationen vom ersten Bild zum Video unter Verwendung der…
gemini-api-dev
google-gemini
Erstellen Sie Anwendungen mit Googles Gemini-Modellen, die multimodale Inhalte, Funktionsaufrufe und strukturierte Ausgaben in Python, JavaScript, Go und Java unterstützen. Greifen Sie auf aktuelle Gemini 3 Modelle (Pro, Flash, Pro Image) mit 1M Token-Kontext zu; ältere Gemini 2.x und 1.5 Modelle sind veraltet. Unterstützt Textgenerierung, Bild-/Audio-/Video-Verständnis, Funktionsaufrufe, strukturierte JSON-Ausgabe, Codeausführung, Kontext-Caching und Embeddings. Offizielle SDKs verfügbar: google-genai (Python),...
gemini-interactions-api
google-gemini
Einheitliche Schnittstelle für Gemini-Modelle und Agents mit serverseitigem Zustand, Streaming und Tool-Orchestrierung. Unterstützt mehrere aktuelle Modelle (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) und den Deep Research Agent; ersetzt automatisch veraltete Modell-IDs durch aktuelle Alternativen. Auslagern des Gesprächsverlaufs an den Server über previous_interaction_id für zustandsbehaftete Multi-Turn-Interaktionen ohne manuelle Verlaufverwaltung. Integrierte Tool-Orchestrierung inklusive...
deliver
google-gemini
Veröffentlicht eine gekürzte Version des Briefings an einen Google Chat- oder Slack-Incoming-Webhook, sodass sich der tägliche Lauf selbst zustellt – und überspringt still, wenn kein Webhook …