metadata-generation

Generiere Show-Metadaten (JSON) mit zeitcodiertem Transkript, Titel, Dauer, Zusammenfassung und Datum, indem Audio und Transkript an Gemini gesendet werden.

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill metadata-generation

Metadata Generation

Generate a structured JSON file containing metadata for the radio show. This is done by sending the final mixed audio file and the original transcript back to Gemini.

Prerequisites

pip install google-genai

Workflow

  1. Read Inputs: Load the transcript from ./workspace/data/script.md and the final audio from ./workspace/audio/final/ai_radio.mp3.
  2. Upload Audio: Upload the audio file to the Gemini Files API.
  3. Generate Metadata: Call Gemini (e.g., gemini-3-flash-preview) using the Interactions API, passing the uploaded audio file and the transcript.
  4. Save Output: Save the resulting JSON to ./workspace/data/show_notes.json.

Python Code

The skill is implemented in scripts/generate_metadata.py.

# Example usage
python3 skills/metadata-generation/scripts/generate_metadata.py --workspace ./workspace

Output

The skill produces a JSON file at ./workspace/data/show_notes.json with the following structure:

{
  "show_title": "...",
  "show_duration": "...",
  "two_sentence_summary": "...",
  "date_of_generation": "YYYY-MM-DD",
  "timecoded_transcript": [
    {
      "timecode": "MM:SS",
      "speaker": "...",
      "text": "..."
    },
    ...
  ]
}

Error Handling

  • If the audio file is missing, the script will fail.
  • If the transcript is missing, it will fail.
  • If the Gemini API call fails, it will report the error and exit.

Mehr Skills von google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Anleitung zur Verwendung des Gemini API CLI-Tools. Verwenden Sie es, wenn Sie über die Befehlszeile mit der Gemini API interagieren, Agents verwalten oder Medien (Bilder, …) erstellen müssen.
behavioral-evals
google-gemini
Anleitung zum Erstellen, Ausführen, Beheben und Fördern von Verhaltensevaluierungen. Verwenden Sie dies zur Überprüfung der Entscheidungslogik von Agenten, zum Debuggen von Fehlern, zum Debuggen von Prompts…
gemini-live-api-dev
google-gemini
Echtzeit-bidirektionales Streaming mit Gemini über WebSockets für Audio-, Video- und Textgespräche. Unterstützt Audio-Eingabe/-Ausgabe (16 kHz PCM), Videobilder, Text und automatische Transkriptionen mit Spracherkennung zur Unterbrechungsverwaltung. Enthält native Audiofunktionen: affektiven Dialog, proaktives Audio und Denkmodus; Funktionsaufrufe für synchrone und asynchrone Werkzeugnutzung; sowie Google Search Grounding. Bietet Sitzungsverwaltung mit Kontextkomprimierung, Wiederaufnahme und...
gemini-omni-flash-api
google-gemini
Nutzen Sie diese Fähigkeit für generative Videobearbeitung, Text-zu-Video, bildreferenzierte Videogenerierung und Übergangsanimationen vom ersten Bild zum Video unter Verwendung der…
gemini-api-dev
google-gemini
Erstellen Sie Anwendungen mit Googles Gemini-Modellen, die multimodale Inhalte, Funktionsaufrufe und strukturierte Ausgaben in Python, JavaScript, Go und Java unterstützen. Greifen Sie auf aktuelle Gemini 3 Modelle (Pro, Flash, Pro Image) mit 1M Token-Kontext zu; ältere Gemini 2.x und 1.5 Modelle sind veraltet. Unterstützt Textgenerierung, Bild-/Audio-/Video-Verständnis, Funktionsaufrufe, strukturierte JSON-Ausgabe, Codeausführung, Kontext-Caching und Embeddings. Offizielle SDKs verfügbar: google-genai (Python),...
gemini-interactions-api
google-gemini
Einheitliche Schnittstelle für Gemini-Modelle und Agents mit serverseitigem Zustand, Streaming und Tool-Orchestrierung. Unterstützt mehrere aktuelle Modelle (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) und den Deep Research Agent; ersetzt automatisch veraltete Modell-IDs durch aktuelle Alternativen. Auslagern des Gesprächsverlaufs an den Server über previous_interaction_id für zustandsbehaftete Multi-Turn-Interaktionen ohne manuelle Verlaufverwaltung. Integrierte Tool-Orchestrierung inklusive...
deliver
google-gemini
Veröffentlicht eine gekürzte Version des Briefings an einen Google Chat- oder Slack-Incoming-Webhook, sodass sich der tägliche Lauf selbst zustellt – und überspringt still, wenn kein Webhook …