metadata-generation

Generar metadatos del programa (JSON) que contengan transcripción con códigos de tiempo, título, duración, resumen y fecha enviando audio y transcripción a Gemini.

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill metadata-generation

Metadata Generation

Generate a structured JSON file containing metadata for the radio show. This is done by sending the final mixed audio file and the original transcript back to Gemini.

Prerequisites

pip install google-genai

Workflow

  1. Read Inputs: Load the transcript from ./workspace/data/script.md and the final audio from ./workspace/audio/final/ai_radio.mp3.
  2. Upload Audio: Upload the audio file to the Gemini Files API.
  3. Generate Metadata: Call Gemini (e.g., gemini-3-flash-preview) using the Interactions API, passing the uploaded audio file and the transcript.
  4. Save Output: Save the resulting JSON to ./workspace/data/show_notes.json.

Python Code

The skill is implemented in scripts/generate_metadata.py.

# Example usage
python3 skills/metadata-generation/scripts/generate_metadata.py --workspace ./workspace

Output

The skill produces a JSON file at ./workspace/data/show_notes.json with the following structure:

{
  "show_title": "...",
  "show_duration": "...",
  "two_sentence_summary": "...",
  "date_of_generation": "YYYY-MM-DD",
  "timecoded_transcript": [
    {
      "timecode": "MM:SS",
      "speaker": "...",
      "text": "..."
    },
    ...
  ]
}

Error Handling

  • If the audio file is missing, the script will fail.
  • If the transcript is missing, it will fail.
  • If the Gemini API call fails, it will report the error and exit.

Más skills de google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Guía para usar la herramienta CLI de la API de Gemini. Úsala cuando necesites interactuar con la API de Gemini a través de la línea de comandos, gestionar agentes o generar contenido multimedia (imágenes,…
behavioral-evals
google-gemini
Guía para crear, ejecutar, corregir y promover evaluaciones conductuales. Úsese al verificar la lógica de decisión del agente, depurar fallos, depurar indicaciones…
gemini-live-api-dev
google-gemini
Transmisión bidireccional en tiempo real con Gemini a través de WebSockets para conversaciones de audio, video y texto. Admite entrada/salida de audio (PCM de 16 kHz), fotogramas de video, texto y transcripciones automáticas con detección de actividad de voz para manejo de interrupciones. Incluye funciones de audio nativas: diálogo afectivo, audio proactivo y modo de pensamiento; llamada a funciones para uso sincrónico y asincrónico de herramientas; y fundamentación con Google Search. Ofrece gestión de sesiones con compresión de contexto, reanudación y...
gemini-omni-flash-api
google-gemini
Usa esta habilidad para edición generativa de video, texto a video, generación de video con referencia de imagen y animaciones de transición de primer fotograma a video utilizando el…
gemini-api-dev
google-gemini
Crea aplicaciones con los modelos Gemini de Google, compatible con contenido multimodal, llamadas a funciones y salidas estructuradas en Python, JavaScript, Go y Java. Accede a los modelos actuales Gemini 3 (Pro, Flash, Pro Image) con contexto de 1 millón de tokens; los modelos heredados Gemini 2.x y 1.5 están obsoletos. Admite generación de texto, comprensión de imágenes/audio/video, llamadas a funciones, salida JSON estructurada, ejecución de código, almacenamiento en caché de contexto y embeddings. SDKs oficiales disponibles: google-genai (Python),...
gemini-interactions-api
google-gemini
Interfaz unificada para modelos y agentes Gemini con estado del lado del servidor, transmisión y orquestación de herramientas. Soporta múltiples modelos actuales (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) y el agente Deep Research; sustituye automáticamente IDs de modelos obsoletos por alternativas actuales. Descarga el historial de conversación al servidor mediante previous_interaction_id para interacciones multi-turno con estado sin gestión manual del historial. Orquestación de herramientas integrada que incluye...
deliver
google-gemini
Publica una versión condensada del informe en un webhook entrante de Google Chat o Slack, de modo que el resumen diario se entregue solo — se omite silenciosamente cuando no hay un webhook…