audio-mixing

Mischen Sie Sprachaudio und Hintergrundmusik zu einer polierten Radioshow-Datei.

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill audio-mixing

Audio Mixing

Combine the TTS speech audio and Lyria background music into a single, polished radio show file.

Embedded Script

python3 skills/audio-mixing/scripts/mix_audio.py --workspace ./workspace

Arguments

ArgumentDefaultDescription
--workspaceworkspaceRoot workspace directory

What it does

  1. Loads speech from {workspace}/audio/speech/speech.wav.
  2. Adds 3 seconds of silence padding to the end of the speech to prevent it from being faded out.
  3. Loads background music from {workspace}/audio/music/background.mp3 (if exists).
  4. Loops music to match speech duration, lowers volume to -18dB.
  5. Overlays speech on music with a 1-second music intro.
  6. Adds fade-in/fade-out.
  7. Exports as MP3.

Dependencies

  • pydub
  • ffmpeg (system)

Mixing Guidelines

ElementLevelNotes
Speech0 dBUntouched, full volume
Background music-18 dBBarely audible — subtle bed under speech

Transitions

  • Music fade-in: 3 seconds
  • Music fade-out: 5 seconds
  • Overall fade-in: 500ms
  • Overall fade-out: 2 seconds

Output

FilePathFormat
MP3 (distribution){workspace}/audio/final/ai_radio.mp3MP3, 192kbps

Fallback

If no background music exists, produces speech-only output with just fade-in/fade-out applied.

Mehr Skills von google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Anleitung zur Verwendung des Gemini API CLI-Tools. Verwenden Sie es, wenn Sie über die Befehlszeile mit der Gemini API interagieren, Agents verwalten oder Medien (Bilder, …) erstellen müssen.
behavioral-evals
google-gemini
Anleitung zum Erstellen, Ausführen, Beheben und Fördern von Verhaltensevaluierungen. Verwenden Sie dies zur Überprüfung der Entscheidungslogik von Agenten, zum Debuggen von Fehlern, zum Debuggen von Prompts…
gemini-live-api-dev
google-gemini
Echtzeit-bidirektionales Streaming mit Gemini über WebSockets für Audio-, Video- und Textgespräche. Unterstützt Audio-Eingabe/-Ausgabe (16 kHz PCM), Videobilder, Text und automatische Transkriptionen mit Spracherkennung zur Unterbrechungsverwaltung. Enthält native Audiofunktionen: affektiven Dialog, proaktives Audio und Denkmodus; Funktionsaufrufe für synchrone und asynchrone Werkzeugnutzung; sowie Google Search Grounding. Bietet Sitzungsverwaltung mit Kontextkomprimierung, Wiederaufnahme und...
gemini-omni-flash-api
google-gemini
Nutzen Sie diese Fähigkeit für generative Videobearbeitung, Text-zu-Video, bildreferenzierte Videogenerierung und Übergangsanimationen vom ersten Bild zum Video unter Verwendung der…
gemini-api-dev
google-gemini
Erstellen Sie Anwendungen mit Googles Gemini-Modellen, die multimodale Inhalte, Funktionsaufrufe und strukturierte Ausgaben in Python, JavaScript, Go und Java unterstützen. Greifen Sie auf aktuelle Gemini 3 Modelle (Pro, Flash, Pro Image) mit 1M Token-Kontext zu; ältere Gemini 2.x und 1.5 Modelle sind veraltet. Unterstützt Textgenerierung, Bild-/Audio-/Video-Verständnis, Funktionsaufrufe, strukturierte JSON-Ausgabe, Codeausführung, Kontext-Caching und Embeddings. Offizielle SDKs verfügbar: google-genai (Python),...
gemini-interactions-api
google-gemini
Einheitliche Schnittstelle für Gemini-Modelle und Agents mit serverseitigem Zustand, Streaming und Tool-Orchestrierung. Unterstützt mehrere aktuelle Modelle (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) und den Deep Research Agent; ersetzt automatisch veraltete Modell-IDs durch aktuelle Alternativen. Auslagern des Gesprächsverlaufs an den Server über previous_interaction_id für zustandsbehaftete Multi-Turn-Interaktionen ohne manuelle Verlaufverwaltung. Integrierte Tool-Orchestrierung inklusive...
deliver
google-gemini
Veröffentlicht eine gekürzte Version des Briefings an einen Google Chat- oder Slack-Incoming-Webhook, sodass sich der tägliche Lauf selbst zustellt – und überspringt still, wenn kein Webhook …