audio-mixing

Campurkan audio ucapan dan musik latar menjadi file acara radio yang halus.

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill audio-mixing

Audio Mixing

Combine the TTS speech audio and Lyria background music into a single, polished radio show file.

Embedded Script

python3 skills/audio-mixing/scripts/mix_audio.py --workspace ./workspace

Arguments

ArgumentDefaultDescription
--workspaceworkspaceRoot workspace directory

What it does

  1. Loads speech from {workspace}/audio/speech/speech.wav.
  2. Adds 3 seconds of silence padding to the end of the speech to prevent it from being faded out.
  3. Loads background music from {workspace}/audio/music/background.mp3 (if exists).
  4. Loops music to match speech duration, lowers volume to -18dB.
  5. Overlays speech on music with a 1-second music intro.
  6. Adds fade-in/fade-out.
  7. Exports as MP3.

Dependencies

  • pydub
  • ffmpeg (system)

Mixing Guidelines

ElementLevelNotes
Speech0 dBUntouched, full volume
Background music-18 dBBarely audible — subtle bed under speech

Transitions

  • Music fade-in: 3 seconds
  • Music fade-out: 5 seconds
  • Overall fade-in: 500ms
  • Overall fade-out: 2 seconds

Output

FilePathFormat
MP3 (distribution){workspace}/audio/final/ai_radio.mp3MP3, 192kbps

Fallback

If no background music exists, produces speech-only output with just fade-in/fade-out applied.

Lebih banyak skill dari google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Panduan untuk menggunakan alat CLI Gemini API. Gunakan saat Anda perlu berinteraksi dengan Gemini API melalui baris perintah, mengelola agen, atau menghasilkan media (gambar, …)
behavioral-evals
google-gemini
Panduan untuk membuat, menjalankan, memperbaiki, dan mempromosikan evaluasi perilaku. Gunakan saat memverifikasi logika keputusan agen, men-debug kegagalan, men-debug prompt…
gemini-live-api-dev
google-gemini
Streaming dua arah secara real-time dengan Gemini melalui WebSocket untuk percakapan audio, video, dan teks. Mendukung input/output audio (PCM 16 kHz), bingkai video, teks, dan transkripsi otomatis dengan deteksi aktivitas suara untuk penanganan interupsi. Menyertakan fitur audio asli: dialog afektif, audio proaktif, dan mode berpikir; pemanggilan fungsi untuk penggunaan alat sinkron dan asinkron; serta penjangkaran Google Search. Menawarkan manajemen sesi dengan kompresi konteks, kelanjutan, dan...
gemini-omni-flash-api
google-gemini
Gunakan keterampilan ini untuk penyuntingan video generatif, teks-ke-video, pembuatan video dengan referensi gambar, dan animasi transisi bingkai pertama-ke-video menggunakan…
gemini-api-dev
google-gemini
Bangun aplikasi dengan model Gemini dari Google, mendukung konten multimodal, pemanggilan fungsi, dan keluaran terstruktur di Python, JavaScript, Go, dan Java. Akses model Gemini 3 terkini (Pro, Flash, Pro Image) dengan konteks 1M token; model lawas Gemini 2.x dan 1.5 sudah tidak digunakan lagi. Mendukung pembuatan teks, pemahaman gambar/audio/video, pemanggilan fungsi, keluaran JSON terstruktur, eksekusi kode, caching konteks, dan embeddings. SDK resmi tersedia: google-genai (Python),...
gemini-interactions-api
google-gemini
Antarmuka terpadu untuk model dan agen Gemini dengan status sisi server, streaming, dan orkestrasi alat. Mendukung beberapa model terkini (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) dan agen Deep Research; secara otomatis mengganti ID model yang tidak digunakan lagi dengan alternatif terkini. Offload riwayat percakapan ke server melalui previous_interaction_id untuk interaksi multi-putaran yang memiliki status tanpa pengelolaan riwayat manual. Orkestrasi alat bawaan termasuk...
deliver
google-gemini
Memposting versi ringkas dari briefing ke incoming webhook Google Chat atau Slack, sehingga laporan harian terkirim dengan sendirinya — melewati secara diam-diam ketika tidak ada webhook yang…