audio-mixing

tarafından google-gemini

Konuşma sesini ve arka plan müziğini cilalı bir radyo programı dosyasına karıştırır.

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill audio-mixing

Audio Mixing

Combine the TTS speech audio and Lyria background music into a single, polished radio show file.

Embedded Script

python3 skills/audio-mixing/scripts/mix_audio.py --workspace ./workspace

Arguments

ArgumentDefaultDescription
--workspaceworkspaceRoot workspace directory

What it does

  1. Loads speech from {workspace}/audio/speech/speech.wav.
  2. Adds 3 seconds of silence padding to the end of the speech to prevent it from being faded out.
  3. Loads background music from {workspace}/audio/music/background.mp3 (if exists).
  4. Loops music to match speech duration, lowers volume to -18dB.
  5. Overlays speech on music with a 1-second music intro.
  6. Adds fade-in/fade-out.
  7. Exports as MP3.

Dependencies

  • pydub
  • ffmpeg (system)

Mixing Guidelines

ElementLevelNotes
Speech0 dBUntouched, full volume
Background music-18 dBBarely audible — subtle bed under speech

Transitions

  • Music fade-in: 3 seconds
  • Music fade-out: 5 seconds
  • Overall fade-in: 500ms
  • Overall fade-out: 2 seconds

Output

FilePathFormat
MP3 (distribution){workspace}/audio/final/ai_radio.mp3MP3, 192kbps

Fallback

If no background music exists, produces speech-only output with just fade-in/fade-out applied.

google-gemini tarafından daha fazla skill

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Gemini API CLI aracını kullanma kılavuzu. Gemini API ile komut satırı üzerinden etkileşim kurmanız, aracıları yönetmeniz veya medya (görseller, …) oluşturmanız gerektiğinde kullanın.
behavioral-evals
google-gemini
Davranışsal değerlendirmeler oluşturma, çalıştırma, düzeltme ve teşvik etme rehberi. Ajan karar mantığını doğrularken, hataları ayıklarken, prompt hatalarını ayıklarken kullanın…
gemini-live-api-dev
google-gemini
Gerçek zamanlı çift yönlü akış, WebSockets üzerinden Gemini ile ses, video ve metin konuşmaları için. Ses giriş/çıkışı (16 kHz PCM), video kareleri, metin ve kesinti yönetimi için ses etkinliği algılamalı otomatik transkripsiyonları destekler. Yerel ses özelliklerini içerir: duygusal diyalog, proaktif ses ve düşünme modu; senkron ve asenkron araç kullanımı için fonksiyon çağrısı; ve Google Search grounding. Oturum yönetimi, bağlam sıkıştırma, devam ettirme ve...
gemini-omni-flash-api
google-gemini
Üretken video düzenleme, metinden videoya, görsel referanslı video oluşturma ve ilk kareden videoya geçiş animasyonları için bu beceriyi kullanın…
gemini-api-dev
google-gemini
Google'ın Gemini modelleriyle uygulamalar geliştirin; çok modlu içerik, fonksiyon çağırma ve yapılandırılmış çıktıları Python, JavaScript, Go ve Java'da destekler. 1M token bağlamıyla mevcut Gemini 3 modellerine (Pro, Flash, Pro Image) erişin; eski Gemini 2.x ve 1.5 modelleri kullanımdan kaldırılmıştır. Metin oluşturma, görüntü/ses/video anlama, fonksiyon çağırma, yapılandırılmış JSON çıktısı, kod yürütme, bağlam önbelleğe alma ve gömme işlemlerini destekler. Resmi SDK'lar mevcuttur: google-genai (Python),...
gemini-interactions-api
google-gemini
Gemini modelleri ve ajanları için sunucu tarafı durumu, akış ve araç orkestrasyonu ile birleşik arayüz. Birden çok güncel modeli (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) ve Deep Research ajanını destekler; kullanımdan kaldırılan model kimliklerini otomatik olarak güncel alternatiflerle değiştirir. previous_interaction_id aracılığıyla konuşma geçmişini sunucuya aktararak manuel geçmiş yönetimi olmadan durum bilgisi olan çok turlu etkileşimler sağlar. Dahili araç orkestrasyonu dahil...
deliver
google-gemini
Özet brifingin kısaltılmış bir sürümünü bir Google Chat veya Slack gelen webhook'una gönderir, böylece günlük çalıştırma kendini teslim eder — webhook yoksa sessizce atlar…