tts-generation

tarafından google-gemini

Radyo programı senaryosunu, muhabir seslerinde telefon efekti ile Interactions API kullanarak konuşma sesine dönüştürün.

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill tts-generation

TTS Generation

Convert the radio show script into speech audio using the Gemini TTS model via the Interactions API. Apply a telephone bandpass filter to correspondent voices so they sound like phone call-ins, while keeping the host's voice clean studio-quality.

Embedded Script

python3 skills/tts-generation/scripts/generate_tts.py --workspace ./workspace

Arguments

ArgumentDefaultDescription
--workspaceworkspaceRoot workspace directory
--workers8Max parallel TTS worker threads

What it does

  1. Reads the script from {workspace}/data/script.md.
  2. Parses it into individual (speaker, text) turns and assigns voices.
  3. Generates TTS for all turns in parallel using a thread pool (default 8 workers).
  4. Retries each failed turn up to 3 times with exponential backoff.
  5. Applies an ffmpeg telephone bandpass filter (300Hz–3.4kHz) to correspondent voices.
  6. Keeps the host (Paul) audio clean and unfiltered.
  7. Concatenates all segments in original script order into a single WAV.

Dependencies

  • google-genai (>= 2.0.0)
  • ffmpeg (system)

API Details

Uses the Interactions API with single-speaker TTS — no multi-speaker workaround needed.

Voice Assignment

Voices are assigned dynamically based on [Male] / [Female] gender tags in the script:

SpeakerVoiceAudio Treatment
Paul (host)PuckClean — no filter
Caller [Female] — 1stKoreTelephone filter
Caller [Female] — 2ndAoedeTelephone filter
Caller [Male] — 1stCharonTelephone filter
Caller [Male] — 2ndFenrirTelephone filter

Voices cycle round-robin if there are more callers than available voices. Accent tags ([Accent: Irish], etc.) are injected into the TTS prompt to influence pronunciation.

Telephone Filter

Applied via ffmpeg to correspondent audio segments:

highpass=f=300, lowpass=f=3400, acompressor, volume=1.5

This simulates the standard telephone bandwidth (300Hz–3.4kHz) and adds compression to mimic phone codec dynamics.

Output

  • Primary output: {workspace}/audio/speech/speech.wav
  • Format: WAV, 24kHz, 16-bit PCM, mono
  • Intermediate segments: {workspace}/audio/speech/segments/turn_*.wav

google-gemini tarafından daha fazla skill

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Gemini API CLI aracını kullanma kılavuzu. Gemini API ile komut satırı üzerinden etkileşim kurmanız, aracıları yönetmeniz veya medya (görseller, …) oluşturmanız gerektiğinde kullanın.
behavioral-evals
google-gemini
Davranışsal değerlendirmeler oluşturma, çalıştırma, düzeltme ve teşvik etme rehberi. Ajan karar mantığını doğrularken, hataları ayıklarken, prompt hatalarını ayıklarken kullanın…
gemini-live-api-dev
google-gemini
Gerçek zamanlı çift yönlü akış, WebSockets üzerinden Gemini ile ses, video ve metin konuşmaları için. Ses giriş/çıkışı (16 kHz PCM), video kareleri, metin ve kesinti yönetimi için ses etkinliği algılamalı otomatik transkripsiyonları destekler. Yerel ses özelliklerini içerir: duygusal diyalog, proaktif ses ve düşünme modu; senkron ve asenkron araç kullanımı için fonksiyon çağrısı; ve Google Search grounding. Oturum yönetimi, bağlam sıkıştırma, devam ettirme ve...
gemini-omni-flash-api
google-gemini
Üretken video düzenleme, metinden videoya, görsel referanslı video oluşturma ve ilk kareden videoya geçiş animasyonları için bu beceriyi kullanın…
gemini-api-dev
google-gemini
Google'ın Gemini modelleriyle uygulamalar geliştirin; çok modlu içerik, fonksiyon çağırma ve yapılandırılmış çıktıları Python, JavaScript, Go ve Java'da destekler. 1M token bağlamıyla mevcut Gemini 3 modellerine (Pro, Flash, Pro Image) erişin; eski Gemini 2.x ve 1.5 modelleri kullanımdan kaldırılmıştır. Metin oluşturma, görüntü/ses/video anlama, fonksiyon çağırma, yapılandırılmış JSON çıktısı, kod yürütme, bağlam önbelleğe alma ve gömme işlemlerini destekler. Resmi SDK'lar mevcuttur: google-genai (Python),...
gemini-interactions-api
google-gemini
Gemini modelleri ve ajanları için sunucu tarafı durumu, akış ve araç orkestrasyonu ile birleşik arayüz. Birden çok güncel modeli (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) ve Deep Research ajanını destekler; kullanımdan kaldırılan model kimliklerini otomatik olarak güncel alternatiflerle değiştirir. previous_interaction_id aracılığıyla konuşma geçmişini sunucuya aktararak manuel geçmiş yönetimi olmadan durum bilgisi olan çok turlu etkileşimler sağlar. Dahili araç orkestrasyonu dahil...
deliver
google-gemini
Özet brifingin kısaltılmış bir sürümünü bir Google Chat veya Slack gelen webhook'una gönderir, böylece günlük çalıştırma kendini teslim eder — webhook yoksa sessizce atlar…