transcribe

tarafından openai

Ses dosyalarını, isteğe bağlı konuşmacı ayırma ve bilinen konuşmacı ipuçlarıyla metne dönüştürür. gpt-4o-mini-transcribe ile hızlı metin transkripsiyonunu ve gpt-4o-transcribe-diarize ile konuşmacı etiketli ayırmayı destekler. Birden fazla ses formatını ve ayırma doğruluğunu artırmak için isteğe bağlı bilinen konuşmacı referanslarını (en fazla 4 konuşmacı) kabul eder. Çıktıyı düz metin, JSON veya ayırmalı JSON olarak, üzerine yazmayı önlemek için yapılandırılabilir çıktı dizinleriyle sunar. OPENAI_API_KEY ortam değişkenini gerektir

npx skills add https://github.com/openai/skills --skill transcribe

Audio Transcribe

Transcribe audio using OpenAI, with optional speaker diarization when requested. Prefer the bundled CLI for deterministic, repeatable runs.

Workflow

  1. Collect inputs: audio file path(s), desired response format (text/json/diarized_json), optional language hint, and any known speaker references.
  2. Verify OPENAI_API_KEY is set. If missing, ask the user to set it locally (do not ask them to paste the key).
  3. Run the bundled transcribe_diarize.py CLI with sensible defaults (fast text transcription).
  4. Validate the output: transcription quality, speaker labels, and segment boundaries; iterate with a single targeted change if needed.
  5. Save outputs under output/transcribe/ when working in this repo.

Decision rules

  • Default to gpt-4o-mini-transcribe with --response-format text for fast transcription.
  • If the user wants speaker labels or diarization, use --model gpt-4o-transcribe-diarize --response-format diarized_json.
  • If audio is longer than ~30 seconds, keep --chunking-strategy auto.
  • Prompting is not supported for gpt-4o-transcribe-diarize.

Output conventions

  • Use output/transcribe/<job-id>/ for evaluation runs.
  • Use --out-dir for multiple files to avoid overwriting.

Dependencies (install if missing)

Prefer uv for dependency management.

uv pip install openai

If uv is unavailable:

python3 -m pip install openai

Environment

  • OPENAI_API_KEY must be set for live API calls.
  • If the key is missing, instruct the user to create one in the OpenAI platform UI and export it in their shell.
  • Never ask the user to paste the full key in chat.

Skill path (set once)

export CODEX_HOME="${CODEX_HOME:-$HOME/.codex}"
export TRANSCRIBE_CLI="$CODEX_HOME/skills/transcribe/scripts/transcribe_diarize.py"

User-scoped skills install under $CODEX_HOME/skills (default: ~/.codex/skills).

CLI quick start

Single file (fast text default):

python3 "$TRANSCRIBE_CLI" \
  path/to/audio.wav \
  --out transcript.txt

Diarization with known speakers (up to 4):

python3 "$TRANSCRIBE_CLI" \
  meeting.m4a \
  --model gpt-4o-transcribe-diarize \
  --known-speaker "Alice=refs/alice.wav" \
  --known-speaker "Bob=refs/bob.wav" \
  --response-format diarized_json \
  --out-dir output/transcribe/meeting

Plain text output (explicit):

python3 "$TRANSCRIBE_CLI" \
  interview.mp3 \
  --response-format text \
  --out interview.txt

Reference map

  • references/api.md: supported formats, limits, response formats, and known-speaker notes.

openai tarafından daha fazla skill

user-context
openai
Veri Analitiği eklentisinin kalıcı kaynak yönlendirme tercihlerini, kayıt mantığını, kurulum ilerlemesini ve anlamsal katman kaydını yükleyin veya yönetin.
official
notion-research-documentation
openai
Notion içeriğini araştır ve yapılandırılmış brifingler, raporlar veya alıntılarla karşılaştırmalar halinde sentezle. Hedeflenen sorguları kullanarak Notion sayfalarını ara ve getir, ardından bulguları temaya göre satır içi kaynak alıntıları ve bir referans bölümüyle düzenle. Kapsam ve kullanıcı hedefine bağlı olarak dört çıktı formatı (hızlı brifing, araştırma özeti, karşılaştırma, kapsamlı rapor) arasından seçim yap. Yerleşik şablonları kullanarak Notion sayfaları oluştur ve güncelle; kaynakları doğrudan bağla ve yeni bilgiler geldikçe değişiklik
official
rcsb-pdb-skill
openai
Temel meta veriler, Search API sorguları ve FASTA indirmeleri için kompakt RCSB PDB talepleri gönderin. Kullanıcı kısa RCSB özetleri istediğinde kullanın; ham JSON veya…
official
pdf
openai
PDF okuma, oluşturma ve doğrulama; görsel işleme ve programatik üretim ile birlikte. Teslimattan önce düzen, boşluk ve tipografinin görsel denetimi için PDF sayfalarını PNG'ye dönüştürme (Poppler / pdftoppm kullanarak). Güvenilir biçimlendirme için PDF'leri programatik olarak reportlab ile oluşturma; pdfplumber veya pypdf ile metin ve meta veri çıkarma. Kalite standartlarını uygulama: kırpılmış metin, üst üste binen öğeler, bozuk tablolar veya işleme yapaylıkları olmamalı; yalnızca ASCII tireleri, insan tarafından okunabilir alıntılar kullanılmalı...
official
test-coverage-improver
openai
Improve test coverage in the OpenAI Agents JS monorepo: run `pnpm test:coverage`, inspect coverage artifacts, identify low-coverage files and branches, propose…
official
playwright
openai
Terminal tabanlı tarayıcı otomasyonu, öğe anlık görüntüleri ve etkileşimli UI iş akışları ile çalışır. playwright-cli wrapper betiği üzerinden işler (npx gerektirir); görsel hata ayıklama için başlıksız ve başlıklı modları destekler. Temel iş akışı: sayfa açma, kararlı öğe referansları için anlık görüntü alma, referansları kullanarak etkileşim kurma, gezinme veya DOM değişikliklerinden sonra yeniden anlık görüntü alma. Form doldurma, tıklama, yazma, çoklu sekme yönetimi, ekran görüntüsü/PDF yakalama ve akış hata ayıklaması için iz kaydı içerir.
official
ukb-topmed-phewas-skill
openai
Tek varyantlar için rsID, GRCh37 veya GRCh38 girişini kabul ederek ve gerekli GRCh38 sorgusuna çözümleyerek kompakt UKB-TOPMed PheWAS özetlerini getirir. Bir…
official
code-review-context
openai
Model görünür bağlamı
official