transcribe

от openai

Транскрибирует аудиофайлы в текст с опциональной диаризацией дикторов и подсказками по известным говорящим. Поддерживает быструю транскрипцию текста через gpt-4o-mini-transcribe и диаризацию с метками дикторов через gpt-4o-transcribe-diarize. Принимает несколько аудиоформатов и опциональные ссылки на известных говорящих (до 4 дикторов) для повышения точности диаризации. Выводит результат в виде обычного текста, JSON или диаризированного JSON с настраиваемыми выходными каталогами для предотвращения перезаписи. Требует переменную окружения OPENAI_API_KEY; использует встроенные...

npx skills add https://github.com/openai/skills --skill transcribe

Audio Transcribe

Transcribe audio using OpenAI, with optional speaker diarization when requested. Prefer the bundled CLI for deterministic, repeatable runs.

Workflow

  1. Collect inputs: audio file path(s), desired response format (text/json/diarized_json), optional language hint, and any known speaker references.
  2. Verify OPENAI_API_KEY is set. If missing, ask the user to set it locally (do not ask them to paste the key).
  3. Run the bundled transcribe_diarize.py CLI with sensible defaults (fast text transcription).
  4. Validate the output: transcription quality, speaker labels, and segment boundaries; iterate with a single targeted change if needed.
  5. Save outputs under output/transcribe/ when working in this repo.

Decision rules

  • Default to gpt-4o-mini-transcribe with --response-format text for fast transcription.
  • If the user wants speaker labels or diarization, use --model gpt-4o-transcribe-diarize --response-format diarized_json.
  • If audio is longer than ~30 seconds, keep --chunking-strategy auto.
  • Prompting is not supported for gpt-4o-transcribe-diarize.

Output conventions

  • Use output/transcribe/<job-id>/ for evaluation runs.
  • Use --out-dir for multiple files to avoid overwriting.

Dependencies (install if missing)

Prefer uv for dependency management.

uv pip install openai

If uv is unavailable:

python3 -m pip install openai

Environment

  • OPENAI_API_KEY must be set for live API calls.
  • If the key is missing, instruct the user to create one in the OpenAI platform UI and export it in their shell.
  • Never ask the user to paste the full key in chat.

Skill path (set once)

export CODEX_HOME="${CODEX_HOME:-$HOME/.codex}"
export TRANSCRIBE_CLI="$CODEX_HOME/skills/transcribe/scripts/transcribe_diarize.py"

User-scoped skills install under $CODEX_HOME/skills (default: ~/.codex/skills).

CLI quick start

Single file (fast text default):

python3 "$TRANSCRIBE_CLI" \
  path/to/audio.wav \
  --out transcript.txt

Diarization with known speakers (up to 4):

python3 "$TRANSCRIBE_CLI" \
  meeting.m4a \
  --model gpt-4o-transcribe-diarize \
  --known-speaker "Alice=refs/alice.wav" \
  --known-speaker "Bob=refs/bob.wav" \
  --response-format diarized_json \
  --out-dir output/transcribe/meeting

Plain text output (explicit):

python3 "$TRANSCRIBE_CLI" \
  interview.mp3 \
  --response-format text \
  --out interview.txt

Reference map

  • references/api.md: supported formats, limits, response formats, and known-speaker notes.

Больше skills от openai

release
openai
Выпустите релиз Symphony, увеличив зафиксированную версию, закоммитив её, пометив объединённый коммит тегом и проверив рабочий процесс релиза Burrito. Используйте, когда вас просят…
signing-entitlements
openai
Проверка подписи кода, прав доступа, усиленного режима выполнения и проблем с Gatekeeper для приложений macOS. Используйте, когда требуется диагностировать ошибки подписи кода, отсутствующие права доступа…
building-ai-agent-on-cloudflare
openai
Создаёт AI-агентов на Cloudflare с использованием Agents SDK, включая управление состоянием, WebSockets в реальном времени, запланированные задачи, интеграцию инструментов и чат…
epigraphdb-skill
openai
Отправляйте компактные запросы к API EpiGraphDB для получения данных по онтологии, литературе, MR, генам-лекарствам и подтверждающим путям. Используйте, когда пользователю нужны краткие сводки EpiGraphDB.
runtime-behavior-probe
openai
Планируйте и проводите исследования поведения во время выполнения с помощью временных пробных скриптов, матриц валидации, контролей состояния и отчетов, ориентированных на результаты. Используйте только когда…
deep-security-scan
openai
Используйте, когда пользователь запрашивает глубокое, исчерпывающее, многопроходное или снижающее вариативность сканирование безопасности Codex по всему репозиторию или в заданной области. Выполняйте повторные независимые…
define-security-policy
openai
Определение, проверка или обновление рекомендаций SECURITY.md для репозитория или компонента. Используется, когда пользователь хочет уточнить, что Codex Security должен проверять, что выходит за рамки…
validation
openai
Используйте, когда Codex уже находится на этапе валидации сканирования безопасности или пользователь явно просит определить, являются ли одно или несколько кандидатных уязвимостей…