Voibe Transcription MCP Server

официальный

Дайте слух Claude/Openclaw/Hermes/Codex/Grok Bot. Voibe превращает записи в текст, с которым может работать ваш ИИ-агент. Попросите агента расшифровать встречу, интервью, звонок, лекцию, выпуск подкаста или голосовую заметку. Сырая расшифровка приходит в чат с метками говорящих, временными метками и сводкой.

Что можно делать с Voibe Transcription MCP?

  • Create transcription jobs — Попросите вашего ассистента начать транскрибацию, отправив аудио через create_transcription_job, с опциональной диаризацией говорящих и пользовательским промптом для саммари.

  • Retrieve transcripts and summaries — Используйте get_transcript, чтобы получить строки с метками говорящих и временными метками, версию в виде простого текста и настраиваемое саммари, сформированное вашим промптом.

  • List past recordings — Вызовите list_transcripts, чтобы увидеть предыдущие задания в порядке от новых к старым, включая статус, заголовок и длительность аудио.

  • Check remaining minutes — Запросите get_balance, чтобы узнать, сколько минут транскрибации у вас осталось перед началом нового задания.

  • Receive results via webhook — Передайте webhook_url при создании задания, чтобы готовый транскрипт и саммари автоматически отправлялись на ваш endpoint через POST.

Документация

Workflows

Простой API для сложных рабочих процессов

Один вызов возвращает расшифровку, говорящих и сводку. Что ваш агент построит поверх этого — уже интересная часть.

Заметки с совещаний

  1. Запись стендапа попадает в ваш бакет
  2. Один вызов возвращает, кто что сказал, плюс сводку только по решениям
  3. Ваш агент публикует заметки и открывает следующие шаги

"prompt": "summarise as decisions and owners"

Поддержка и контроль качества

  1. Звонок в поддержку завершается, запись отправляется
  2. Метки говорящих отделяют клиента от оператора
  3. Ваш агент оценивает звонок и помечает те, что стоит пересмотреть

"prompt": "list the customer's unresolved complaints"

Производство подкастов

  1. Эпизод загружается, регистрируется вебхук
  2. Готовая расшифровка приходит на ваш эндпоинт с таймкодами
  3. Ваш агент пишет шоу-ноты и нарезает маркеры глав

"prompt": "write show notes with chapter titles"

Звонки продаж в CRM

  1. Запись звонка отправляется сразу после окончания встречи
  2. Сводка возвращается в виде пунктов действий
  3. Ваш агент записывает их в сделку и планирует следующий шаг

"prompt": "list action items with owners and dates"

Каждый из этих сценариев использует одни и те же три эндпоинта. Меняется только промпт, который вы отправляете, и то, что ваш агент делает с ответом.

Создан для агентов

Если ваш агент умеет вызывать URL, он умеет слушать

Один POST, одна загрузка, один JSON-ответ. Никакого SDK для внедрения, никакого рантайма для установки, никакого фреймворка для интеграции.

  • Claude Code
  • Codex
  • Cursor
  • Hermes
  • OpenClaw

Два способа подключения, ничего устанавливать не нужно. Подключите MCP-сервер и спросите, или укажите агенту на документацию — и он напишет клиент под ваш сценарий.

Вставьте это в своего агента

Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.

MCP-сервер

Используйте его из Claude, Cursor, Codex и ChatGPT

Voibe — это MCP-сервер. Подключите его один раз, и AI-приложение, которым вы уже пользуетесь, сможет расшифровывать записи, читать результат и проверять ваши протоколы. Без кода.

  1. Добавьте коннектор Вставьте адрес в ваше приложение: Claude — в раздел Connectors, Claude Code — одной командой, Cursor и Codex — в их конфигурационный файл.
  2. Войдите один раз Подтвердите Voibe в браузере. Новый email-адрес получает аккаунт с 15 бесплатными минутами. Никаких API-ключей для копирования.
  3. Спросите «Расшифруй эту запись». Инструмент для кода сам загрузит файл. Чат-приложение даст вам ссылку для загрузки. Расшифровка и сводка вернутся прямо в чат.
  4. Тот же API, тот же аккаунт, та же тарификация: за каждую секунду аудио, только когда задача завершена.

MCP-адрес

https://api.getvoibe.com/mcp

Claude Code

claude mcp add --transport http voibe https://api.getvoibe.com/mcp
  • create_transcription_job Начать расшифровку

  • get_transcript Статус, затем расшифровка и сводка

  • list_transcripts Ваши записи, сначала новые

  • get_balance Осталось минут

  • Claude

  • Claude Desktop

  • Cowork

  • Claude Code

  • Cursor

  • Codex

  • ChatGPT

  • VS Code

  • Hermes

  • OpenClaw

Что получает ваш агент

Что возвращает API расшифровки речи

Никакого второго вызова к суммаризатору, никакого отдельного сервиса диаризации, никакого склеивающего кода.

GET /v1/transcripts/{job_id}

{
  "job_id": "a523721c-…",
  "status": "DONE",
  "title": "Pricing page review",
  "audio_duration_seconds": 205.27,
  "seconds_charged": 206,
  "diarize": true,
  "transcript": [
    { "speaker": "Priya", "start": 0.4,  "end": 5.2,
      "text": "Let's start with the pricing page. Where are we?" },
    { "speaker": "Tom",   "start": 6.1, "end": 10.8,
      "text": "Copy is done. I need a review before Thursday." }
  ],
  "transcript_text": "Priya: Let's start with the pricing page…",
  "summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
  "error": null
}
  • transcript Каждая строка с указанием говорящего и временем начала и конца в секундах. Цитируйте нужного человека, переходите к нужному моменту или направляйте следующий шаг тому, кто об этом просил.
  • transcript_text Та же расшифровка одной простой строкой, готовая для вставки в промпт или индекс.
  • summary Краткая сводка, которую ваш агент может опубликовать, сохранить или проанализировать без второго вызова модели. Она сопровождается заголовком для записи.

Сценарии использования

Настройте один раз. Оно работает каждую неделю.

Вы не пишете интеграцию. Вы описываете повторяющуюся задачу агенту, которым уже пользуетесь, и он пишет скрипт, который вызывает Voibe по расписанию.

Продакт-менеджер

использует Claude Cowork

Превращает неделю звонков с клиентами в тематический дайджест отзывов, не прослушивая ни одного из них.

Что он попросил у своего агента

«Каждую пятницу отправляй записи звонков за прошлую неделю в API Voibe и дай мне пять главных тем с цитатой и именем клиента для каждой.»

Разработчик

использует Codex

Ведёт поисковый индекс расшифровок всех стендапов и инцидент-звонков, которые записывает команда.

Что он попросил у своего агента

«Напиши задачу, которая публикует новые записи из нашего бакета в API Voibe, сохраняет JSON и индексирует transcript_text в Postgres для поиска.»

Основатель

использует Hermes

Превращает звонки с инвесторами и клиентами в следующие шаги до конца дня.

Что он попросил у своего агента

«Когда приходит запись звонка, расшифруй её через Voibe и составь черновик follow-up письма со списком моих обязательств и сроков.»

Контент-креатор

использует OpenClaw

Превращает каждый новый эпизод в шоу-ноты, маркеры глав и кандидатов в клипы за ночь.

Что он попросил у своего агента

«Следи за этой папкой. Когда появляется новый эпизод, расшифруй его через Voibe и дай мне главы, шоу-ноты и три лучшие цитаты с таймкодами.»

Каждый из этих сценариев — один разговор с агентом. Агент подключается к MCP-серверу или читает документацию, пишет скрипт и ставит его по расписанию; вы проверяете результат.

Цены

Цены на API распознавания речи

15 бесплатных минут, затем покупайте минуты, которые не сгорают. Платите за аудио, которое ваши агенты действительно расшифровывают: без подписки, без мест, без ежемесячного минимума.

$50 $0.27 за час аудио

11 000 минут · 183 часа аудио

Начните с 15 бесплатных минут

Без карты. За каждую секунду аудио, списание при завершении задачи. Минуты не сгорают.

Диаризация говорящих

Диаризация говорящих: ваш агент знает, кто что сказал

Метки говорящих включены по умолчанию: каждая строка возвращается с меткой говорящего и временем начала и конца в секундах. Нет ограничения на число различаемых говорящих, а когда люди называют свои имена, сводка использует их. Никакой отдельной модели диаризации для запуска, никакой дополнительной платы. Установите diarize в false для простой расшифровки.

  • Агенты для встреч, отслеживающие, кто за что взялся
  • Агенты поддержки, цитирующие клиента
  • Конвейеры интервью и подкастов
  • Любые сценарии, где говорит больше одного человека

Одно поле в вызове создания

{ "diarize": true }

Вебхуки

Асинхронная расшифровка: ваш агент запускает и идёт дальше

Передайте webhook_url при создании задачи, и мы отправим POST с готовым результатом на ваш эндпоинт. Никакой цикл агента не блокируется на опросе. Тело содержит имя события и то же тело задачи, что и в GET, так что один обработчик покрывает оба пути.

Одно поле в вызове создания

{ "webhook_url": "https://you.dev/ready" }

Управляемые сводки

Запросите форму, которая нужна вашему агенту

Передайте промпт, и сводка вернётся в том виде, который удобен вашему коду: только решения, пункты действий, маркированные списки. Ваш агент получает полезную структуру без второго вызова модели. До 2 000 символов. Это меняет сводку.

Ваши инструкции, ваша сводка

{
  "diarize": true,
  "prompt": "summarise as bullet points, focus on decisions"
}

Интеграция

Позвольте вашему кодирующему агенту всё подключить

Скопируйте один промпт из портала в Claude Code, Codex, Cursor или любого кодирующего агента — и он напишет клиент за вас. Промпт приходит с уже заполненным ключом. А когда нужно просто расшифровать запись, пропустите код: подключите MCP-сервер и спросите.

Создавайте полезные приложения

Что разработчики строят на API распознавания речи

API даёт текст с метками говорящих, таймкоды и управляемую сводку. Вот продукты, которые из этого получаются.

Заметки со встреч

Превратите запись в заметки с указанием, кто за что взялся. Метки говорящих делают атрибуцию, промпт формирует вывод в виде решений и ответственных.

Поисковый архив звонков

Индексируйте transcript_text для полнотекстового поиска и храните таймкоды, чтобы переходить к нужному моменту. Фильтруйте по говорящему, чтобы найти, что один человек сказал за месяцы звонков.

Субтитры

Каждая строка приходит с временем начала и конца в секундах — это всё, что нужно для файла SRT или VTT. Субтитры для целой видеотеки без касания редактора.

Голосовые заметки в задачи

Мемо на ходу становится структурированной работой. Попросите промпт выдать пункты действий с ответственными и сроками, затем запишите их прямо в ваш трекер.

Оценка звонков и коучинг

Отделите оператора от клиента, затем оцените звонок по вашему собственному регламенту. Проверьте выбросы.

Голосовой интерфейс для вашего продукта

Позвольте пользователям говорить с вашим приложением. Отправьте клип, получите текст, который ваш агент может маршрутизировать, и пропустите создание речевой инфраструктуры.

Ни одному из этих сценариев не нужен другой эндпоинт. Расшифровка, говорящие и сводка приходят в одном ответе; продукт — это то, что вы с ними делаете.

Как это работает

Как работает API распознавания речи

Три эндпоинта, два шага. Создайте задачу, загрузите аудио по полученной подписанной ссылке, затем опрашивайте результат или позвольте вебхуку доставить его вам.

  • POST /v1/transcripts Запускает задачу и возвращает подписанную ссылку для загрузки.
  • GET /v1/transcripts/{job_id} Возвращает статус, расшифровку и сводку.
  • GET /v1/transcripts Список ваших задач, до 200 на страницу.
  • Аудио идёт напрямую в хранилище по подписанной ссылке, так что большие файлы никогда не проходят через API-запрос. Файлы до 200 МБ; ссылка действует 5 часов.

Загрузите аудио

curl -s -X PUT "$UPLOAD_URL" \
  -H "Content-Type: application/octet-stream" \
  --data-binary @pricing-meeting.mp3

Доверие и надёжность

Нулевое хранение вашего аудио

Запись удаляется в момент появления расшифровки. Она никогда не сохраняется и никогда не используется для обучения моделей.

  • Аудио удаляется после расшифровки

    Запись удаляется после того, как расшифровка создана.
  • Никогда не используется для обучения моделей

    Ничто из того, что вы отправляете, не используется для обучения моделей. Ваши записи принадлежат вам.
  • Каждое чтение ограничено вашим аккаунтом

    Задачу может прочитать только аккаунт, который её создал.
  • За неудачные задачи не взимается плата

    Вы платите только когда задача достигает DONE. Задачи в очереди, в обработке и неудачные ничего не стоят, так что повторная попытка тоже ничего не стоит.

Ваши расшифровки остаются доступными через GET /v1/transcripts в течение 24 часов после завершения задачи, так что агент может получить результат снова без повторной отправки аудио.

FAQ по API распознавания речи

Какой API распознавания речи лучший для AI-агентов?

Тот, который ваш агент может использовать без ожидания интеграции. API Voibe — это обычный HTTP: один POST для запуска задачи, одна загрузка, один JSON-ответ с расшифровкой, метками говорящих, таймкодами и сводкой. Никакого SDK для установки и никакого фреймворка для выбора. Это также MCP-сервер на https://api.getvoibe.com/mcp,, так что Claude, Claude Code, Cursor, Codex и ChatGPT подключаются к нему напрямую. Для вашего собственного кода укажите агенту на https://platform.getvoibe.com/docs.md — и он разберётся с вызовами под ваш сценарий. Каждый новый аккаунт начинается с 15 бесплатных минут и без карты.

Есть ли у API распознавания речи Voibe MCP-сервер?

Да. MCP-сервер Voibe находится на https://api.getvoibe.com/mcp. Добавьте его в Claude, Claude Code, Cursor, Codex, ChatGPT или VS Code как пользовательский коннектор или одним блоком конфигурации, войдите один раз и попросите приложение расшифровать запись. Он предоставляет четыре инструмента: начать расшифровку, получить расшифровку, список расшифровок и проверка оставшихся минут. Он использует тот же аккаунт, те же минуты и ту же посекундную тарификацию, что и API.

Может ли Claude расшифровать запись встречи через Voibe?

Да. В Claude откройте Customize, затем Connectors, нажмите +, выберите Add custom connector, вставьте https://api.getvoibe.com/mcp и войдите. Затем попросите Claude расшифровать запись. Claude не может читать файлы на вашем компьютере, поэтому он даст вам ссылку для загрузки; перетащите файл, и Claude получит расшифровку и сводку. Это работает в Claude в вебе, Claude Desktop и Cowork.

Как расшифровать аудио из Claude Code, Cursor или Codex?

Подключите MCP-сервер Voibe и спросите. Для Claude Code выполните claude mcp add --transport http voibe https://api.getvoibe.com/mcp, введите /mcp в сессии и войдите. Cursor и Codex принимают один блок в их конфигурационном файле. Затем попросите агента расшифровать файл: он сам загрузит файл и вернёт расшифровку с метками говорящих и сводку. Настройка для каждого приложения — на https://platform.getvoibe.com/docs/mcp.

Определяет ли API разных говорящих и знает ли он их имена? Да. Метки говорящих включены по умолчанию: каждая строка возвращается с меткой говорящего и временем начала и окончания в секундах. Говорящие обозначаются как speaker_0, speaker_1 и так далее, последовательно в пределах одной записи, без ограничения на количество различаемых говорящих. Сводка и заголовок используют имена людей, когда они есть в записи, например, когда кто-то представляется или к нему обращаются по имени. Диаризация говорящих включена в стоимость. Установите diarize в false для получения простой расшифровки.

Какие аудиоформаты, размеры файлов и лимиты запросов применяются?

mp3, wav, m4a, mp4, flac, ogg и webm принимаются напрямую; другие аудио- и видеофайлы сначала конвертируются, если аудио можно прочитать. Формат определяется по содержимому файла. Каждый файл может быть размером до 200 МБ, а URL для загрузки действует 5 часов. Лимиты запросов: 50 заданий в минуту и 1000 заданий в день на аккаунт; при превышении вызов create возвращает 429, поэтому подождите и повторите попытку.

Какие языки поддерживает API преобразования речи в текст?

Модели речи и сводки многоязычны, поэтому запись не обязательно должна быть на английском. Разделение говорящих работает одинаково на любом языке.

Нужно ли мне опрашивать результаты?

Нет. Передайте webhook_url при создании задания, и мы отправим POST с готовым результатом на ваш endpoint, как только он будет готов. Тело содержит имя события, transcript.completed или transcript.failed, и то же тело задания, что и GET /v1/transcripts/{job_id}, поэтому один обработчик покрывает оба случая. Опрос по-прежнему доступен, если вы предпочитаете его.

Как выставляются счета и истекают ли минуты?

За каждую секунду аудио, округлённую до целой секунды. Файл длительностью 3 минуты 24 секунды стоит 3 минуты 24 секунды. Вы платите только когда задание достигает статуса DONE, поэтому задания в очереди, обработке и с ошибкой ничего не стоят. Каждый новый аккаунт начинается с 15 бесплатных минут, и карта не требуется. После этого вы покупаете минуты разовыми пакетами, от $10 за 2000 минут. Минуты никогда не истекают, и нет подписки или ежемесячного минимума.

Что произойдёт, если задание завершится с ошибкой?

Вы не платите. Задание возвращается со статусом FAILED и полем error, объясняющим, что пошло не так, простыми словами, например, недостаточно минут для длины аудио или файл не был загружен в течение 24 часов. Если минут совсем не осталось, вызов create отклоняется с кодом 402 до любой загрузки, поэтому ничего не отправляется.

Хранится ли моё аудио или используется для обучения моделей?

Аудио удаляется после транскрипции и никогда не используется для обучения моделей. Расшифровки и сводки остаются доступными для чтения в течение 24 часов после завершения задания, затем удаляются. Название задания, длительность и стоимость остаются в вашей истории. Каждое чтение ограничено вашим аккаунтом, поэтому вы видите только свои задания. Преобразование речи в текст работает на Whisper large-v3-turbo, разделение говорящих — на pyannote community-1, а сводка — на gpt-oss-120b.

Чем это отличается от запуска Whisper самостоятельно?

Нет инфраструктуры для запуска, нет GPU, который нужно поддерживать, и нет масштабирования, которым нужно управлять. Диаризация говорящих и сводка возвращаются в том же ответе, что и расшифровка, без второй модели и без связующего кода. Вы платите за каждую секунду транскрибированного аудио, и вам не нужно платить за серверное время.