Voibe Transcription MCP Server

resmi

Berikan telinga untuk Claude/Openclaw/Hermes/Codex/Grok Bot. Voibe mengubah rekaman menjadi teks yang dapat digunakan oleh agen AI Anda. Minta agen Anda untuk mentranskripsikan rapat, wawancara, panggilan, kuliah, episode podcast, atau memo suara. Transkrip mentah tiba di obrolan dengan label pembicara, stempel waktu, dan ringkasan.

Apa yang bisa Anda lakukan dengan Voibe Transcription MCP?

  • Membuat pekerjaan transkripsi — Minta asisten Anda untuk memulai transkripsi dengan mengirimkan audio melalui create_transcription_job, dengan opsi diarisasi pembicara dan ringkasan khusus sesuai prompt.

  • Mengambil transkrip dan ringkasan — Gunakan get_transcript untuk mengambil baris berlabel pembicara dengan stempel waktu, versi teks biasa, dan ringkasan yang dapat diarahkan sesuai prompt Anda.

  • Mendaftar rekaman sebelumnya — Panggil list_transcripts untuk melihat pekerjaan sebelumnya yang diurutkan dari yang terbaru, termasuk status, judul, dan durasi audio.

  • Memeriksa sisa menit — Kueri get_balance untuk melihat berapa menit transkripsi yang tersisa sebelum memulai pekerjaan baru.

  • Menerima hasil melalui webhook — Berikan webhook_url saat membuat pekerjaan untuk mendapatkan transkrip dan ringkasan yang selesai dikirim otomatis ke endpoint Anda.

Dokumentasi

Workflows

API sederhana untuk alur kerja yang kompleks

Satu panggilan mengembalikan transkrip, pembicara, dan ringkasan. Yang Anda bangun di atasnya adalah bagian yang menarik.

Catatan rapat

  1. Rekaman standup masuk ke bucket Anda
  2. Satu panggilan mengembalikan siapa mengatakan apa, plus ringkasan khusus keputusan
  3. Agen Anda memposting catatan dan membuka tindak lanjut

"prompt": "ringkas sebagai keputusan dan pemilik"

Dukungan QA

  1. Panggilan dukungan selesai dan rekaman dikirim
  2. Label pembicara memisahkan pelanggan dari perwakilan
  3. Agen Anda menilai panggilan dan menandai yang perlu ditinjau

"prompt": "daftarkan keluhan pelanggan yang belum terselesaikan"

Produksi podcast

  1. Sebuah episode diunggah dan webhook didaftarkan
  2. Transkrip selesai tiba di endpoint Anda dengan stempel waktu
  3. Agen Anda menulis catatan acara dan memotong penanda bab

"prompt": "tulis catatan acara dengan judul bab"

Panggilan penjualan ke CRM

  1. Rekaman panggilan dikirim segera setelah rapat berakhir
  2. Ringkasan kembali sebagai item tindakan
  3. Agen Anda menuliskannya ke kesepakatan dan menjadwalkan langkah berikutnya

"prompt": "daftarkan item tindakan dengan pemilik dan tanggal"

Setiap contoh ini menggunakan tiga endpoint yang sama. Satu-satunya yang berubah adalah prompt yang Anda kirim dan apa yang dilakukan agen Anda dengan responsnya.

Dibangun untuk agen

Jika agen Anda bisa memanggil URL, ia bisa mendengarkan

Satu POST, satu unggahan, satu respons JSON. Tanpa SDK yang perlu diadopsi, tanpa runtime yang perlu diinstal, tanpa framework yang perlu diikat.

  • Claude Code
  • Codex
  • Cursor
  • Hermes
  • OpenClaw

Dua cara masuk, tidak ada yang perlu diinstal. Hubungkan server MCP dan bertanya, atau arahkan agen Anda ke dokumentasi dan ia menulis klien yang dibutuhkan kasus penggunaan Anda.

Tempel ini ke agen Anda

Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.

Server MCP

Gunakan dari Claude, Cursor, Codex, dan ChatGPT

Voibe adalah server MCP. Hubungkan sekali dan aplikasi AI yang sudah Anda gunakan dapat mentranskripsikan rekaman, membaca hasilnya, dan memeriksa notulen Anda. Tanpa kode.

  1. Tambahkan konektor Tempel alamat ke aplikasi Anda: Claude di bawah Connectors, Claude Code dengan satu perintah, Cursor dan Codex di file konfigurasi mereka.
  2. Masuk sekali Setujui Voibe di browser. Alamat email baru mendapatkan akun dengan 15 menit gratis. Tanpa kunci API yang perlu disalin.
  3. Bertanya "Transkripsikan rekaman ini." Alat coding mengunggah file itu sendiri. Aplikasi chat memberi Anda tautan unggahan. Transkrip dan ringkasan kembali di chat.
  4. API yang sama, akun yang sama, penagihan yang sama: per detik audio, hanya saat pekerjaan selesai.

Alamat MCP

https://api.getvoibe.com/mcp

Claude Code

claude mcp add --transport http voibe https://api.getvoibe.com/mcp
  • create_transcription_job Mulai transkripsi

  • get_transcript Status, lalu transkrip dan ringkasan

  • list_transcripts Rekaman Anda, terbaru dulu

  • get_balance Menit tersisa

  • Claude

  • Claude Desktop

  • Cowork

  • Claude Code

  • Cursor

  • Codex

  • ChatGPT

  • VS Code

  • Hermes

  • OpenClaw

Apa yang agen Anda dapatkan kembali

Apa yang dikembalikan API transkripsi

Tanpa panggilan kedua ke perangkum, tanpa layanan diarisasi terpisah, tanpa kode perekat yang menyatukannya.

GET /v1/transcripts/{job_id}

{
  "job_id": "a523721c-…",
  "status": "DONE",
  "title": "Pricing page review",
  "audio_duration_seconds": 205.27,
  "seconds_charged": 206,
  "diarize": true,
  "transcript": [
    { "speaker": "Priya", "start": 0.4,  "end": 5.2,
      "text": "Let's start with the pricing page. Where are we?" },
    { "speaker": "Tom",   "start": 6.1, "end": 10.8,
      "text": "Copy is done. I need a review before Thursday." }
  ],
  "transcript_text": "Priya: Let's start with the pricing page…",
  "summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
  "error": null
}
  • transcript Setiap baris dengan siapa yang mengatakannya, serta waktu mulai dan berakhir dalam detik. Kutip orang yang tepat, lompat ke momen itu, atau arahkan tindak lanjut ke siapa pun yang memintanya.
  • transcript_text Transkrip yang sama sebagai satu string polos, siap dimasukkan langsung ke prompt atau indeks.
  • summary Ringkasan singkat yang dapat diposting, disimpan, atau diproses agen Anda tanpa panggilan model kedua. Disertai judul untuk rekaman.

Kasus penggunaan

Atur sekali. Berjalan setiap minggu.

Anda tidak menulis integrasinya. Anda mendeskripsikan pekerjaan berulang ke agen yang sudah Anda gunakan, dan ia menulis skrip yang memanggil Voibe secara terjadwal.

Manajer produk

menggunakan Claude Cowork

Mengubah seminggu panggilan pelanggan menjadi ringkasan umpan balik bertema, tanpa mendengarkan semuanya.

Apa yang mereka minta ke agen mereka

"Setiap Jumat, kirim rekaman panggilan minggu lalu ke API Voibe dan beri saya lima tema teratas, dengan kutipan dan nama pelanggan untuk masing-masing."

Pengembang

menggunakan Codex

Menjaga indeks transkrip yang dapat dicari untuk setiap standup dan panggilan insiden yang direkam tim.

Apa yang mereka minta ke agen mereka

"Tulis pekerjaan yang memposting rekaman baru dari bucket kami ke API Voibe, menyimpan JSON, dan mengindeks transcript_text di Postgres untuk pencarian."

Pendiri

menggunakan Hermes

Mengubah panggilan investor dan penjualan menjadi tindak lanjut sebelum hari berakhir.

Apa yang mereka minta ke agen mereka

"Saat rekaman panggilan masuk, transkripsikan dengan Voibe dan buat draf email tindak lanjut yang mencantumkan apa yang saya komit dan kapan."

Pembuat konten

menggunakan OpenClaw

Mengubah setiap episode baru menjadi catatan acara, penanda bab, dan kandidat klip semalaman.

Apa yang mereka minta ke agen mereka

"Pantau folder ini. Saat episode baru muncul, transkripsikan dengan Voibe dan beri saya bab, catatan acara, dan tiga kutipan terbaik dengan stempel waktu."

Masing-masing ini adalah satu percakapan dengan agen. Agen terhubung ke server MCP atau membaca dokumentasi, menulis skrip, dan menjadwalkannya; Anda meninjau hasilnya.

Harga

Harga API ucapan ke teks

15 menit gratis, lalu beli menit yang tidak pernah kedaluwarsa. Bayar untuk audio yang benar-benar ditranskripsikan agen Anda: tanpa langganan, tanpa kursi, tanpa minimum bulanan.

$50 $0,27 per jam audio

11.000 menit · 183 jam audio

Mulai dengan 15 menit gratis

Tanpa kartu. Per detik audio, ditagih saat pekerjaan selesai. Menit tidak pernah kedaluwarsa.

Diarisasi pembicara

Diarisasi pembicara: agen Anda tahu siapa mengatakan apa

Label pembicara aktif secara default: setiap baris kembali dengan label pembicara serta waktu mulai dan berakhir dalam detik. Tidak ada batas berapa banyak pembicara yang dibedakan, dan saat orang menyebut nama mereka, ringkasan menggunakannya. Tanpa model diarisasi terpisah yang perlu dijalankan, tanpa biaya tambahan. Atur diarize ke false untuk transkrip polos.

  • Agen rapat yang melacak siapa yang berkomitmen pada apa
  • Agen dukungan yang mengutip pelanggan
  • Pipeline wawancara dan podcast
  • Di mana pun lebih dari satu orang berbicara

Satu bidang pada panggilan pembuatan

{ "diarize": true }

Webhook

Transkripsi asinkron: agen Anda memicu dan melanjutkan

Berikan webhook_url saat Anda membuat pekerjaan dan kami POST hasil selesai ke endpoint Anda. Tidak ada loop agen yang terjebak menunggu polling. Badan membawa nama peristiwa dan badan pekerjaan yang sama seperti GET, sehingga satu penangan mencakup kedua jalur.

Satu bidang pada panggilan pembuatan

{ "webhook_url": "https://you.dev/ready" }

Ringkasan yang dapat diarahkan

Minta bentuk yang dibutuhkan agen Anda

Berikan prompt dan ringkasan kembali dengan cara yang ingin dibaca kode Anda: keputusan saja, item tindakan, poin-poin. Agen Anda mendapatkan struktur yang dapat digunakan tanpa panggilan model kedua. Hingga 2.000 karakter. Ini mengubah ringkasan.

Instruksi Anda, ringkasan Anda

{
  "diarize": true,
  "prompt": "summarise as bullet points, focus on decisions"
}

Integrasi

Biarkan agen pengkodean Anda menyambungkannya

Salin satu prompt dari portal ke Claude Code, Codex, Cursor, atau agen pengkodean mana pun, dan ia menulis klien untuk Anda. Prompt tiba dengan kunci Anda sudah terisi. Dan saat Anda hanya perlu mentranskripsikan rekaman, lewati kode: hubungkan server MCP dan bertanya.

Bangun aplikasi yang berguna

Apa yang dikembangkan pengembang dengan API ucapan ke teks

API memberi Anda teks berlabel pembicara, stempel waktu, dan ringkasan yang dapat diarahkan. Ini adalah produk yang muncul dari itu.

Pencatat rapat

Ubah rekaman menjadi catatan yang menyebutkan siapa yang berkomitmen pada apa. Label pembicara melakukan atribusi, prompt membentuk keluaran menjadi keputusan dan pemilik.

Arsip panggilan yang dapat dicari

Indeks transcript_text untuk pencarian teks lengkap dan simpan stempel waktu untuk melompat langsung ke momen itu. Filter berdasarkan pembicara untuk menemukan apa yang dikatakan satu orang selama berbulan-bulan panggilan.

Teks dan subtitle

Setiap baris tiba dengan waktu mulai dan berakhir dalam detik, yang merupakan semua yang dibutuhkan file SRT atau VTT. Beri teks seluruh perpustakaan video tanpa menyentuh editor.

Catatan suara menjadi tugas

Memo sambil berjalan menjadi pekerjaan terstruktur. Minta prompt untuk item tindakan dengan pemilik dan tanggal, lalu tulis langsung ke pelacak Anda.

Penilaian dan pembinaan panggilan

Pisahkan perwakilan dari pelanggan, lalu nilai panggilan terhadap rubrik Anda sendiri. Tinjau yang di luar kebiasaan.

Antarmuka suara untuk produk Anda

Biarkan pengguna berbicara ke aplikasi Anda. Kirim klip, dapatkan teks yang dapat diarahkan agen Anda, dan lewati membangun infrastruktur ucapan.

Tidak ada yang membutuhkan endpoint berbeda. Transkrip, pembicara, dan ringkasan semuanya tiba dalam satu respons; produknya adalah apa yang Anda lakukan dengannya.

Cara kerjanya

Cara kerja API ucapan ke teks

Tiga endpoint, dua langkah. Buat pekerjaan, unggah audio ke URL yang ditandatangani yang Anda dapatkan, lalu polling hasilnya atau biarkan webhook membawanya ke Anda.

  • POST /v1/transcripts Memulai pekerjaan dan mengembalikan URL unggahan yang ditandatangani.
  • GET /v1/transcripts/{job_id} Mengembalikan status, transkrip, dan ringkasan.
  • GET /v1/transcripts Mencantumkan pekerjaan Anda, hingga 200 per halaman.
  • Audio langsung menuju penyimpanan di URL yang ditandatangani, sehingga file besar tidak pernah melewati permintaan API. File hingga 200 MB; URL berfungsi selama 5 jam.

Unggah audio

curl -s -X PUT "$UPLOAD_URL" \
  -H "Content-Type: application/octet-stream" \
  --data-binary @pricing-meeting.mp3

Kepercayaan dan keandalan

Retensi nol pada audio Anda

Rekaman dihapus saat transkrip ada. Tidak pernah disimpan, dan tidak pernah digunakan untuk melatih model.

  • Audio dihapus setelah transkripsi

    Rekaman dihapus setelah transkrip diproduksi.
  • Tidak pernah digunakan untuk melatih model

    Tidak ada yang Anda kirim digunakan untuk melatih model. Rekaman Anda adalah milik Anda.
  • Setiap pembacaan dibatasi pada akun Anda

    Pekerjaan hanya dapat dibaca oleh akun yang membuatnya.
  • Pekerjaan yang gagal tidak pernah ditagih

    Anda hanya membayar saat pekerjaan mencapai DONE. Pekerjaan yang diantrekan, diproses, dan gagal tidak dikenai biaya, sehingga percobaan ulang juga tidak dikenai biaya.

Transkrip Anda tetap dapat dibaca melalui GET /v1/transcripts selama 24 jam setelah pekerjaan selesai, sehingga agen dapat mengambil hasil lagi tanpa mengirim ulang audio.

FAQ API ucapan ke teks

Apa API ucapan ke teks terbaik untuk agen AI?

Yang dapat digunakan agen Anda tanpa menunggu integrasi. API Voibe adalah HTTP polos: satu POST untuk memulai pekerjaan, satu unggahan, satu respons JSON yang berisi transkrip, label pembicara, stempel waktu, dan ringkasan. Tidak ada SDK yang perlu diinstal dan tidak ada framework yang perlu dikomit. Ini juga merupakan server MCP di https://api.getvoibe.com/mcp, sehingga Claude, Claude Code, Cursor, Codex, dan ChatGPT terhubung langsung ke sana. Untuk kode Anda sendiri, arahkan agen ke https://platform.getvoibe.com/docs.md dan ia menyelesaikan panggilan yang dibutuhkan kasus penggunaan Anda. Setiap akun baru dimulai dengan 15 menit gratis dan tanpa kartu.

Apakah API ucapan ke teks Voibe memiliki server MCP?

Ya. Server MCP Voibe berada di https://api.getvoibe.com/mcp. Tambahkan ke Claude, Claude Code, Cursor, Codex, ChatGPT, atau VS Code sebagai konektor khusus atau dengan satu blok konfigurasi, masuk sekali, dan minta aplikasi mentranskripsikan rekaman. Ini mengekspos empat alat: mulai transkripsi, dapatkan transkrip, daftarkan transkripsi, dan periksa menit tersisa. Ini menggunakan akun yang sama, menit yang sama, dan penagihan per detik yang sama dengan API.

Bisakah Claude mentranskripsikan rekaman rapat dengan Voibe?

Ya. Di Claude, buka Customize, lalu Connectors, klik +, pilih Add custom connector, tempel https://api.getvoibe.com/mcp dan masuk. Lalu minta Claude mentranskripsikan rekaman. Claude tidak dapat membaca file di komputer Anda, jadi ia memberi Anda tautan unggahan; jatuhkan file dan Claude mengambil transkrip dan ringkasan. Ini berfungsi di Claude di web, Claude Desktop, dan Cowork.

Bagaimana cara mentranskripsikan audio dari Claude Code, Cursor, atau Codex?

Hubungkan server MCP Voibe dan bertanya. Untuk Claude Code, jalankan claude mcp add --transport http voibe https://api.getvoibe.com/mcp, ketik /mcp di sesi dan masuk. Cursor dan Codex menerima satu blok di file konfigurasi mereka. Lalu minta agen mentranskripsikan file: ia mengunggah file itu sendiri dan mengembalikan transkrip berlabel pembicara dan ringkasan. Pengaturan untuk setiap aplikasi ada di https://platform.getvoibe.com/docs/mcp.

Apakah API mengidentifikasi pembicara yang berbeda, dan apakah ia tahu nama mereka? Ya. Label pembicara aktif secara bawaan: setiap baris kembali dengan label pembicara serta waktu mulai dan selesai dalam detik. Pembicara diberi label speaker_0, speaker_1, dan seterusnya, secara konsisten dalam satu rekaman, tanpa batas jumlah pembicara yang dibedakan. Ringkasan dan judul menggunakan nama orang jika rekaman menyebutkannya, misalnya ketika seseorang memperkenalkan diri atau dipanggil dengan nama. Diarisasi pembicara sudah termasuk dalam harga. Atur diarize ke false untuk transkrip polos.

Format audio, ukuran file, dan batas kecepatan apa yang berlaku?

mp3, wav, m4a, mp4, flac, ogg, dan webm langsung diterima; file audio dan video lain dikonversi terlebih dahulu jika audionya dapat dibaca. Format dibaca dari isi file. Setiap file dapat berukuran hingga 200 MB, dan URL unggahan berlaku selama 5 jam. Batas kecepatan adalah 50 pekerjaan per menit dan 1.000 pekerjaan per hari per akun; jika melebihi itu, panggilan create mengembalikan 429, jadi tunggu dan coba lagi.

Bahasa apa saja yang didukung oleh API speech to text?

Model ucapan dan ringkasan bersifat multibahasa, jadi rekaman tidak harus dalam bahasa Inggris. Pemisahan pembicara bekerja sama di semua bahasa.

Apakah saya harus melakukan polling untuk hasil?

Tidak. Berikan webhook_url saat Anda membuat pekerjaan dan kami mengirimkan hasil selesai ke endpoint Anda segera setelah siap. Badan pesan membawa nama peristiwa, transcript.completed atau transcript.failed, dan badan pekerjaan yang sama dengan GET /v1/transcripts/{job_id}, sehingga satu penanganan mencakup keduanya. Polling tetap tersedia jika Anda lebih menyukainya.

Bagaimana saya ditagih, dan apakah menit kedaluwarsa?

Per detik audio, dibulatkan ke atas ke detik penuh. File berdurasi 3 menit 24 detik dikenakan biaya 3 menit 24 detik. Anda hanya ditagih ketika pekerjaan mencapai DONE, jadi pekerjaan yang antre, diproses, dan gagal tidak dikenakan biaya. Setiap akun baru dimulai dengan 15 menit gratis dan tidak diperlukan kartu. Setelah itu, Anda membeli menit dalam paket sekali bayar, mulai dari $10 untuk 2.000 menit. Menit tidak pernah kedaluwarsa, dan tidak ada langganan atau minimum bulanan.

Apa yang terjadi jika pekerjaan gagal?

Anda tidak dikenakan biaya. Pekerjaan kembali dengan status FAILED dan kolom error yang menjelaskan apa yang salah dalam kata-kata sederhana, misalnya menit tidak cukup untuk panjang audio, atau file yang tidak pernah tiba dalam 24 jam. Jika tidak ada menit sama sekali, panggilan create ditolak dengan 402 sebelum unggahan apa pun, jadi tidak ada yang dikirim.

Apakah audio saya disimpan atau digunakan untuk melatih model?

Audio dihapus setelah transkripsi dan tidak pernah digunakan untuk melatih model. Transkrip dan ringkasan tetap dapat dibaca selama 24 jam setelah pekerjaan selesai, lalu dihapus. Judul, durasi, dan biaya pekerjaan tetap ada di riwayat Anda. Setiap pembacaan dibatasi pada akun Anda, jadi Anda hanya melihat pekerjaan Anda sendiri. Speech to text berjalan pada Whisper large-v3-turbo, pemisahan pembicara pada pyannote community-1, dan ringkasan pada gpt-oss-120b.

Apa bedanya dengan menjalankan Whisper sendiri?

Tidak ada infrastruktur yang perlu dijalankan, tidak ada GPU yang perlu dijaga tetap panas, dan tidak ada penskalaan yang perlu dikelola. Diarisasi pembicara dan ringkasan kembali dalam respons yang sama dengan transkrip, tanpa model kedua dan tanpa kode perekat. Anda membayar per detik audio yang ditranskripsi, dan tidak ada waktu server yang perlu dibayar.