Voibe Transcription MCP Server
oficialDale oídos a Claude/Openclaw/Hermes/Codex/Grok Bot. Voibe convierte grabaciones en texto con el que tu agente de IA puede trabajar. Pídele a tu agente que transcriba una reunión, entrevista, llamada, conferencia, episodio de podcast o nota de voz. La transcripción cruda llega al chat con etiquetas de hablante, marcas de tiempo y un resumen.
¿Qué puedes hacer con Voibe Transcription MCP?
-
Crear trabajos de transcripción — Pídele a tu asistente que inicie una transcripción enviando audio mediante
create_transcription_job, con diarización de hablantes opcional y un prompt de resumen personalizado. -
Recuperar transcripciones y resúmenes — Usa
get_transcriptpara obtener líneas etiquetadas por hablante con marcas de tiempo, una versión en texto plano y un resumen ajustable según tu prompt. -
Listar grabaciones anteriores — Llama a
list_transcriptspara ver tus trabajos previos del más reciente al más antiguo, incluyendo estado, título y duración del audio. -
Verificar minutos restantes — Consulta
get_balancepara ver cuántos minutos de transcripción te quedan antes de iniciar un nuevo trabajo. -
Recibir resultados mediante webhook — Pasa un
webhook_urlal crear un trabajo para que la transcripción finalizada y el resumen se envíen automáticamente a tu endpoint mediante POST.
Documentación
Workflows
API simple para flujos de trabajo complejos
Una sola llamada devuelve la transcripción, los hablantes y el resumen. Lo que tu agente construya sobre eso es la parte interesante.
Notas de reunión
- Una grabación de standup llega a tu bucket
- Una llamada devuelve quién dijo qué, más un resumen solo de decisiones
- Tu agente publica las notas y abre los seguimientos
"prompt": "resumir como decisiones y responsables"
QA de soporte
- Una llamada de soporte termina y se envía la grabación
- Las etiquetas de hablante separan al cliente del representante
- Tu agente califica la llamada y marca las que deben revisarse
"prompt": "listar las quejas no resueltas del cliente"
Producción de podcasts
- Se sube un episodio y se registra un webhook
- La transcripción terminada llega a tu endpoint con marcas de tiempo
- Tu agente escribe las notas del programa y corta los marcadores de capítulos
"prompt": "escribir notas del programa con títulos de capítulos"
Llamadas de ventas al CRM
- Se envía una grabación de llamada tan pronto como termina la reunión
- El resumen regresa como elementos de acción
- Tu agente los escribe en el trato y programa el siguiente paso
"prompt": "listar elementos de acción con responsables y fechas"
Cada uno de estos usa los mismos tres endpoints. Lo único que cambia es el prompt que envías y lo que tu agente hace con la respuesta.
Diseñado para agentes
Si tu agente puede llamar a una URL, puede escuchar
Un POST, una subida, una respuesta JSON. Sin SDK que adoptar, sin runtime que instalar, sin framework al que comprometerse.
- Claude Code
Codex
Cursor
Hermes
OpenClaw
Dos formas de entrar, nada que instalar. Conecta el servidor MCP y pregunta, o apunta a tu agente a la documentación y él escribe el cliente que tu caso de uso necesita.
Pega esto en tu agente
Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.
Servidor MCP
Úsalo desde Claude, Cursor, Codex y ChatGPT
Voibe es un servidor MCP. Conéctalo una vez y la app de IA que ya usas puede transcribir una grabación, leer el resultado y revisar tus minutos. Sin código.
- Añade el conector Pega la dirección en tu app: Claude bajo Connectors, Claude Code con un comando, Cursor y Codex en su archivo de configuración.
- Inicia sesión una vez Aprueba Voibe en el navegador. Una nueva dirección de correo obtiene una cuenta con 15 minutos gratis. Sin clave API que copiar.
- Pregunta "Transcribe esta grabación." Una herramienta de código sube el archivo por sí misma. Una app de chat te da un enlace de subida. La transcripción y el resumen regresan en el chat.
- Misma API, misma cuenta, misma facturación: por segundo de audio, solo cuando el trabajo termina.
Dirección MCP
https://api.getvoibe.com/mcp
Claude Code
claude mcp add --transport http voibe https://api.getvoibe.com/mcp
-
create_transcription_jobIniciar una transcripción -
get_transcriptEstado, luego la transcripción y el resumen -
list_transcriptsTus grabaciones, más recientes primero -
get_balanceMinutos restantes -
Claude
-
Claude Desktop
-
Cowork
-
Claude Code
-
Cursor
-
Codex
-
ChatGPT
-
VS Code
-
Hermes
-
OpenClaw
Lo que tu agente recibe
Lo que devuelve la API de transcripción
Sin segunda llamada a un resumidor, sin servicio de diarización separado, sin código de pegamento que los una.
GET /v1/transcripts/{job_id}
{
"job_id": "a523721c-…",
"status": "DONE",
"title": "Pricing page review",
"audio_duration_seconds": 205.27,
"seconds_charged": 206,
"diarize": true,
"transcript": [
{ "speaker": "Priya", "start": 0.4, "end": 5.2,
"text": "Let's start with the pricing page. Where are we?" },
{ "speaker": "Tom", "start": 6.1, "end": 10.8,
"text": "Copy is done. I need a review before Thursday." }
],
"transcript_text": "Priya: Let's start with the pricing page…",
"summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
"error": null
}
transcriptCada línea con quién la dijo, y su tiempo de inicio y fin en segundos. Cita a la persona correcta, salta al momento, o dirige un seguimiento a quien lo pidió.transcript_textLa misma transcripción como una sola cadena de texto, lista para insertarse directamente en un prompt o un índice.summaryUn resumen breve que tu agente puede publicar, almacenar o razonar sin una segunda llamada al modelo. Viene con un título para la grabación.
Casos de uso
Configúralo una vez. Se ejecuta cada semana.
No escribes la integración. Describes el trabajo repetitivo al agente que ya usas, y él escribe el script que llama a Voibe en un horario.
Gerente de producto
usando Claude Cowork
Convierte una semana de llamadas de clientes en un resumen de comentarios por temas, sin escuchar ninguna.
Lo que le pidieron a su agente
"Cada viernes, envía las grabaciones de llamadas de la semana pasada a la API de Voibe y dame los cinco temas principales, con una cita y el nombre del cliente para cada uno."
Desarrollador
usando Codex
Mantiene un índice de transcripciones buscable de cada standup y llamada de incidente que el equipo graba.
Lo que le pidieron a su agente
"Escribe un trabajo que publique nuevas grabaciones de nuestro bucket a la API de Voibe, almacene el JSON, e indexe transcript_text en Postgres para búsqueda."
Fundador
usando Hermes
Convierte llamadas de inversores y ventas en seguimientos antes de que termine el día.
Lo que le pidieron a su agente
"Cuando llegue una grabación de llamada, transcríbela con Voibe y redacta el correo de seguimiento listando a qué me comprometí y para cuándo."
Creador de contenido
usando OpenClaw
Convierte cada nuevo episodio en notas del programa, marcadores de capítulos y candidatos a clips durante la noche.
Lo que le pidieron a su agente
"Vigila esta carpeta. Cuando aparezca un nuevo episodio, transcríbelo con Voibe y dame capítulos, notas del programa y las tres mejores citas destacadas con marcas de tiempo."
Cada uno de estos es una conversación con un agente. El agente se conecta al servidor MCP o lee la documentación, escribe el script y lo programa; tú revisas el resultado.
Precios
Precios de la API de texto a voz
15 minutos gratis, luego compra minutos que nunca expiran. Paga por el audio que tus agentes realmente transcriben: sin suscripción, sin asientos, sin mínimo mensual.
$50 $0.27 por hora de audio
11,000 minutos · 183 horas de audio
Comienza con 15 minutos gratis
Sin tarjeta. Por segundo de audio, cobrado cuando un trabajo termina. Los minutos nunca expiran.
Diarización de hablantes
Diarización de hablantes: tu agente sabe quién dijo qué
Las etiquetas de hablante están activadas por defecto: cada línea regresa con una etiqueta de hablante y tiempos de inicio y fin en segundos. No hay límite en cuántos hablantes se distinguen, y cuando las personas dicen sus nombres, el resumen los usa. Sin modelo de diarización separado que ejecutar, sin cargo extra. Establece diarize en false para una transcripción simple.
- Agentes de reuniones que rastrean quién se comprometió a qué
- Agentes de soporte que citan al cliente
- Pipelines de entrevistas y podcasts
- En cualquier lugar donde hable más de una persona
Un campo en la llamada de creación
{ "diarize": true }
Webhooks
Transcripción asíncrona: tu agente dispara y sigue adelante
Pasa un webhook_url cuando crees el trabajo y hacemos POST del resultado terminado a tu endpoint. Ningún bucle de agente queda bloqueado en un poll. El cuerpo lleva un nombre de evento y el mismo cuerpo de trabajo que el GET, así un solo manejador cubre ambas rutas.
Un campo en la llamada de creación
{ "webhook_url": "https://you.dev/ready" }
Resúmenes dirigibles
Pide la forma que tu agente necesita
Pasa un prompt y el resumen regresa como tu código quiere leerlo: solo decisiones, elementos de acción, viñetas. Tu agente obtiene estructura utilizable sin una segunda llamada al modelo. Hasta 2,000 caracteres. Cambia el resumen.
Tus instrucciones, tu resumen
{
"diarize": true,
"prompt": "summarise as bullet points, focus on decisions"
}
Integración
Deja que tu agente de código lo conecte
Copia un prompt del portal en Claude Code, Codex, Cursor o cualquier agente de código, y él escribe el cliente por ti. El prompt llega con tu clave ya completada. Y cuando solo necesitas transcribir una grabación, salta el código: conecta el servidor MCP y pregunta.
Construye apps útiles
Lo que los desarrolladores construyen con la API de texto a voz
La API te da texto con etiquetas de hablante, marcas de tiempo y un resumen dirigible. Estos son los productos que surgen de eso.
Tomador de notas de reuniones
Convierte una grabación en notas que nombran quién se comprometió a qué. Las etiquetas de hablante hacen la atribución, el prompt da forma al resultado en decisiones y responsables.
Archivo de llamadas buscable
Indexa transcript_text para búsqueda de texto completo y guarda las marcas de tiempo para saltar directo al momento. Filtra por hablante para encontrar lo que una persona dijo a lo largo de meses de llamadas.
Subtítulos y subtítulos cerrados
Cada línea llega con un tiempo de inicio y fin en segundos, que es todo lo que un archivo SRT o VTT necesita. Subtitula una biblioteca completa de videos sin tocar un editor.
Notas de voz a tareas
Un memo caminando y hablando se convierte en trabajo estructurado. Pide al prompt elementos de acción con responsables y fechas, luego escríbelos directamente en tu rastreador.
Calificación y coaching de llamadas
Separa al representante del cliente, luego califica la llamada contra tu propia rúbrica. Revisa los valores atípicos.
Una interfaz de voz para tu producto
Deja que los usuarios hablen con tu app. Envía el clip, recibe texto que tu agente puede enrutar, y evita construir infraestructura de voz.
Ninguno de estos necesita un endpoint diferente. La transcripción, los hablantes y el resumen llegan todos en una respuesta; el producto es lo que haces con eso.
Cómo funciona
Cómo funciona la API de texto a voz
Tres endpoints, dos pasos. Crea el trabajo, sube el audio a la URL firmada que recibes, luego consulta el resultado o deja que un webhook te lo traiga.
- POST /v1/transcripts Inicia un trabajo y devuelve una URL de subida firmada.
- GET /v1/transcripts/{job_id} Devuelve estado, transcripción y resumen.
- GET /v1/transcripts Lista tus trabajos, hasta 200 por página.
- El audio va directo al almacenamiento en la URL firmada, así los archivos grandes nunca viajan a través de una solicitud API. Archivos hasta 200 MB; la URL funciona por 5 horas.
Sube el audio
curl -s -X PUT "$UPLOAD_URL" \
-H "Content-Type: application/octet-stream" \
--data-binary @pricing-meeting.mp3
Confianza y fiabilidad
Retención cero en tu audio
La grabación se elimina en el momento en que existe la transcripción. Nunca se guarda, y nunca se usa para entrenar modelos.
-
El audio se elimina después de la transcripción
La grabación se elimina una vez que se ha producido la transcripción. -
Nunca se usa para entrenar modelos
Nada de lo que envías se usa para entrenar modelos. Tus grabaciones son tuyas. -
Cada lectura está limitada a tu cuenta
Un trabajo solo puede ser leído por la cuenta que lo creó. -
Los trabajos fallidos nunca se cobran
Solo pagas cuando un trabajo llega a DONE. En cola, procesando y fallidos no cuestan nada, así que un reintento tampoco cuesta nada.
Tus transcripciones permanecen legibles a través de GET /v1/transcripts durante 24 horas después de que el trabajo termina, así un agente puede obtener un resultado de nuevo sin reenviar el audio.
Preguntas frecuentes de la API de texto a voz
¿Cuál es la mejor API de texto a voz para agentes de IA?
La que tu agente puede usar sin esperar una integración. La API de Voibe es HTTP simple: un POST para iniciar un trabajo, una subida, una respuesta JSON que contiene la transcripción, etiquetas de hablante, marcas de tiempo y un resumen. No hay SDK que instalar ni framework al que comprometerse. También es un servidor MCP en https://api.getvoibe.com/mcp, así que Claude, Claude Code, Cursor, Codex y ChatGPT se conectan directamente. Para tu propio código, apunta al agente a https://platform.getvoibe.com/docs.md y él resuelve las llamadas que tu caso de uso necesita. Cada cuenta nueva comienza con 15 minutos gratis y sin tarjeta.
¿La API de texto a voz de Voibe tiene un servidor MCP?
Sí. El servidor MCP de Voibe está en https://api.getvoibe.com/mcp. Añádelo a Claude, Claude Code, Cursor, Codex, ChatGPT o VS Code como conector personalizado o con un bloque de configuración, inicia sesión una vez, y pide a la app que transcriba una grabación. Expone cuatro herramientas: iniciar una transcripción, obtener una transcripción, listar transcripciones y verificar minutos restantes. Usa la misma cuenta, los mismos minutos y la misma facturación por segundo que la API.
¿Puede Claude transcribir una grabación de reunión con Voibe?
Sí. En Claude, abre Customize, luego Connectors, haz clic en +, elige Add custom connector, pega https://api.getvoibe.com/mcp e inicia sesión. Luego pide a Claude que transcriba una grabación. Claude no puede leer archivos en tu computadora, así que te da un enlace de subida; suelta el archivo y Claude obtiene la transcripción y el resumen. Esto funciona en Claude en la web, Claude Desktop y Cowork.
¿Cómo transcribo audio desde Claude Code, Cursor o Codex?
Conecta el servidor MCP de Voibe y pregunta. Para Claude Code, ejecuta claude mcp add --transport http voibe https://api.getvoibe.com/mcp, escribe /mcp en una sesión e inicia sesión. Cursor y Codex toman un bloque en su archivo de configuración. Luego pide al agente que transcriba un archivo: él sube el archivo por sí mismo y devuelve la transcripción con etiquetas de hablante y el resumen. La configuración para cada app está en https://platform.getvoibe.com/docs/mcp.
¿La API identifica diferentes hablantes, y sabe sus nombres? Sí. Las etiquetas de hablante están activadas por defecto: cada línea viene con una etiqueta de hablante y tiempos de inicio y fin en segundos. Los hablantes se etiquetan como speaker_0, speaker_1 y así sucesivamente, de forma consistente dentro de una grabación, sin límite en cuántos se distinguen. El resumen y el título usan los nombres de las personas cuando la grabación los incluye, por ejemplo, cuando alguien se presenta o es mencionado por su nombre. La diarización de hablantes está incluida en el precio. Establece diarize en false para obtener una transcripción simple.
¿Qué formatos de audio, tamaños de archivo y límites de tasa se aplican?
mp3, wav, m4a, mp4, flac, ogg y webm se aceptan directamente; otros archivos de audio y video se convierten primero cuando el audio puede leerse. El formato se detecta a partir del contenido del archivo. Cada archivo puede tener hasta 200 MB, y la URL de carga funciona durante 5 horas. Los límites de tasa son 50 trabajos por minuto y 1,000 trabajos por día por cuenta; más allá de eso, la llamada create devuelve 429, así que espera y reintenta.
¿Qué idiomas soporta la API de voz a texto?
Los modelos de voz y resumen son multilingües, por lo que la grabación no tiene que estar en inglés. La separación de hablantes funciona igual en cualquier idioma.
¿Tengo que consultar los resultados periódicamente?
No. Pasa un webhook_url cuando crees el trabajo y te enviaremos el resultado final a tu endpoint tan pronto como esté listo. El cuerpo incluye un nombre de evento, transcript.completed o transcript.failed, y el mismo cuerpo de trabajo que GET /v1/transcripts/{job_id}, por lo que un solo manejador cubre ambos casos. La consulta periódica sigue disponible si la prefieres.
¿Cómo se me factura y los minutos caducan?
Por segundo de audio, redondeado al segundo completo. Un archivo de 3 minutos y 24 segundos cuesta 3 minutos y 24 segundos. Solo se te cobra cuando un trabajo alcanza el estado DONE, por lo que los trabajos en cola, en proceso y fallidos no cuestan nada. Cada cuenta nueva comienza con 15 minutos gratuitos y no se requiere tarjeta. Después, compras minutos en paquetes de un solo uso, desde $10 por 2,000 minutos. Los minutos nunca caducan, y no hay suscripción ni mínimo mensual.
¿Qué sucede si un trabajo falla?
No se te cobra. El trabajo devuelve un estado de FAILED y un campo de error que explica qué salió mal en palabras sencillas, por ejemplo, minutos insuficientes para la duración del audio, o un archivo que nunca llegó dentro de las 24 horas. Si no quedan minutos en absoluto, la llamada create se rechaza con un 402 antes de cualquier carga, por lo que no se envía nada.
¿Se almacena mi audio o se usa para entrenar modelos?
El audio se elimina después de la transcripción y nunca se usa para entrenar modelos. Las transcripciones y los resúmenes permanecen legibles durante 24 horas después de que el trabajo finaliza, y luego se eliminan. El título, la duración y el costo del trabajo permanecen en tu historial. Cada lectura está limitada a tu cuenta, por lo que solo ves tus propios trabajos. La voz a texto se ejecuta en Whisper large-v3-turbo, la separación de hablantes en pyannote community-1, y el resumen en gpt-oss-120b.
¿En qué se diferencia esto de ejecutar Whisper yo mismo?
No hay infraestructura que operar, ni GPU que mantener caliente, ni escalado que gestionar. La diarización de hablantes y el resumen vienen en la misma respuesta que la transcripción, sin un segundo modelo ni código de conexión. Pagas por segundo de audio transcrito, y no hay tiempo de servidor que pagar.