Voibe Transcription MCP Server

officiel

Donnez des oreilles à Claude/Openclaw/Hermes/Codex/Grok Bot. Voibe transforme les enregistrements en texte que votre agent IA peut exploiter. Demandez à votre agent de transcrire une réunion, un entretien, un appel, un cours, un épisode de podcast ou une note vocale. La transcription brute arrive dans le chat avec les étiquettes des intervenants, les horodatages et un résumé.

Que pouvez-vous faire avec Voibe Transcription MCP ?

  • Créer des tâches de transcription — Demandez à votre assistant de lancer une transcription en soumettant un audio via create_transcription_job, avec une diarisation des locuteurs optionnelle et une invite de résumé personnalisée.

  • Récupérer les transcriptions et les résumés — Utilisez get_transcript pour obtenir les lignes étiquetées par locuteur avec horodatages, une version en texte brut et un résumé orientable façonné par votre invite.

  • Lister les enregistrements passés — Appelez list_transcripts pour voir vos tâches précédentes de la plus récente à la plus ancienne, y compris le statut, le titre et la durée de l’audio.

  • Vérifier les minutes restantes — Interrogez get_balance pour voir combien de minutes de transcription il vous reste avant de lancer une nouvelle tâche.

  • Recevoir les résultats via webhook — Transmettez un webhook_url lors de la création d’une tâche pour que la transcription terminée et le résumé soient automatiquement envoyés à votre point de terminaison.

Documentation

Workflows

API simple pour des workflows complexes

Un seul appel renvoie la transcription, les intervenants et le résumé. Ce que votre agent construit par-dessus, c'est là que l'intérêt réside.

Notes de réunion

  1. Un enregistrement de standup arrive dans votre bucket
  2. Un seul appel renvoie qui a dit quoi, plus un résumé limité aux décisions
  3. Votre agent publie les notes et ouvre les suivis

"prompt" : "résumer sous forme de décisions et de responsables"

Support QA

  1. Un appel de support se termine et l'enregistrement est envoyé
  2. Les étiquettes d'intervenants séparent le client de l'agent
  3. Votre agent évalue l'appel et signale ceux à examiner

"prompt" : "lister les plaintes non résolues du client"

Production de podcasts

  1. Un épisode est téléversé et un webhook est enregistré
  2. La transcription terminée arrive à votre endpoint avec les horodatages
  3. Votre agent rédige les notes d'émission et découpe les marqueurs de chapitres

"prompt" : "rédiger des notes d'émission avec des titres de chapitres"

Appels de vente vers le CRM

  1. Un enregistrement d'appel est envoyé dès que la réunion se termine
  2. Le résumé revient sous forme d'éléments d'action
  3. Votre agent les écrit sur l'affaire et planifie l'étape suivante

"prompt" : "lister les éléments d'action avec responsables et dates"

Chacun de ces cas utilise les mêmes trois endpoints. La seule chose qui change, c'est le prompt que vous envoyez et ce que votre agent fait de la réponse.

Conçu pour les agents

Si votre agent peut appeler une URL, il peut écouter

Un POST, un téléversement, une réponse JSON. Pas de SDK à adopter, pas de runtime à installer, pas de framework à épouser.

  • Claude Code
  • Codex
  • Cursor
  • Hermes
  • OpenClaw

Deux façons d'entrer, rien à installer. Connectez le serveur MCP et demandez, ou pointez votre agent vers la documentation et il écrit le client dont votre cas d'usage a besoin.

Collez ceci dans votre agent

Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.

Serveur MCP

Utilisez-le depuis Claude, Cursor, Codex et ChatGPT

Voibe est un serveur MCP. Connectez-le une fois et l'application d'IA que vous utilisez déjà peut transcrire un enregistrement, lire le résultat et vérifier vos notes. Aucun code.

  1. Ajoutez le connecteur Collez l'adresse dans votre application : Claude sous Connecteurs, Claude Code avec une commande, Cursor et Codex dans leur fichier de configuration.
  2. Connectez-vous une fois Approuvez Voibe dans le navigateur. Une nouvelle adresse e-mail obtient un compte avec 15 minutes gratuites. Pas de clé API à copier.
  3. Demandez « Transcrivez cet enregistrement. » Un outil de codage téléverse le fichier lui-même. Une application de chat vous donne un lien de téléversement. La transcription et le résumé reviennent dans le chat.
  4. Même API, même compte, même facturation : par seconde d'audio, uniquement lorsque le travail se termine.

Adresse MCP

https://api.getvoibe.com/mcp

Claude Code

claude mcp add --transport http voibe https://api.getvoibe.com/mcp
  • create_transcription_job Démarrer une transcription

  • get_transcript Statut, puis la transcription et le résumé

  • list_transcripts Vos enregistrements, du plus récent au plus ancien

  • get_balance Minutes restantes

  • Claude

  • Claude Desktop

  • Cowork

  • Claude Code

  • Cursor

  • Codex

  • ChatGPT

  • VS Code

  • Hermes

  • OpenClaw

Ce que votre agent reçoit en retour

Ce que renvoie l'API de transcription vocale

Pas de second appel à un résumeur, pas de service de diarisation séparé, pas de code de collage pour les assembler.

GET /v1/transcripts/{job_id}

{
  "job_id": "a523721c-…",
  "status": "DONE",
  "title": "Pricing page review",
  "audio_duration_seconds": 205.27,
  "seconds_charged": 206,
  "diarize": true,
  "transcript": [
    { "speaker": "Priya", "start": 0.4,  "end": 5.2,
      "text": "Let's start with the pricing page. Where are we?" },
    { "speaker": "Tom",   "start": 6.1, "end": 10.8,
      "text": "Copy is done. I need a review before Thursday." }
  ],
  "transcript_text": "Priya: Let's start with the pricing page…",
  "summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
  "error": null
}
  • transcript Chaque ligne avec qui l'a dite, et son heure de début et de fin en secondes. Citez la bonne personne, sautez au moment précis, ou acheminez un suivi vers celui qui l'a demandé.
  • transcript_text La même transcription sous forme d'une seule chaîne de texte, prête à être insérée directement dans un prompt ou un index.
  • summary Un court résumé que votre agent peut publier, stocker ou analyser sans un second appel de modèle. Il est accompagné d'un titre pour l'enregistrement.

Cas d'usage

Configurez-le une fois. Il tourne chaque semaine.

Vous n'écrivez pas l'intégration. Vous décrivez le travail répétitif à l'agent que vous utilisez déjà, et il écrit le script qui appelle Voibe selon un calendrier.

Chef de produit

utilisant Claude Cowork

Transforme une semaine d'appels clients en un digest de retours thématiques, sans en écouter aucun.

Ce qu'ils ont demandé à leur agent

« Chaque vendredi, envoyez les enregistrements d'appels de la semaine à l'API Voibe et donnez-moi les cinq thèmes principaux, avec une citation et le nom du client pour chacun. »

Développeur

utilisant Codex

Maintient un index de transcriptions consultable de chaque standup et appel d'incident que l'équipe enregistre.

Ce qu'ils ont demandé à leur agent

« Écrivez un travail qui publie les nouveaux enregistrements de notre bucket vers l'API Voibe, stocke le JSON, et indexe transcript_text dans Postgres pour la recherche. »

Fondateur

utilisant Hermes

Transforme les appels d'investisseurs et de ventes en suivis avant la fin de la journée.

Ce qu'ils ont demandé à leur agent

« Quand un enregistrement d'appel arrive, transcrivez-le avec Voibe et rédigez l'e-mail de suivi listant ce que j'ai promis et pour quand. »

Créateur de contenu

utilisant OpenClaw

Transforme chaque nouvel épisode en notes d'émission, marqueurs de chapitres et candidats à l'extrait du jour au lendemain.

Ce qu'ils ont demandé à leur agent

« Surveillez ce dossier. Quand un nouvel épisode apparaît, transcrivez-le avec Voibe et donnez-moi les chapitres, les notes d'émission et les trois meilleures citations avec horodatages. »

Chacun de ces cas est une conversation avec un agent. L'agent se connecte au serveur MCP ou lit la documentation, écrit le script et le planifie ; vous examinez le résultat.

Tarification

Tarification de l'API de transcription vocale

15 minutes gratuites, puis achetez des minutes qui n'expirent jamais. Payez pour l'audio que vos agents transcrivent réellement : pas d'abonnement, pas de sièges, pas de minimum mensuel.

$50 $0,27 par heure d'audio

11 000 minutes · 183 heures d'audio

Commencez avec 15 minutes gratuites

Pas de carte. Par seconde d'audio, facturé lorsqu'un travail se termine. Les minutes n'expirent jamais.

Diarisation des intervenants

Diarisation des intervenants : votre agent sait qui a dit quoi

Les étiquettes d'intervenants sont activées par défaut : chaque ligne revient avec une étiquette d'intervenant et des heures de début et de fin en secondes. Il n'y a pas de limite au nombre d'intervenants distingués, et lorsque les gens prononcent leurs noms, le résumé les utilise. Pas de modèle de diarisation séparé à exécuter, pas de frais supplémentaires. Définissez diarize sur false pour une transcription simple.

  • Agents de réunion qui suivent qui s'est engagé à quoi
  • Agents de support qui citent le client
  • Pipelines d'interviews et de podcasts
  • Partout où plus d'une personne parle

Un champ sur l'appel de création

{ "diarize": true }

Webhooks

Transcription asynchrone : votre agent se déclenche et passe à autre chose

Passez un webhook_url lors de la création du travail et nous publions le résultat terminé sur votre endpoint. Aucune boucle d'agent ne reste bloquée sur un sondage. Le corps porte un nom d'événement et le même corps de travail que le GET, donc un seul gestionnaire couvre les deux chemins.

Un champ sur l'appel de création

{ "webhook_url": "https://you.dev/ready" }

Résumés orientables

Demandez la forme dont votre agent a besoin

Passez un prompt et le résumé revient de la manière que votre code veut lire : décisions uniquement, éléments d'action, puces. Votre agent obtient une structure utilisable sans un second appel de modèle. Jusqu'à 2 000 caractères. Cela modifie le résumé.

Vos instructions, votre résumé

{
  "diarize": true,
  "prompt": "summarise as bullet points, focus on decisions"
}

Intégration

Laissez votre agent de codage faire le câblage

Copiez un prompt depuis le portail dans Claude Code, Codex, Cursor ou tout agent de codage, et il écrit le client pour vous. Le prompt arrive avec votre clé déjà remplie. Et quand vous n'avez besoin que de transcrire un enregistrement, sautez le code : connectez le serveur MCP et demandez.

Construisez des applications utiles

Ce que les développeurs construisent avec l'API de transcription vocale

L'API vous donne du texte avec étiquettes d'intervenants, des horodatages et un résumé orientable. Voici les produits qui en découlent.

Preneur de notes de réunion

Transformez un enregistrement en notes qui nomment qui s'est engagé à quoi. Les étiquettes d'intervenants font l'attribution, le prompt façonne la sortie en décisions et responsables.

Archive d'appels consultable

Indexez transcript_text pour la recherche en texte intégral et conservez les horodatages pour sauter directement au moment. Filtrez par intervenant pour trouver ce qu'une personne a dit sur des mois d'appels.

Sous-titres et légendes

Chaque ligne arrive avec une heure de début et de fin en secondes, ce qui est tout ce dont un fichier SRT ou VTT a besoin. Sous-titrez toute une bibliothèque vidéo sans toucher à un éditeur.

Notes vocales en tâches

Une note prise en marchant devient un travail structuré. Demandez au prompt des éléments d'action avec responsables et dates, puis écrivez-les directement dans votre outil de suivi.

Évaluation et coaching d'appels

Séparez l'agent du client, puis évaluez l'appel selon votre propre grille. Examinez les cas aberrants.

Une interface vocale pour votre produit

Laissez les utilisateurs parler à votre application. Envoyez le clip, récupérez du texte que votre agent peut acheminer, et évitez de construire une infrastructure vocale.

Aucun de ces cas n'a besoin d'un endpoint différent. La transcription, les intervenants et le résumé arrivent tous dans une seule réponse ; le produit, c'est ce que vous en faites.

Comment ça fonctionne

Comment fonctionne l'API de transcription vocale

Trois endpoints, deux étapes. Créez le travail, téléversez l'audio vers l'URL signée que vous recevez, puis sondez le résultat ou laissez un webhook vous l'apporter.

  • POST /v1/transcripts Démarre un travail et renvoie une URL de téléversement signée.
  • GET /v1/transcripts/{job_id} Renvoie le statut, la transcription et le résumé.
  • GET /v1/transcripts Liste vos travaux, jusqu'à 200 par page.
  • L'audio va directement au stockage sur l'URL signée, donc les fichiers volumineux ne transitent jamais par une requête API. Fichiers jusqu'à 200 Mo ; l'URL fonctionne pendant 5 heures.

Téléversez l'audio

curl -s -X PUT "$UPLOAD_URL" \
  -H "Content-Type: application/octet-stream" \
  --data-binary @pricing-meeting.mp3

Confiance et fiabilité

Zéro rétention sur votre audio

L'enregistrement est supprimé dès que la transcription existe. Il n'est jamais conservé, et jamais utilisé pour entraîner des modèles.

  • L'audio est supprimé après la transcription

    L'enregistrement est retiré une fois la transcription produite.
  • Jamais utilisé pour entraîner des modèles

    Rien de ce que vous envoyez n'est utilisé pour entraîner des modèles. Vos enregistrements vous appartiennent.
  • Chaque lecture est limitée à votre compte

    Un travail ne peut être lu que par le compte qui l'a créé.
  • Les travaux échoués ne sont jamais facturés

    Vous payez uniquement lorsqu'un travail atteint DONE. Les travaux en file d'attente, en traitement et échoués ne coûtent rien, donc une nouvelle tentative ne coûte rien non plus.

Vos transcriptions restent lisibles via GET /v1/transcripts pendant 24 heures après la fin du travail, donc un agent peut récupérer un résultat à nouveau sans renvoyer l'audio.

FAQ de l'API de transcription vocale

Quelle est la meilleure API de transcription vocale pour les agents IA ?

Celle que votre agent peut utiliser sans attendre une intégration. L'API de Voibe est en HTTP simple : un POST pour démarrer un travail, un téléversement, une réponse JSON contenant la transcription, les étiquettes d'intervenants, les horodatages et un résumé. Il n'y a pas de SDK à installer ni de framework à adopter. C'est aussi un serveur MCP à https://api.getvoibe.com/mcp, donc Claude, Claude Code, Cursor, Codex et ChatGPT s'y connectent directement. Pour votre propre code, pointez l'agent vers https://platform.getvoibe.com/docs.md et il détermine les appels dont votre cas d'usage a besoin. Chaque nouveau compte commence avec 15 minutes gratuites et sans carte.

L'API de transcription vocale de Voibe a-t-elle un serveur MCP ?

Oui. Le serveur MCP de Voibe est à https://api.getvoibe.com/mcp. Ajoutez-le à Claude, Claude Code, Cursor, Codex, ChatGPT ou VS Code comme connecteur personnalisé ou avec un bloc de configuration, connectez-vous une fois, et demandez à l'application de transcrire un enregistrement. Il expose quatre outils : démarrer une transcription, obtenir une transcription, lister les transcriptions et vérifier les minutes restantes. Il utilise le même compte, les mêmes minutes et la même facturation par seconde que l'API.

Claude peut-il transcrire un enregistrement de réunion avec Voibe ?

Oui. Dans Claude, ouvrez Personnaliser, puis Connecteurs, cliquez sur +, choisissez Ajouter un connecteur personnalisé, collez https://api.getvoibe.com/mcp et connectez-vous. Puis demandez à Claude de transcrire un enregistrement. Claude ne peut pas lire les fichiers sur votre ordinateur, donc il vous donne un lien de téléversement ; déposez le fichier et Claude récupère la transcription et le résumé. Cela fonctionne dans Claude sur le web, Claude Desktop et Cowork.

Comment transcrire de l'audio depuis Claude Code, Cursor ou Codex ?

Connectez le serveur MCP de Voibe et demandez. Pour Claude Code, exécutez claude mcp add --transport http voibe https://api.getvoibe.com/mcp, tapez /mcp dans une session et connectez-vous. Cursor et Codex prennent un bloc dans leur fichier de configuration. Puis demandez à l'agent de transcrire un fichier : il téléverse le fichier lui-même et renvoie la transcription avec étiquettes d'intervenants et le résumé. La configuration pour chaque application est à https://platform.getvoibe.com/docs/mcp.

L'API identifie-t-elle les différents intervenants, et connaît-elle leurs noms ? Oui. Les étiquettes de locuteur sont activées par défaut : chaque ligne revient avec une étiquette de locuteur et des heures de début et de fin en secondes. Les locuteurs sont étiquetés speaker_0, speaker_1, etc., de manière cohérente au sein d'un enregistrement, sans limite sur le nombre de locuteurs distingués. Le résumé et le titre utilisent les noms des personnes lorsque l'enregistrement le fait, par exemple lorsque quelqu'un se présente ou est appelé par son nom. La diarisation des locuteurs est incluse dans le prix. Définissez diarize sur false pour une transcription simple.

Quels formats audio, tailles de fichiers et limites de débit s'appliquent ?

mp3, wav, m4a, mp4, flac, ogg et webm sont acceptés directement ; les autres fichiers audio et vidéo sont convertis d'abord lorsque l'audio peut être lu. Le format est lu à partir du contenu du fichier. Chaque fichier peut peser jusqu'à 200 Mo, et l'URL de téléversement est valable 5 heures. Les limites de débit sont de 50 tâches par minute et de 1 000 tâches par jour par compte ; au-delà, l'appel create renvoie 429, donc attendez et réessayez.

Quelles langues l'API de reconnaissance vocale prend-elle en charge ?

Les modèles de reconnaissance vocale et de résumé sont multilingues, donc l'enregistrement n'a pas besoin d'être en anglais. La séparation des locuteurs fonctionne de la même manière dans toutes les langues.

Dois-je interroger les résultats ?

Non. Passez un webhook_url lors de la création de la tâche et nous publions le résultat terminé sur votre endpoint dès qu'il est prêt. Le corps contient un nom d'événement, transcript.completed ou transcript.failed, et le même corps de tâche que GET /v1/transcripts/{job_id}, donc un seul gestionnaire couvre les deux. L'interrogation reste disponible si vous préférez.

Comment suis-je facturé, et les minutes expirent-elles ?

Par seconde d'audio, arrondie à la seconde entière. Un fichier de 3 minutes 24 secondes coûte 3 minutes 24 secondes. Vous n'êtes facturé que lorsqu'une tâche atteint DONE, donc les tâches en file d'attente, en cours de traitement et échouées ne coûtent rien. Chaque nouveau compte commence avec 15 minutes gratuites et aucune carte n'est requise. Ensuite, vous achetez des minutes en packs uniques, à partir de 10 $ pour 2 000 minutes. Les minutes n'expirent jamais, et il n'y a ni abonnement ni minimum mensuel.

Que se passe-t-il si une tâche échoue ?

Vous n'êtes pas facturé. La tâche revient avec un statut FAILED et un champ error expliquant ce qui n'a pas fonctionné en termes simples, par exemple pas assez de minutes pour la durée de l'audio, ou un fichier jamais arrivé dans les 24 heures. S'il ne reste plus aucune minute, l'appel create est refusé avec un 402 avant tout téléversement, donc rien n'est envoyé.

Mon audio est-il stocké ou utilisé pour entraîner des modèles ?

L'audio est supprimé après la transcription et n'est jamais utilisé pour entraîner des modèles. Les transcriptions et les résumés restent lisibles pendant 24 heures après la fin de la tâche, puis ils sont supprimés. Le titre, la durée et le coût de la tâche restent dans votre historique. Chaque lecture est limitée à votre compte, donc vous ne voyez que vos propres tâches. La reconnaissance vocale s'exécute sur Whisper large-v3-turbo, la séparation des locuteurs sur pyannote community-1, et le résumé sur gpt-oss-120b.

En quoi cela diffère-t-il de l'exécution de Whisper moi-même ?

Il n'y a aucune infrastructure à exécuter, aucun GPU à maintenir et aucune mise à l'échelle à gérer. La diarisation des locuteurs et le résumé reviennent dans la même réponse que la transcription, sans second modèle ni code de collage. Vous payez par seconde d'audio transcrit, et il n'y a pas de temps serveur à payer.