Voibe Transcription MCP Server

offiziell

Gib Claude/Openclaw/Hermes/Codex/Grok Bot Ohren. Voibe verwandelt Aufnahmen in Text, mit dem dein KI-Agent arbeiten kann. Bitte deinen Agenten, ein Meeting, Interview, Telefonat, einen Vortrag, eine Podcast-Episode oder eine Sprachnotiz zu transkribieren. Das rohe Transkript kommt mit Sprecherkennzeichnungen, Zeitstempeln und einer Zusammenfassung in den Chat.

Was kann man mit Voibe Transcription MCP machen?

  • Transkriptionsaufträge erstellen — Bitten Sie Ihren Assistenten, einen Transkriptionsauftrag zu starten, indem Sie Audio über create_transcription_job übermitteln, optional mit Sprecher-Diarisierung und einem benutzerdefinierten Zusammenfassungs-Prompt.

  • Transkripte und Zusammenfassungen abrufen — Verwenden Sie get_transcript, um sprechermarkierte Zeilen mit Zeitstempeln, eine Klartextversion und eine steuerbare Zusammenfassung abzurufen, die durch Ihren Prompt geformt wird.

  • Frühere Aufnahmen auflisten — Rufen Sie list_transcripts auf, um Ihre früheren Aufträge neueste zuerst zu sehen, einschließlich Status, Titel und Audiodauer.

  • Verbleibende Minuten prüfen — Fragen Sie get_balance ab, um zu sehen, wie viele Transkriptionsminuten Ihnen noch zur Verfügung stehen, bevor Sie einen neuen Auftrag starten.

  • Ergebnisse per Webhook empfangen — Übergeben Sie eine webhook_url beim Erstellen eines Auftrags, um das fertige Transkript und die Zusammenfassung automatisch an Ihren Endpunkt POSTen zu lassen.

Dokumentation

Workflows

Einfache API für komplexe Workflows

Ein einziger Aufruf liefert das Transkript, die Sprecher und die Zusammenfassung. Was Ihr Agent darauf aufbaut, ist der interessante Teil.

Meeting-Notizen

  1. Eine Stand-up-Aufnahme landet in Ihrem Bucket
  2. Ein Aufruf liefert, wer was gesagt hat, plus eine Zusammenfassung nur mit Entscheidungen
  3. Ihr Agent postet die Notizen und erstellt die Folgetermine

„prompt": „als Entscheidungen und Verantwortliche zusammenfassen"

Support-Qualitätssicherung

  1. Ein Support-Anruf endet und die Aufnahme wird gesendet
  2. Sprecher-Labels trennen den Kunden vom Mitarbeiter
  3. Ihr Agent bewertet den Anruf und markiert diejenigen, die überprüft werden sollten

„prompt": „die ungelösten Beschwerden des Kunden auflisten"

Podcast-Produktion

  1. Eine Episode wird hochgeladen und ein Webhook registriert
  2. Das fertige Transkript trifft mit Zeitstempeln an Ihrem Endpunkt ein
  3. Ihr Agent schreibt Shownotes und setzt Kapitelmarker

„prompt": „Shownotes mit Kapiteltiteln schreiben"

Vertriebsgespräche ins CRM

  1. Eine Gesprächsaufnahme wird direkt nach Meeting-Ende gesendet
  2. Die Zusammenfassung kommt als Aktionspunkte zurück
  3. Ihr Agent schreibt sie auf den Deal und plant den nächsten Schritt

„prompt": „Aktionspunkte mit Verantwortlichen und Terminen auflisten"

Jeder dieser Fälle nutzt dieselben drei Endpunkte. Das Einzige, was sich ändert, ist der Prompt, den Sie senden, und was Ihr Agent mit der Antwort tut.

Gebaut für Agenten

Wenn Ihr Agent eine URL aufrufen kann, kann er zuhören

Ein POST, ein Upload, eine JSON-Antwort. Kein SDK zu übernehmen, keine Laufzeit zu installieren, kein Framework, an das man sich bindet.

  • Claude Code
  • Codex
  • Cursor
  • Hermes
  • OpenClaw

Zwei Wege hinein, nichts zu installieren. Verbinden Sie den MCP-Server und fragen Sie, oder weisen Sie Ihren Agenten auf die Dokumentation hin, und er schreibt den Client, den Ihr Anwendungsfall benötigt.

Fügen Sie dies in Ihren Agenten ein

Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.

MCP-Server

Nutzung mit Claude, Cursor, Codex und ChatGPT

Voibe ist ein MCP-Server. Verbinden Sie ihn einmal, und die KI-App, die Sie bereits nutzen, kann eine Aufnahme transkribieren, das Ergebnis lesen und Ihre Notizen prüfen. Ohne Code.

  1. Connector hinzufügen Fügen Sie die Adresse in Ihre App ein: Claude unter Connectors, Claude Code mit einem Befehl, Cursor und Codex in ihrer Konfigurationsdatei.
  2. Einmal anmelden Genehmigen Sie Voibe im Browser. Eine neue E-Mail-Adresse erhält ein Konto mit 15 kostenlosen Minuten. Kein API-Schlüssel zum Kopieren.
  3. Fragen „Transkribiere diese Aufnahme." Ein Codierungstool lädt die Datei selbst hoch. Eine Chat-App gibt Ihnen einen Upload-Link. Das Transkript und die Zusammenfassung kommen im Chat zurück.
  4. Gleiche API, gleiches Konto, gleiche Abrechnung: pro Sekunde Audio, nur wenn der Auftrag abgeschlossen ist.

MCP-Adresse

https://api.getvoibe.com/mcp

Claude Code

claude mcp add --transport http voibe https://api.getvoibe.com/mcp
  • create_transcription_job Eine Transkription starten

  • get_transcript Status, dann Transkript und Zusammenfassung

  • list_transcripts Ihre Aufnahmen, neueste zuerst

  • get_balance Verbleibende Minuten

  • Claude

  • Claude Desktop

  • Cowork

  • Claude Code

  • Cursor

  • Codex

  • ChatGPT

  • VS Code

  • Hermes

  • OpenClaw

Was Ihr Agent zurückbekommt

Was die Transkriptions-API zurückgibt

Kein zweiter Aufruf an einen Summarizer, kein separater Diarisierungsdienst, kein Klebecode, der sie zusammennäht.

GET /v1/transcripts/{job_id}

{
  "job_id": "a523721c-…",
  "status": "DONE",
  "title": "Pricing page review",
  "audio_duration_seconds": 205.27,
  "seconds_charged": 206,
  "diarize": true,
  "transcript": [
    { "speaker": "Priya", "start": 0.4,  "end": 5.2,
      "text": "Let's start with the pricing page. Where are we?" },
    { "speaker": "Tom",   "start": 6.1, "end": 10.8,
      "text": "Copy is done. I need a review before Thursday." }
  ],
  "transcript_text": "Priya: Let's start with the pricing page…",
  "summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
  "error": null
}
  • transcript Jede Zeile mit dem Sprecher sowie Start- und Endzeit in Sekunden. Zitieren Sie die richtige Person, springen Sie zum Moment oder leiten Sie eine Folgefrage an denjenigen weiter, der sie gestellt hat.
  • transcript_text Dasselbe Transkript als einen einfachen String, bereit, direkt in einen Prompt oder einen Index eingefügt zu werden.
  • summary Eine kurze Zusammenfassung, die Ihr Agent posten, speichern oder verarbeiten kann, ohne einen zweiten Modellaufruf. Sie kommt mit einem Titel für die Aufnahme.

Anwendungsfälle

Einmal eingerichtet. Läuft jede Woche.

Sie schreiben nicht die Integration. Sie beschreiben dem Agenten, den Sie bereits nutzen, den wiederkehrenden Auftrag, und er schreibt das Skript, das Voibe nach Zeitplan aufruft.

Produktmanager

mit Claude Cowork

Verwandelt eine Woche Kundengespräche in einen thematischen Feedback-Digest, ohne eines davon anzuhören.

Was sie ihren Agenten gebeten haben

„Sende jeden Freitag die Anrufaufnahmen der letzten Woche an die Voibe-API und gib mir die fünf wichtigsten Themen, mit einem Zitat und dem Kundennamen für jedes."

Entwickler

mit Codex

Pflegt einen durchsuchbaren Transkript-Index jedes Stand-ups und jedes Incident-Calls, den das Team aufzeichnet.

Was sie ihren Agenten gebeten haben

„Schreibe einen Job, der neue Aufnahmen aus unserem Bucket an die Voibe-API postet, das JSON speichert und transcript_text in Postgres für die Suche indiziert."

Gründer

mit Hermes

Lässt Investoren- und Vertriebsgespräche noch am selben Tag in Folgetermine umwandeln.

Was sie ihren Agenten gebeten haben

„Wenn eine Gesprächsaufnahme eintrifft, transkribiere sie mit Voibe und entwirf die Folge-E-Mail, die auflistet, wozu ich mich verpflichtet habe und bis wann."

Content-Ersteller

mit OpenClaw

Verwandelt jede neue Episode über Nacht in Shownotes, Kapitelmarker und Clip-Kandidaten.

Was sie ihren Agenten gebeten haben

„Beobachte diesen Ordner. Wenn eine neue Episode erscheint, transkribiere sie mit Voibe und gib mir Kapitel, Shownotes und die drei besten Pull-Quote mit Zeitstempeln."

Jeder dieser Fälle ist ein einziges Gespräch mit einem Agenten. Der Agent verbindet sich mit dem MCP-Server oder liest die Dokumentation, schreibt das Skript und plant es; Sie prüfen die Ausgabe.

Preise

Speech-to-Text-API-Preise

15 kostenlose Minuten, dann Minuten kaufen, die nie ablaufen. Bezahlen Sie für das Audio, das Ihre Agenten tatsächlich transkribieren: kein Abo, keine Sitze, kein monatliches Minimum.

$50 $0,27 pro Stunde Audio

11.000 Minuten · 183 Stunden Audio

Mit 15 kostenlosen Minuten starten

Keine Karte. Pro Sekunde Audio, abgerechnet, wenn ein Auftrag abgeschlossen ist. Minuten laufen nie ab.

Sprecher-Diarisierung

Sprecher-Diarisierung: Ihr Agent weiß, wer was gesagt hat

Sprecher-Labels sind standardmäßig aktiviert: Jede Zeile kommt mit einem Sprecher-Label sowie Start- und Endzeit in Sekunden zurück. Es gibt keine Obergrenze, wie viele Sprecher unterschieden werden, und wenn Personen ihre Namen nennen, verwendet die Zusammenfassung diese. Kein separates Diarisierungsmodell zum Ausführen, keine zusätzlichen Kosten. Setzen Sie diarize auf false für ein einfaches Transkript.

  • Meeting-Agenten, die verfolgen, wer sich wozu verpflichtet hat
  • Support-Agenten, die den Kunden zitieren
  • Interview- und Podcast-Pipelines
  • Überall, wo mehr als eine Person spricht

Ein Feld beim Erstellen des Aufrufs

{ "diarize": true }

Webhooks

Asynchrone Transkription: Ihr Agent feuert und zieht weiter

Übergeben Sie eine webhook_url beim Erstellen des Auftrags, und wir POSTEN das fertige Ergebnis an Ihren Endpunkt. Keine Agentenschleife blockiert auf einem Poll. Der Body trägt einen Ereignisnamen und denselben Auftrags-Body wie der GET, sodass ein Handler beide Pfade abdeckt.

Ein Feld beim Erstellen des Aufrufs

{ "webhook_url": "https://you.dev/ready" }

Steuerbare Zusammenfassungen

Fragen Sie nach der Form, die Ihr Agent benötigt

Übergeben Sie einen Prompt, und die Zusammenfassung kommt so zurück, wie Ihr Code sie lesen möchte: nur Entscheidungen, Aktionspunkte, Aufzählungspunkte. Ihr Agent erhält nutzbare Struktur ohne einen zweiten Modellaufruf. Bis zu 2.000 Zeichen. Es ändert die Zusammenfassung.

Ihre Anweisungen, Ihre Zusammenfassung

{
  "diarize": true,
  "prompt": "summarise as bullet points, focus on decisions"
}

Integration

Lassen Sie Ihren Codierungsagenten es verdrahten

Kopieren Sie einen Prompt aus dem Portal in Claude Code, Codex, Cursor oder einen beliebigen Codierungsagenten, und er schreibt den Client für Sie. Der Prompt kommt mit Ihrem bereits ausgefüllten Schlüssel. Und wenn Sie nur eine Aufnahme transkribieren müssen, überspringen Sie den Code: Verbinden Sie den MCP-Server und fragen Sie.

Nützliche Apps bauen

Was Entwickler mit der Speech-to-Text-API bauen

Die API liefert sprechergelabelten Text, Zeitstempel und eine steuerbare Zusammenfassung. Das sind die Produkte, die daraus entstehen.

Meeting-Notiznehmer

Verwandeln Sie eine Aufnahme in Notizen, die benennen, wer sich wozu verpflichtet hat. Sprecher-Labels übernehmen die Zuordnung, der Prompt formt die Ausgabe zu Entscheidungen und Verantwortlichen.

Durchsuchbares Anrufarchiv

Indizieren Sie transcript_text für die Volltextsuche und behalten Sie die Zeitstempel, um direkt zum Moment zu springen. Filtern Sie nach Sprecher, um zu finden, was eine Person über Monate von Anrufen gesagt hat.

Untertitel

Jede Zeile kommt mit Start- und Endzeit in Sekunden, was alles ist, was eine SRT- oder VTT-Datei benötigt. Untertiteln Sie eine ganze Videobibliothek, ohne einen Editor anzufassen.

Sprachnotizen zu Aufgaben

Ein Geh-und-Red-Memo wird strukturierte Arbeit. Fragen Sie den Prompt nach Aktionspunkten mit Verantwortlichen und Terminen, dann schreiben Sie sie direkt in Ihren Tracker.

Anrufbewertung und Coaching

Trennen Sie den Mitarbeiter vom Kunden, dann bewerten Sie den Anruf gegen Ihre eigene Rubrik. Überprüfen Sie die Ausreißer.

Eine Sprachschnittstelle für Ihr Produkt

Lassen Sie Benutzer mit Ihrer App sprechen. Senden Sie den Clip, erhalten Sie Text zurück, den Ihr Agent weiterleiten kann, und überspringen Sie den Aufbau von Sprachinfrastruktur.

Keiner dieser Fälle benötigt einen anderen Endpunkt. Das Transkript, die Sprecher und die Zusammenfassung kommen alle in einer Antwort; das Produkt ist, was Sie damit tun.

So funktioniert es

Wie die Speech-to-Text-API funktioniert

Drei Endpunkte, zwei Schritte. Erstellen Sie den Auftrag, laden Sie das Audio auf die signierte URL hoch, die Sie zurückbekommen, dann pollen Sie auf das Ergebnis oder lassen Sie einen Webhook es zu Ihnen bringen.

  • POST /v1/transcripts Startet einen Auftrag und gibt eine signierte Upload-URL zurück.
  • GET /v1/transcripts/{job_id} Gibt Status, Transkript und Zusammenfassung zurück.
  • GET /v1/transcripts Listet Ihre Aufträge, bis zu 200 pro Seite.
  • Audio geht direkt auf die signierte URL in den Speicher, sodass große Dateien nie durch eine API-Anfrage reisen. Dateien bis 200 MB; die URL funktioniert 5 Stunden.

Laden Sie das Audio hoch

curl -s -X PUT "$UPLOAD_URL" \
  -H "Content-Type: application/octet-stream" \
  --data-binary @pricing-meeting.mp3

Vertrauen und Zuverlässigkeit

Null-Aufbewahrung Ihres Audios

Die Aufnahme wird gelöscht, sobald das Transkript existiert. Sie wird nie aufbewahrt und nie zum Trainieren von Modellen verwendet.

  • Audio wird nach der Transkription gelöscht

    Die Aufnahme wird entfernt, sobald das Transkript erstellt wurde.
  • Nie zum Trainieren von Modellen verwendet

    Nichts, was Sie senden, wird zum Trainieren von Modellen verwendet. Ihre Aufnahmen gehören Ihnen.
  • Jeder Lesezugriff ist auf Ihr Konto beschränkt

    Ein Auftrag kann nur von dem Konto gelesen werden, das ihn erstellt hat.
  • Fehlgeschlagene Aufträge werden nie berechnet

    Sie zahlen nur, wenn ein Auftrag DONE erreicht. In der Warteschlange, in Verarbeitung und fehlgeschlagene Aufträge kosten nichts, also kostet ein erneuter Versuch auch nichts.

Ihre Transkripte bleiben über GET /v1/transcripts 24 Stunden nach Abschluss des Auftrags lesbar, sodass ein Agent ein Ergebnis erneut abrufen kann, ohne das Audio erneut zu senden.

Speech-to-Text-API-FAQ

Was ist die beste Speech-to-Text-API für KI-Agenten?

Die, die Ihr Agent ohne Warten auf eine Integration nutzen kann. Voibes API ist einfaches HTTP: ein POST zum Starten eines Auftrags, ein Upload, eine JSON-Antwort mit Transkript, Sprecher-Labels, Zeitstempeln und einer Zusammenfassung. Es gibt kein SDK zu installieren und kein Framework, dem man sich verpflichtet. Es ist auch ein MCP-Server unter https://api.getvoibe.com/mcp,, sodass Claude, Claude Code, Cursor, Codex und ChatGPT sich direkt verbinden. Für Ihren eigenen Code weisen Sie den Agenten auf https://platform.getvoibe.com/docs.md hin, und er arbeitet die Aufrufe aus, die Ihr Anwendungsfall benötigt. Jedes neue Konto startet mit 15 kostenlosen Minuten und ohne Karte.

Hat die Voibe-Speech-to-Text-API einen MCP-Server?

Ja. Der Voibe-MCP-Server ist unter https://api.getvoibe.com/mcp.. Fügen Sie ihn zu Claude, Claude Code, Cursor, Codex, ChatGPT oder VS Code als benutzerdefinierten Connector oder mit einem Konfigurationsblock hinzu, melden Sie sich einmal an, und bitten Sie die App, eine Aufnahme zu transkribieren. Er stellt vier Tools bereit: eine Transkription starten, ein Transkript abrufen, Transkriptionen auflisten und verbleibende Minuten prüfen. Er verwendet dasselbe Konto, dieselben Minuten und dieselbe Abrechnung pro Sekunde wie die API.

Kann Claude eine Meeting-Aufnahme mit Voibe transkribieren?

Ja. Öffnen Sie in Claude Customize, dann Connectors, klicken Sie +, wählen Sie Benutzerdefinierten Connector hinzufügen, fügen Sie https://api.getvoibe.com/mcp ein und melden Sie sich an. Dann bitten Sie Claude, eine Aufnahme zu transkribieren. Claude kann keine Dateien auf Ihrem Computer lesen, also gibt es Ihnen einen Upload-Link; legen Sie die Datei hinein, und Claude holt das Transkript und die Zusammenfassung. Dies funktioniert in Claude im Web, Claude Desktop und Cowork.

Wie transkribiere ich Audio von Claude Code, Cursor oder Codex?

Verbinden Sie den Voibe-MCP-Server und fragen Sie. Für Claude Code führen Sie claude mcp add --transport http voibe https://api.getvoibe.com/mcp, aus, tippen Sie /mcp in einer Sitzung und melden Sie sich an. Cursor und Codex nehmen einen Block in ihrer Konfigurationsdatei. Dann bitten Sie den Agenten, eine Datei zu transkribieren: Er lädt die Datei selbst hoch und gibt das sprechergelabelte Transkript und die Zusammenfassung zurück. Die Einrichtung für jede App ist unter https://platform.getvoibe.com/docs/mcp.

Identifiziert die API verschiedene Sprecher, und kennt sie ihre Namen? Ja. Sprecherkennzeichnung ist standardmäßig aktiviert: Jede Zeile wird mit einer Sprecherkennzeichnung sowie Start- und Endzeit in Sekunden zurückgegeben. Sprecher werden als speaker_0, speaker_1 usw. gekennzeichnet, konsistent innerhalb einer Aufnahme, ohne Begrenzung der Anzahl unterscheidbarer Sprecher. Die Zusammenfassung und der Titel verwenden die Namen der Personen, wenn diese in der Aufnahme vorkommen, zum Beispiel wenn sich jemand vorstellt oder namentlich angesprochen wird. Sprecher-Diarisierung ist im Preis enthalten. Setzen Sie diarize auf false, um ein einfaches Transkript zu erhalten.

Welche Audioformate, Dateigrößen und Ratenbegrenzungen gelten?

mp3, wav, m4a, mp4, flac, ogg und webm werden direkt verarbeitet; andere Audio- und Videodateien werden zuerst konvertiert, wenn das Audio gelesen werden kann. Das Format wird aus dem Inhalt der Datei ermittelt. Jede Datei kann bis zu 200 MB groß sein, und die Upload-URL ist 5 Stunden gültig. Die Ratenbegrenzungen betragen 50 Aufträge pro Minute und 1.000 Aufträge pro Tag pro Konto; darüber hinaus gibt der Create-Aufruf 429 zurück, also warten und erneut versuchen.

Welche Sprachen unterstützt die Speech-to-Text-API?

Die Sprach- und Zusammenfassungsmodelle sind mehrsprachig, sodass die Aufnahme nicht auf Englisch sein muss. Die Sprechertrennung funktioniert in jeder Sprache gleich.

Muss ich auf Ergebnisse pollen?

Nein. Übergeben Sie eine webhook_url beim Erstellen des Auftrags, und wir senden das fertige Ergebnis per POST an Ihren Endpunkt, sobald es bereit ist. Der Body enthält einen Ereignisnamen, transcript.completed oder transcript.failed, sowie denselben Auftrags-Body wie GET /v1/transcripts/{job_id}, sodass ein Handler beides abdeckt. Polling ist weiterhin verfügbar, falls Sie es bevorzugen.

Wie wird abgerechnet, und verfallen Minuten?

Pro Sekunde Audio, aufgerundet auf die ganze Sekunde. Eine Datei von 3 Minuten 24 Sekunden kostet 3 Minuten 24 Sekunden. Es wird nur berechnet, wenn ein Auftrag den Status DONE erreicht, also kosten Warteschlangen-, Verarbeitungs- und fehlgeschlagene Aufträge nichts. Jedes neue Konto startet mit 15 kostenlosen Minuten, und es ist keine Karte erforderlich. Danach kaufen Sie Minuten in einmaligen Paketen, ab 10 $ für 2.000 Minuten. Minuten verfallen nie, und es gibt kein Abonnement und kein monatliches Minimum.

Was passiert, wenn ein Auftrag fehlschlägt?

Es wird nichts berechnet. Der Auftrag wird mit dem Status FAILED und einem Fehlerfeld zurückgegeben, das in einfachen Worten erklärt, was schiefgelaufen ist, zum Beispiel nicht genügend Minuten für die Länge des Audios oder eine Datei, die innerhalb von 24 Stunden nie angekommen ist. Wenn überhaupt keine Minuten mehr vorhanden sind, wird der Create-Aufruf mit 402 abgelehnt, bevor ein Upload erfolgt, sodass nichts gesendet wird.

Wird mein Audio gespeichert oder zum Trainieren von Modellen verwendet?

Audio wird nach der Transkription gelöscht und niemals zum Trainieren von Modellen verwendet. Transkripte und Zusammenfassungen bleiben 24 Stunden nach Abschluss des Auftrags lesbar und werden dann gelöscht. Der Titel, die Länge und die Kosten des Auftrags bleiben in Ihrem Verlauf. Jeder Lesezugriff ist auf Ihr Konto beschränkt, sodass Sie nur Ihre eigenen Aufträge sehen. Speech-to-Text läuft auf Whisper large-v3-turbo, Sprechertrennung auf pyannote community-1 und die Zusammenfassung auf gpt-oss-120b.

Wie unterscheidet sich das von der Ausführung von Whisper selbst?

Es gibt keine Infrastruktur zu betreiben, keine GPU warmzuhalten und kein Skalieren zu verwalten. Sprecher-Diarisierung und Zusammenfassung kommen in derselben Antwort wie das Transkript zurück, ohne zweites Modell und ohne Klebecode. Sie zahlen pro Sekunde transkribiertem Audio, und es gibt keine Serverzeit zu bezahlen.