Voibe Transcription MCP Server

आधिकारिक

क्लॉड/ओपनक्लॉ/हर्मीस/कोडेक्स/ग्रॉक बॉट को कान दें। Voibe रिकॉर्डिंग्स को टेक्स्ट में बदल देता है जिसके साथ आपका AI एजेंट काम कर सकता है। अपने एजेंट से किसी मीटिंग, इंटरव्यू, कॉल, लेक्चर, पॉडकास्ट एपिसोड या वॉयस मेमो को ट्रांसक्राइब करने के लिए कहें। कच्चा ट्रांसक्रिप्ट स्पीकर लेबल, टाइमस्टैम्प और सारांश के साथ चैट में आता है।

Voibe Transcription MCP के साथ आप क्या कर सकते हैं?

  • Create transcription jobs — अपने सहायक से create_transcription_job के माध्यम से ऑडियो सबमिट करके ट्रांसक्रिप्शन शुरू करने के लिए कहें, जिसमें वैकल्पिक स्पीकर डायराइज़ेशन और एक कस्टम सारांश प्रॉम्प्ट शामिल हो सकता है।

  • Retrieve transcripts and summariesget_transcript का उपयोग करके स्पीकर-लेबल वाली पंक्तियों को टाइमस्टैम्प, एक सादा-टेक्स्ट संस्करण, और आपके प्रॉम्प्ट द्वारा आकार दिया गया एक नियंत्रणीय सारांश प्राप्त करें।

  • List past recordingslist_transcripts को कॉल करके अपने पिछले कार्यों को नवीनतम पहले देखें, जिसमें स्थिति, शीर्षक, और ऑडियो अवधि शामिल हो।

  • Check remaining minutes — नया कार्य शुरू करने से पहले get_balance से पूछताछ करें कि आपके पास कितने ट्रांसक्रिप्शन मिनट बचे हैं।

  • Receive results via webhook — कार्य बनाते समय webhook_url पास करें ताकि समाप्त ट्रांसक्रिप्ट और सारांश स्वचालित रूप से आपके एंडपॉइंट पर POST किया जा सके।

दस्तावेज़

Workflows

जटिल वर्कफ़्लो के लिए सरल API

एक कॉल ट्रांसक्रिप्ट, स्पीकर और सारांश लौटाती है। आपका एजेंट उसके ऊपर जो बनाता है वही दिलचस्प हिस्सा है।

मीटिंग नोट्स

  1. एक स्टैंडअप रिकॉर्डिंग आपके बकेट में आती है
  2. एक कॉल लौटाती है कि किसने क्या कहा, साथ ही केवल निर्णयों का सारांश
  3. आपका एजेंट नोट्स पोस्ट करता है और फॉलो-अप खोलता है

"prompt": "निर्णय और मालिकों के रूप में सारांशित करें"

सपोर्ट QA

  1. एक सपोर्ट कॉल समाप्त होती है और रिकॉर्डिंग भेजी जाती है
  2. स्पीकर लेबल ग्राहक को प्रतिनिधि से अलग करते हैं
  3. आपका एजेंट कॉल को स्कोर करता है और समीक्षा के लिए चिह्नित करता है

"prompt": "ग्राहक की अनसुलझी शिकायतों की सूची बनाएं"

पॉडकास्ट निर्माण

  1. एक एपिसोड अपलोड किया जाता है और एक वेबहुक पंजीकृत होता है
  2. पूरा ट्रांसक्रिप्ट टाइमस्टैम्प के साथ आपके एंडपॉइंट पर पहुंचता है
  3. आपका एजेंट शो नोट्स लिखता है और अध्याय मार्कर काटता है

"prompt": "अध्याय शीर्षकों के साथ शो नोट्स लिखें"

सेल्स कॉल से CRM

  1. मीटिंग समाप्त होते ही एक कॉल रिकॉर्डिंग भेजी जाती है
  2. सारांश कार्य आइटम के रूप में वापस आता है
  3. आपका एजेंट उन्हें डील पर लिखता है और अगला कदम शेड्यूल करता है

"prompt": "मालिकों और तिथियों के साथ कार्य आइटम सूचीबद्ध करें"

इनमें से हर एक वही तीन एंडपॉइंट हैं। केवल बदलने वाली चीज़ वह prompt है जो आप भेजते हैं और आपका एजेंट प्रतिक्रिया के साथ क्या करता है।

एजेंटों के लिए निर्मित

यदि आपका एजेंट URL कॉल कर सकता है, तो वह सुन सकता है

एक POST, एक अपलोड, एक JSON प्रतिक्रिया। कोई SDK अपनाने की ज़रूरत नहीं, कोई रनटाइम इंस्टॉल करने की ज़रूरत नहीं, कोई फ्रेमवर्क से बंधने की ज़रूरत नहीं।

  • Claude Code
  • Codex
  • Cursor
  • Hermes
  • OpenClaw

दो तरीके अंदर, कुछ भी इंस्टॉल करने की ज़रूरत नहीं। MCP सर्वर कनेक्ट करें और पूछें, या अपने एजेंट को दस्तावेज़ों की ओर इंगित करें और यह वह क्लाइंट लिखता है जो आपके उपयोग के मामले को चाहिए।

इसे अपने एजेंट में पेस्ट करें

Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.

MCP सर्वर

इसे Claude, Cursor, Codex और ChatGPT से उपयोग करें

Voibe एक MCP सर्वर है। इसे एक बार कनेक्ट करें और जो AI ऐप आप पहले से उपयोग करते हैं वह रिकॉर्डिंग ट्रांसक्राइब कर सकता है, परिणाम पढ़ सकता है और आपके मिनट्स जांच सकता है। कोई कोड नहीं।

  1. कनेक्टर जोड़ें पता अपने ऐप में पेस्ट करें: Claude में Connectors के तहत, Claude Code में एक कमांड के साथ, Cursor और Codex में उनकी कॉन्फ़िग फ़ाइल में।
  2. एक बार साइन इन करें ब्राउज़र में Voibe को स्वीकृत करें। एक नया ईमेल पता 15 मुफ्त मिनटों के साथ खाता प्राप्त करता है। कॉपी करने के लिए कोई API कुंजी नहीं।
  3. पूछें "इस रिकॉर्डिंग को ट्रांसक्राइब करें।" एक कोडिंग टूल फ़ाइल स्वयं अपलोड करता है। एक चैट ऐप आपको एक अपलोड लिंक देता है। ट्रांसक्रिप्ट और सारांश चैट में वापस आते हैं।
  4. समान API, समान खाता, समान बिलिंग: ऑडियो के प्रति सेकंड, केवल जब कार्य समाप्त होता है।

MCP पता

https://api.getvoibe.com/mcp

Claude Code

claude mcp add --transport http voibe https://api.getvoibe.com/mcp
  • create_transcription_job एक ट्रांसक्रिप्शन शुरू करें

  • get_transcript स्थिति, फिर ट्रांसक्रिप्ट और सारांश

  • list_transcripts आपकी रिकॉर्डिंग, नई से पुरानी

  • get_balance शेष मिनट

  • Claude

  • Claude Desktop

  • Cowork

  • Claude Code

  • Cursor

  • Codex

  • ChatGPT

  • VS Code

  • Hermes

  • OpenClaw

आपका एजेंट क्या वापस पाता है

ट्रांसक्रिप्शन API क्या लौटाता है

किसी सारांशकर्ता के लिए कोई दूसरी कॉल नहीं, कोई अलग diarization सेवा नहीं, उन्हें जोड़ने वाला कोई गोंद कोड नहीं।

GET /v1/transcripts/{job_id}

{
  "job_id": "a523721c-…",
  "status": "DONE",
  "title": "Pricing page review",
  "audio_duration_seconds": 205.27,
  "seconds_charged": 206,
  "diarize": true,
  "transcript": [
    { "speaker": "Priya", "start": 0.4,  "end": 5.2,
      "text": "Let's start with the pricing page. Where are we?" },
    { "speaker": "Tom",   "start": 6.1, "end": 10.8,
      "text": "Copy is done. I need a review before Thursday." }
  ],
  "transcript_text": "Priya: Let's start with the pricing page…",
  "summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
  "error": null
}
  • transcript हर पंक्ति जिसमें किसने कहा, और उसका प्रारंभ और समाप्ति समय सेकंड में। सही व्यक्ति को उद्धृत करें, पल पर कूदें, या फॉलो-अप को उस व्यक्ति के पास भेजें जिसने इसे मांगा।
  • transcript_text वही ट्रांसक्रिप्ट एक सादे स्ट्रिंग के रूप में, सीधे prompt या इंडेक्स में डालने के लिए तैयार।
  • summary एक छोटा सारांश जो आपका एजेंट दूसरे मॉडल कॉल के बिना पोस्ट, संग्रहीत या तर्क कर सकता है। यह रिकॉर्डिंग के लिए एक शीर्षक के साथ आता है।

उपयोग के मामले

इसे एक बार सेट करें। यह हर हफ्ते चलता है।

आप एकीकरण नहीं लिखते। आप उस एजेंट को आवर्ती कार्य का वर्णन करते हैं जिसे आप पहले से उपयोग करते हैं, और यह वह स्क्रिप्ट लिखता है जो शेड्यूल पर Voibe को कॉल करती है।

उत्पाद प्रबंधक

Claude Cowork का उपयोग करते हुए

ग्राहक कॉलों के एक सप्ताह को थीम वाले फीडबैक डाइजेस्ट में बदल देता है, बिना उनमें से किसी को सुने।

उन्होंने अपने एजेंट से क्या पूछा

"हर शुक्रवार, पिछले सप्ताह की कॉल रिकॉर्डिंग Voibe API को भेजें और मुझे शीर्ष पांच थीम दें, प्रत्येक के लिए एक उद्धरण और ग्राहक का नाम के साथ।"

डेवलपर

Codex का उपयोग करते हुए

टीम द्वारा रिकॉर्ड की गई हर स्टैंडअप और घटना कॉल का खोजने योग्य ट्रांसक्रिप्ट इंडेक्स रखता है।

उन्होंने अपने एजेंट से क्या पूछा

"एक कार्य लिखें जो हमारे बकेट से नई रिकॉर्डिंग Voibe API को पोस्ट करता है, JSON संग्रहीत करता है, और खोज के लिए Postgres में transcript_text को इंडेक्स करता है।"

संस्थापक

Hermes का उपयोग करते हुए

निवेशक और सेल्स कॉल को दिन समाप्त होने से पहले फॉलो-अप में बदल देता है।

उन्होंने अपने एजेंट से क्या पूछा

"जब एक कॉल रिकॉर्डिंग आती है, इसे Voibe के साथ ट्रांसक्राइब करें और फॉलो-अप ईमेल का मसौदा तैयार करें जिसमें सूची हो कि मैंने क्या वादा किया और कब तक।"

सामग्री निर्माता

OpenClaw का उपयोग करते हुए

हर नए एपिसोड को शो नोट्स, अध्याय मार्कर और क्लिप उम्मीदवारों में रातोंरात बदल देता है।

उन्होंने अपने एजेंट से क्या पूछा

"इस फ़ोल्डर को देखें। जब एक नया एपिसोड दिखाई देता है, इसे Voibe के साथ ट्रांसक्राइब करें और मुझे अध्याय, शो नोट्स और टाइमस्टैम्प के साथ तीन सर्वश्रेष्ठ पुल उद्धरण दें।"

इनमें से प्रत्येक एक एजेंट के साथ एक बातचीत है। एजेंट MCP सर्वर से कनेक्ट होता है या दस्तावेज़ पढ़ता है, स्क्रिप्ट लिखता है और इसे शेड्यूल करता है; आप आउटपुट की समीक्षा करते हैं।

मूल्य निर्धारण

स्पीच टू टेक्स्ट API मूल्य निर्धारण

15 मुफ्त मिनट, फिर मिनट खरीदें जो कभी समाप्त नहीं होते। उस ऑडियो के लिए भुगतान करें जिसे आपके एजेंट वास्तव में ट्रांसक्राइब करते हैं: कोई सदस्यता नहीं, कोई सीट नहीं, कोई मासिक न्यूनतम नहीं।

$50 $0.27 प्रति घंटा ऑडियो

11,000 मिनट · 183 घंटे ऑडियो

15 मुफ्त मिनटों के साथ शुरू करें

कोई कार्ड नहीं। ऑडियो के प्रति सेकंड, कार्य समाप्त होने पर शुल्क लिया जाता है। मिनट कभी समाप्त नहीं होते।

स्पीकर diarization

स्पीकर diarization: आपका एजेंट जानता है कि किसने क्या कहा

स्पीकर लेबल डिफ़ॉल्ट रूप से चालू हैं: हर पंक्ति एक स्पीकर लेबल और प्रारंभ और समाप्ति समय सेकंड में वापस आती है। कितने स्पीकर अलग किए जाते हैं इसकी कोई सीमा नहीं है, और जब लोग अपने नाम कहते हैं तो सारांश उनका उपयोग करता है। चलाने के लिए कोई अलग diarization मॉडल नहीं, कोई अतिरिक्त शुल्क नहीं। सादे ट्रांसक्रिप्ट के लिए diarize को false पर सेट करें।

  • मीटिंग एजेंट जो ट्रैक करते हैं कि किसने क्या वादा किया
  • सपोर्ट एजेंट जो ग्राहक को उद्धृत करते हैं
  • साक्षात्कार और पॉडकास्ट पाइपलाइन
  • कहीं भी एक से अधिक व्यक्ति बोलते हैं

क्रिएट कॉल पर एक फ़ील्ड

{ "diarize": true }

वेबहुक

एसिंक्रोनस ट्रांसक्रिप्शन: आपका एजेंट फायर करता है और आगे बढ़ता है

कार्य बनाते समय एक webhook_url पास करें और हम समाप्त परिणाम आपके एंडपॉइंट पर POST करते हैं। कोई एजेंट लूप पोल पर अवरुद्ध नहीं बैठता। बॉडी एक इवेंट नाम और GET के समान कार्य बॉडी ले जाती है, इसलिए एक हैंडलर दोनों पथों को कवर करता है।

क्रिएट कॉल पर एक फ़ील्ड

{ "webhook_url": "https://you.dev/ready" }

स्टीयरेबल सारांश

वह आकार मांगें जो आपके एजेंट को चाहिए

एक prompt पास करें और सारांश उस तरह वापस आता है जैसे आपका कोड इसे पढ़ना चाहता है: केवल निर्णय, कार्य आइटम, बुलेट पॉइंट। आपका एजेंट दूसरे मॉडल कॉल के बिना उपयोग योग्य संरचना प्राप्त करता है। 2,000 वर्णों तक। यह सारांश बदल देता है।

आपके निर्देश, आपका सारांश

{
  "diarize": true,
  "prompt": "summarise as bullet points, focus on decisions"
}

एकीकरण

अपने कोडिंग एजेंट को इसे वायर करने दें

पोर्टल से एक prompt को Claude Code, Codex, Cursor या किसी भी कोडिंग एजेंट में कॉपी करें, और यह आपके लिए क्लाइंट लिखता है। prompt आपकी कुंजी पहले से भरी हुई आता है। और जब आपको केवल एक रिकॉर्डिंग ट्रांसक्राइब करने की आवश्यकता होती है, तो कोड छोड़ें: MCP सर्वर कनेक्ट करें और पूछें।

उपयोगी ऐप्स बनाएं

डेवलपर्स स्पीच टू टेक्स्ट API के साथ क्या बनाते हैं

API आपको स्पीकर-लेबल वाला टेक्स्ट, टाइमस्टैम्प और एक स्टीयरेबल सारांश देता है। ये वे उत्पाद हैं जो उससे निकलते हैं।

मीटिंग नोट लेने वाला

एक रिकॉर्डिंग को नोट्स में बदलें जो नाम देते हैं कि किसने क्या वादा किया। स्पीकर लेबल एट्रिब्यूशन करते हैं, prompt आउटपुट को निर्णयों और मालिकों में आकार देता है।

खोजने योग्य कॉल संग्रह

पूर्ण-पाठ खोज के लिए transcript_text को इंडेक्स करें और पल पर कूदने के लिए टाइमस्टैम्प रखें। स्पीकर द्वारा फ़िल्टर करें ताकि पता चले कि एक व्यक्ति ने महीनों की कॉलों में क्या कहा।

कैप्शन और उपशीर्षक

हर पंक्ति सेकंड में प्रारंभ और समाप्ति समय के साथ आती है, जो एक SRT या VTT फ़ाइल को चाहिए। संपादक को छुए बिना पूरी वीडियो लाइब्रेरी को कैप्शन करें।

वॉयस नोट्स से कार्य

एक चलते-फिरते मेमो संरचित कार्य बन जाता है। prompt से मालिकों और तिथियों के साथ कार्य आइटम मांगें, फिर उन्हें सीधे अपने ट्रैकर में लिखें।

कॉल स्कोरिंग और कोचिंग

प्रतिनिधि को ग्राहक से अलग करें, फिर अपने स्वयं के रूब्रिक के खिलाफ कॉल को स्कोर करें। आउटलायर्स की समीक्षा करें।

आपके उत्पाद के लिए एक वॉयस इंटरफ़ेस

उपयोगकर्ताओं को अपने ऐप से बात करने दें। क्लिप भेजें, वापस टेक्स्ट पाएं जिसे आपका एजेंट रूट कर सकता है, और स्पीच इंफ्रास्ट्रक्चर बनाना छोड़ दें।

इनमें से किसी को भी एक अलग एंडपॉइंट की आवश्यकता नहीं है। ट्रांसक्रिप्ट, स्पीकर और सारांश सभी एक प्रतिक्रिया में आते हैं; उत्पाद वही है जो आप इसके साथ करते हैं।

यह कैसे काम करता है

स्पीच टू टेक्स्ट API कैसे काम करता है

तीन एंडपॉइंट, दो चरण। कार्य बनाएं, ऑडियो को उस signed URL पर अपलोड करें जो आपको वापस मिलता है, फिर परिणाम के लिए पोल करें या एक वेबहुक को इसे आपके पास लाने दें।

  • POST /v1/transcripts एक कार्य शुरू करता है और एक signed अपलोड URL लौटाता है।
  • GET /v1/transcripts/{job_id} स्थिति, ट्रांसक्रिप्ट और सारांश लौटाता है।
  • GET /v1/transcripts आपके कार्यों को सूचीबद्ध करता है, प्रति पृष्ठ 200 तक।
  • ऑडियो सीधे signed URL पर स्टोरेज में जाता है, इसलिए बड़ी फ़ाइलें कभी भी API अनुरोध के माध्यम से यात्रा नहीं करतीं। 200 MB तक की फ़ाइलें; URL 5 घंटे के लिए काम करता है।

ऑडियो अपलोड करें

curl -s -X PUT "$UPLOAD_URL" \
  -H "Content-Type: application/octet-stream" \
  --data-binary @pricing-meeting.mp3

विश्वास और विश्वसनीयता

आपके ऑडियो पर शून्य प्रतिधारण

रिकॉर्डिंग उस क्षण हटा दी जाती है जब ट्रांसक्रिप्ट मौजूद होता है। इसे कभी नहीं रखा जाता, और कभी मॉडलों को प्रशिक्षित करने के लिए उपयोग नहीं किया जाता।

  • ट्रांसक्रिप्शन के बाद ऑडियो हटा दिया जाता है

    ट्रांसक्रिप्ट उत्पन्न होने के बाद रिकॉर्डिंग हटा दी जाती है।
  • मॉडलों को प्रशिक्षित करने के लिए कभी उपयोग नहीं किया जाता

    आप जो भेजते हैं उसका उपयोग मॉडलों को प्रशिक्षित करने के लिए नहीं किया जाता। आपकी रिकॉर्डिंग आपकी हैं।
  • हर पढ़ना आपके खाते तक सीमित है

    एक कार्य केवल उस खाते द्वारा पढ़ा जा सकता है जिसने इसे बनाया।
  • असफल कार्यों के लिए कभी शुल्क नहीं

    आप केवल तब भुगतान करते हैं जब एक कार्य DONE तक पहुंचता है। कतारबद्ध, प्रसंस्करण और असफल कार्यों की कोई लागत नहीं है, इसलिए एक पुनः प्रयास की भी कोई लागत नहीं है।

आपके ट्रांसक्रिप्ट कार्य समाप्त होने के बाद 24 घंटे तक GET /v1/transcripts के माध्यम से पठनीय रहते हैं, इसलिए एक एजेंट ऑडियो को फिर से भेजे बिना परिणाम फिर से प्राप्त कर सकता है।

स्पीच टू टेक्स्ट API FAQ

AI एजेंटों के लिए सबसे अच्छा स्पीच टू टेक्स्ट API क्या है?

वह जो आपका एजेंट एकीकरण की प्रतीक्षा किए बिना उपयोग कर सकता है। Voibe का API सादा HTTP है: एक कार्य शुरू करने के लिए एक POST, एक अपलोड, एक JSON प्रतिक्रिया जिसमें ट्रांसक्रिप्ट, स्पीकर लेबल, टाइमस्टैम्प और एक सारांश होता है। इंस्टॉल करने के लिए कोई SDK नहीं और प्रतिबद्ध होने के लिए कोई फ्रेमवर्क नहीं। यह https://api.getvoibe.com/mcp, पर एक MCP सर्वर भी है ताकि Claude, Claude Code, Cursor, Codex और ChatGPT सीधे इससे कनेक्ट हों। अपने स्वयं के कोड के लिए, एजेंट को https://platform.getvoibe.com/docs.md पर इंगित करें और यह आपके उपयोग के मामले के लिए आवश्यक कॉल समझ लेता है। हर नए खाते की शुरुआत 15 मुफ्त मिनटों और बिना कार्ड के होती है।

क्या Voibe स्पीच टू टेक्स्ट API में MCP सर्वर है?

हाँ। Voibe MCP सर्वर https://api.getvoibe.com/mcp. पर है। इसे Claude, Claude Code, Cursor, Codex, ChatGPT या VS Code में एक कस्टम कनेक्टर या एक कॉन्फ़िग ब्लॉक के साथ जोड़ें, एक बार साइन इन करें, और ऐप से एक रिकॉर्डिंग ट्रांसक्राइब करने को कहें। यह चार उपकरण उजागर करता है: एक ट्रांसक्रिप्शन शुरू करें, एक ट्रांसक्रिप्ट प्राप्त करें, ट्रांसक्रिप्शन सूचीबद्ध करें और शेष मिनट जांचें। यह API के समान खाता, समान मिनट और समान प्रति-सेकंड बिलिंग का उपयोग करता है।

क्या Claude Voibe के साथ एक मीटिंग रिकॉर्डिंग ट्रांसक्राइब कर सकता है?

हाँ। Claude में, Customize खोलें, फिर Connectors, + पर क्लिक करें, Add custom connector चुनें, https://api.getvoibe.com/mcp पेस्ट करें और साइन इन करें। फिर Claude से एक रिकॉर्डिंग ट्रांसक्राइब करने को कहें। Claude आपके कंप्यूटर पर फ़ाइलें नहीं पढ़ सकता, इसलिए यह आपको एक अपलोड लिंक देता है; फ़ाइल डालें और Claude ट्रांसक्रिप्ट और सारांश प्राप्त करता है। यह वेब पर Claude, Claude Desktop और Cowork में काम करता है।

मैं Claude Code, Cursor या Codex से ऑडियो कैसे ट्रांसक्राइब करूं?

Voibe MCP सर्वर कनेक्ट करें और पूछें। Claude Code के लिए, claude mcp add --transport http voibe https://api.getvoibe.com/mcp, चलाएं, एक सत्र में type /mcp टाइप करें और साइन इन करें। Cursor और Codex अपनी कॉन्फ़िग फ़ाइल में एक ब्लॉक लेते हैं। फिर एजेंट से एक फ़ाइल ट्रांसक्राइब करने को कहें: यह फ़ाइल स्वयं अपलोड करता है और स्पीकर-लेबल वाला ट्रांसक्रिप्ट और सारांश लौटाता है। हर ऐप के लिए सेटअप https://platform.getvoibe.com/docs/mcp. पर है।

क्या API विभिन्न स्पीकरों की पहचान करता है, और क्या यह उनके नाम जानता है? हाँ। स्पीकर लेबल डिफ़ॉल्ट रूप से चालू होते हैं: हर पंक्ति स्पीकर लेबल और सेकंड में प्रारंभ और समाप्ति समय के साथ वापस आती है। स्पीकर को speaker_0, speaker_1 इत्यादि के रूप में लेबल किया जाता है, जो एक रिकॉर्डिंग के भीतर लगातार होते हैं, और कितने अलग-अलग स्पीकर पहचाने जाते हैं इसकी कोई सीमा नहीं है। सारांश और शीर्षक लोगों के नामों का उपयोग करते हैं जब रिकॉर्डिंग में ऐसा होता है, उदाहरण के लिए जब कोई अपना परिचय देता है या नाम से संबोधित किया जाता है। स्पीकर डायराइज़ेशन कीमत में शामिल है। सादा ट्रांसक्रिप्ट के लिए diarize को false पर सेट करें।

कौन से ऑडियो प्रारूप, फ़ाइल आकार और दर सीमाएँ लागू होती हैं?

mp3, wav, m4a, mp4, flac, ogg और webm सीधे जाते हैं; अन्य ऑडियो और वीडियो फ़ाइलें पहले परिवर्तित की जाती हैं जब ऑडियो पढ़ा जा सकता है। प्रारूप फ़ाइल की सामग्री से पढ़ा जाता है। प्रत्येक फ़ाइल 200 MB तक हो सकती है, और अपलोड URL 5 घंटे के लिए काम करता है। दर सीमाएँ प्रति मिनट 50 जॉब और प्रति दिन 1,000 जॉब प्रति खाता हैं; उससे अधिक होने पर create कॉल 429 लौटाता है, इसलिए प्रतीक्षा करें और पुनः प्रयास करें।

स्पीच टू टेक्स्ट API कौन सी भाषाएँ समर्थन करता है?

स्पीच और सारांश मॉडल बहुभाषी हैं, इसलिए रिकॉर्डिंग अंग्रेजी में होना आवश्यक नहीं है। स्पीकर पृथक्करण किसी भी भाषा में समान रूप से काम करता है।

क्या मुझे परिणामों के लिए पोल करना होगा?

नहीं। जब आप जॉब बनाते हैं तो webhook_url पास करें और हम तैयार होते ही तैयार परिणाम आपके एंडपॉइंट पर POST करते हैं। बॉडी में एक इवेंट नाम, transcript.completed या transcript.failed, और GET /v1/transcripts/{job_id} के समान जॉब बॉडी होती है, इसलिए एक हैंडलर दोनों को कवर करता है। यदि आप चाहें तो पोलिंग अभी भी उपलब्ध है।

मुझे कैसे बिल किया जाता है, और क्या मिनट समाप्त होते हैं?

ऑडियो के प्रति सेकंड, पूरे सेकंड तक गोल किया जाता है। 3 मिनट 24 सेकंड की फ़ाइल की लागत 3 मिनट 24 सेकंड है। आपसे केवल तब शुल्क लिया जाता है जब कोई जॉब DONE तक पहुँचता है, इसलिए कतारबद्ध, प्रोसेसिंग और विफल जॉब की कोई लागत नहीं होती। हर नए खाते की शुरुआत 15 मुफ्त मिनट के साथ होती है और कोई कार्ड आवश्यक नहीं है। उसके बाद आप एकमुश्त पैक में मिनट खरीदते हैं, $10 से 2,000 मिनट के लिए। मिनट कभी समाप्त नहीं होते, और कोई सदस्यता या मासिक न्यूनतम नहीं है।

यदि कोई जॉब विफल हो जाए तो क्या होता है?

आपसे शुल्क नहीं लिया जाता। जॉब FAILED की स्थिति और एक error फ़ील्ड के साथ वापस आता है जो सरल शब्दों में समझाता है कि क्या गलत हुआ, उदाहरण के लिए ऑडियो की लंबाई के लिए पर्याप्त मिनट नहीं, या एक फ़ाइल जो 24 घंटे के भीतर कभी नहीं पहुँची। बिल्कुल भी मिनट नहीं बचे होने पर, किसी भी अपलोड से पहले create कॉल 402 के साथ अस्वीकार कर दिया जाता है, इसलिए कुछ भी नहीं भेजा जाता।

क्या मेरा ऑडियो संग्रहीत किया जाता है या मॉडल प्रशिक्षित करने के लिए उपयोग किया जाता है?

ऑडियो ट्रांसक्रिप्शन के बाद हटा दिया जाता है और मॉडल प्रशिक्षित करने के लिए कभी उपयोग नहीं किया जाता। ट्रांसक्रिप्ट और सारांश जॉब समाप्त होने के 24 घंटे तक पठनीय रहते हैं, फिर हटा दिए जाते हैं। जॉब का शीर्षक, लंबाई और लागत आपके इतिहास में रहती है। हर पठन आपके खाते तक सीमित है, इसलिए आप केवल अपने स्वयं के जॉब देखते हैं। स्पीच टू टेक्स्ट Whisper large-v3-turbo पर चलता है, स्पीकर पृथक्करण pyannote community-1 पर, और सारांश gpt-oss-120b पर।

यह स्वयं Whisper चलाने से कैसे अलग है?

चलाने के लिए कोई इंफ्रास्ट्रक्चर नहीं है, गर्म रखने के लिए कोई GPU नहीं है और प्रबंधित करने के लिए कोई स्केलिंग नहीं है। स्पीकर डायराइज़ेशन और सारांश ट्रांसक्रिप्ट के समान प्रतिक्रिया में वापस आते हैं, बिना किसी दूसरे मॉडल और बिना किसी ग्लू कोड के। आप ट्रांसक्राइब किए गए ऑडियो के प्रति सेकंड भुगतान करते हैं, और कोई सर्वर समय भुगतान करने के लिए नहीं है।