Voibe Transcription MCP Server
官方讓Claude/Openclaw/Hermes/Codex/Grok Bot擁有耳朵。Voibe將錄音轉換成你的AI代理可以處理的文字。讓你的代理轉錄會議、訪談、通話、講座、播客單集或語音備忘錄。原始轉錄稿會連同說話者標籤、時間戳和摘要一起出現在對話中。
你可以用 Voibe Transcription MCP 做什麼?
-
建立轉錄任務 — 請您的助理透過
create_transcription_job提交音訊來開始轉錄,可選擇啟用說話者分離及自訂摘要提示。 -
取得轉錄稿與摘要 — 使用
get_transcript擷取帶有時間戳記的說話者標記行、純文字版本,以及由您的提示所塑造的可引導摘要。 -
列出過往錄音 — 呼叫
list_transcripts以查看您先前的任務,依最新優先排序,包含狀態、標題與音訊長度。 -
檢查剩餘分鐘數 — 在開始新任務前,查詢
get_balance以查看您剩餘的轉錄分鐘數。 -
透過 Webhook 接收結果 — 建立任務時傳入
webhook_url,即可自動將完成的轉錄稿與摘要 POST 至您的端點。
文件
Workflows
複雜工作流程的簡單 API
一次呼叫即可取得逐字稿、說話者和摘要。你的 agent 在此基礎上建構的內容,才是真正有趣的部分。
會議記錄
- 站立會議錄音進入你的儲存空間
- 一次呼叫回傳誰說了什麼,加上僅含決策的摘要
- 你的 agent 發布會議記錄並開啟後續事項
「prompt」:「以決策和負責人形式總結」
客服品質保證
- 客服通話結束,錄音被送出
- 說話者標籤區分客戶與客服人員
- 你的 agent 為通話評分,並標記需要複查的通話
「prompt」:「列出客戶未解決的投訴」
播客製作
- 上傳一集節目並註冊 webhook
- 完成的逐字稿連同時間戳送達你的端點
- 你的 agent 撰寫節目筆記並剪輯章節標記
「prompt」:「以章節標題撰寫節目筆記」
銷售通話匯入 CRM
- 會議結束後立即送出通話錄音
- 摘要以行動項目形式回傳
- 你的 agent 將它們寫入交易紀錄,並安排下一步
「prompt」:「列出含負責人和日期的行動項目」
以上每一個案例都使用相同的三個端點。唯一改變的是你送出的 prompt,以及你的 agent 如何處理回應。
專為 agent 打造
如果你的 agent 能呼叫 URL,它就能聽
一個 POST、一次上傳、一個 JSON 回應。無需採用 SDK、無需安裝執行環境、無需綁定任何框架。
- Claude Code
Codex
Cursor
Hermes
OpenClaw
兩種接入方式,無需安裝任何東西。連接 MCP server 然後直接詢問,或將文件指向你的 agent,它就會為你的使用情境撰寫所需的 client。
將此貼給你的 agent
Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.
MCP server
從 Claude、Cursor、Codex 和 ChatGPT 使用
Voibe 是一個 MCP server。連接一次,你已在使用的人工智慧應用程式就能轉錄錄音、讀取結果並檢查你的會議記錄。無需撰寫程式碼。
- 新增連接器 將位址貼入你的應用程式:Claude 在 Connectors 下、Claude Code 用一條指令、Cursor 和 Codex 在它們的設定檔中。
- 登入一次 在瀏覽器中核准 Voibe。新的電子郵件地址可獲得含 15 分鐘免費額度的帳戶。無需複製 API 金鑰。
- 提出要求 「轉錄這段錄音。」程式碼工具會自行上傳檔案。聊天應用程式會給你一個上傳連結。逐字稿和摘要會直接回傳到聊天中。
- 相同的 API、相同的帳戶、相同的計費方式:按音訊秒數計費,僅在工作完成時收費。
MCP 位址
https://api.getvoibe.com/mcp
Claude Code
claude mcp add --transport http voibe https://api.getvoibe.com/mcp
-
create_transcription_job開始轉錄 -
get_transcript狀態,接著是逐字稿和摘要 -
list_transcripts你的錄音,最新的在前 -
get_balance剩餘分鐘數 -
Claude
-
Claude Desktop
-
Cowork
-
Claude Code
-
Cursor
-
Codex
-
ChatGPT
-
VS Code
-
Hermes
-
OpenClaw
你的 agent 會收到什麼
轉錄 API 回傳的內容
無需第二次呼叫摘要服務、無需獨立的說話者分離服務、無需撰寫膠水程式碼將它們串接起來。
GET /v1/transcripts/{job_id}
{
"job_id": "a523721c-…",
"status": "DONE",
"title": "Pricing page review",
"audio_duration_seconds": 205.27,
"seconds_charged": 206,
"diarize": true,
"transcript": [
{ "speaker": "Priya", "start": 0.4, "end": 5.2,
"text": "Let's start with the pricing page. Where are we?" },
{ "speaker": "Tom", "start": 6.1, "end": 10.8,
"text": "Copy is done. I need a review before Thursday." }
],
"transcript_text": "Priya: Let's start with the pricing page…",
"summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
"error": null
}
transcript每一行都包含說話者,以及以秒為單位的開始和結束時間。引用正確的人、跳到該時刻,或將後續事項路由給提出要求的人。transcript_text相同的逐字稿以純文字字串呈現,可直接放入 prompt 或索引中。summary一份簡短摘要,你的 agent 可以直接發布、儲存或進行推理,無需第二次模型呼叫。摘要附帶錄音的標題。
使用案例
設定一次,每週自動執行。
你不需要撰寫整合程式碼。你只需向已使用的 agent 描述重複性的工作,它就會撰寫腳本,按排程呼叫 Voibe。
產品經理
使用 Claude Cowork
將一週的客戶通話轉換為主題式回饋摘要,完全不需要聆聽任何一通。
他們對 agent 的要求
「每週五,將上週的通話錄音傳送給 Voibe API,並給我前五大主題,每個主題附上引言和客戶名稱。」
開發者
使用 Codex
為團隊錄製的每次站立會議和事故通話維護可搜尋的逐字稿索引。
他們對 agent 的要求
「撰寫一個工作,將我們儲存空間中的新錄音發布到 Voibe API、儲存 JSON,並將 transcript_text 索引到 Postgres 以供搜尋。」
創辦人
使用 Hermes
在當天結束前將投資人和銷售通話轉換為後續事項。
他們對 agent 的要求
「當通話錄音送達時,用 Voibe 轉錄它,並草擬後續電子郵件,列出我承諾的事項和截止日期。」
內容創作者
使用 OpenClaw
將每集新節目在隔夜轉換為節目筆記、章節標記和剪輯候選片段。
他們對 agent 的要求
「監看這個資料夾。當新集數出現時,用 Voibe 轉錄它,並給我章節、節目筆記和三段最佳引言連同時間戳。」
以上每一個案例都只是與 agent 的一次對話。Agent 連接到 MCP server 或閱讀文件、撰寫腳本並安排執行時間;你只需審查輸出。
定價
語音轉文字 API 定價
15 分鐘免費額度,之後購買永不過期的分鐘數。只需為你的 agent 實際轉錄的音訊付費:無訂閱、無席位費、無每月最低消費。
$50 每小時音訊 $0.27
11,000 分鐘 · 183 小時音訊
從 15 分鐘免費額度開始
無需信用卡。按音訊秒數計費,工作完成時收費。分鐘數永不過期。
說話者分離
說話者分離:你的 agent 知道誰說了什麼
說話者標籤預設開啟:每一行都會回傳說話者標籤,以及以秒為單位的開始和結束時間。可區分的說話者數量沒有限制,當人們說出自己的名字時,摘要會使用這些名字。無需執行額外的說話者分離模型、無需額外費用。將 diarize 設為 false 即可取得純逐字稿。
- 追蹤誰承諾了什麼的會議 agent
- 引用客戶原話的客服 agent
- 訪談和播客管線
- 任何有多人說話的情境
建立呼叫中的一個欄位
{ "diarize": true }
Webhooks
非同步轉錄:你的 agent 觸發後即可繼續
在建立工作時傳入 webhook_url,我們就會將完成的結果 POST 到你的端點。沒有 agent 迴圈會阻塞在輪詢上。請求主體包含事件名稱和與 GET 相同的工作主體,因此一個處理器即可涵蓋兩種路徑。
建立呼叫中的一個欄位
{ "webhook_url": "https://you.dev/ready" }
可引導的摘要
要求你的 agent 需要的格式
傳入一個 prompt,摘要就會以你的程式碼想要讀取的方式回傳:僅決策、行動項目、條列重點。你的 agent 無需第二次模型呼叫即可獲得可用的結構。最多 2,000 個字元。它會改變摘要的內容。
你的指示,你的摘要
{
"diarize": true,
"prompt": "summarise as bullet points, focus on decisions"
}
整合
讓你的程式碼 agent 自行接線
將入口網站中的一個 prompt 複製到 Claude Code、Codex、Cursor 或任何程式碼 agent 中,它就會為你撰寫 client。該 prompt 送達時已填入你的金鑰。而當你只需要轉錄一段錄音時,可以跳過程式碼:連接 MCP server 然後直接提出要求。
建構實用的應用程式
開發者使用語音轉文字 API 建構的內容
API 提供帶說話者標籤的文字、時間戳和可引導的摘要。以下是從中衍生出的產品。
會議記錄工具
將錄音轉換為指名誰承諾了什麼的筆記。說話者標籤負責歸屬,prompt 將輸出格式化為決策和負責人。
可搜尋的通話檔案庫
索引 transcript_text 以進行全文搜尋,並保留時間戳以直接跳到該時刻。按說話者篩選,找出某人在數月通話中說過的話。
字幕和隱藏式字幕
每一行都附有以秒為單位的開始和結束時間,這正是 SRT 或 VTT 檔案所需的全部內容。無需碰編輯器即可為整個影片庫加上字幕。
語音備忘錄轉任務
邊走邊說的備忘錄變成結構化的工作。要求 prompt 提供含負責人和日期的行動項目,然後直接寫入你的任務追蹤器。
通話評分與輔導
將客服人員與客戶分開,然後根據你自己的評分標準為通話評分。檢視異常值。
為你的產品提供語音介面
讓使用者與你的應用程式對話。送出音訊片段、取回你的 agent 可以路由的文字,並跳過建構語音基礎設施。
以上任何一個都不需要不同的端點。逐字稿、說話者和摘要全部在一個回應中送達;產品在於你如何運用它。
運作方式
語音轉文字 API 的運作方式
三個端點、兩個步驟。建立工作、將音訊上傳到你取得的簽署 URL,然後輪詢結果或讓 webhook 將結果送達。
- POST /v1/transcripts 啟動工作並回傳簽署的上傳 URL。
- GET /v1/transcripts/{job_id} 回傳狀態、逐字稿和摘要。
- GET /v1/transcripts 列出你的工作,每頁最多 200 筆。
- 音訊透過簽署 URL 直接送往儲存空間,因此大型檔案永遠不會透過 API 請求傳輸。檔案上限 200 MB;URL 有效時間為 5 小時。
上傳音訊
curl -s -X PUT "$UPLOAD_URL" \
-H "Content-Type: application/octet-stream" \
--data-binary @pricing-meeting.mp3
信任與可靠性
音訊零保留
錄音在逐字稿產生的那一刻即被刪除。它永遠不會被保留,也永遠不會被用來訓練模型。
-
音訊在轉錄後即被刪除
錄音在逐字稿產生後即被移除。 -
永遠不會用來訓練模型
你送出的任何內容都不會被用來訓練模型。你的錄音屬於你。 -
每次讀取都限定在你的帳戶範圍內
工作只能由建立它的帳戶讀取。 -
失敗的工作永遠不會收費
你只在工作達到 DONE 狀態時付費。佇列中、處理中和失敗的工作不花費任何費用,因此重試也不花費任何費用。
你的逐字稿在工作完成後 24 小時內可透過 GET /v1/transcripts 讀取,因此 agent 可以再次取得結果,而無需重新傳送音訊。
語音轉文字 API 常見問題
對 AI agent 而言,最好的語音轉文字 API 是什麼?
是你的 agent 無需等待整合即可使用的那一個。Voibe 的 API 是純 HTTP:一個 POST 啟動工作、一次上傳、一個包含逐字稿、說話者標籤、時間戳和摘要的 JSON 回應。無需安裝 SDK、無需承諾任何框架。它同時也是一個位於 https://api.getvoibe.com/mcp, 的 MCP server,因此 Claude、Claude Code、Cursor、Codex 和 ChatGPT 可以直接連接。對於你自己的程式碼,將 agent 指向 https://platform.getvoibe.com/docs.md,它就會自行找出你的使用情境所需的呼叫。每個新帳戶都從 15 分鐘免費額度開始,無需信用卡。
Voibe 語音轉文字 API 有 MCP server 嗎?
有。Voibe MCP server 位於 https://api.getvoibe.com/mcp. 將它新增到 Claude、Claude Code、Cursor、Codex、ChatGPT 或 VS Code 作為自訂連接器,或使用一個設定區塊,登入一次,然後要求應用程式轉錄一段錄音。它提供四個工具:開始轉錄、取得逐字稿、列出轉錄工作和檢查剩餘分鐘數。它使用與 API 相同的帳戶、相同的分鐘數和相同的按秒計費方式。
Claude 可以用 Voibe 轉錄會議錄音嗎?
可以。在 Claude 中,開啟 Customize,然後 Connectors,按一下 +,選擇 Add custom connector,貼上 https://api.getvoibe.com/mcp 然後登入。接著要求 Claude 轉錄一段錄音。Claude 無法讀取你電腦上的檔案,所以它會給你一個上傳連結;將檔案放入,Claude 就會取得逐字稿和摘要。這在網頁版 Claude、Claude Desktop 和 Cowork 中都可以運作。
如何從 Claude Code、Cursor 或 Codex 轉錄音訊?
連接 Voibe MCP server 然後提出要求。對於 Claude Code,執行 claude mcp add --transport http voibe https://api.getvoibe.com/mcp, 在 session 中輸入 /mcp 並登入。Cursor 和 Codex 在它們的設定檔中接受一個區塊。然後要求 agent 轉錄一個檔案:它會自行上傳檔案,並回傳帶說話者標籤的逐字稿和摘要。每個應用程式的設定說明位於 https://platform.getvoibe.com/docs/mcp.
API 能區分不同的說話者嗎?它知道他們的名字嗎? 是的。說話者標籤預設為開啟:每一行都會附上說話者標籤,以及以秒為單位的開始和結束時間。說話者會標記為 speaker_0、speaker_1 等,在同一錄音內保持一致,且不限制可區分的說話者數量。當錄音中提到人名時(例如有人自我介紹或被指名道姓),摘要和標題會使用這些名字。說話者分離(diarization)已包含在價格中。若要取得純文字轉錄稿,請將 diarize 設為 false。
支援哪些音訊格式、檔案大小和速率限制?
mp3、wav、m4a、mp4、flac、ogg 和 webm 可直接上傳;其他音訊和視訊檔案若音訊可讀取,會先進行轉換。格式會從檔案內容判斷。每個檔案最大可達 200 MB,上傳 URL 的有效期限為 5 小時。速率限制為每分鐘 50 個任務,每個帳號每天 1,000 個任務;超過此限制時,建立呼叫會回傳 429,因此請等待後重試。
語音轉文字 API 支援哪些語言?
語音和摘要模型為多語言模型,因此錄音不一定要是英文。說話者分離在任何語言中都以相同方式運作。
我需要輪詢(poll)結果嗎?
不需要。建立任務時傳入 webhook_url,我們會在結果準備好時立即將完成的結果 POST 到您的端點。請求主體包含事件名稱(transcript.completed 或 transcript.failed)以及與 GET /v1/transcripts/{job_id} 相同的任務主體,因此一個處理器即可涵蓋兩種情況。如果您偏好輪詢,仍然可以使用。
我如何被計費,分鐘數會過期嗎?
按音訊的每秒計費,無條件進位到整秒。一個 3 分 24 秒的檔案費用為 3 分 24 秒。只有在任務達到 DONE 狀態時才會收費,因此排隊中、處理中和失敗的任務都不會產生費用。每個新帳號一開始有 15 分鐘免費額度,且不需綁定信用卡。之後您可以購買一次性分鐘數包,最低從 $10 購買 2,000 分鐘起。分鐘數永不過期,沒有訂閱制,也沒有每月最低消費。
如果任務失敗會怎樣?
您不會被收費。任務會以 FAILED 狀態回傳,並附上 error 欄位,以淺白文字說明問題所在,例如音訊長度所需的分鐘數不足,或檔案在 24 小時內從未送達。如果完全沒有剩餘分鐘數,建立呼叫會在任何上傳前以 402 拒絕,因此不會傳送任何內容。
我的音訊會被儲存或用於訓練模型嗎?
音訊在轉錄後會被刪除,且絕不會用於訓練模型。轉錄稿和摘要在任務完成後可讀取 24 小時,之後會被刪除。任務的標題、長度和費用會保留在您的歷史記錄中。每次讀取都限定在您的帳號範圍內,因此您只會看到自己的任務。語音轉文字使用 Whisper large-v3-turbo 執行,說話者分離使用 pyannote community-1,摘要則使用 gpt-oss-120b。
這與我自己執行 Whisper 有何不同?
不需要管理基礎設施、不需要維持 GPU 運作,也不需要處理擴充問題。說話者分離和摘要會與轉錄稿在同一個回應中回傳,不需要第二個模型或額外的膠水程式碼。您只需按轉錄的音訊秒數付費,無需支付伺服器時間費用。