Voibe Transcription MCP Server
官方让Claude/Openclaw/Hermes/Codex/Grok Bot拥有耳朵。Voibe将录音转换为你的AI代理可以处理的文本。让你的代理转录会议、访谈、通话、讲座、播客剧集或语音备忘录。原始转录文本会连同说话人标签、时间戳和摘要一起出现在聊天中。
你可以用 Voibe Transcription MCP 做什么?
-
创建转录任务 — 让您的助手通过提交音频来启动转录,使用
create_transcription_job,可选用说话人分离和自定义摘要提示。 -
获取转录文本和摘要 — 使用
get_transcript获取带时间戳的说话人标注行、纯文本版本,以及由您的提示词塑造的可控摘要。 -
列出历史录音 — 调用
list_transcripts查看您之前的任务,按最新优先排序,包括状态、标题和音频时长。 -
检查剩余分钟数 — 在开始新任务前,查询
get_balance以查看您剩余的转录分钟数。 -
通过 Webhook 接收结果 — 创建任务时传入
webhook_url,即可自动将完成的转录文本和摘要 POST 到您的端点。
文档
Workflows
面向复杂工作流的简单 API
一次调用即可返回转写文本、说话人和摘要。你的 Agent 在此基础上构建什么,才是真正有趣的部分。
会议纪要
- 站会录音进入你的存储桶
- 一次调用返回谁说了什么,外加一份仅含决策的摘要
- 你的 Agent 发布纪要并创建后续事项
“prompt”: “summarise as decisions and owners”
客服质检
- 客服通话结束,录音被发送
- 说话人标签将客户与客服代表区分开
- 你的 Agent 为通话打分,并标记需要复核的通话
“prompt”: “list the customer's unresolved complaints”
播客制作
- 节目上传并注册 webhook
- 带时间戳的完整转写文本送达你的端点
- 你的 Agent 撰写节目笔记并切分章节标记
“prompt”: “write show notes with chapter titles”
销售通话写入 CRM
- 会议一结束,通话录音即被发送
- 摘要以行动项的形式返回
- 你的 Agent 将其写入商机,并安排下一步
“prompt”: “list action items with owners and dates”
以上每一个场景使用的都是相同的三个端点。唯一变化的是你发送的 prompt,以及你的 Agent 如何处理响应。
为 Agent 而生
只要你的 Agent 能调用 URL,它就能“听”
一次 POST、一次上传、一个 JSON 响应。无需适配 SDK、无需安装运行时、无需绑定框架。
- Claude Code
Codex
Cursor
Hermes
OpenClaw
两种接入方式,无需安装任何东西。连接 MCP 服务器后直接提问,或者将文档指给你的 Agent,它会为你所需的用例编写客户端。
粘贴到你的 Agent 中
Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.
MCP 服务器
从 Claude、Cursor、Codex 和 ChatGPT 中使用
Voibe 是一个 MCP 服务器。连接一次,你已在使用的 AI 应用即可转写录音、读取结果并查看会议纪要。无需编写代码。
- 添加连接器 将地址粘贴到你的应用中:Claude 在 Connectors 下,Claude Code 用一条命令,Cursor 和 Codex 在它们的配置文件中。
- 登录一次 在浏览器中批准 Voibe。新邮箱地址会自动获得含 15 分钟免费额度的账户。无需复制 API 密钥。
- 提问 “转写这段录音。”编码工具会自行上传文件。聊天应用会给你一个上传链接。转写文本和摘要会直接返回在聊天中。
- 同一 API、同一账户、同一计费方式:按音频秒数计费,仅在任务完成时收费。
MCP 地址
https://api.getvoibe.com/mcp
Claude Code
claude mcp add --transport http voibe https://api.getvoibe.com/mcp
-
create_transcription_job开始一次转写 -
get_transcript状态,然后是转写文本和摘要 -
list_transcripts你的录音,最新的在前 -
get_balance剩余分钟数 -
Claude
-
Claude Desktop
-
Cowork
-
Claude Code
-
Cursor
-
Codex
-
ChatGPT
-
VS Code
-
Hermes
-
OpenClaw
你的 Agent 会得到什么
转写 API 返回什么
无需第二次调用摘要服务、无需单独的说话人分离服务、无需拼接它们的胶水代码。
GET /v1/transcripts/{job_id}
{
"job_id": "a523721c-…",
"status": "DONE",
"title": "Pricing page review",
"audio_duration_seconds": 205.27,
"seconds_charged": 206,
"diarize": true,
"transcript": [
{ "speaker": "Priya", "start": 0.4, "end": 5.2,
"text": "Let's start with the pricing page. Where are we?" },
{ "speaker": "Tom", "start": 6.1, "end": 10.8,
"text": "Copy is done. I need a review before Thursday." }
],
"transcript_text": "Priya: Let's start with the pricing page…",
"summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
"error": null
}
transcript每一行都带有说话人信息,以及以秒为单位的开始和结束时间。准确引用说话人、跳转到对应时刻,或将后续事项路由给提出它的人。transcript_text同一份转写文本以纯字符串形式呈现,可直接放入 prompt 或索引中。summary一份简短摘要,你的 Agent 无需第二次模型调用即可发布、存储或推理。它还附带录音的标题。
使用场景
配置一次,每周自动运行
你不需要编写集成代码。你只需向已在使用的 Agent 描述重复性任务,它就会编写脚本,按计划调用 Voibe。
产品经理
使用 Claude Cowork
将一周的客户通话转化为按主题分类的反馈摘要,无需收听任何一通。
他们向 Agent 提出的请求
“每周五,将上周的通话录音发送到 Voibe API,并给我前五大主题,每个主题附上一条引语和客户名称。”
开发者
使用 Codex
为团队录制的每次站会和事故通话维护一个可搜索的转写索引。
他们向 Agent 提出的请求
“编写一个任务,将我们存储桶中的新录音发布到 Voibe API,存储 JSON,并将 transcript_text 索引到 Postgres 中以便搜索。”
创始人
使用 Hermes
在当天结束前将投资人和销售通话转化为后续事项。
他们向 Agent 提出的请求
“当通话录音到达时,用 Voibe 转写它,并起草后续邮件,列出我承诺的事项和截止时间。”
内容创作者
使用 OpenClaw
每晚将每期新节目转化为节目笔记、章节标记和剪辑候选片段。
他们向 Agent 提出的请求
“监控这个文件夹。当新节目出现时,用 Voibe 转写它,并给我章节、节目笔记和三条最佳引语及时间戳。”
以上每一个场景都是与 Agent 的一次对话。Agent 连接到 MCP 服务器或阅读文档、编写脚本并安排计划;你只需审核输出。
定价
语音转文本 API 定价
15 分钟免费额度,之后购买永不过期的分钟数。只为你的 Agent 实际转写的音频付费:无订阅、无席位费、无月度最低消费。
$50 $0.27 每小时的音频
11,000 分钟 · 183 小时的音频
从 15 分钟免费额度开始
无需银行卡。按音频秒数计费,任务完成时收费。分钟数永不过期。
说话人分离
说话人分离:你的 Agent 知道谁说了什么
说话人标签默认开启:每一行都会返回说话人标签以及以秒为单位的开始和结束时间。可区分的说话人数量没有上限,当人们说出自己的名字时,摘要会使用这些名字。无需单独运行分离模型,无需额外费用。将 diarize 设为 false 即可获得纯转写文本。
- 跟踪谁承诺了什么的会议 Agent
- 引用客户原话的客服 Agent
- 访谈和播客流水线
- 任何有多人说话的场合
创建调用中的一个字段
{ "diarize": true }
Webhooks
异步转写:你的 Agent 触发后即可继续
在创建任务时传入 webhook_url,我们会在任务完成后将结果 POST 到你的端点。没有 Agent 循环阻塞在轮询上。请求体包含事件名称和与 GET 相同的任务体,因此一个处理器即可覆盖两种路径。
创建调用中的一个字段
{ "webhook_url": "https://you.dev/ready" }
可引导的摘要
请求你的 Agent 所需的格式
传入一个 prompt,摘要就会以你的代码想要读取的方式返回:仅决策、行动项、要点列表。你的 Agent 无需第二次模型调用即可获得可用的结构。最多 2,000 个字符。它会改变摘要的内容。
你的指令,你的摘要
{
"diarize": true,
"prompt": "summarise as bullet points, focus on decisions"
}
集成
让你的编码 Agent 自行接入
将门户中的一条 prompt 复制到 Claude Code、Codex、Cursor 或任何编码 Agent 中,它就会为你编写客户端。该 prompt 已预填你的密钥。当你只需要转写一段录音时,可以跳过代码:连接 MCP 服务器并直接提问。
构建有用的应用
开发者用语音转文本 API 构建什么
该 API 提供带说话人标签的文本、时间戳和可引导的摘要。以下是从中衍生出的产品。
会议记录工具
将录音转化为能指出谁承诺了什么的纪要。说话人标签负责归属,prompt 将输出塑造成决策和负责人。
可搜索的通话档案
索引 transcript_text 以进行全文搜索,并保留时间戳以直接跳转到对应时刻。按说话人筛选,找出某人在数月通话中说过的话。
字幕和隐藏式字幕
每一行都带有以秒为单位的开始和结束时间,这正是 SRT 或 VTT 文件所需的全部信息。无需触碰编辑器即可为整个视频库添加字幕。
语音备忘转任务
边走边说的备忘变成结构化的工作。让 prompt 返回带负责人和日期的行动项,然后直接写入你的任务追踪器。
通话评分与辅导
将客服代表与客户分开,然后根据你自己的评分标准为通话打分。复核异常值。
为你的产品提供语音界面
让用户与你的应用对话。发送音频片段,取回你的 Agent 可以路由的文本,无需构建语音基础设施。
以上都不需要不同的端点。转写文本、说话人和摘要都在一个响应中返回;产品是你用它做什么。
工作原理
语音转文本 API 的工作原理
三个端点,两个步骤。创建任务,将音频上传到你获得的签名 URL,然后轮询结果或让 webhook 将结果送达。
- POST /v1/transcripts 启动任务并返回签名上传 URL。
- GET /v1/transcripts/{job_id} 返回状态、转写文本和摘要。
- GET /v1/transcripts 列出你的任务,每页最多 200 条。
- 音频通过签名 URL 直接进入存储,因此大文件永远不会通过 API 请求传输。文件最大 200 MB;URL 有效期为 5 小时。
上传音频
curl -s -X PUT "$UPLOAD_URL" \
-H "Content-Type: application/octet-stream" \
--data-binary @pricing-meeting.mp3
信任与可靠性
音频零保留
录音在转写文本生成的那一刻即被删除。它永远不会被保留,也永远不会被用于训练模型。
-
转写后音频即被删除
录音在转写文本生成后即被移除。 -
永不用于训练模型
你发送的任何内容都不会被用于训练模型。你的录音属于你自己。 -
每次读取都限定在你的账户范围内
任务只能被创建它的账户读取。 -
失败的任务永不收费
你只在任务达到 DONE 状态时付费。排队中、处理中和失败的任务不产生费用,因此重试也不产生费用。
你的转写文本在任务完成后 24 小时内可通过 GET /v1/transcripts 读取,因此 Agent 可以再次获取结果而无需重新发送音频。
语音转文本 API 常见问题
对 AI Agent 来说,最好的语音转文本 API 是什么?
是你的 Agent 无需等待集成即可使用的那一个。Voibe 的 API 是纯 HTTP:一次 POST 启动任务,一次上传,一个包含转写文本、说话人标签、时间戳和摘要的 JSON 响应。无需安装 SDK,无需绑定框架。它同时也是一个 MCP 服务器,地址为 https://api.getvoibe.com/mcp,,因此 Claude、Claude Code、Cursor、Codex 和 ChatGPT 可以直接连接。对于你自己的代码,将 https://platform.getvoibe.com/docs.md 指给 Agent,它就能为你所需的用例找出调用方式。每个新账户都从 15 分钟免费额度和无需银行卡开始。
Voibe 语音转文本 API 有 MCP 服务器吗?
有。Voibe MCP 服务器位于 https://api.getvoibe.com/mcp.。将其作为自定义连接器或通过一个配置块添加到 Claude、Claude Code、Cursor、Codex、ChatGPT 或 VS Code 中,登录一次,然后让应用转写一段录音。它暴露四个工具:开始转写、获取转写文本、列出转写任务和检查剩余分钟数。它使用与 API 相同的账户、相同的分钟数和相同的按秒计费方式。
Claude 能用 Voibe 转写会议录音吗?
可以。在 Claude 中,打开 Customize,然后选择 Connectors,点击 +,选择 Add custom connector,粘贴 https://api.getvoibe.com/mcp 并登录。然后让 Claude 转写一段录音。Claude 无法读取你电脑上的文件,所以它会给你一个上传链接;将文件拖入,Claude 就会获取转写文本和摘要。这在网页版 Claude、Claude Desktop 和 Cowork 中均可用。
如何从 Claude Code、Cursor 或 Codex 中转写音频?
连接 Voibe MCP 服务器并直接提问。对于 Claude Code,运行 claude mcp add --transport http voibe https://api.getvoibe.com/mcp,,在会话中输入 /mcp 并登录。Cursor 和 Codex 在其配置文件中添加一个块即可。然后让 Agent 转写一个文件:它会自行上传文件并返回带说话人标签的转写文本和摘要。每个应用的设置说明位于 https://platform.getvoibe.com/docs/mcp.
API 能识别不同的说话人吗?它能知道他们的名字吗? 是的。说话人标签默认开启:每一行都会附带说话人标签以及以秒为单位的开始和结束时间。说话人被标记为 speaker_0、speaker_1 等,在同一段录音内保持一致,并且不限制可区分的说话人数量。当录音中提到人名时(例如有人自我介绍或被点名),摘要和标题会使用人名。说话人分离已包含在价格中。如需纯文本转录,可将 diarize 设为 false。
支持哪些音频格式、文件大小和速率限制?
mp3、wav、m4a、mp4、flac、ogg 和 webm 可直接上传;其他音频和视频文件在音频可读取时会先进行转换。格式根据文件内容识别。每个文件最大 200 MB,上传 URL 有效期为 5 小时。速率限制为每个账户每分钟 50 个任务、每天 1,000 个任务;超过限制后创建调用会返回 429,请等待后重试。
语音转文字 API 支持哪些语言?
语音和摘要模型是多语言的,因此录音不限于英语。说话人分离在任何语言下都以相同方式工作。
我必须轮询结果吗?
不需要。创建任务时传入 webhook_url,我们会在结果就绪后立即将完成结果 POST 到您的端点。请求体包含事件名称(transcript.completed 或 transcript.failed)以及与 GET /v1/transcripts/{job_id} 相同的任务体,因此一个处理程序即可覆盖两种情况。如果您更倾向于轮询,轮询方式仍然可用。
如何计费,分钟数会过期吗?
按音频秒数计费,向上取整到整秒。一个 3 分 24 秒的文件按 3 分 24 秒计费。仅在任务达到 DONE 状态时收费,因此排队中、处理中和失败的任务不产生费用。每个新账户默认赠送 15 分钟免费额度,无需绑定银行卡。之后您可以购买一次性分钟数套餐,最低 $10 可购买 2,000 分钟。分钟数永不过期,没有订阅,也没有月度最低消费。
任务失败会怎样?
您不会被收费。任务会以 FAILED 状态返回,并附带 error 字段,用通俗语言说明失败原因,例如音频时长对应的分钟数不足,或文件在 24 小时内未到达。如果账户完全没有剩余分钟数,创建调用会在任何上传前以 402 被拒绝,因此不会发送任何内容。
我的音频会被存储或用于训练模型吗?
音频在转录后即被删除,绝不会用于训练模型。转录文本和摘要在任务完成后 24 小时内可读取,之后会被删除。任务的标题、时长和费用会保留在您的历史记录中。每次读取都限定在您的账户范围内,因此您只能看到自己的任务。语音转文字基于 Whisper large-v3-turbo 运行,说话人分离基于 pyannote community-1,摘要基于 gpt-oss-120b。
这与我自己运行 Whisper 有何不同?
无需搭建基础设施、无需维护 GPU、也无需管理扩展。说话人分离和摘要在与转录文本相同的响应中返回,无需第二个模型或胶水代码。您只需按转录的音频秒数付费,无需为服务器时间付费。