Voibe Transcription MCP Server
chính thứcHãy cho Claude/Openclaw/Hermes/Codex/Grok Bot đôi tai. Voibe biến bản ghi âm thành văn bản mà tác nhân AI của bạn có thể xử lý. Hãy yêu cầu tác nhân của bạn phiên âm một cuộc họp, buổi phỏng vấn, cuộc gọi, bài giảng, tập podcast hoặc ghi chú thoại. Bản phiên âm thô sẽ đến trong cuộc trò chuyện kèm nhãn người nói, dấu thời gian và bản tóm tắt.
Bạn có thể làm gì với Voibe Transcription MCP?
-
Tạo tác vụ phiên âm — Yêu cầu trợ lý của bạn bắt đầu phiên âm bằng cách gửi âm thanh qua
create_transcription_job, với tùy chọn tách người nói và lời nhắc tóm tắt tùy chỉnh. -
Truy xuất bản ghi và tóm tắt — Sử dụng
get_transcriptđể lấy các dòng có gắn nhãn người nói kèm dấu thời gian, bản văn bản thuần túy và bản tóm tắt có thể điều chỉnh theo lời nhắc của bạn. -
Liệt kê các bản ghi trước đó — Gọi
list_transcriptsđể xem các tác vụ trước đây của bạn theo thứ tự mới nhất trước, bao gồm trạng thái, tiêu đề và thời lượng âm thanh. -
Kiểm tra số phút còn lại — Truy vấn
get_balanceđể xem bạn còn bao nhiêu phút phiên âm trước khi bắt đầu một tác vụ mới. -
Nhận kết quả qua webhook — Truyền
webhook_urlkhi tạo tác vụ để bản ghi và tóm tắt hoàn chỉnh được tự động POST đến điểm cuối của bạn.
Tài liệu
Workflows
API đơn giản cho quy trình phức tạp
Một lần gọi trả về bản ghi âm, người nói và bản tóm tắt. Điều thú vị là agent của bạn xây dựng được gì trên nền tảng đó.
Ghi chú cuộc họp
- Bản ghi âm standup được tải lên bucket của bạn
- Một lần gọi trả về ai đã nói gì, cùng bản tóm tắt chỉ gồm các quyết định
- Agent của bạn đăng ghi chú và mở các mục theo dõi
"prompt": "tóm tắt thành các quyết định và người phụ trách"
Hỗ trợ khách hàng QA
- Cuộc gọi hỗ trợ kết thúc và bản ghi âm được gửi đi
- Nhãn người nói tách biệt khách hàng và nhân viên hỗ trợ
- Agent của bạn chấm điểm cuộc gọi và đánh dấu những cuộc cần xem lại
"prompt": "liệt kê các khiếu nại chưa được giải quyết của khách hàng"
Sản xuất podcast
- Một tập được tải lên và webhook được đăng ký
- Bản ghi âm hoàn chỉnh đến endpoint của bạn kèm dấu thời gian
- Agent của bạn viết ghi chú chương trình và cắt các điểm đánh dấu chương
"prompt": "viết ghi chú chương trình với tiêu đề các chương"
Cuộc gọi bán hàng đến CRM
- Bản ghi âm cuộc gọi được gửi ngay khi cuộc họp kết thúc
- Bản tóm tắt trả về dưới dạng các mục hành động
- Agent của bạn ghi chúng vào thương vụ và lên lịch bước tiếp theo
"prompt": "liệt kê các mục hành động với người phụ trách và ngày tháng"
Mỗi trường hợp trên đều dùng cùng ba endpoint. Điều duy nhất thay đổi là prompt bạn gửi và những gì agent của bạn làm với phản hồi.
Được xây dựng cho agent
Nếu agent của bạn có thể gọi một URL, nó có thể nghe
Một POST, một lần tải lên, một phản hồi JSON. Không cần SDK, không cần cài đặt runtime, không cần gắn bó với framework nào.
- Claude Code
Codex
Cursor
Hermes
OpenClaw
Hai cách kết nối, không cần cài đặt gì. Kết nối MCP server và yêu cầu, hoặc trỏ agent của bạn vào tài liệu và nó sẽ viết client cho nhu cầu của bạn.
Dán đoạn này vào agent của bạn
Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.
MCP server
Sử dụng từ Claude, Cursor, Codex và ChatGPT
Voibe là một MCP server. Kết nối một lần và ứng dụng AI bạn đang dùng có thể ghi âm, đọc kết quả và kiểm tra biên bản của bạn. Không cần viết code.
- Thêm bộ kết nối Dán địa chỉ vào ứng dụng của bạn: Claude trong mục Connectors, Claude Code bằng một lệnh, Cursor và Codex trong tệp cấu hình của chúng.
- Đăng nhập một lần Phê duyệt Voibe trong trình duyệt. Một địa chỉ email mới sẽ có tài khoản với 15 phút miễn phí. Không cần sao chép API key.
- Yêu cầu "Ghi âm bản ghi này." Một công cụ lập trình tự tải tệp lên. Một ứng dụng trò chuyện đưa cho bạn liên kết tải lên. Bản ghi âm và bản tóm tắt trả về trong cuộc trò chuyện.
- Cùng API, cùng tài khoản, cùng cách tính phí: mỗi giây âm thanh, chỉ tính khi công việc hoàn tất.
Địa chỉ MCP
https://api.getvoibe.com/mcp
Claude Code
claude mcp add --transport http voibe https://api.getvoibe.com/mcp
-
create_transcription_jobBắt đầu một bản ghi âm -
get_transcriptTrạng thái, sau đó là bản ghi âm và bản tóm tắt -
list_transcriptsCác bản ghi của bạn, mới nhất trước -
get_balanceSố phút còn lại -
Claude
-
Claude Desktop
-
Cowork
-
Claude Code
-
Cursor
-
Codex
-
ChatGPT
-
VS Code
-
Hermes
-
OpenClaw
Những gì agent của bạn nhận lại
API ghi âm trả về gì
Không cần gọi thêm lần thứ hai cho bộ tóm tắt, không cần dịch vụ diarization riêng, không cần mã kết nối chúng lại với nhau.
GET /v1/transcripts/{job_id}
{
"job_id": "a523721c-…",
"status": "DONE",
"title": "Pricing page review",
"audio_duration_seconds": 205.27,
"seconds_charged": 206,
"diarize": true,
"transcript": [
{ "speaker": "Priya", "start": 0.4, "end": 5.2,
"text": "Let's start with the pricing page. Where are we?" },
{ "speaker": "Tom", "start": 6.1, "end": 10.8,
"text": "Copy is done. I need a review before Thursday." }
],
"transcript_text": "Priya: Let's start with the pricing page…",
"summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
"error": null
}
transcriptMỗi dòng kèm người nói, thời gian bắt đầu và kết thúc tính bằng giây. Trích dẫn đúng người, nhảy đến khoảnh khắc, hoặc chuyển tiếp mục theo dõi đến người đã yêu cầu.transcript_textBản ghi âm tương tự dưới dạng một chuỗi văn bản đơn giản, sẵn sàng để đưa trực tiếp vào prompt hoặc chỉ mục.summaryMột bản tóm tắt ngắn mà agent của bạn có thể đăng, lưu trữ hoặc phân tích mà không cần gọi mô hình lần thứ hai. Nó đi kèm với tiêu đề cho bản ghi.
Use cases
Thiết lập một lần. Nó chạy mỗi tuần.
Bạn không viết tích hợp. Bạn mô tả công việc lặp lại cho agent bạn đang dùng, và nó viết script gọi Voibe theo lịch trình.
Quản lý sản phẩm
dùng Claude Cowork
Biến một tuần các cuộc gọi khách hàng thành bản tóm tắt phản hồi theo chủ đề, mà không cần nghe bất kỳ cuộc gọi nào.
Điều họ yêu cầu agent của mình
"Mỗi thứ Sáu, gửi bản ghi âm cuộc gọi của tuần trước đến API Voibe và cho tôi năm chủ đề hàng đầu, kèm trích dẫn và tên khách hàng cho mỗi chủ đề."
Nhà phát triển
dùng Codex
Giữ một chỉ mục bản ghi âm có thể tìm kiếm cho mọi cuộc họp standup và cuộc gọi sự cố mà nhóm ghi lại.
Điều họ yêu cầu agent của mình
"Viết một công việc đăng các bản ghi mới từ bucket của chúng tôi đến API Voibe, lưu JSON và lập chỉ mục transcript_text trong Postgres để tìm kiếm."
Nhà sáng lập
dùng Hermes
Biến các cuộc gọi nhà đầu tư và bán hàng thành các mục theo dõi trước khi ngày kết thúc.
Điều họ yêu cầu agent của mình
"Khi một bản ghi cuộc gọi được tải lên, ghi âm nó bằng Voibe và soạn email theo dõi liệt kê những gì tôi cam kết và thời hạn."
Nhà sáng tạo nội dung
dùng OpenClaw
Biến mỗi tập mới thành ghi chú chương trình, điểm đánh dấu chương và ứng viên clip qua đêm.
Điều họ yêu cầu agent của mình
"Theo dõi thư mục này. Khi một tập mới xuất hiện, ghi âm nó bằng Voibe và cho tôi các chương, ghi chú chương trình và ba trích dẫn nổi bật nhất kèm dấu thời gian."
Mỗi trường hợp này là một cuộc trò chuyện với một agent. Agent kết nối đến MCP server hoặc đọc tài liệu, viết script và lên lịch; bạn xem lại kết quả.
Pricing
Giá API chuyển giọng nói thành văn bản
15 phút miễn phí, sau đó mua phút không bao giờ hết hạn. Trả tiền cho âm thanh mà agent của bạn thực sự ghi âm: không đăng ký, không ghế ngồi, không mức tối thiểu hàng tháng.
$50 $0.27 mỗi giờ âm thanh
11.000 phút · 183 giờ âm thanh
Bắt đầu với 15 phút miễn phí
Không cần thẻ. Mỗi giây âm thanh, tính phí khi công việc hoàn tất. Phút không bao giờ hết hạn.
Speaker diarization
Speaker diarization: agent của bạn biết ai đã nói gì
Nhãn người nói được bật theo mặc định: mỗi dòng trả về kèm nhãn người nói và thời gian bắt đầu và kết thúc tính bằng giây. Không có giới hạn về số người nói được phân biệt, và khi mọi người nói tên của họ, bản tóm tắt sẽ dùng chúng. Không cần chạy mô hình diarization riêng, không tính phí thêm. Đặt diarize thành false để có bản ghi âm đơn giản.
- Agent cuộc họp theo dõi ai cam kết điều gì
- Agent hỗ trợ trích dẫn khách hàng
- Quy trình phỏng vấn và podcast
- Bất cứ nơi nào có nhiều hơn một người nói
Một trường trên lệnh tạo
{ "diarize": true }
Webhooks
Ghi âm không đồng bộ: agent của bạn kích hoạt và tiếp tục
Truyền webhook_url khi bạn tạo công việc và chúng tôi POST kết quả hoàn chỉnh đến endpoint của bạn. Không có vòng lặp agent bị chặn khi chờ phản hồi. Phần thân mang tên sự kiện và cùng phần thân công việc như GET, vì vậy một trình xử lý bao phủ cả hai đường dẫn.
Một trường trên lệnh tạo
{ "webhook_url": "https://you.dev/ready" }
Bản tóm tắt có thể điều hướng
Yêu cầu hình dạng agent của bạn cần
Truyền một prompt và bản tóm tắt trả về theo cách mã của bạn muốn đọc: chỉ quyết định, mục hành động, gạch đầu dòng. Agent của bạn nhận được cấu trúc hữu ích mà không cần gọi mô hình lần thứ hai. Tối đa 2.000 ký tự. Nó thay đổi bản tóm tắt.
Hướng dẫn của bạn, bản tóm tắt của bạn
{
"diarize": true,
"prompt": "summarise as bullet points, focus on decisions"
}
Tích hợp
Để agent lập trình của bạn tự kết nối
Sao chép một prompt từ cổng thông tin vào Claude Code, Codex, Cursor hoặc bất kỳ agent lập trình nào, và nó viết client cho bạn. Prompt đến với key của bạn đã được điền sẵn. Và khi bạn chỉ cần ghi âm một bản ghi, bỏ qua mã: kết nối MCP server và yêu cầu.
Xây dựng ứng dụng hữu ích
Nhà phát triển xây dựng gì với API chuyển giọng nói thành văn bản
API cung cấp cho bạn văn bản có nhãn người nói, dấu thời gian và bản tóm tắt có thể điều hướng. Đây là những sản phẩm phát sinh từ đó.
Ghi chú cuộc họp
Biến bản ghi âm thành ghi chú nêu tên ai cam kết điều gì. Nhãn người nói thực hiện việc gán, prompt định hình đầu ra thành các quyết định và người phụ trách.
Kho lưu trữ cuộc gọi có thể tìm kiếm
Lập chỉ mục transcript_text để tìm kiếm toàn văn và giữ dấu thời gian để nhảy thẳng đến khoảnh khắc. Lọc theo người nói để tìm những gì một người đã nói qua nhiều tháng cuộc gọi.
Phụ đề và chú thích
Mỗi dòng đến với thời gian bắt đầu và kết thúc tính bằng giây, đó là tất cả những gì tệp SRT hoặc VTT cần. Phụ đề toàn bộ thư viện video mà không cần chạm vào trình chỉnh sửa.
Ghi chú thoại thành nhiệm vụ
Một bản ghi nhớ khi đi bộ trở thành công việc có cấu trúc. Yêu cầu prompt tạo các mục hành động với người phụ trách và ngày tháng, sau đó ghi chúng trực tiếp vào trình theo dõi của bạn.
Chấm điểm và huấn luyện cuộc gọi
Tách nhân viên khỏi khách hàng, sau đó chấm điểm cuộc gọi theo tiêu chí của riêng bạn. Xem lại các trường hợp ngoại lệ.
Giao diện thoại cho sản phẩm của bạn
Cho phép người dùng nói chuyện với ứng dụng của bạn. Gửi clip, nhận lại văn bản mà agent của bạn có thể định tuyến, và bỏ qua việc xây dựng hạ tầng giọng nói.
Không trường hợp nào cần endpoint khác. Bản ghi âm, người nói và bản tóm tắt đều đến trong một phản hồi; sản phẩm là những gì bạn làm với nó.
Cách hoạt động
API chuyển giọng nói thành văn bản hoạt động như thế nào
Ba endpoint, hai bước. Tạo công việc, tải âm thanh lên URL đã ký bạn nhận lại, sau đó chờ kết quả hoặc để webhook mang đến cho bạn.
- POST /v1/transcripts Bắt đầu một công việc và trả về URL tải lên đã ký.
- GET /v1/transcripts/{job_id} Trả về trạng thái, bản ghi âm và bản tóm tắt.
- GET /v1/transcripts Liệt kê các công việc của bạn, tối đa 200 mỗi trang.
- Âm thanh đi thẳng đến bộ lưu trữ trên URL đã ký, vì vậy tệp lớn không bao giờ đi qua yêu cầu API. Tệp tối đa 200 MB; URL hoạt động trong 5 giờ.
Tải âm thanh lên
curl -s -X PUT "$UPLOAD_URL" \
-H "Content-Type: application/octet-stream" \
--data-binary @pricing-meeting.mp3
Tin cậy và độ tin cậy
Không lưu trữ âm thanh của bạn
Bản ghi âm bị xóa ngay khi bản ghi âm tồn tại. Nó không bao giờ được giữ lại và không bao giờ được dùng để huấn luyện mô hình.
-
Âm thanh bị xóa sau khi ghi âm
Bản ghi được xóa sau khi bản ghi âm đã được tạo. -
Không bao giờ dùng để huấn luyện mô hình
Không có gì bạn gửi được dùng để huấn luyện mô hình. Bản ghi của bạn là của bạn. -
Mỗi lần đọc được giới hạn trong tài khoản của bạn
Một công việc chỉ có thể được đọc bởi tài khoản đã tạo nó. -
Công việc thất bại không bao giờ bị tính phí
Bạn chỉ trả tiền khi công việc đạt DONE. Các công việc xếp hàng, đang xử lý và thất bại không tốn gì, vì vậy thử lại cũng không tốn gì.
Bản ghi âm của bạn vẫn có thể đọc qua GET /v1/transcripts trong 24 giờ sau khi công việc hoàn tất, vì vậy agent có thể lấy lại kết quả mà không cần gửi lại âm thanh.
Câu hỏi thường gặp về API chuyển giọng nói thành văn bản
API chuyển giọng nói thành văn bản tốt nhất cho AI agent là gì?
API mà agent của bạn có thể dùng mà không cần chờ tích hợp. API của Voibe là HTTP đơn giản: một POST để bắt đầu công việc, một lần tải lên, một phản hồi JSON chứa bản ghi âm, nhãn người nói, dấu thời gian và bản tóm tắt. Không cần cài SDK và không cần cam kết với framework nào. Nó cũng là một MCP server tại https://api.getvoibe.com/mcp, vì vậy Claude, Claude Code, Cursor, Codex và ChatGPT kết nối trực tiếp. Cho mã của riêng bạn, trỏ agent vào https://platform.getvoibe.com/docs.md và nó tự tìm ra các lệnh gọi cho nhu cầu của bạn. Mỗi tài khoản mới bắt đầu với 15 phút miễn phí và không cần thẻ.
API chuyển giọng nói thành văn bản của Voibe có MCP server không?
Có. MCP server của Voibe tại https://api.getvoibe.com/mcp. Thêm nó vào Claude, Claude Code, Cursor, Codex, ChatGPT hoặc VS Code như một bộ kết nối tùy chỉnh hoặc với một khối cấu hình, đăng nhập một lần, và yêu cầu ứng dụng ghi âm một bản ghi. Nó cung cấp bốn công cụ: bắt đầu ghi âm, lấy bản ghi âm, liệt kê bản ghi âm và kiểm tra số phút còn lại. Nó dùng cùng tài khoản, cùng phút và cùng cách tính phí mỗi giây như API.
Claude có thể ghi âm cuộc họp bằng Voibe không?
Có. Trong Claude, mở Customize, sau đó Connectors, nhấp +, chọn Add custom connector, dán https://api.getvoibe.com/mcp và đăng nhập. Sau đó yêu cầu Claude ghi âm một bản ghi. Claude không thể đọc tệp trên máy tính của bạn, vì vậy nó đưa cho bạn liên kết tải lên; thả tệp vào và Claude lấy bản ghi âm và bản tóm tắt. Điều này hoạt động trong Claude trên web, Claude Desktop và Cowork.
Làm thế nào để ghi âm âm thanh từ Claude Code, Cursor hoặc Codex?
Kết nối MCP server Voibe và yêu cầu. Cho Claude Code, chạy claude mcp add --transport http voibe https://api.getvoibe.com/mcp, gõ /mcp trong phiên và đăng nhập. Cursor và Codex nhận một khối trong tệp cấu hình của chúng. Sau đó yêu cầu agent ghi âm một tệp: nó tự tải tệp lên và trả về bản ghi âm có nhãn người nói và bản tóm tắt. Thiết lập cho mỗi ứng dụng tại https://platform.getvoibe.com/docs/mcp.
API có xác định các người nói khác nhau và biết tên của họ không? Có. Nhãn người nói được bật theo mặc định: mỗi dòng trả về kèm nhãn người nói và thời gian bắt đầu, kết thúc tính bằng giây. Người nói được gắn nhãn speaker_0, speaker_1, v.v., nhất quán trong một bản ghi, không giới hạn số lượng người được phân biệt. Phần tóm tắt và tiêu đề sử dụng tên người khi bản ghi có, ví dụ khi ai đó tự giới thiệu hoặc được gọi tên. Phân tách người nói đã bao gồm trong giá. Đặt diarize thành false để nhận bản ghi chép thuần.
Các định dạng âm thanh, giới hạn kích thước tệp và giới hạn tốc độ áp dụng là gì?
mp3, wav, m4a, mp4, flac, ogg và webm được xử lý trực tiếp; các tệp âm thanh và video khác được chuyển đổi trước khi có thể đọc được âm thanh. Định dạng được đọc từ nội dung tệp. Mỗi tệp có thể lên tới 200 MB và URL tải lên có hiệu lực trong 5 giờ. Giới hạn tốc độ là 50 tác vụ mỗi phút và 1.000 tác vụ mỗi ngày cho mỗi tài khoản; vượt quá mức đó, lệnh gọi tạo trả về mã 429, vì vậy hãy chờ và thử lại.
API chuyển giọng nói thành văn bản hỗ trợ những ngôn ngữ nào?
Các mô hình chuyển giọng nói và tóm tắt đa ngôn ngữ, vì vậy bản ghi không nhất thiết phải bằng tiếng Anh. Phân tách người nói hoạt động giống nhau ở mọi ngôn ngữ.
Tôi có phải thăm dò kết quả không?
Không. Truyền webhook_url khi bạn tạo tác vụ và chúng tôi sẽ POST kết quả hoàn tất đến điểm cuối của bạn ngay khi sẵn sàng. Phần thân chứa tên sự kiện, transcript.completed hoặc transcript.failed, và cùng phần thân tác vụ như GET /v1/transcripts/{job_id}, vì vậy một trình xử lý bao phủ cả hai. Thăm dò vẫn khả dụng nếu bạn thích.
Tôi bị tính phí như thế nào và số phút có hết hạn không?
Tính theo mỗi giây âm thanh, làm tròn lên đến giây nguyên. Một tệp dài 3 phút 24 giây có giá 3 phút 24 giây. Bạn chỉ bị tính phí khi tác vụ đạt trạng thái DONE, vì vậy các tác vụ đang xếp hàng, đang xử lý và thất bại không tốn phí. Mỗi tài khoản mới bắt đầu với 15 phút miễn phí và không yêu cầu thẻ. Sau đó, bạn mua phút theo gói một lần, từ $10 cho 2.000 phút. Phút không bao giờ hết hạn, không có đăng ký và không có mức tối thiểu hàng tháng.
Điều gì xảy ra nếu một tác vụ thất bại?
Bạn không bị tính phí. Tác vụ trả về trạng thái FAILED và trường error giải thích điều gì sai bằng lời rõ ràng, ví dụ không đủ phút cho độ dài âm thanh, hoặc tệp không bao giờ đến trong vòng 24 giờ. Khi không còn phút nào, lệnh gọi tạo bị từ chối với mã 402 trước khi tải lên, vì vậy không có gì được gửi.
Âm thanh của tôi có được lưu trữ hoặc dùng để huấn luyện mô hình không?
Âm thanh bị xóa sau khi chuyển giọng nói thành văn bản và không bao giờ được dùng để huấn luyện mô hình. Bản ghi chép và tóm tắt vẫn đọc được trong 24 giờ sau khi tác vụ hoàn tất, sau đó chúng bị xóa. Tiêu đề, độ dài và chi phí của tác vụ vẫn nằm trong lịch sử của bạn. Mọi lần đọc đều giới hạn trong tài khoản của bạn, vì vậy bạn chỉ thấy tác vụ của chính mình. Chuyển giọng nói thành văn bản chạy trên Whisper large-v3-turbo, phân tách người nói trên pyannote community-1, và tóm tắt trên gpt-oss-120b.
Điều này khác gì so với tự chạy Whisper?
Không có hạ tầng để vận hành, không có GPU để giữ ấm và không có mở rộng quy mô để quản lý. Phân tách người nói và tóm tắt trả về trong cùng phản hồi với bản ghi chép, không cần mô hình thứ hai và không cần mã kết nối. Bạn trả tiền theo mỗi giây âm thanh được chuyển, và không có thời gian máy chủ để trả.