Voibe Transcription MCP Server
공식Claude/Openclaw/Hermes/Codex/Grok 봇에 귀를 달아주세요. Voibe는 녹음을 AI 에이전트가 작업할 수 있는 텍스트로 변환합니다. 에이전트에게 회의, 인터뷰, 통화, 강의, 팟캐스트 에피소드 또는 음성 메모를 전사하도록 요청하세요. 원본 전사본은 화자 라벨, 타임스탬프 및 요약과 함께 채팅에 도착합니다.
Voibe Transcription MCP(으)로 무엇을 할 수 있나요?
-
Create transcription jobs — 어시스턴트에게
create_transcription_job을 통해 오디오를 제출하여 전사 작업을 시작하도록 요청하세요. 선택적으로 화자 분리 및 사용자 정의 요약 프롬프트를 포함할 수 있습니다. -
Retrieve transcripts and summaries —
get_transcript를 사용하여 타임스탬프가 포함된 화자 라벨링된 대사, 일반 텍스트 버전, 그리고 프롬프트에 따라 조정된 조정 가능한 요약을 가져오세요. -
List past recordings —
list_transcripts를 호출하여 상태, 제목, 오디오 길이를 포함한 이전 작업을 최신순으로 확인하세요. -
Check remaining minutes — 새 작업을 시작하기 전에
get_balance를 쿼리하여 남은 전사 시간(분)을 확인하세요. -
Receive results via webhook — 작업 생성 시
webhook_url을 전달하면 완성된 전사본과 요약이 자동으로 엔드포인트에 POST됩니다.
문서
Workflows
복잡한 워크플로우를 위한 간단한 API
한 번의 호출로 대본, 화자, 요약을 반환합니다. 그 위에 에이전트가 무엇을 구축하는지가 흥미로운 부분입니다.
회의 노트
- 스탠드업 녹음이 버킷에 도착합니다
- 한 번의 호출로 누가 무엇을 말했는지, 그리고 결정 사항만 담긴 요약이 반환됩니다
- 에이전트가 노트를 게시하고 후속 작업을 엽니다
"prompt": "결정 사항과 담당자로 요약해 줘"
지원 QA
- 지원 통화가 끝나고 녹음이 전송됩니다
- 화자 라벨이 고객과 상담원을 구분합니다
- 에이전트가 통화를 평가하고 검토할 항목을 표시합니다
"prompt": "고객의 해결되지 않은 불만 사항을 나열해 줘"
팟캐스트 제작
- 에피소드가 업로드되고 웹훅이 등록됩니다
- 완성된 대본이 타임스탬프와 함께 엔드포인트에 도착합니다
- 에이전트가 쇼 노트를 작성하고 챕터 마커를 만듭니다
"prompt": "챕터 제목이 포함된 쇼 노트를 작성해 줘"
영업 통화를 CRM으로
- 통화 녹음이 회의가 끝나자마자 전송됩니다
- 요약이 실행 항목으로 반환됩니다
- 에이전트가 이를 거래에 기록하고 다음 단계를 일정에 추가합니다
"prompt": "담당자와 날짜가 포함된 실행 항목을 나열해 줘"
이 모든 것은 동일한 세 개의 엔드포인트입니다. 달라지는 것은 보내는 프롬프트와 에이전트가 응답으로 수행하는 작업뿐입니다.
에이전트를 위해 설계됨
에이전트가 URL을 호출할 수 있다면 들을 수 있습니다
POST 하나, 업로드 하나, JSON 응답 하나. 채택할 SDK도, 설치할 런타임도, 결합할 프레임워크도 없습니다.
- Claude Code
Codex
Cursor
Hermes
OpenClaw
두 가지 진입 방법, 설치할 것 없음. MCP 서버를 연결하고 요청하거나, 에이전트를 문서로 안내하면 사용 사례에 필요한 클라이언트를 작성합니다.
에이전트에 붙여넣기
Read https://platform.getvoibe.com/docs.md and write me a client that
sends a meeting recording to the Voibe API and returns who said
what, with timestamps and a summary.
MCP 서버
Claude, Cursor, Codex, ChatGPT에서 사용하기
Voibe는 MCP 서버입니다. 한 번 연결하면 이미 사용 중인 AI 앱이 녹음을 전사하고, 결과를 읽고, 회의록을 확인할 수 있습니다. 코드가 필요 없습니다.
- 커넥터 추가 앱에 주소를 붙여넣으세요: Claude는 Connectors에서, Claude Code는 명령어 하나로, Cursor와 Codex는 설정 파일에서.
- 한 번 로그인 브라우저에서 Voibe를 승인하세요. 새 이메일 주소는 15분 무료 계정이 생성됩니다. 복사할 API 키가 없습니다.
- 요청 "이 녹음을 전사해 줘." 코딩 도구는 파일을 직접 업로드합니다. 채팅 앱은 업로드 링크를 제공합니다. 대본과 요약이 채팅에서 반환됩니다.
- 동일한 API, 동일한 계정, 동일한 결제: 오디오 초당 과금, 작업이 완료될 때만 청구됩니다.
MCP 주소
https://api.getvoibe.com/mcp
Claude Code
claude mcp add --transport http voibe https://api.getvoibe.com/mcp
-
create_transcription_job전사 시작 -
get_transcript상태, 그다음 대본과 요약 -
list_transcripts녹음 목록, 최신순 -
get_balance남은 시간(분) -
Claude
-
Claude Desktop
-
Cowork
-
Claude Code
-
Cursor
-
Codex
-
ChatGPT
-
VS Code
-
Hermes
-
OpenClaw
에이전트가 돌려받는 것
전사 API가 반환하는 것
요약기를 위한 두 번째 호출도, 별도의 화자 분리 서비스도, 그것들을 연결하는 접착 코드도 없습니다.
GET /v1/transcripts/{job_id}
{
"job_id": "a523721c-…",
"status": "DONE",
"title": "Pricing page review",
"audio_duration_seconds": 205.27,
"seconds_charged": 206,
"diarize": true,
"transcript": [
{ "speaker": "Priya", "start": 0.4, "end": 5.2,
"text": "Let's start with the pricing page. Where are we?" },
{ "speaker": "Tom", "start": 6.1, "end": 10.8,
"text": "Copy is done. I need a review before Thursday." }
],
"transcript_text": "Priya: Let's start with the pricing page…",
"summary": { "text": "Pricing page ships Friday. Tom owns the copy, Priya reviews on Thursday." },
"error": null
}
transcript누가 말했는지, 시작 및 종료 시간(초)이 포함된 모든 줄. 올바른 사람을 인용하고, 해당 순간으로 이동하거나, 요청한 사람에게 후속 작업을 전달하세요.transcript_text동일한 대본을 하나의 일반 문자열로, 프롬프트나 인덱스에 바로 넣을 준비가 된 상태.summary에이전트가 두 번째 모델 호출 없이 게시, 저장 또는 추론할 수 있는 짧은 요약. 녹음 제목도 함께 제공됩니다.
사용 사례
한 번 설정하면 매주 실행됩니다
통합을 직접 작성하지 않습니다. 이미 사용 중인 에이전트에게 반복 작업을 설명하면, 에이전트가 Voibe를 호출하는 스크립트를 일정에 맞춰 작성합니다.
제품 관리자
Claude Cowork 사용
일주일간의 고객 통화를 테마별 피드백 요약으로 전환하며, 그중 어떤 것도 듣지 않습니다.
에이전트에게 요청한 내용
"매주 금요일, 지난주 통화 녹음을 Voibe API로 보내고 상위 5개 테마를 각각 인용문과 고객 이름과 함께 알려줘."
개발자
Codex 사용
팀이 기록하는 모든 스탠드업 및 장애 통화의 검색 가능한 대본 인덱스를 유지합니다.
에이전트에게 요청한 내용
"버킷의 새 녹음을 Voibe API에 게시하고, JSON을 저장하고, transcript_text를 Postgres에 인덱싱하는 작업을 작성해 줘."
창업자
Hermes 사용
투자자 및 영업 통화를 하루가 끝나기 전에 후속 작업으로 전환합니다.
에이전트에게 요청한 내용
"통화 녹음이 도착하면 Voibe로 전사하고, 내가 약속한 것과 기한을 나열한 후속 이메일 초안을 작성해 줘."
콘텐츠 크리에이터
OpenClaw 사용
모든 새 에피소드를 하룻밤 사이에 쇼 노트, 챕터 마커, 클립 후보로 전환합니다.
에이전트에게 요청한 내용
"이 폴더를 감시해. 새 에피소드가 나타나면 Voibe로 전사하고 챕터, 쇼 노트, 타임스탬프가 있는 최고의 인용문 3개를 알려줘."
각각은 에이전트와의 한 번의 대화입니다. 에이전트가 MCP 서버에 연결하거나 문서를 읽고, 스크립트를 작성하고 일정을 잡습니다. 결과물을 검토하는 것은 사용자입니다.
가격
음성 텍스트 변환 API 가격
15분 무료, 이후에는 만료되지 않는 분을 구매하세요. 에이전트가 실제로 전사하는 오디오에 대해서만 지불: 구독 없음, 좌석 없음, 월 최소 금액 없음.
$50 오디오 시간당 $0.27
11,000분 · 183시간 오디오
15분 무료로 시작
카드 불필요. 오디오 초당 과금, 작업 완료 시 청구. 분은 만료되지 않습니다.
화자 분리
화자 분리: 에이전트가 누가 무엇을 말했는지 압니다
화자 라벨은 기본적으로 켜져 있습니다: 모든 줄에 화자 라벨과 시작 및 종료 시간(초)이 함께 반환됩니다. 구분할 수 있는 화자 수에 제한이 없으며, 사람들이 이름을 말하면 요약에서 그 이름을 사용합니다. 실행할 별도의 화자 분리 모델도, 추가 요금도 없습니다. 일반 대본이 필요하면 diarize를 false로 설정하세요.
- 누가 무엇을 약속했는지 추적하는 회의 에이전트
- 고객을 인용하는 지원 에이전트
- 인터뷰 및 팟캐스트 파이프라인
- 두 명 이상이 말하는 모든 곳
생성 호출의 한 필드
{ "diarize": true }
웹훅
비동기 전사: 에이전트가 실행하고 넘어갑니다
작업 생성 시 webhook_url을 전달하면 완료된 결과를 엔드포인트에 POST합니다. 에이전트 루프가 폴링에 막혀 있지 않습니다. 본문에는 이벤트 이름과 GET과 동일한 작업 본문이 포함되어 있어 하나의 핸들러가 두 경로를 모두 처리합니다.
생성 호출의 한 필드
{ "webhook_url": "https://you.dev/ready" }
조정 가능한 요약
에이전트가 필요로 하는 형태를 요청하세요
프롬프트를 전달하면 요약이 코드가 읽기 원하는 방식으로 반환됩니다: 결정 사항만, 실행 항목, 불릿 포인트. 에이전트는 두 번째 모델 호출 없이 사용 가능한 구조를 얻습니다. 최대 2,000자. 요약이 변경됩니다.
사용자의 지침, 사용자의 요약
{
"diarize": true,
"prompt": "summarise as bullet points, focus on decisions"
}
통합
코딩 에이전트가 연결하도록 하세요
포털에서 프롬프트 하나를 Claude Code, Codex, Cursor 또는 모든 코딩 에이전트에 복사하면 클라이언트를 작성합니다. 프롬프트에는 키가 이미 채워져 도착합니다. 녹음 전사만 필요한 경우 코드를 건너뛰세요: MCP 서버를 연결하고 요청하세요.
유용한 앱 구축
개발자가 음성 텍스트 변환 API로 구축하는 것
API는 화자 라벨이 있는 텍스트, 타임스탬프, 조정 가능한 요약을 제공합니다. 다음은 그로부터 나오는 제품들입니다.
회의 메모 작성기
녹음을 누가 무엇을 약속했는지 이름을 명시하는 노트로 전환합니다. 화자 라벨이 귀속을 담당하고, 프롬프트가 출력을 결정 사항과 담당자로 구성합니다.
검색 가능한 통화 아카이브
전체 텍스트 검색을 위해 transcript_text를 인덱싱하고 타임스탬프를 유지하여 해당 순간으로 바로 이동하세요. 화자별로 필터링하여 수개월간의 통화에서 한 사람이 말한 내용을 찾으세요.
자막 및 캡션
모든 줄에 시작 및 종료 시간(초)이 포함되어 있어 SRT 또는 VTT 파일에 필요한 전부입니다. 편집기를 건드리지 않고 전체 비디오 라이브러리에 자막을 추가하세요.
음성 메모를 작업으로
걷고 말하는 메모가 구조화된 작업이 됩니다. 담당자와 날짜가 포함된 실행 항목을 프롬프트에 요청한 다음 트래커에 바로 작성하세요.
통화 평가 및 코칭
상담원과 고객을 분리한 다음 자체 평가 기준으로 통화를 평가하세요. 이상치를 검토하세요.
제품을 위한 음성 인터페이스
사용자가 앱과 대화할 수 있게 하세요. 클립을 보내고, 에이전트가 라우팅할 수 있는 텍스트를 받고, 음성 인프라 구축을 건너뛰세요.
이 중 어떤 것도 다른 엔드포인트가 필요하지 않습니다. 대본, 화자, 요약이 모두 하나의 응답으로 도착합니다. 제품은 그것으로 무엇을 하는지입니다.
작동 방식
음성 텍스트 변환 API 작동 방식
세 개의 엔드포인트, 두 단계. 작업을 생성하고, 받은 서명된 URL로 오디오를 업로드한 다음, 결과를 폴링하거나 웹훅이 가져오게 하세요.
- POST /v1/transcripts 작업을 시작하고 서명된 업로드 URL을 반환합니다.
- GET /v1/transcripts/{job_id} 상태, 대본, 요약을 반환합니다.
- GET /v1/transcripts 작업 목록을 페이지당 최대 200개까지 반환합니다.
- 오디오는 서명된 URL로 스토리지에 직접 전송되므로 대용량 파일이 API 요청을 통과하지 않습니다. 최대 200MB 파일; URL은 5시간 동안 유효합니다.
오디오 업로드
curl -s -X PUT "$UPLOAD_URL" \
-H "Content-Type: application/octet-stream" \
--data-binary @pricing-meeting.mp3
신뢰와 안정성
오디오 제로 보존
녹음은 대본이 존재하는 순간 삭제됩니다. 절대 보관되지 않으며, 모델 훈련에 사용되지 않습니다.
-
전사 후 오디오 삭제
녹음은 대본이 생성된 후 제거됩니다. -
모델 훈련에 절대 사용되지 않음
보내는 어떤 것도 모델 훈련에 사용되지 않습니다. 녹음은 사용자의 것입니다. -
모든 읽기는 계정 범위로 제한
작업은 생성한 계정만 읽을 수 있습니다. -
실패한 작업은 청구되지 않음
작업이 DONE에 도달할 때만 지불합니다. 대기 중, 처리 중, 실패한 작업은 비용이 들지 않으므로 재시도도 비용이 들지 않습니다.
대본은 작업 완료 후 24시간 동안 GET /v1/transcripts를 통해 읽을 수 있으므로 에이전트가 오디오를 다시 보내지 않고 결과를 다시 가져올 수 있습니다.
음성 텍스트 변환 API FAQ
AI 에이전트를 위한 최고의 음성 텍스트 변환 API는 무엇인가요?
에이전트가 통합을 기다리지 않고 사용할 수 있는 API입니다. Voibe의 API는 일반 HTTP입니다: 작업 시작을 위한 POST 하나, 업로드 하나, 대본, 화자 라벨, 타임스탬프, 요약이 포함된 JSON 응답 하나. 설치할 SDK도, 약속할 프레임워크도 없습니다. 또한 https://api.getvoibe.com/mcp, 에 MCP 서버가 있어 Claude, Claude Code, Cursor, Codex, ChatGPT가 직접 연결합니다. 자체 코드의 경우 에이전트를 https://platform.getvoibe.com/docs.md 으로 안내하면 사용 사례에 필요한 호출을 알아냅니다. 모든 새 계정은 카드 없이 15분 무료로 시작합니다.
Voibe 음성 텍스트 변환 API에 MCP 서버가 있나요?
네. Voibe MCP 서버는 https://api.getvoibe.com/mcp. 에 있습니다. Claude, Claude Code, Cursor, Codex, ChatGPT 또는 VS Code에 사용자 지정 커넥터 또는 구성 블록 하나로 추가하고, 한 번 로그인한 다음, 앱에 녹음 전사를 요청하세요. 네 가지 도구를 제공합니다: 전사 시작, 대본 가져오기, 전사 목록, 남은 시간 확인. API와 동일한 계정, 동일한 분, 동일한 초당 과금을 사용합니다.
Claude가 Voibe로 회의 녹음을 전사할 수 있나요?
네. Claude에서 Customize, Connectors를 열고, +를 클릭하고, Add custom connector를 선택하고, https://api.getvoibe.com/mcp 을 붙여넣고 로그인하세요. 그런 다음 Claude에 녹음 전사를 요청하세요. Claude는 컴퓨터의 파일을 읽을 수 없으므로 업로드 링크를 제공합니다. 파일을 넣으면 Claude가 대본과 요약을 가져옵니다. 이 기능은 웹의 Claude, Claude Desktop, Cowork에서 작동합니다.
Claude Code, Cursor 또는 Codex에서 오디오를 어떻게 전사하나요?
Voibe MCP 서버를 연결하고 요청하세요. Claude Code의 경우 claude mcp add --transport http voibe https://api.getvoibe.com/mcp, 를 실행하고 세션에서 /mcp를 입력한 후 로그인하세요. Cursor와 Codex는 구성 파일에 블록 하나를 추가합니다. 그런 다음 에이전트에 파일 전사를 요청하세요: 파일을 직접 업로드하고 화자 라벨이 있는 대본과 요약을 반환합니다. 모든 앱의 설정은 https://platform.getvoibe.com/docs/mcp. 에 있습니다.
API가 다른 화자를 식별하고 이름을 알 수 있나요? 네. 화자 라벨은 기본적으로 켜져 있습니다. 모든 줄에는 화자 라벨과 시작 및 종료 시간(초)이 함께 반환됩니다. 화자는 speaker_0, speaker_1 등으로 표시되며, 녹음 내에서 일관되게 유지되고 구분되는 화자 수에 상한은 없습니다. 요약과 제목은 녹음에 사람 이름이 나올 때(예: 누군가 자신을 소개하거나 이름으로 호명될 때) 그 이름을 사용합니다. 화자 분리 기능은 가격에 포함되어 있습니다. 일반 텍스트 전사본만 원하면 diarize를 false로 설정하세요.
어떤 오디오 형식, 파일 크기 및 속도 제한이 적용되나요?
mp3, wav, m4a, mp4, flac, ogg 및 webm 파일은 바로 처리됩니다. 다른 오디오 및 비디오 파일은 오디오를 읽을 수 있는 경우 먼저 변환됩니다. 형식은 파일 내용에서 읽힙니다. 각 파일은 최대 200MB까지 가능하며, 업로드 URL은 5시간 동안 유효합니다. 속도 제한은 계정당 분당 50개 작업, 하루 1,000개 작업입니다. 이를 초과하면 create 호출이 429를 반환하므로 잠시 기다렸다가 다시 시도하세요.
음성 텍스트 변환 API는 어떤 언어를 지원하나요?
음성 및 요약 모델은 다국어를 지원하므로 녹음이 영어일 필요는 없습니다. 화자 분리 기능은 모든 언어에서 동일하게 작동합니다.
결과를 얻기 위해 폴링해야 하나요?
아니요. 작업을 만들 때 webhook_url을 전달하면 준비되는 즉시 완료된 결과를 엔드포인트로 POST합니다. 본문에는 transcript.completed 또는 transcript.failed 이벤트 이름과 GET /v1/transcripts/{job_id}와 동일한 작업 본문이 포함되므로 하나의 핸들러로 두 경우 모두 처리할 수 있습니다. 원한다면 폴링도 계속 사용할 수 있습니다.
요금은 어떻게 청구되며, 분은 만료되나요?
오디오 1초당 요금이 청구되며, 1초 단위로 올림 처리됩니다. 3분 24초 파일은 3분 24초로 청구됩니다. 작업이 DONE 상태에 도달했을 때만 요금이 청구되므로 대기 중, 처리 중, 실패한 작업은 비용이 들지 않습니다. 모든 새 계정은 15분 무료로 시작하며 카드는 필요 없습니다. 이후에는 일회성 팩으로 분을 구매할 수 있으며, 2,000분에 $10부터 시작합니다. 분은 만료되지 않으며 구독이나 월 최소 사용량도 없습니다.
작업이 실패하면 어떻게 되나요?
요금이 청구되지 않습니다. 작업은 FAILED 상태와 함께 반환되며, 오류 필드에 문제가 무엇인지 평이한 언어로 설명됩니다(예: 오디오 길이에 비해 분이 부족하거나 24시간 내에 파일이 도착하지 않은 경우). 남은 분이 전혀 없으면 업로드 전에 create 호출이 402로 거부되므로 아무것도 전송되지 않습니다.
내 오디오가 저장되거나 모델 학습에 사용되나요?
오디오는 전사 후 삭제되며 모델 학습에 사용되지 않습니다. 전사본과 요약은 작업 완료 후 24시간 동안 읽을 수 있으며 그 후 삭제됩니다. 작업의 제목, 길이 및 비용은 기록에 남습니다. 모든 읽기는 계정 범위로 제한되므로 자신의 작업만 볼 수 있습니다. 음성 텍스트 변환은 Whisper large-v3-turbo에서 실행되고, 화자 분리는 pyannote community-1에서, 요약은 gpt-oss-120b에서 실행됩니다.
직접 Whisper를 실행하는 것과 어떻게 다른가요?
실행할 인프라, 유지할 GPU, 관리할 확장 작업이 없습니다. 화자 분리와 요약은 전사본과 동일한 응답으로 반환되며, 두 번째 모델이나 연결 코드가 필요 없습니다. 전사된 오디오 1초당 비용을 지불하며 서버 시간에 대한 비용은 없습니다.