VoiceVox

Um servidor para conversão de texto em fala (TTS) usando o mecanismo VoiceVox.

Documentação

Image

🤖 Servidor MCP Agent VRM

Python 3.10+ License: MIT Ruff Pytest

GitHub Repo stars GitHub forks GitHub release GitHub tag

É um servidor Model Context Protocol que fornece funcionalidades de avatar VRM por meio do AgentVRM. Com este servidor, o Claude pode gerar voz a partir de texto usando os avatares VRM fornecidos pelo mecanismo AgentVRM e expressá-los como avatares 3D.


🎥 Vídeo de demonstração

https://github.com/user-attachments/assets/ea4b736d-a326-45b0-be88-b01fff6dc3f3

✨ Recursos

  • Leitura de texto: Lê o texto especificado usando o avatar VRM do AgentVRM.
  • Exibição de avatar VRM: O avatar VRM 3D lê o texto e também expressa expressões faciais e animações.
  • Reprodução automática de áudio: Reproduz automaticamente o áudio gerado no local.
  • Salvamento de arquivo de áudio: O áudio gerado é salvo como arquivo .wav na pasta assets.

🚀 Pré-requisitos

  • O mecanismo AgentVRM deve estar em execução (local ou remotamente)
  • Python 3.10 ou superior

📦 Instalação

Usando uv (recomendado)

Ao usar uv, nenhuma instalação especial é necessária. Execute agent-vrm-mcp diretamente usando uvx.

⚙️ Configuração

Mecanismo AgentVRM

Este servidor requer o mecanismo AgentVRM para funcionar. O mecanismo deve ser iniciado manualmente. Por padrão, tenta conectar-se a http://localhost:3001/api/speak_text. Você pode especificar uma URL diferente com o argumento --api-url.

O mecanismo AgentVRM pode ser baixado e instalado a partir do repositório oficial do AgentVRM.

Configuração para Claude Desktop

Adicione à configuração do Claude Desktop:

Ao usar uvx
{
  "mcpServers": {
    "vrm": {
      "command": "uvx",
      "args": ["agent-vrm-mcp", "--api-url=http://localhost:3001/api/speak_text"]
    }
  }
}

🛠️ Ferramentas disponíveis

  • speak_text - Converte texto em voz usando AgentVRM e expressa com avatar VRM
    • Argumentos obrigatórios:
      • text (string): Texto a ser convertido em voz
    • Argumentos opcionais:
      • speaker_id (inteiro, padrão: 1): ID do falante a ser usado
      • speed_scale (numérico, padrão: 1.0): Fator de velocidade de reprodução
      • auto_play (booleano, padrão: True): Se deve reproduzir automaticamente após a geração

🎵 Recursos especiais

  • O áudio gerado é reproduzido automaticamente de forma específica da plataforma:
    • Windows: Usa o player padrão do sistema
    • macOS: Usa o utilitário integrado afplay
    • Linux: Tenta aplay primeiro e, se falhar, usa xdg-open como alternativa

📁 Estrutura do projeto

🧑‍💻 Procedimentos de configuração e execução em modo de desenvolvimento

Para desenvolvedores, resumimos os procedimentos de instalação em modo de desenvolvimento usando uv e execução com o MCP Inspector.

# プロジェクトディレクトリで開発モードでインストール
cd C:\Prj\agent-vrm-mcp
uv sync

# 開発モードでパッケージをインストール
uv pip install -e .

# MCP Inspector で実行
npx @modelcontextprotocol/inspector python -m agent_vrm_mcp --api-url=http://localhost:3001/api/speak_text
  • Sincronize os pacotes de dependência com uv sync.
  • Execute o modo de desenvolvimento (instalação editável) com uv pip install -e ..
  • Usando o MCP Inspector, você pode iniciar o servidor agent_vrm_mcp especificando o endpoint da API.

📄 Licença

agent-vrm-mcp é fornecido sob a licença MIT. Isso significa que você pode usá-lo, modificá-lo e distribuí-lo livremente, de acordo com os termos da licença MIT.

🔗 Links