VoiceVox

Un servidor para conversión de texto a voz (TTS) que utiliza el motor VoiceVox.

Documentación

Image

🤖 Servidor MCP Agent VRM

Python 3.10+ License: MIT Ruff Pytest

GitHub Repo stars GitHub forks GitHub release GitHub tag

Es un servidor de Model Context Protocol que proporciona funciones de avatar VRM a través de AgentVRM. Con este servidor, Claude puede generar voz a partir de texto utilizando los avatares VRM que ofrece el motor AgentVRM y expresarlos como avatares 3D.


🎥 Video de demostración

https://github.com/user-attachments/assets/ea4b736d-a326-45b0-be88-b01fff6dc3f3

✨ Funciones

  • Lectura de texto: Lee el texto especificado con el avatar VRM de AgentVRM.
  • Visualización de avatar VRM: El avatar VRM 3D lee el texto y también expresa expresiones faciales y animaciones.
  • Reproducción automática de audio: Reproduce automáticamente el audio generado en el momento.
  • Guardado de archivos de audio: El audio generado se guarda como archivo .wav en la carpeta assets.

🚀 Requisitos previos

  • Que el motor AgentVRM esté en funcionamiento (local o remotamente)
  • Python 3.10 o superior

📦 Instalación

Uso de uv (recomendado)

Si se usa uv, no se necesita ninguna instalación especial. Ejecute agent-vrm-mcp directamente usando uvx.

⚙️ Configuración

Motor AgentVRM

Este servidor necesita el motor AgentVRM para funcionar. El motor debe iniciarse manualmente. Por defecto, intenta conectarse a http://localhost:3001/api/speak_text. Se puede especificar otra URL con el argumento --api-url.

El motor AgentVRM se puede descargar e instalar desde el repositorio oficial de AgentVRM.

Configuración para Claude Desktop

Añadir a la configuración de Claude Desktop:

Cuando se usa uvx
{
  "mcpServers": {
    "vrm": {
      "command": "uvx",
      "args": ["agent-vrm-mcp", "--api-url=http://localhost:3001/api/speak_text"]
    }
  }
}

🛠️ Herramientas disponibles

  • speak_text - Convierte texto a voz usando AgentVRM y lo expresa con un avatar VRM
    • Argumentos obligatorios:
      • text (cadena): Texto a convertir en voz
    • Argumentos opcionales:
      • speaker_id (entero, predeterminado: 1): ID del hablante a utilizar
      • speed_scale (numérico, predeterminado: 1.0): Multiplicador de velocidad de reproducción
      • auto_play (booleano, predeterminado: True): Si se reproduce automáticamente después de la generación

🎵 Funciones especiales

  • El audio generado se reproduce automáticamente de forma específica para cada plataforma:
    • Windows: Usa el reproductor predeterminado del sistema
    • macOS: Usa la utilidad integrada afplay
    • Linux: Primero intenta con aplay y, si falla, recurre a xdg-open

📁 Estructura del proyecto

🧑‍💻 Procedimiento de configuración y ejecución en modo de desarrollo

Para desarrolladores, se resumen los pasos de instalación en modo de desarrollo usando uv y la ejecución con MCP Inspector.

# プロジェクトディレクトリで開発モードでインストール
cd C:\Prj\agent-vrm-mcp
uv sync

# 開発モードでパッケージをインストール
uv pip install -e .

# MCP Inspector で実行
npx @modelcontextprotocol/inspector python -m agent_vrm_mcp --api-url=http://localhost:3001/api/speak_text
  • Sincronice los paquetes de dependencias con uv sync.
  • Realice la instalación en modo de desarrollo (instalación editable) con uv pip install -e ..
  • Usando MCP Inspector, puede iniciar el servidor agent_vrm_mcp especificando el endpoint de API.

📄 Licencia

agent-vrm-mcp se proporciona bajo la licencia MIT. Esto significa que puede usarse, modificarse y distribuirse libremente de acuerdo con los términos de la licencia MIT.

🔗 Enlaces