LLMTest

Proxy de LLM que evalúa modelos de IA con indicaciones reales y encuentra alternativas más rápidas y económicas entre más de 340 modelos.

Documentación

Servidor MCP de LLMTest

npm version MIT License

Servidor MCP que evalúa modelos de IA con tus prompts reales y encuentra alternativas más baratas y rápidas. Funciona con Claude Code, Cursor, Windsurf y cualquier herramienta compatible con MCP.

Inicio Rápido

1. Obtén tu clave de API

Regístrate en llmtest.io y obtén tu clave de API desde el panel de control.

2. Añádelo a tu herramienta

Claude Code:

claude mcp add llmtest -- npx llmtest-mcp

Luego configura tu clave:

export LLMTEST_API_KEY=llmt_your_key_here

Cursor / Windsurf / Otros clientes MCP:

Añádelo a tu archivo de configuración de MCP:

{
  "mcpServers": {
    "llmtest": {
      "command": "npx",
      "args": ["llmtest-mcp"],
      "env": {
        "LLMTEST_API_KEY": "llmt_your_key_here"
      }
    }
  }
}

3. Habla con tu IA

Solo pregunta en lenguaje natural:

  • "Revisa mi estado de LLMTest"
  • "Encuentra modelos más baratos para mis llamadas de IA"
  • "Ejecuta un benchmark en mi flujo de escritor de blog"
  • "¿Qué modelos están en tendencia?"

Cómo Funciona

LLMTest es un proxy que se sitúa entre tu aplicación y los proveedores de IA. Apunta tu aplicación a https://llmtest.io/v1 en lugar de llamar directamente a OpenAI/Anthropic, y LLMTest rastrea tu uso, evalúa alternativas y sugiere ahorros de costos.

Este servidor MCP le da a tu asistente de IA acceso a las herramientas de LLMTest para que pueda gestionar todo por ti.

Herramientas Disponibles

HerramientaDescripción
statusMuestra el estado del proxy y un resumen de actividad
list_flowsLista todos los flujos de IA con estadísticas de costo y latencia
get_suggestionsObtén recomendaciones pendientes de cambio de modelo
update_suggestionAcepta o descarta una sugerencia
run_benchmarkEvalúa un flujo contra modelos retadores
optimize_promptReescribe el prompt de un flujo y encuentra un modelo más barato que siga funcionando
seed_samplesAñade prompts de prueba para evaluación previa al lanzamiento
list_samplesMuestra las muestras de prueba almacenadas por flujo
list_new_modelsMuestra modelos nuevos y en tendencia
get_accountRevisa el saldo de créditos y el uso
get_autopilot_statusComprueba si el autopiloto está activado y si la cuenta es elegible
enable_autopilotActiva la auto-optimización semanal con compuertas de seguridad y reversión automática basada en deriva
disable_autopilotDesactiva el autopiloto (las optimizaciones existentes permanecen activas)
list_active_optimizationsLista las optimizaciones auto-aceptadas que aún están dentro de su ventana de reversión de 24 horas
revert_optimizationRevierte una optimización auto-aceptada al prompt anterior

Autopiloto

El autopiloto optimiza automáticamente tus flujos con una cadencia semanal. Los cambios que pasan todas las compuertas de seguridad se activan con una ventana de reversión de 24 horas. La detección de deriva sigue comprobando después de eso y revierte si la calidad baja.

Para habilitarlo desde tu IDE: pide a tu asistente de IA algo como "habilita el autopiloto de LLMTest". Llamará a enable_autopilot. Usa get_autopilot_status para confirmar los requisitos previos.

Requisitos previos (verificados por flujo en cada ciclo):

  • Autopiloto habilitado en la cuenta
  • Correo electrónico verificado
  • Antigüedad de la cuenta ≥ 14 días (rampa de confianza)
  • El flujo tiene ≥ 20 llamadas reales en los últimos 7 días
  • El flujo no ha sido optimizado por el autopiloto en los últimos 14 días (período de enfriamiento)
  • Saldo de crédito positivo (~$1–2 por ejecución)

Compuertas de seguridad (todas deben pasar para la auto-aceptación): límite inferior del IC del 95% > 50% de tasa de victoria, acuerdo multi-juez ≥ 80%, ahorro total ≥ 20%, sin advertencia de sesgo de longitud, verificación de regresión del conjunto dorado.

Reversión: ventana de 24 horas después de la auto-aceptación. Después de eso, solo la detección de deriva puede revertir.

Flujo de Trabajo Típico

Antes del lanzamiento (sin tráfico aún):

  1. Dile a tu IA: "Estoy construyendo un chatbot de soporte usando gpt-4o"
  2. Siembra muestras de prueba realistas con seed_samples
  3. Ejecuta run_benchmark para comparar modelos
  4. Te muestra get_suggestions con alternativas más baratas

Después del lanzamiento (con tráfico real):

  1. Enruta tus llamadas de IA a través de https://llmtest.io/v1
  2. LLMTest monitorea el uso y hace auto-evaluación cuando los flujos alcanzan 50+ llamadas
  3. Pregunta "¿alguna sugerencia de ahorro de costos?" para ver recomendaciones
  4. Acepta una sugerencia y actualiza tu código

Variables de Entorno

VariableRequeridaDescripción
LLMTEST_API_KEYSíTu clave de API de llmtest.io/dashboard
LLMTEST_BASE_URLNoURL de API personalizada (por defecto https://llmtest.io)

Enlaces

Licencia

MIT