LLMTest
Proxy de LLM que evalúa modelos de IA con indicaciones reales y encuentra alternativas más rápidas y económicas entre más de 340 modelos.
Documentación
Servidor MCP de LLMTest
Servidor MCP que evalúa modelos de IA con tus prompts reales y encuentra alternativas más baratas y rápidas. Funciona con Claude Code, Cursor, Windsurf y cualquier herramienta compatible con MCP.
Inicio Rápido
1. Obtén tu clave de API
Regístrate en llmtest.io y obtén tu clave de API desde el panel de control.
2. Añádelo a tu herramienta
Claude Code:
claude mcp add llmtest -- npx llmtest-mcp
Luego configura tu clave:
export LLMTEST_API_KEY=llmt_your_key_here
Cursor / Windsurf / Otros clientes MCP:
Añádelo a tu archivo de configuración de MCP:
{
"mcpServers": {
"llmtest": {
"command": "npx",
"args": ["llmtest-mcp"],
"env": {
"LLMTEST_API_KEY": "llmt_your_key_here"
}
}
}
}
3. Habla con tu IA
Solo pregunta en lenguaje natural:
- "Revisa mi estado de LLMTest"
- "Encuentra modelos más baratos para mis llamadas de IA"
- "Ejecuta un benchmark en mi flujo de escritor de blog"
- "¿Qué modelos están en tendencia?"
Cómo Funciona
LLMTest es un proxy que se sitúa entre tu aplicación y los proveedores de IA. Apunta tu aplicación a https://llmtest.io/v1 en lugar de llamar directamente a OpenAI/Anthropic, y LLMTest rastrea tu uso, evalúa alternativas y sugiere ahorros de costos.
Este servidor MCP le da a tu asistente de IA acceso a las herramientas de LLMTest para que pueda gestionar todo por ti.
Herramientas Disponibles
| Herramienta | Descripción |
|---|---|
status | Muestra el estado del proxy y un resumen de actividad |
list_flows | Lista todos los flujos de IA con estadísticas de costo y latencia |
get_suggestions | Obtén recomendaciones pendientes de cambio de modelo |
update_suggestion | Acepta o descarta una sugerencia |
run_benchmark | Evalúa un flujo contra modelos retadores |
optimize_prompt | Reescribe el prompt de un flujo y encuentra un modelo más barato que siga funcionando |
seed_samples | Añade prompts de prueba para evaluación previa al lanzamiento |
list_samples | Muestra las muestras de prueba almacenadas por flujo |
list_new_models | Muestra modelos nuevos y en tendencia |
get_account | Revisa el saldo de créditos y el uso |
get_autopilot_status | Comprueba si el autopiloto está activado y si la cuenta es elegible |
enable_autopilot | Activa la auto-optimización semanal con compuertas de seguridad y reversión automática basada en deriva |
disable_autopilot | Desactiva el autopiloto (las optimizaciones existentes permanecen activas) |
list_active_optimizations | Lista las optimizaciones auto-aceptadas que aún están dentro de su ventana de reversión de 24 horas |
revert_optimization | Revierte una optimización auto-aceptada al prompt anterior |
Autopiloto
El autopiloto optimiza automáticamente tus flujos con una cadencia semanal. Los cambios que pasan todas las compuertas de seguridad se activan con una ventana de reversión de 24 horas. La detección de deriva sigue comprobando después de eso y revierte si la calidad baja.
Para habilitarlo desde tu IDE: pide a tu asistente de IA algo como "habilita el autopiloto de LLMTest". Llamará a enable_autopilot. Usa get_autopilot_status para confirmar los requisitos previos.
Requisitos previos (verificados por flujo en cada ciclo):
- Autopiloto habilitado en la cuenta
- Correo electrónico verificado
- Antigüedad de la cuenta ≥ 14 días (rampa de confianza)
- El flujo tiene ≥ 20 llamadas reales en los últimos 7 días
- El flujo no ha sido optimizado por el autopiloto en los últimos 14 días (período de enfriamiento)
- Saldo de crédito positivo (~$1–2 por ejecución)
Compuertas de seguridad (todas deben pasar para la auto-aceptación): límite inferior del IC del 95% > 50% de tasa de victoria, acuerdo multi-juez ≥ 80%, ahorro total ≥ 20%, sin advertencia de sesgo de longitud, verificación de regresión del conjunto dorado.
Reversión: ventana de 24 horas después de la auto-aceptación. Después de eso, solo la detección de deriva puede revertir.
Flujo de Trabajo Típico
Antes del lanzamiento (sin tráfico aún):
- Dile a tu IA: "Estoy construyendo un chatbot de soporte usando gpt-4o"
- Siembra muestras de prueba realistas con
seed_samples - Ejecuta
run_benchmarkpara comparar modelos - Te muestra
get_suggestionscon alternativas más baratas
Después del lanzamiento (con tráfico real):
- Enruta tus llamadas de IA a través de
https://llmtest.io/v1 - LLMTest monitorea el uso y hace auto-evaluación cuando los flujos alcanzan 50+ llamadas
- Pregunta "¿alguna sugerencia de ahorro de costos?" para ver recomendaciones
- Acepta una sugerencia y actualiza tu código
Variables de Entorno
| Variable | Requerida | Descripción |
|---|---|---|
LLMTEST_API_KEY | Sí | Tu clave de API de llmtest.io/dashboard |
LLMTEST_BASE_URL | No | URL de API personalizada (por defecto https://llmtest.io) |
Enlaces
Licencia
MIT