WhichModel
Enrutamiento de modelos LLM optimizado en costos para agentes autónomos
Documentación
whichmodel-mcp
Un asesor de enrutamiento de modelos para agentes autónomos: obtén recomendaciones de LLM optimizadas en costos a través de MCP.
whichmodel.dev rastrea precios y capacidades en más de 100 modelos de LLM, actualizados cada 4 horas. Este servidor MCP expone esos datos para que los agentes de IA puedan elegir el modelo adecuado al mejor precio para cada tarea.
Endpoint MCP
https://whichmodel.dev/mcp
Transporte: HTTP transmisible (especificación MCP 2025-03-26)
Inicio rápido
Agrega a la configuración de tu cliente MCP:
{
"mcpServers": {
"whichmodel": {
"url": "https://whichmodel.dev/mcp"
}
}
}
No se requiere clave API. No se necesita instalación.
Stdio (clientes locales)
Para clientes MCP que usan transporte stdio (Claude Desktop, Cursor, etc.):
{
"mcpServers": {
"whichmodel": {
"command": "npx",
"args": ["-y", "whichmodel-mcp"]
}
}
}
Esto ejecuta un proxy local ligero que reenvía solicitudes al servidor remoto.
Herramientas
recommend_model
Obtén una recomendación de modelo optimizada en costos para un tipo de tarea, complejidad y presupuesto específicos.
| Parámetro | Tipo | Descripción |
|---|---|---|
task_type | enum (obligatorio) | chat, code_generation, code_review, summarisation, translation, data_extraction, tool_calling, creative_writing, research, classification, embedding, vision, reasoning |
complexity | low | medium | high | Complejidad de la tarea (predeterminado: medium) |
estimated_input_tokens | número | Tamaño esperado de entrada en tokens |
estimated_output_tokens | número | Tamaño esperado de salida en tokens |
budget_per_call | número | Gasto máximo en USD por llamada |
requirements | objeto | Requisitos de capacidad: tool_calling, json_output, streaming, context_window_min, providers_include, providers_exclude |
Devuelve: modelo recomendado, alternativa, opción económica, estimación de costos y justificación.
compare_models
Comparación directa de 2 a 5 modelos con proyecciones de costos por volumen opcionales.
| Parámetro | Tipo | Descripción |
|---|---|---|
models | string[] (obligatorio) | IDs de modelos, p. ej. [anthropic/claude-sonnet-4, openai/gpt-4.1] |
task_type | enum | Contexto para la comparación |
volume | objeto | calls_per_day, avg_input_tokens, avg_output_tokens para proyecciones de costos diarios/mensuales |
Devuelve: precios, capacidades, niveles de calidad y costos proyectados por modelo.
get_pricing
Consulta de datos de precios sin procesar con filtros por modelo, proveedor, límite de precio y capacidades.
| Parámetro | Tipo | Descripción |
|---|---|---|
model_id | string | ID de modelo específico |
provider | string | Filtrar por proveedor, p. ej. anthropic |
max_input_price | número | Precio máximo de entrada por millón de tokens (USD) |
capabilities | string[] | Capacidades requeridas: tool_calling, json_output, streaming, vision |
min_context_window | número | Ventana de contexto mínima en tokens |
limit | número | Resultados máximos (1–100, predeterminado 20) |
check_price_changes
Consulta qué precios de modelos han cambiado desde una fecha determinada.
| Parámetro | Tipo | Descripción |
|---|---|---|
since | string (obligatorio) | Fecha ISO, p. ej. 2026-04-01 |
model_id | string | Filtrar a un modelo específico |
provider | string | Filtrar a un proveedor específico |
Devuelve: aumentos de precios, disminuciones, modelos nuevos y descontinuaciones.
Integración con agentes
WhichModel está diseñado para ser una herramienta predeterminada en los flujos de agentes autónomos. Agrégala a cualquier agente para que pueda elegir el modelo adecuado al precio correcto para cada subtarea automáticamente.
Prompt del sistema (copiar y pegar)
Agrega este bloque al prompt del sistema de tu agente:
You have access to the WhichModel MCP server for cost-aware model selection.
Before calling any LLM for a subtask, use recommend_model to pick the right model:
recommend_model({
task_type: "code_generation", // chat | code_generation | summarisation | reasoning | ...
complexity: "medium", // low | medium | high
estimated_input_tokens: 2000, // optional
estimated_output_tokens: 500, // optional
budget_per_call: 0.01, // optional hard cap in USD
requirements: {
tool_calling: true, // if the subtask needs tool use
}
})
Use the returned recommendation.model_id. The response includes cost_estimate and
reasoning so you can log why each model was chosen.
Plantillas de prompt vía MCP
El servidor expone plantillas de prompt integradas que puedes obtener mediante prompts/get:
| Nombre del prompt | Caso de uso |
|---|---|
cost-aware-agent | Bloque completo de prompt del sistema para selección de modelos consciente de costos |
task-router-snippet | Fragmento mínimo para agregar a un prompt del sistema existente |
budget-constrained-agent | Límite de costo estricto por llamada (pasa el argumento budget_usd) |
Recupéralas programáticamente:
{ "method": "prompts/get", "params": { "name": "cost-aware-agent" } }
Integraciones con frameworks
- LangChain:
langchain-whichmodel— cadenaWhichModelRouter - Haystack:
whichmodel-haystack— componenteWhichModelRouter
Frescura de los datos
Los datos de precios se actualizan cada 4 horas desde OpenRouter. Cada respuesta incluye una marca de tiempo data_freshness para que sepas qué tan actualizados están los datos.
Enlaces
- Sitio web: whichmodel.dev
- Endpoint MCP: https://whichmodel.dev/mcp
- Descubrimiento: https://whichmodel.dev/.well-known/mcp.json
- Registro nAIm: naim.janis7ewski.org — registro de servicios de IA; explora la categoría LLM para encontrar WhichModel como fuente de precios en vivo y enlazar directamente al endpoint MCP