WhichModel
Roteamento otimizado de custos de modelos LLM para agentes autônomos
Documentação
whichmodel-mcp
Um consultor de roteamento de modelos para agentes autônomos — obtenha recomendações de LLM otimizadas por custo via MCP.
whichmodel.dev rastreia preços e capacidades de mais de 100 modelos de LLM, atualizados a cada 4 horas. Este servidor MCP expõe esses dados para que agentes de IA possam escolher o modelo certo pelo melhor preço para cada tarefa.
Endpoint MCP
https://whichmodel.dev/mcp
Transporte: HTTP Streamable (especificação MCP 2025-03-26)
Início Rápido
Adicione à configuração do seu cliente MCP:
{
"mcpServers": {
"whichmodel": {
"url": "https://whichmodel.dev/mcp"
}
}
}
Nenhuma chave de API necessária. Nenhuma instalação necessária.
Stdio (clientes locais)
Para clientes MCP que usam transporte stdio (Claude Desktop, Cursor, etc.):
{
"mcpServers": {
"whichmodel": {
"command": "npx",
"args": ["-y", "whichmodel-mcp"]
}
}
}
Isso executa um proxy local leve que encaminha solicitações para o servidor remoto.
Ferramentas
recommend_model
Obtenha uma recomendação de modelo otimizada por custo para um tipo de tarefa, complexidade e orçamento específicos.
| Parâmetro | Tipo | Descrição |
|---|---|---|
task_type | enum (obrigatório) | chat, code_generation, code_review, summarisation, translation, data_extraction, tool_calling, creative_writing, research, classification, embedding, vision, reasoning |
complexity | low | medium | high | Complexidade da tarefa (padrão: medium) |
estimated_input_tokens | número | Tamanho esperado de entrada em tokens |
estimated_output_tokens | número | Tamanho esperado de saída em tokens |
budget_per_call | número | Gasto máximo em USD por chamada |
requirements | objeto | Requisitos de capacidade: tool_calling, json_output, streaming, context_window_min, providers_include, providers_exclude |
Retorna: modelo recomendado, alternativa, opção econômica, estimativa de custo e justificativa.
compare_models
Comparação direta de 2 a 5 modelos com projeções opcionais de custo por volume.
| Parâmetro | Tipo | Descrição |
|---|---|---|
models | string[] (obrigatório) | IDs de modelos, ex.: [anthropic/claude-sonnet-4, openai/gpt-4.1] |
task_type | enum | Contexto para comparação |
volume | objeto | calls_per_day, avg_input_tokens, avg_output_tokens para projeções de custo diário/mensal |
Retorna: preços, capacidades, níveis de qualidade e custos projetados por modelo.
get_pricing
Consulta de dados brutos de preços com filtros por modelo, provedor, teto de preço e capacidades.
| Parâmetro | Tipo | Descrição |
|---|---|---|
model_id | string | ID específico do modelo |
provider | string | Filtrar por provedor, ex.: anthropic |
max_input_price | número | Preço máximo de entrada por milhão de tokens (USD) |
capabilities | string[] | Capacidades necessárias: tool_calling, json_output, streaming, vision |
min_context_window | número | Janela de contexto mínima em tokens |
limit | número | Máximo de resultados (1–100, padrão 20) |
check_price_changes
Veja quais preços de modelos mudaram desde uma determinada data.
| Parâmetro | Tipo | Descrição |
|---|---|---|
since | string (obrigatório) | Data ISO, ex.: 2026-04-01 |
model_id | string | Filtrar para um modelo específico |
provider | string | Filtrar para um provedor específico |
Retorna: aumentos de preço, reduções, novos modelos e descontinuações.
Integração com Agentes
O WhichModel foi projetado para ser uma ferramenta padrão em pipelines de agentes autônomos. Adicione-o a qualquer agente para que ele possa escolher o modelo certo pelo preço certo para cada subtarefa automaticamente.
Prompt do sistema (copiar e colar)
Adicione este bloco ao prompt do sistema do seu agente:
You have access to the WhichModel MCP server for cost-aware model selection.
Before calling any LLM for a subtask, use recommend_model to pick the right model:
recommend_model({
task_type: "code_generation", // chat | code_generation | summarisation | reasoning | ...
complexity: "medium", // low | medium | high
estimated_input_tokens: 2000, // optional
estimated_output_tokens: 500, // optional
budget_per_call: 0.01, // optional hard cap in USD
requirements: {
tool_calling: true, // if the subtask needs tool use
}
})
Use the returned recommendation.model_id. The response includes cost_estimate and
reasoning so you can log why each model was chosen.
Modelos de prompt via MCP
O servidor expõe modelos de prompt integrados que você pode buscar via prompts/get:
| Nome do prompt | Caso de uso |
|---|---|
cost-aware-agent | Bloco completo de prompt do sistema para seleção de modelos com consciência de custo |
task-router-snippet | Trecho mínimo para adicionar a um prompt de sistema existente |
budget-constrained-agent | Limite rígido de custo por chamada (passe o argumento budget_usd) |
Recupere-os programaticamente:
{ "method": "prompts/get", "params": { "name": "cost-aware-agent" } }
Integrações com frameworks
- LangChain:
langchain-whichmodel— cadeiaWhichModelRouter - Haystack:
whichmodel-haystack— componenteWhichModelRouter
Atualização dos Dados
Os dados de preços são atualizados a cada 4 horas a partir do OpenRouter. Cada resposta inclui um carimbo de data/hora data_freshness para que você saiba o quão atualizados estão os dados.
Links
- Site: whichmodel.dev
- Endpoint MCP: https://whichmodel.dev/mcp
- Descoberta: https://whichmodel.dev/.well-known/mcp.json
- Registro nAIm: naim.janis7ewski.org — registro de serviços de IA; navegue pela categoria LLM para encontrar o WhichModel como fonte de preços ao vivo e acessar diretamente o endpoint MCP