WhichModel

Roteamento otimizado de custos de modelos LLM para agentes autônomos

Documentação

whichmodel-mcp

Um consultor de roteamento de modelos para agentes autônomos — obtenha recomendações de LLM otimizadas por custo via MCP.

whichmodel.dev rastreia preços e capacidades de mais de 100 modelos de LLM, atualizados a cada 4 horas. Este servidor MCP expõe esses dados para que agentes de IA possam escolher o modelo certo pelo melhor preço para cada tarefa.

Endpoint MCP

https://whichmodel.dev/mcp

Transporte: HTTP Streamable (especificação MCP 2025-03-26)

Início Rápido

Adicione à configuração do seu cliente MCP:

{
  "mcpServers": {
    "whichmodel": {
      "url": "https://whichmodel.dev/mcp"
    }
  }
}

Nenhuma chave de API necessária. Nenhuma instalação necessária.

Stdio (clientes locais)

Para clientes MCP que usam transporte stdio (Claude Desktop, Cursor, etc.):

{
  "mcpServers": {
    "whichmodel": {
      "command": "npx",
      "args": ["-y", "whichmodel-mcp"]
    }
  }
}

Isso executa um proxy local leve que encaminha solicitações para o servidor remoto.

Ferramentas

recommend_model

Obtenha uma recomendação de modelo otimizada por custo para um tipo de tarefa, complexidade e orçamento específicos.

ParâmetroTipoDescrição
task_typeenum (obrigatório)chat, code_generation, code_review, summarisation, translation, data_extraction, tool_calling, creative_writing, research, classification, embedding, vision, reasoning
complexitylow | medium | highComplexidade da tarefa (padrão: medium)
estimated_input_tokensnúmeroTamanho esperado de entrada em tokens
estimated_output_tokensnúmeroTamanho esperado de saída em tokens
budget_per_callnúmeroGasto máximo em USD por chamada
requirementsobjetoRequisitos de capacidade: tool_calling, json_output, streaming, context_window_min, providers_include, providers_exclude

Retorna: modelo recomendado, alternativa, opção econômica, estimativa de custo e justificativa.


compare_models

Comparação direta de 2 a 5 modelos com projeções opcionais de custo por volume.

ParâmetroTipoDescrição
modelsstring[] (obrigatório)IDs de modelos, ex.: [anthropic/claude-sonnet-4, openai/gpt-4.1]
task_typeenumContexto para comparação
volumeobjetocalls_per_day, avg_input_tokens, avg_output_tokens para projeções de custo diário/mensal

Retorna: preços, capacidades, níveis de qualidade e custos projetados por modelo.


get_pricing

Consulta de dados brutos de preços com filtros por modelo, provedor, teto de preço e capacidades.

ParâmetroTipoDescrição
model_idstringID específico do modelo
providerstringFiltrar por provedor, ex.: anthropic
max_input_pricenúmeroPreço máximo de entrada por milhão de tokens (USD)
capabilitiesstring[]Capacidades necessárias: tool_calling, json_output, streaming, vision
min_context_windownúmeroJanela de contexto mínima em tokens
limitnúmeroMáximo de resultados (1–100, padrão 20)

check_price_changes

Veja quais preços de modelos mudaram desde uma determinada data.

ParâmetroTipoDescrição
sincestring (obrigatório)Data ISO, ex.: 2026-04-01
model_idstringFiltrar para um modelo específico
providerstringFiltrar para um provedor específico

Retorna: aumentos de preço, reduções, novos modelos e descontinuações.

Integração com Agentes

O WhichModel foi projetado para ser uma ferramenta padrão em pipelines de agentes autônomos. Adicione-o a qualquer agente para que ele possa escolher o modelo certo pelo preço certo para cada subtarefa automaticamente.

Prompt do sistema (copiar e colar)

Adicione este bloco ao prompt do sistema do seu agente:

You have access to the WhichModel MCP server for cost-aware model selection.

Before calling any LLM for a subtask, use recommend_model to pick the right model:

  recommend_model({
    task_type: "code_generation",   // chat | code_generation | summarisation | reasoning | ...
    complexity: "medium",           // low | medium | high
    estimated_input_tokens: 2000,   // optional
    estimated_output_tokens: 500,   // optional
    budget_per_call: 0.01,          // optional hard cap in USD
    requirements: {
      tool_calling: true,           // if the subtask needs tool use
    }
  })

Use the returned recommendation.model_id. The response includes cost_estimate and
reasoning so you can log why each model was chosen.

Modelos de prompt via MCP

O servidor expõe modelos de prompt integrados que você pode buscar via prompts/get:

Nome do promptCaso de uso
cost-aware-agentBloco completo de prompt do sistema para seleção de modelos com consciência de custo
task-router-snippetTrecho mínimo para adicionar a um prompt de sistema existente
budget-constrained-agentLimite rígido de custo por chamada (passe o argumento budget_usd)

Recupere-os programaticamente:

{ "method": "prompts/get", "params": { "name": "cost-aware-agent" } }

Integrações com frameworks

Atualização dos Dados

Os dados de preços são atualizados a cada 4 horas a partir do OpenRouter. Cada resposta inclui um carimbo de data/hora data_freshness para que você saiba o quão atualizados estão os dados.

Links