LLMTest

Proxy LLM que avalia modelos de IA em prompts reais e encontra alternativas mais baratas e rápidas entre mais de 340 modelos.

Documentação

Servidor MCP LLMTest

npm version MIT License

Servidor MCP que avalia modelos de IA com seus prompts reais e encontra alternativas mais baratas e rápidas. Funciona com Claude Code, Cursor, Windsurf e qualquer ferramenta compatível com MCP.

Início Rápido

1. Obtenha sua chave de API

Cadastre-se em llmtest.io e pegue sua chave de API no painel.

2. Adicione à sua ferramenta

Claude Code:

claude mcp add llmtest -- npx llmtest-mcp

Depois defina sua chave:

export LLMTEST_API_KEY=llmt_your_key_here

Cursor / Windsurf / Outros clientes MCP:

Adicione ao seu arquivo de configuração MCP:

{
  "mcpServers": {
    "llmtest": {
      "command": "npx",
      "args": ["llmtest-mcp"],
      "env": {
        "LLMTEST_API_KEY": "llmt_your_key_here"
      }
    }
  }
}

3. Converse com sua IA

Basta perguntar em linguagem natural:

  • "Verifique meu status no LLMTest"
  • "Encontre modelos mais baratos para minhas chamadas de IA"
  • "Execute um benchmark no meu fluxo de redator de blog"
  • "Quais modelos estão em alta?"

Como Funciona

LLMTest é um proxy que fica entre seu aplicativo e os provedores de IA. Aponte seu aplicativo para https://llmtest.io/v1 em vez de chamar OpenAI/Anthropic diretamente, e o LLMTest rastreia seu uso, avalia alternativas e sugere economia de custos.

Este servidor MCP dá ao seu assistente de IA acesso às ferramentas do LLMTest para que ele possa gerenciar tudo por você.

Ferramentas Disponíveis

FerramentaDescrição
statusMostra status do proxy e resumo de atividade
list_flowsLista todos os fluxos de IA com estatísticas de custo e latência
get_suggestionsObtém recomendações pendentes de troca de modelo
update_suggestionAceita ou descarta uma sugestão
run_benchmarkAvalia um fluxo contra modelos concorrentes
optimize_promptReescreve o prompt de um fluxo e encontra um modelo mais barato que ainda funciona
seed_samplesAdiciona prompts de teste para avaliação pré-lançamento
list_samplesMostra amostras de teste armazenadas por fluxo
list_new_modelsMostra modelos novos e em alta
get_accountVerifica saldo de créditos e uso
get_autopilot_statusVerifica se o autopiloto está ativo e se a conta é elegível
enable_autopilotAtiva otimização automática semanal com barreiras de segurança + reversão automática baseada em desvio
disable_autopilotDesativa o autopiloto (otimizações existentes permanecem ativas)
list_active_optimizationsLista otimizações aceitas automaticamente ainda dentro da janela de reversão de 24h
revert_optimizationReverte uma otimização aceita automaticamente para o prompt anterior

Autopiloto

O autopiloto otimiza automaticamente seus fluxos em cadência semanal. Alterações que passam por todas as barreiras de segurança entram no ar com uma janela de reversão de 24 horas. A detecção de desvio continua verificando depois disso e reverte se a qualidade cair.

Para ativar pelo seu IDE: peça ao seu assistente de IA algo como "ative o autopiloto do LLMTest". Ele chamará enable_autopilot. Use get_autopilot_status para confirmar os pré-requisitos.

Pré-requisitos (verificados por fluxo a cada ciclo):

  • Autopiloto ativado na conta
  • E-mail verificado
  • Idade da conta ≥ 14 dias (rampa de confiança)
  • Fluxo com ≥ 20 chamadas reais nos últimos 7 dias
  • Fluxo não otimizado pelo autopiloto nos últimos 14 dias (período de espera)
  • Saldo de créditos positivo (~US$ 1–2 por execução)

Barreiras de segurança (todas devem passar para aceitação automática): limite inferior do IC de 95% > 50% de taxa de vitória, concordância multi-avaliador ≥ 80%, economia total ≥ 20%, sem aviso de viés de comprimento, verificação de regressão no conjunto dourado.

Reversão: janela de 24h após aceitação automática. Depois disso, apenas a detecção de desvio pode reverter.

Fluxo de Trabalho Típico

Pré-lançamento (sem tráfego ainda):

  1. Diga à sua IA: "Estou criando um chatbot de suporte usando gpt-4o"
  2. Ela cria amostras de teste realistas com seed_samples
  3. Ela executa run_benchmark para comparar modelos
  4. Ela mostra get_suggestions com alternativas mais baratas

Pós-lançamento (com tráfego real):

  1. Roteie suas chamadas de IA através de https://llmtest.io/v1
  2. O LLMTest monitora o uso e avalia automaticamente quando os fluxos atingem 50+ chamadas
  3. Pergunte "alguma sugestão de economia?" para ver recomendações
  4. Aceite uma sugestão e atualize seu código

Variáveis de Ambiente

VariávelObrigatóriaDescrição
LLMTEST_API_KEYSimSua chave de API de llmtest.io/dashboard
LLMTEST_BASE_URLNãoURL de API personalizada (padrão: https://llmtest.io)

Links

Licença

MIT