LLMTest
Proxy LLM que avalia modelos de IA em prompts reais e encontra alternativas mais baratas e rápidas entre mais de 340 modelos.
Documentação
Servidor MCP LLMTest
Servidor MCP que avalia modelos de IA com seus prompts reais e encontra alternativas mais baratas e rápidas. Funciona com Claude Code, Cursor, Windsurf e qualquer ferramenta compatível com MCP.
Início Rápido
1. Obtenha sua chave de API
Cadastre-se em llmtest.io e pegue sua chave de API no painel.
2. Adicione à sua ferramenta
Claude Code:
claude mcp add llmtest -- npx llmtest-mcp
Depois defina sua chave:
export LLMTEST_API_KEY=llmt_your_key_here
Cursor / Windsurf / Outros clientes MCP:
Adicione ao seu arquivo de configuração MCP:
{
"mcpServers": {
"llmtest": {
"command": "npx",
"args": ["llmtest-mcp"],
"env": {
"LLMTEST_API_KEY": "llmt_your_key_here"
}
}
}
}
3. Converse com sua IA
Basta perguntar em linguagem natural:
- "Verifique meu status no LLMTest"
- "Encontre modelos mais baratos para minhas chamadas de IA"
- "Execute um benchmark no meu fluxo de redator de blog"
- "Quais modelos estão em alta?"
Como Funciona
LLMTest é um proxy que fica entre seu aplicativo e os provedores de IA. Aponte seu aplicativo para https://llmtest.io/v1 em vez de chamar OpenAI/Anthropic diretamente, e o LLMTest rastreia seu uso, avalia alternativas e sugere economia de custos.
Este servidor MCP dá ao seu assistente de IA acesso às ferramentas do LLMTest para que ele possa gerenciar tudo por você.
Ferramentas Disponíveis
| Ferramenta | Descrição |
|---|---|
status | Mostra status do proxy e resumo de atividade |
list_flows | Lista todos os fluxos de IA com estatísticas de custo e latência |
get_suggestions | Obtém recomendações pendentes de troca de modelo |
update_suggestion | Aceita ou descarta uma sugestão |
run_benchmark | Avalia um fluxo contra modelos concorrentes |
optimize_prompt | Reescreve o prompt de um fluxo e encontra um modelo mais barato que ainda funciona |
seed_samples | Adiciona prompts de teste para avaliação pré-lançamento |
list_samples | Mostra amostras de teste armazenadas por fluxo |
list_new_models | Mostra modelos novos e em alta |
get_account | Verifica saldo de créditos e uso |
get_autopilot_status | Verifica se o autopiloto está ativo e se a conta é elegível |
enable_autopilot | Ativa otimização automática semanal com barreiras de segurança + reversão automática baseada em desvio |
disable_autopilot | Desativa o autopiloto (otimizações existentes permanecem ativas) |
list_active_optimizations | Lista otimizações aceitas automaticamente ainda dentro da janela de reversão de 24h |
revert_optimization | Reverte uma otimização aceita automaticamente para o prompt anterior |
Autopiloto
O autopiloto otimiza automaticamente seus fluxos em cadência semanal. Alterações que passam por todas as barreiras de segurança entram no ar com uma janela de reversão de 24 horas. A detecção de desvio continua verificando depois disso e reverte se a qualidade cair.
Para ativar pelo seu IDE: peça ao seu assistente de IA algo como "ative o autopiloto do LLMTest". Ele chamará enable_autopilot. Use get_autopilot_status para confirmar os pré-requisitos.
Pré-requisitos (verificados por fluxo a cada ciclo):
- Autopiloto ativado na conta
- E-mail verificado
- Idade da conta ≥ 14 dias (rampa de confiança)
- Fluxo com ≥ 20 chamadas reais nos últimos 7 dias
- Fluxo não otimizado pelo autopiloto nos últimos 14 dias (período de espera)
- Saldo de créditos positivo (~US$ 1–2 por execução)
Barreiras de segurança (todas devem passar para aceitação automática): limite inferior do IC de 95% > 50% de taxa de vitória, concordância multi-avaliador ≥ 80%, economia total ≥ 20%, sem aviso de viés de comprimento, verificação de regressão no conjunto dourado.
Reversão: janela de 24h após aceitação automática. Depois disso, apenas a detecção de desvio pode reverter.
Fluxo de Trabalho Típico
Pré-lançamento (sem tráfego ainda):
- Diga à sua IA: "Estou criando um chatbot de suporte usando gpt-4o"
- Ela cria amostras de teste realistas com
seed_samples - Ela executa
run_benchmarkpara comparar modelos - Ela mostra
get_suggestionscom alternativas mais baratas
Pós-lançamento (com tráfego real):
- Roteie suas chamadas de IA através de
https://llmtest.io/v1 - O LLMTest monitora o uso e avalia automaticamente quando os fluxos atingem 50+ chamadas
- Pergunte "alguma sugestão de economia?" para ver recomendações
- Aceite uma sugestão e atualize seu código
Variáveis de Ambiente
| Variável | Obrigatória | Descrição |
|---|---|---|
LLMTEST_API_KEY | Sim | Sua chave de API de llmtest.io/dashboard |
LLMTEST_BASE_URL | Não | URL de API personalizada (padrão: https://llmtest.io) |
Links
Licença
MIT