ComparEdge LLM Cost
Matemática de custo de tokens para chamadas de API LLM: 69 modelos em 17 provedores, preços verificados pela ComparEdge. Gratuito, sem chave de API.
Documentação
Quando alguém pergunta quanto o recurso de IA custará em escala, a resposta honesta na maioria das equipes é um encolher de ombros. As tarifas mudaram duas vezes desde que alguém verificou pela última vez, e o próprio modelo citará preços de seus dados de treinamento. Este servidor MCP mantém tarifas atuais por milhão de tokens para 69 modelos onde seu assistente pode alcançá-los, e faz a aritmética por conta própria.
Veja como funciona
$ You: price Claude Opus 4.8 on a 25k-token prompt with a 1k answer, run 5,000 times
llm-cost › estimate_cost
Cost estimate: Claude Opus 4.8 (Anthropic)
Rates: input $5/1M, output $25/1M, cached input $0.5/1M
Per call (25,000 in + 1,000 out tokens):
input: $0.1250
output: $0.0250
per call total: $0.1500
Across 5,000 calls: $750.00
Ways to pay less for the same 5,000 calls:
with cached input: $187.50
via batch API: $375.00
Nada aqui é arredondado ou adivinhado. A tarifa é verificada, com data, e o servidor multiplicou.
Abra uma segunda sessão: mesma chamada em quatro modelos, classificados
$ You: compare that call on Opus 4.8, Sonnet 5, GPT-5.6 Terra and Gemini 3.1 Pro
llm-cost › compare_models_cost
25,000 in + 1,000 out, cheapest first:
1. Claude Sonnet 5 $0.0600 /call $300.00 /5k
2. Gemini 3.1 Pro $0.0620 /call $310.00 /5k
3. GPT-5.6 Terra $0.0775 /call $387.50 /5k
4. Claude Opus 4.8 $0.1500 /call $750.00 /5k
Ranking uses each model's live feed entry, not remembered prices.
A lacuna que ela preenche
| Um assistente sozinho | Um assistente com llm-cost |
|---|---|
| cita tarifas de saída de dados de treinamento, muitas vezes desatualizadas por uma geração | lê a tarifa atual, com data |
| achata a estimativa para "alguns centavos" | $0.1500 por chamada, $750.00 em 5,000 |
| nunca menciona descontos por lote ou cache | $375.00 lote, $187.50 em cache, apenas onde o modelo realmente os oferece |
| confiantemente errado, sem como saber | cada número remonta a uma entrada de feed com data de verificação |
Os mesmos números respondem no navegador através do LLM calculator, e o LLM category hub classifica cada modelo rastreado por avaliação e preço.
Para onde os números vão
flowchart LR
V["provider pricing pages<br/>17 providers"] --> CE["verification<br/>date-stamped checks"]
CE --> F["model prices feed<br/>69 models, USD per 1M tokens"]
F -->|"6h cache, serve stale on failure"| MCP["llm-cost server<br/>local arithmetic"]
MCP --> A["your agent"]
O servidor nunca chama uma API de provedor. Ele lê um feed público, llms-model-prices.json, e calcula localmente. Nada para limitar a taxa, nenhuma chave para vazar, e uma falha de rede serve a última cópia boa em vez de um erro. Como cada preço é verificado está documentado na metodologia, e o catálogo por trás dele é distribuído como um conjunto de dados aberto sob CC BY 4.0.
As seis ferramentas
Quatro fazem a matemática. Duas ajudam você a encontrar o ID exato do modelo que a matemática quer.
| Ferramenta | Respostas | Parâmetros |
|---|---|---|
estimate_cost | uma chamada, ou N chamadas idênticas, em dólares | model, input_tokens, output_tokens, calls? |
compare_models_cost | a mesma chamada precificada em 2 a 6 modelos | models[], input_tokens, output_tokens |
monthly_budget | gasto diário, mensal, anual para uma carga de trabalho | model, daily_calls, avg_input_tokens, avg_output_tokens |
cheapest_models | modelos de menor custo, piso de contexto opcional | min_context?, limit? |
list_models | todos os modelos com tarifas, contexto e nível | provider? |
list_providers | provedores com contagens de modelos e escolha mais barata | nenhum |
Regras práticas de tokens, para quando ninguém sabe as contagens
- Uma página de prosa em inglês tem aproximadamente 500 tokens; um token tem cerca de quatro caracteres.
- As referências de modelo são tolerantes:
claude-opus-4-8,Opus 4.8eanthropic/opusresolvem para o mesmo modelo. Quando o resolvedor não tem certeza, ele retorna candidatos em vez de adivinhar. cheapest_modelsclassifica por uma tarifa combinada ponderando entrada para saída 3 para 1, porque cargas de trabalho reais leem muito mais do que escrevem. Confirme o vencedor comestimate_costna sua divisão real.
Prompts
| Prompt | Argumentos | Execuções |
|---|---|---|
estimate_my_workflow | workflow, model? | estimativas de tokens mais custo por execução e mensal para um fluxo de trabalho descrito |
pick_cheapest_model | task | modelo mais barato que ainda atende ao requisito, principais candidatos precificados |
forecast_ai_budget | model, usage | fatura mensal e anual projetada a partir do volume esperado |
Conecte
{
"mcpServers": {
"llm-cost": {
"command": "npx",
"args": ["-y", "@comparedge/llm-cost-mcp@latest"]
}
}
}
O Claude Desktop mantém este arquivo em ~/Library/Application Support/Claude/claude_desktop_config.json. Cursor: Configurações, depois MCP. VS Code com Copilot lê .vscode/mcp.json. Reinicie o cliente; seis ferramentas aparecem. Sem chave de API, sem conta. Guias passo a passo por cliente estão no guia de configuração.
Família
Construído pela ComparEdge, onde os preços de software são verificados nas páginas dos fornecedores antes que alguém os cite. Dois irmãos compartilham os dados: o servidor de catálogo completo e um observador de mudanças de preço, ambos no ComparEdge MCP.
Licenciado sob MIT. JSON-RPC 2.0 sobre stdio, Model Context Protocol padrão.