//beforeyouship - LLM cost modeling from your editor

We need to translate the given text from English to Brazilian Portuguese. The text describes an MCP server for LLM cost modeling. We must preserve product names, protocol names, URLs, numbers, technical terms. No extra commentary, no labels. The name "//beforeyouship" is not in the text, so we don't include it. The text includes "GPT-5.x, Claude, Gemini, DeepSeek" - preserve those. Also "beforeyouship.dev" URL. Numbers like 3×, 10×, 18-model, six free-tier models. Also "Pro API key". Translate naturally. Let's translate: "Model the realistic monthly cost of an LLM app **before you build it**. Not a token calculator: retries, prompt caching, batch discounts, infra overhead, and 3×/10× growth are modeled in, across GPT-5.x, Claude, Gemini, DeepSeek, and more. **Works without a key.** Connect and ask — demo mode covers the six free-tier models. A Pro API

Documentação

Início rápido

O beforeyouship é um modelo de custo pré-implantação para aplicações de LLM. Você descreve a arquitetura e o padrão de uso; a ferramenta retorna uma previsão de custo mensal entre os níveis de modelos, com multiplicadores honestos para repetições, cache, processamento em lote e crescimento. É uma ferramenta de planejamento para a fase de design — antes de você se comprometer com uma stack.

  1. Escolha um arquétipo de aplicativo. Sete predefinições cobrem os perfis de custo comuns (chatbot, RAG, agente multi-etapas, processador de documentos, etc.). Cada uma preenche padrões sensatos de tokens e comportamento de repetição.
  2. Ajuste o padrão de uso. Chamadas por dia, chamadas de LLM por requisição, contagens médias de tokens de entrada e saída. Cole seu prompt em vez de adivinhar — o tokenizador integrado estima a contagem localmente.
  3. Ajuste os multiplicadores de custo. Taxa de repetição, taxa de acerto de cache, elegibilidade para lote, sobrecarga de infraestrutura. Cada um tem uma fórmula definida; veja Como os custos são modelados abaixo.
  4. Leia a tabela de custos. Três colunas: Ingênuo (tokens brutos × preços), Realista (seus multiplicadores aplicados), Pior Caso (taxa de repetição elevada e, para agente/RAG, repetições em cascata).
  5. Leia o menor custo modelado. A ferramenta classifica cada modelo pelo custo mensal realista com ajustes específicos de arquétipo e mostra o vencedor como {model} — $X/mo, com os números por trás da classificação. Veja Seleção de modelos para as regras por arquétipo.
  6. Verifique o alarme de sensibilidade. Escolha quaisquer dois modelos e veja a taxa de repetição na qual o mais barato deixa de ser mais barato. O Pro estende isso para uma varredura completa entre taxa de acerto de cache, preço de entrada e volume.

O plano gratuito cobre seis modelos em quatro provedores. O Pro desbloqueia o catálogo completo (dezoito modelos, todos os provedores), detalhamento de tokens por camada de entrada, custo por MAU, um orçamento global de repetições, exportações e integrações.

Como os custos são modelados

Cada modelo no catálogo produz três números de custo mensal. Todos usam as mesmas contagens de tokens de entrada e saída; apenas os multiplicadores diferem.

Custo base por chamada

base_cost = (in_tokens × in_price + out_tokens × out_price) / 1,000,000

A matemática bruta de tokens — sem repetições, sem cache, sem lote. Isso é o que alimenta a coluna Naive $/mo quando multiplicado por calls/day × 30 × calls/request.

Sobrecarga de repetição

retry_cost_per_call = base_cost_per_call × retry_rate × 0.3

A taxa de repetição padrão é de 8% (15% para RAG e agentes multi-etapas, que repetem com mais frequência porque as falhas se acumulam ao longo da cadeia). O fator 0.3 reflete que a maioria das repetições é curta — elas regeneram apenas a chamada que falhou, não a saída completa.

Economia de cache

savings_per_hit  = (in_tokens / 1M) × (in_price - cached_in_price)
write_overhead   = (in_tokens / 1M) × (cache_write_price - in_price) × (1 - hit_rate)
cache_savings    = savings_per_hit × hit_rate - write_overhead

A Anthropic cobra gravações de cache a 1,25× o preço base de entrada; OpenAI e Google não têm sobretaxa de gravação. Leituras de cache custam 90% menos na OpenAI (gpt-5.x), Anthropic e Gemini, e ~97% menos no DeepSeek V4 Flash. A fórmula acima captura ambos os lados.

Economia em lote

in_rate   = 1 - (batch_in_price  / in_price)      # usually 0.5
out_rate  = 1 - (batch_out_price / out_price)     # usually 0.5
in_spend  = in_cost - cache_savings               # what you're actually billed
batch_savings = (in_spend × in_rate + out_cost × out_rate) × batch_pct

A API em lote é aproximadamente 50% mais barata que o preço em tempo real tanto na entrada quanto na saída, ao custo de maior latência (minutos a horas). Só é útil para cargas de trabalho offline — o arquétipo Processador de documentos a ativa por padrão com 80% de elegibilidade.

Observe o termo in_spend: o desconto de lote é aplicado sobre seus gastos de entrada pós-cache, não sobre o preço de tabela. Os provedores empilham os dois multiplicativamente — uma leitura em cache dentro de um trabalho em lote é cobrada à taxa de cache × taxa de lote — então descontar o preço de tabela aqui descontaria os mesmos tokens em cache duas vezes. Isso também significa que as duas alavancas não se somam como parecem: com 100% de elegibilidade para lote, seu total é exatamente a metade, não importa quão boa seja sua taxa de acerto de cache.

Sobrecarga de infraestrutura

Um item fixo de 15% cobre hospedagem, banco de dados vetorial, orquestração e ferramentas de observabilidade que escalam com os gastos de API. Ajustável nas configurações; defina como 0 se você auto-hospedar o lado da infraestrutura.

Juntando tudo

effective_cost_per_call = base + retry - cache_savings - batch_savings
monthly_cost = effective_cost_per_call
             × calls_per_day × 30 × calls_per_request
             × (1 + infra_overhead_pct / 100)

As três colunas de saída

  • Ingênuo $/mês — custo base × número de chamadas. Sem repetições, sem cache, sem lote. O número que você calcularia nas costas de um guardanapo. Intencionalmente esmaecido na interface; nunca mostrado isoladamente.
  • Realista $/mês — seus multiplicadores aplicados conforme definido acima. O número principal — é com ele que você deve planejar.
  • Pior Caso $/mês — usa uma taxa de repetição elevada (padrão de 20%). Para arquétipos de RAG e agente multi-etapas, as repetições se acumulam ao longo da cadeia por meio de uma fórmula em cascata. Testa o quão exposto você está a dias de tráfego ruim.

Tokenização

As contagens de tokens impulsionam todo o cálculo de custo, então a precisão importa. O desafio é que cada provedor usa um tokenizador diferente.

A linha de base

O modo de colagem executa o tokenizador nativo da OpenAI (o200k_base) localmente no seu navegador via WebAssembly. O texto do seu prompt nunca sai da página.

Ajuste por modelo

Para modelos que não são da OpenAI, o mecanismo de custo multiplica a contagem o200k_base por uma proporção calibrada. Valores aproximados para texto em inglês:

  • OpenAI, Azure OpenAI, Llama 3.x, Amazon Nova: 1,00 (linha de base)
  • Gemini 2.5 Flash: ≈ 0,97 (SentencePiece, ligeiramente mais eficiente em inglês)
  • Mistral Large 3 / Small 4: ≈ 1,03
  • Cohere Command R+/R, DeepSeek V4 Flash: ≈ 1,05
  • Claude Sonnet 4.6 / Haiku 4.5: ≈ 1,10 (verboso em inglês)

Quando verificar

As proporções calibradas são precisas em aproximadamente ±5% para inglês. São menos precisas para código pesado, conteúdo multilíngue ou formatação incomum. Se sua carga de trabalho for uma dessas, cole uma amostra representativa no endpoint count_tokens do seu próprio provedor e compare com o número mostrado no modo de colagem — divida a contagem do provedor pela contagem o200k_base para obter sua proporção real.

O mecanismo de custo não se importa com tokens acima da aritmética de preço por milhão. Mesmo um erro de tokenizador de 10% geralmente representa menos variação do que seu palpite de taxa de repetição ou taxa de acerto de cache.

Arquétipos

Sete predefinições cobrem os perfis de custo de LLM significativamente diferentes. Cada predefinição preenche contagens padrão de tokens, chamadas por requisição, taxa de repetição e (quando apropriado) elegibilidade para lote. Todos os valores permanecem editáveis após a seleção.

ArquétipoChamadas/reqTokens entrada/saídaPrincipal direcionador de custo
Chatbot simples1800 / 400Volume de chamadas
Chatbot com histórico13000 / 600Crescimento do contexto
Pipeline RAG3–52000 / 500Número de chamadas × cache
Roteador multi-modelo2–41000 / 400Lógica de roteamento + mix de modelos
Assistente de codificação1–24000 / 1500Entrada grande + saída
Processador de documentos18000 / 800Volume × economia em lote
Agente multi-etapas5–121500 / 600Etapas × repetições em cascata

Cada arquétipo, em uma linha mais um exemplo típico

Chatbot simples

DefiniçãoSeu aplicativo recebe uma mensagem do usuário, envia para um LLM com algumas instruções e retorna uma resposta. Sem memória entre sessões. Cada conversa começa do zero.

Exemplo típicoUm widget de suporte ao cliente em um site de e-commerce. O usuário digita 'onde está meu pedido?' — o LLM responde usando um prompt de sistema fixo sobre as políticas da empresa. Cada sessão é idêntica em estrutura.

Especificação completa →

Chatbot com histórico

DefiniçãoComo um chatbot simples, mas você inclui mensagens anteriores em cada novo prompt para que o LLM 'lembre' da conversa. Quanto mais turnos, maior (e mais caro) fica cada chamada.

Exemplo típicoUm assistente de vendas com IA que qualifica leads em uma conversa multi-turnos. No turno 8, o prompt inclui o prompt de sistema + 7 trocas anteriores — facilmente 4.000–6.000 tokens por chamada.

Especificação completa →

Pipeline RAG

DefiniçãoSeu aplicativo pesquisa uma base de conhecimento (documentos, banco de dados, site) e usa o que encontra para responder à pergunta. Por baixo dos panos, isso requer várias chamadas de LLM — não apenas uma.

Exemplo típicoUma base de conhecimento interna de uma empresa. O funcionário pergunta 'qual é nossa política de licença parental?' — o aplicativo reescreve a consulta, pesquisa documentos de RH, reordena os resultados e então gera uma resposta citando a política relevante. 3–5 chamadas de LLM por pergunta.

Especificação completa →

Roteador multi-modelo

DefiniçãoSeu aplicativo usa uma camada de roteamento para decidir qual LLM chamar com base na complexidade ou no tipo de cada requisição. Perguntas simples vão para um modelo barato e rápido. Tarefas complexas ou sensíveis escalam para um modelo de fronteira. O custo depende quase inteiramente de quão precisamente o roteador classifica as tarefas.

Exemplo típicoUma plataforma de suporte B2B. Consultas simples como 'redefinir minha senha' roteiam para o GPT-5.4 mini (~0,07¢). Consultas complexas como 'explique por que minha integração empresarial está falhando' escalam para o GPT-5.4 (~0,7¢). Uma taxa de roteamento incorreto de 10% para o modelo caro pode multiplicar o custo esperado por 5.

Especificação completa →

Assistente de codificação

DefiniçãoSeu aplicativo ajuda desenvolvedores a escrever, revisar, explicar ou depurar código. Os prompts são grandes (arquivos de código, diffs, instruções) e as saídas são grandes (código gerado, explicações). Os custos de tokens são maiores que os de um chatbot típico.

Exemplo típicoUma ferramenta de revisão de PR. O desenvolvedor abre um pull request — o aplicativo envia o diff inteiro (3.000 tokens) para um LLM e recebe de volta uma revisão de código detalhada (1.200 tokens). O preço de saída importa muito aqui.

Especificação completa →

Processador de documentos

DefiniçãoSeu aplicativo processa documentos em massa — resumindo, extraindo dados, classificando ou traduzindo. Isso roda em segundo plano, não em tempo real. Como é assíncrono, você pode usar preços de lote mais baratos.

Exemplo típicoUma ferramenta de tecnologia jurídica que resume contratos durante a noite. 500 contratos enviados — cada um passa por uma chamada de LLM para extrair cláusulas-chave. Nenhum usuário está esperando. A API em lote dá 50% de desconto.

Especificação completa →

Agente multi-etapas

DefiniçãoSeu aplicativo dá a uma IA um objetivo e deixa que ela descubra os passos por conta própria — usando ferramentas, tomando decisões e iterando até concluir. Cada passo é uma chamada de LLM separada. Uma tarefa que leva 10 passos custa 10× uma tarefa de chamada única.

Exemplo típicoUm agente de pesquisa autônomo. O usuário diz 'encontre os 5 melhores concorrentes do meu SaaS e resuma os preços deles.' O agente pesquisa na web, visita cada site, extrai preços, compara e escreve um resumo — 8–12 chamadas de LLM por tarefa.

Especificação completa →

Se seu aplicativo não se encaixar perfeitamente em nenhuma predefinição, escolha a mais próxima e sobrescreva as entradas de uso. O mecanismo de custo não sabe qual predefinição você escolheu — ele apenas usa os números que você fornece. O arquétipo afeta apenas a lógica de seleção de modelos e algumas dicas de interface.

Seleção de modelos — menor custo modelado

O cartão de modelo é analítico, não consultivo. Ele mostra o modelo com o menor custo modelado para sua carga de trabalho como {model} — $X/mo, os números reais por trás dessa classificação e uma alternativa representando a troca oposta (uma opção premium se o vencedor for de nível econômico, a opção mais barata e confiável se o vencedor for premium) como uma comparação de preço pura. Sem rodeios, sem linguagem de "melhor ajuste" — os números fazem o caso, e o alarme de sensibilidade abaixo do cartão mostra exatamente quando eles deixam de valer.

A classificação não é uma ordenação ingênua de mais barato primeiro. Regras específicas de arquétipo a ajustam:

Etapa 1 — eliminar outliers grosseiros

Ordene pelo custo mensal realista ascendente. Descarte qualquer modelo que custe mais de 2× o mais barato, com uma exceção: um modelo de nível premium dentro de 20% do mais barato recebe uma dispensa por motivos de qualidade.

Etapa 2 — pontuação específica de arquétipo

Pipeline RAG, Agente multi-etapas

Pule a eliminação de 2×. Pontuação = monthlyCost − 3 × cacheSavings. A economia de cache domina porque o prompt de sistema + o contexto de recuperação são reenviados em cada chamada. RAG tem um piso de qualidade: se o vencedor for de nível econômico, promova um modelo médio ou premium cuja pontuação efetiva esteja dentro de 2× — RAG é voltado ao cliente.

Processador de documentos

Pontuação = monthlyCost − batchSavings. Empates são desfeitos pelo maior contexto. Tende a favorecer modelos elegíveis para lote e de contexto longo.

Chatbot simples, Chatbot com histórico

Exclua o nível premium (exagero para chat). Escolha o mais barato, mas exclua o DeepSeek a menos que seja mais de 50% mais barato que a próxima opção não-DeepSeek (proteção de política de dados para cargas de trabalho sensíveis).

Assistente de codificação, Roteador multi-modelo Padrão mínimo de qualidade: exclua o nível de orçamento por completo. Codificação @ 4000 / 1500 tokens e lógica de roteamento exigem capacidade real de raciocínio; modelos da classe 8B não se qualificam. Reexecute a seleção 2× contra o pool qualificado de nível médio/premium e, em seguida, escolha o mais barato.

Classificação com ciência de acesso

Usuários gratuitos veem o menor custo modelado dentro do pool do nível gratuito (o cartão do modelo na página principal). Quando modelos do catálogo estendido ficam abaixo do vencedor gratuito, um banner abaixo do cartão informa quantos modelos de menor custo existem — uma contagem neutra, sem preço e sem nome do modelo. Usuários Pro veem a classificação calculada sobre o catálogo completo — consistente entre o cartão principal e o modal do catálogo de modelos.

Ferramentas de análise

Quatro camadas de análise que se situam sobre o mecanismo de custo base. Nenhuma delas altera o que aparece nas colunas Ingênuo / Realista / Pior Caso — elas refinam como você raciocina sobre as entradas. O número principal do alarme de sensibilidade é gratuito; todo o resto aqui é Pro.

Alarme de sensibilidade e varredura completa

Um único número de custo é uma estimativa pontual; o alarme informa o quão frágil ela é. Escolha quaisquer dois modelos (nível gratuito: os seis modelos gratuitos; Pro: o catálogo completo) e o número principal mostra o ponto de equilíbrio da taxa de nova tentativa — a taxa de nova tentativa na qual o modelo mais barato deixa de ser mais barato. Novas tentativas cobram novamente tokens brutos e não armazenados em cache, então um modelo que vence na economia de cache pode perder sua liderança conforme as falhas aumentam. Se as curvas nunca se cruzam no intervalo de 0–30%, o número principal informa isso — um modelo simplesmente domina.

A varredura completa (Pro) estende a mesma análise a todas as alavancas: taxa de acerto de cache (0–80%), preço de entrada (0,5×–2× o preço de tabela atual) e volume de chamadas. Para cada parâmetro, ela varre o valor em seu intervalo, recalcula o custo mensal realista a cada etapa e informa onde as curvas do par selecionado se cruzam. Todo o cálculo da varredura é executado no servidor.

Modelos com preços idênticos entre provedores (ex.: GPT-5.4 na OpenAI vs. Azure) empatam em todos os pontos — não há ponto de equilíbrio a ser informado. E observe que o Passe de Exportação não desbloqueia a varredura completa; ela exige uma assinatura Pro ativa.

Detalhamento de tokens de entrada

Divide o número de tokens médios de entrada em quatro camadas nomeadas — prompt do sistema, contexto de recuperação (RAG), histórico da conversa e a mensagem real do usuário. O total alimenta o mecanismo de custo de forma idêntica; o detalhamento revela qual camada está dominando a conta e qual camada é a melhor candidata a cache (prompt do sistema e histórico são os mais favoráveis a cache).

Custo por usuário / MAU

Divide o custo mensal realista pelo seu número de usuários ativos mensais. Útil para verificações de sanidade em páginas de preços ("estamos em $X / MAU com 1 mil usuários, $Y / MAU com 10 mil") e relatórios para o conselho. Assume que as chamadas por dia escalam linearmente com os usuários — ajuste as chamadas por dia para sua curva de uso real se ela for super-linear ou sub-linear.

Orçamento global de novas tentativas

Substitui a heurística de taxa de nova tentativa de 8% / 15% por um limite determinístico: máximo de novas tentativas por chamada, com um máximo opcional de novas tentativas por hora. Se seu código tem backoff exponencial com um limite rígido, isso é mais realista que o modelo baseado em taxa. A coluna Pior Caso respeita o limite quando definido.

Servidor MCP (Pro)

beforeyouship executa um servidor MCP (Model Context Protocol) remoto, para que você possa consultar modelos de custo sem sair do seu editor — do Claude Code, Cursor ou qualquer cliente MCP que suporte o transporte HTTP Streamable. Mesmo mecanismo de custo, mesmos dados de preços, mesma saída Ingênuo / Realista / Pior Caso do site. Também listado no Smithery.

Ferramentas

  • list_archetypes — os sete arquétipos de aplicativos com seus parâmetros de uso padrão.
  • get_model_prices — preços atuais por 1M de tokens para o catálogo completo, com metadados de desatualização.
  • estimate_cost — modelo de custo completo para um arquétipo em um determinado padrão de uso: custo mensal Ingênuo / Realista / Pior Caso por modelo, cenários de crescimento e a escolha de menor custo modelado com sua alternativa.

Configuração

  1. Gere uma chave de API. Menu da conta → Chaves de API → Gerar chave de API. A chave é exibida uma única vez — armazene-a no seu gerenciador de segredos. Até cinco chaves ativas; revogue a qualquer momento.
  2. Adicione o servidor. No Claude Code:
claude mcp add --transport http beforeyouship \
  https://beforeyouship.dev/api/mcp \
  --header "Authorization: Bearer bys_..."

No Cursor ou outros clientes MCP, adicione um servidor remoto com a URL https://beforeyouship.dev/api/mcp e o mesmo cabeçalho Authorization.

  1. Experimente. Cole isto no seu editor:
Estimate the monthly cost of a RAG pipeline at 10,000 requests/day

Modo de demonstração

Ainda não tem chave? Pule o sinalizador --header e o servidor executa em modo de demonstração — todas as três ferramentas funcionam com os seis modelos do nível gratuito. Uma chave Pro desbloqueia o catálogo completo em todos os provedores.

O acesso ao catálogo completo é um recurso Pro. As chaves sobrevivem a uma assinatura vencida, mas voltam ao modo de demonstração (somente modelos do nível gratuito) até que a assinatura esteja ativa novamente — revogue chaves não utilizadas no menu da conta.

Modelos e dados de preços

Os preços vêm das tabelas de tarifas oficiais de cada provedor. Eles são armazenados em /data/prices.json e revisados mensalmente. Uma GitHub Action semanal verifica a desatualização e notifica o mantenedor se alguma entrada não for reverificada em 30 dias.

O aviso "!"

Qualquer modelo cujo preço não tenha sido reverificado nos últimos 30 dias recebe um pequeno "!" âmbar ao lado do nome. Passe o mouse sobre o ícone para ver a data da última verificação e a URL da fonte. É um alerta, não um defeito — os preços raramente mudam entre verificações, mas o aviso evita que números desatualizados sejam confiados cegamente.

Modelos gratuitos vs. Pro

O nível gratuito cobre seis modelos que abrangem os quatro maiores provedores e todo o espectro de qualidade: GPT-5.4, GPT-5.4 mini (OpenAI), Claude Sonnet 4.6, Claude Haiku 4.5 (Anthropic), Gemini 2.5 Flash (Google), DeepSeek V4 Flash. O Pro adiciona mais doze entre Mistral, Cohere, AWS Bedrock (Nova), Azure OpenAI, Together AI e Groq.

Suporte a cache

Nem todo provedor expõe cache de prompt no nível da API. OpenAI, Anthropic, Google, DeepSeek, Azure OpenAI, Mistral e AWS Nova oferecem; Cohere, Together e Groq não. Se você definir uma taxa de acerto de cache > 0, modelos sem cache simplesmente mostram zero economia de cache — seu custo mensal realista não é afetado.

Descontinuações de provedores

Os nomes de endpoint legados do DeepSeek (deepseek-chat e deepseek-reasoner) foram aposentados em 24/07/2026; ambos já roteavam transparentemente para o V4 Flash. Use deepseek-v4-flash. As tarifas atuais estão na página de preços do DeepSeek — elas mudaram substancialmente em agosto de 2026, então não as repetimos aqui.

O que esta ferramenta NÃO modela

Estes são custos reais que você incorrerá em produção, mas a ferramenta deliberadamente os omite. Cada um é específico demais do projeto para ser modelado honestamente apenas com entradas de uso.

  • Aluguel de GPU e inferência auto-hospedada. Executar Llama ou Mistral em suas próprias GPUs substitui a cobrança por token pelo aluguel horário de GPU — uma estrutura de custo completamente diferente que depende de QPS, tamanho de lote e classe de GPU.
  • Modelos de embedding. Embeddings geralmente são uma linha de orçamento separada (indexação vetorial, busca semântica). Vale modelar, mas não nesta ferramenta.
  • Fine-tuning. Custos de treinamento de fine-tune e o prêmio por token no modelo resultante são altamente variáveis; fora do escopo.
  • Banco de dados vetorial. A sobrecarga de infraestrutura de 15% é um espaço reservado aproximado. Pinecone, Weaviate ou pgvector na sua escala devem ser modelados separadamente se forem uma linha de orçamento significativa.
  • Rotulagem e avaliações com humano no circuito. Garantia de qualidade, conjuntos de dados de avaliação e tempo de revisão humana podem superar a conta da API em domínios regulados. Fora do escopo aqui.
  • Ferramentas de observabilidade. LangSmith, Helicone, PromptLayer, etc. — modeladas implicitamente através da sobrecarga de 15%, mas se sua pilha de observabilidade for significativa, considere-a separadamente.

Perguntas frequentes

Qual é a precisão da estimativa?

O cálculo base de tokens é exato; os multiplicadores são estimativas que você controla. Com multiplicadores bem escolhidos (sua taxa real de novas tentativas, sua taxa real de acerto de cache), espere ±15% de precisão em pequena escala e ±25% em escala 10×, onde os efeitos de limite de taxa começam a impactar. Cada fórmula está documentada na seção de metodologia.

Posso salvar meu modelo?

O nível Pro inclui uma gaveta de Cenários Salvos (até dez cenários por conta). Cada cenário salvo captura o arquétipo, as entradas de uso e os multiplicadores. O nível gratuito não persiste cenários.

Posso compartilhar um modelo com um colega?

Sim — o botão Copiar link codifica todo o seu cenário na URL. Recurso do nível gratuito. O compartilhamento é colaborativo: o destinatário pode ajustar os multiplicadores, mas para manter a versão ajustada, ele precisa copiar a nova URL e compartilhá-la de volta. Sem sincronização em tempo real.

Por que o menor custo modelado difere entre gratuito e Pro?

A classificação do nível gratuito é calculada apenas com os seis modelos gratuitos; a classificação Pro considera todos os dezoito. Para a maioria dos arquétipos, o mesmo modelo vence em ambos os pools, mas nos arquétipos de chatbot, codificação e roteador, o pool Pro frequentemente revela uma opção significativamente mais barata. Usuários gratuitos veem um banner com uma contagem neutra de quantos modelos de menor custo existem no catálogo estendido — sem preço, sem nome do modelo.

Por que o Llama 8B nunca lidera a classificação para codificação?

O mecanismo de seleção de modelos impõe um padrão mínimo de qualidade nos arquétipos de assistente de codificação e roteador multi-modelo — modelos de nível de orçamento (classe 8B) são excluídos por completo. O Llama 8B é adequado para chat ou sumarização simples, mas é insuficiente para trabalho de codificação com 4000 de entrada / 1500 de saída, independentemente do quão barato seja.

O que é o alarme de sensibilidade?

Escolha quaisquer dois modelos e o alarme mostra a taxa de nova tentativa na qual o mais barato deixa de ser mais barato — o ponto de equilíbrio onde as curvas de custo se cruzam. Novas tentativas cobram novamente tokens brutos não armazenados em cache, então a economia impulsionada por cache se desgasta conforme as falhas aumentam. O número principal é gratuito; a varredura completa (Pro) informa pontos de equilíbrio em taxa de acerto de cache, preço de entrada e volume de chamadas para o mesmo par, calculados no servidor. Se dois modelos nunca se cruzam no intervalo, um simplesmente domina — o alarme informa isso em vez de inventar um número.

Quando devo ativar o processamento em lote?

O lote economiza cerca de 50% na entrada e saída, mas adiciona minutos a horas de latência. Use-o para pipelines offline: sumarização noturna, classificação em massa, processamento de documentos. Não o use para fluxos voltados ao usuário. O arquétipo Processador de documentos o ativa por padrão com 80% de elegibilidade.

O que o Passe de Exportação faz?

Desbloqueio único de $5 que dá 24 horas de acesso Pro mais um exportação incluída em PDF ou CSV. Projetado para usuários que precisam de um artefato de custo pronto para o conselho sem se comprometer com uma assinatura mensal.

O que significa o "!" âmbar no nome de um modelo?

O preço do modelo não foi reverificado nos últimos 30 dias. Passe o mouse sobre o ícone para ver a data da última verificação e a URL da fonte. É um indicador de atualização, não um defeito.

Meu texto de prompt sai do meu dispositivo quando eu o colo?

Não. O tokenizador é executado inteiramente no lado do cliente via WebAssembly. Seu texto de prompt nunca sai da página, nunca atinge um servidor e não é registrado. O pacote WASM do tokenizador carrega de forma preguiçosa quando você alterna o modo de colagem pela primeira vez.

Com que frequência os dados de preços são atualizados?

O ciclo de revisão manual é mensal. Uma GitHub Action semanal verifica a data last_verified em cada modelo e alerta via Telegram se algo ficar desatualizado por mais de 30 dias. Mudanças significativas de preços são aplicadas conforme são anunciadas.

E se minha arquitetura não se encaixar em nenhum padrão predefinido?

Escolha o arquétipo mais próximo e sobrescreva as entradas de uso (chamadas por dia, chamadas por solicitação, contagens de tokens, multiplicadores). O arquétipo afeta apenas a lógica de seleção de modelos e algumas dicas de interface; o mecanismo de custo trabalha com os números que você fornece.

Glossário

Estimativa Ingênua

Somente cálculo base de tokens — sem novas tentativas, cache, lote ou sobrecarga de infraestrutura.

Estimativa Realista

Ingênua + seus multiplicadores de novas tentativas, cache, lote e sobrecarga aplicados.

Pior Caso

Realista com uma taxa de nova tentativa elevada (padrão 20%) e, para arquétipos RAG/agente, novas tentativas em cascata ao longo da cadeia.

Taxa de nova tentativa

Fração de chamadas que falham e são tentadas novamente uma vez. Padrão 8% (15% para RAG/agente). Novas tentativas são cobradas a 30% do custo base da chamada (regenerando apenas a chamada que falhou, não a saída completa).

Taxa de acerto de cache Fração dos tokens de entrada servidos pelo cache de prompt, em vez do preço total de entrada. Padrão de 40%; faixa realista de 30–60% em cargas de trabalho com prompts de sistema reutilizáveis.

Escrita de cache

Tokens gravados no cache pela primeira vez. Cobrados a 1,25× o preço base de entrada na Anthropic; gratuitos na OpenAI e Google.

Entrada em cache

Tokens lidos do cache em chamadas subsequentes. Cobrados a 0,1× do preço base de entrada na OpenAI (gpt-5.x), Anthropic e Gemini; 0,02× no DeepSeek V4 Flash.

API em lote

Camada de API assíncrona ~50% mais barata que em tempo real, tanto na entrada quanto na saída. Latência de minutos a horas. Disponível na OpenAI, Anthropic, Google e AWS.

Sobrecarga de infraestrutura

Percentual fixo adicionado ao custo mensal para cobrir hospedagem, banco de vetores, orquestração e observabilidade. Padrão de 15%; ajustável em Configurações.

Repetições em cascata

Em arquétipos de agente/RAG, uma única repetição pode se acumular em N chamadas encadeadas. O Pior Caso usa essa fórmula em vez de uma taxa fixa de repetição.

Proporção do tokenizador

Multiplicador por modelo aplicado à contagem o200k_base para aproximar o tokenizador nativo desse modelo. Consulte a seção Tokenização.

Camada premium / intermediária / econômica

Classificação interna de qualidade usada pelo mecanismo de seleção de modelos. Aproximadamente: modelos de fronteira, intermediários capazes e modelos pequenos/baratos.

Varredura de sensibilidade

Recalcula o custo mensal realista enquanto um parâmetro (taxa de repetição, taxa de acerto de cache, preço de entrada ou volume de chamadas) se move em sua faixa, mantendo todo o resto fixo. Mostra o quão frágil é uma classificação de custo.

Ponto de equilíbrio (cruzamento)

O valor do parâmetro em que as curvas de custo de dois modelos se cruzam — abaixo dele, um modelo é mais barato; acima, o outro. O título de alerta relata o ponto de equilíbrio da taxa de repetição para o par escolhido; a varredura completa (Pro) relata pontos de equilíbrio para cada parâmetro varrido.