ComparEdge LLM Cost
Cálculo de costos de tokens para llamadas a la API de LLM: 69 modelos en 17 proveedores, precios verificados por ComparEdge. Gratuito, sin clave de API.
Documentación
Alguien pregunta cuánto costará la función de IA a escala, y la respuesta honesta en la mayoría de los equipos es un encogimiento de hombros. Las tarifas cambiaron dos veces desde que alguien las revisó por última vez, y el propio modelo citará felizmente precios de sus datos de entrenamiento. Este servidor MCP mantiene tarifas actuales por millón de tokens para 69 modelos donde tu asistente puede consultarlas, y hace la aritmética por sí mismo.
Míralo funcionar
$ You: price Claude Opus 4.8 on a 25k-token prompt with a 1k answer, run 5,000 times
llm-cost › estimate_cost
Cost estimate: Claude Opus 4.8 (Anthropic)
Rates: input $5/1M, output $25/1M, cached input $0.5/1M
Per call (25,000 in + 1,000 out tokens):
input: $0.1250
output: $0.0250
per call total: $0.1500
Across 5,000 calls: $750.00
Ways to pay less for the same 5,000 calls:
with cached input: $187.50
via batch API: $375.00
Nada aquí está redondeado o adivinado. La tarifa está verificada, con fecha, y el servidor la multiplicó.
Abre una segunda sesión: la misma llamada en cuatro modelos, clasificados
$ You: compare that call on Opus 4.8, Sonnet 5, GPT-5.6 Terra and Gemini 3.1 Pro
llm-cost › compare_models_cost
25,000 in + 1,000 out, cheapest first:
1. Claude Sonnet 5 $0.0600 /call $300.00 /5k
2. Gemini 3.1 Pro $0.0620 /call $310.00 /5k
3. GPT-5.6 Terra $0.0775 /call $387.50 /5k
4. Claude Opus 4.8 $0.1500 /call $750.00 /5k
Ranking uses each model's live feed entry, not remembered prices.
La brecha que cierra
| Un asistente por sí solo | Un asistente con llm-cost |
|---|---|
| cita tarifas de salida de datos de entrenamiento, a menudo desactualizadas por una generación | lee la tarifa actual, con fecha |
| aplana la estimación a "unos centavos" | $0.1500 por llamada, $750.00 en 5,000 |
| nunca menciona descuentos por lote o caché | $375.00 lote, $187.50 en caché, solo donde el modelo realmente los ofrece |
| confiadamente equivocado, sin forma de saberlo | cada cifra se rastrea hasta una entrada del feed con fecha de verificación |
Los mismos números responden en un navegador a través de la calculadora LLM, y el centro de categorías LLM clasifica cada modelo rastreado por puntuación y precio.
Dónde viajan los números
flowchart LR
V["provider pricing pages<br/>17 providers"] --> CE["verification<br/>date-stamped checks"]
CE --> F["model prices feed<br/>69 models, USD per 1M tokens"]
F -->|"6h cache, serve stale on failure"| MCP["llm-cost server<br/>local arithmetic"]
MCP --> A["your agent"]
El servidor nunca llama a una API de proveedor. Lee un feed público, llms-model-prices.json, y calcula localmente. Nada que limitar por tasa, ninguna clave que filtrar, y un fallo de red sirve la última copia buena en lugar de un error. Cómo se verifica cada precio está documentado en la metodología, y el catálogo detrás se publica como un conjunto de datos abierto bajo CC BY 4.0.
Las seis herramientas
Cuatro hacen las matemáticas. Dos te ayudan a encontrar el id de modelo exacto que las matemáticas necesitan.
| Herramienta | Responde | Parámetros |
|---|---|---|
estimate_cost | una llamada, o N llamadas idénticas, en dólares | model, input_tokens, output_tokens, calls? |
compare_models_cost | la misma llamada cotizada en 2 a 6 modelos | models[], input_tokens, output_tokens |
monthly_budget | gasto diario, mensual, anual para una carga de trabajo | model, daily_calls, avg_input_tokens, avg_output_tokens |
cheapest_models | modelos de menor costo, con piso de contexto opcional | min_context?, limit? |
list_models | cada modelo con tarifas, contexto y nivel | provider? |
list_providers | proveedores con conteos de modelos y la opción más barata | ninguno |
Reglas generales de tokens, para cuando nadie sabe los conteos
- Una página de prosa en inglés es aproximadamente 500 tokens; un token es alrededor de cuatro caracteres.
- Las referencias de modelo son tolerantes:
claude-opus-4-8,Opus 4.8yanthropic/opusse resuelven al mismo modelo. Cuando el resolvedor no está seguro, devuelve candidatos en lugar de adivinar. cheapest_modelsclasifica por una tarifa combinada que pondera entrada a salida 3 a 1, porque las cargas de trabajo reales leen mucho más de lo que escriben. Confirma al ganador conestimate_costen tu división real.
Indicaciones
| Indicación | Argumentos | Ejecuta |
|---|---|---|
estimate_my_workflow | workflow, model? | estimaciones de tokens más costo por ejecución y mensual para un flujo de trabajo descrito |
pick_cheapest_model | task | el modelo más barato que aún cumple el requisito, con los mejores candidatos cotizados |
forecast_ai_budget | model, usage | factura mensual y anual proyectada desde el volumen esperado |
Conéctalo
{
"mcpServers": {
"llm-cost": {
"command": "npx",
"args": ["-y", "@comparedge/llm-cost-mcp@latest"]
}
}
}
Claude Desktop guarda este archivo en ~/Library/Application Support/Claude/claude_desktop_config.json. Cursor: Configuración, luego MCP. VS Code con Copilot lee .vscode/mcp.json. Reinicia el cliente; aparecen seis herramientas. Sin clave de API, sin cuenta. Guías paso a paso por cliente están en la guía de configuración.
Familia
Construido por ComparEdge, donde los precios de software se verifican contra las páginas de los proveedores antes de que alguien los cite. Dos hermanos comparten los datos: el servidor de catálogo completo y un vigilante de cambios de precios, ambos en ComparEdge MCP.
Licencia MIT. JSON-RPC 2.0 sobre stdio, Protocolo de Contexto de Modelo estándar.