//beforeyouship - LLM cost modeling from your editor
We need to translate the given text into Spanish, preserving the name "//beforeyouship - LLM cost modeling from your editor" as it appears, but the instruction says "Do not include the name unless it appears in the source text." The source text does not include the name; the name is given separately as the directory item type. So we only translate the text inside <text>. The text is a description. We must preserve product names, protocol names, URLs, numbers, technical terms. So "LLM", "GPT-5.x", "Claude", "Gemini", "DeepSeek", "Pro API key", "beforeyouship.dev" should remain as is. Also "demo mode", "free-tier models", "18-model catalog". Translate the rest naturally. Let me write the translation: "Modela el costo mensual realista de una aplicación LLM **antes de construirla**. No es una calculadora de tokens: reintentos, almacenamiento en caché de prompts, descuentos por lotes, gastos generales
Documentación
Inicio rápido
beforeyouship es un modelo de costos previo al despliegue para aplicaciones de LLM. Describes la arquitectura y el patrón de uso; la herramienta devuelve un pronóstico de costo mensual entre los distintos niveles de modelos, con multiplicadores honestos para reintentos, caché, procesamiento por lotes y crecimiento. Es una herramienta de planificación para la fase de diseño, antes de que te comprometas con una pila tecnológica.
- Elige un arquetipo de aplicación. Siete ajustes predefinidos cubren los perfiles de costo comunes (chatbot, RAG, agente de múltiples pasos, procesador de documentos, etc.). Cada uno rellena valores predeterminados sensatos de tokens y comportamiento de reintentos.
- Ajusta el patrón de uso. Llamadas por día, llamadas de LLM por solicitud, recuentos promedio de tokens de entrada y salida. Pega tu prompt en lugar de adivinar: el tokenizador integrado estima el recuento localmente.
- Ajusta los multiplicadores de costo. Tasa de reintentos, tasa de aciertos de caché, elegibilidad para lotes, gastos generales de infraestructura. Cada uno tiene una fórmula definida; consulta Cómo se modelan los costos más abajo.
- Lee la tabla de costos. Tres columnas: Ingenuo (tokens brutos × precios), Realista (tus multiplicadores aplicados), Peor caso (tasa de reintentos elevada y, para agentes/RAG, reintentos en cascada).
- Lee el costo modelado más bajo. La herramienta clasifica cada modelo por costo mensual realista con ajustes según el arquetipo y muestra al ganador como
{model} — $X/mo, con los números detrás de la clasificación. Consulta Selección de modelos para las reglas por arquetipo. - Revisa el disparador de sensibilidad. Elige dos modelos cualesquiera y observa la tasa de reintentos en la que el más barato deja de serlo. Pro extiende esto a un barrido completo de tasa de aciertos de caché, precio de entrada y volumen.
El nivel gratuito cubre seis modelos de cuatro proveedores. Pro desbloquea el catálogo completo (dieciocho modelos, todos los proveedores), desglose de tokens por capa de entrada, costo por MAU, un presupuesto global de reintentos, exportaciones e integraciones.
Cómo se modelan los costos
Cada modelo del catálogo produce tres cifras de costo mensual. Todos usan los mismos recuentos de tokens de entrada y salida; solo cambian los multiplicadores.
Costo base por llamada
base_cost = (in_tokens × in_price + out_tokens × out_price) / 1,000,000
La matemática de tokens pura: sin reintentos, sin caché, sin lotes. Esto es lo que alimenta la columna Naive $/mo cuando se multiplica por calls/day × 30 × calls/request.
Sobrecarga por reintentos
retry_cost_per_call = base_cost_per_call × retry_rate × 0.3
La tasa de reintentos predeterminada es del 8% (15% para RAG y agentes de múltiples pasos, que reintentan con más frecuencia porque los fallos se acumulan a lo largo de la cadena). El factor 0.3 refleja que la mayoría de los reintentos son cortos: regeneran solo la llamada fallida, no la salida completa.
Ahorros por caché
savings_per_hit = (in_tokens / 1M) × (in_price - cached_in_price)
write_overhead = (in_tokens / 1M) × (cache_write_price - in_price) × (1 - hit_rate)
cache_savings = savings_per_hit × hit_rate - write_overhead
Anthropic cobra las escrituras de caché a 1.25× el precio base de entrada; OpenAI y Google no tienen recargo por escritura. Las lecturas de caché son un 90% más baratas en OpenAI (gpt-5.x), Anthropic y Gemini, y aproximadamente un 97% más baratas en DeepSeek V4 Flash. La fórmula anterior captura ambos lados.
Ahorros por lotes
in_rate = 1 - (batch_in_price / in_price) # usually 0.5
out_rate = 1 - (batch_out_price / out_price) # usually 0.5
in_spend = in_cost - cache_savings # what you're actually billed
batch_savings = (in_spend × in_rate + out_cost × out_rate) × batch_pct
La API por lotes es aproximadamente un 50% más barata que los precios en tiempo real tanto en entrada como en salida, a costa de una mayor latencia (de minutos a horas). Solo es útil para cargas de trabajo fuera de línea: el arquetipo de procesador de documentos lo habilita por defecto con un 80% de elegibilidad.
Observa el término in_spend: el descuento por lotes se aplica sobre tu gasto de entrada post-caché, no sobre el precio de lista. Los proveedores apilan ambos de forma multiplicativa: una lectura en caché dentro de un trabajo por lotes se factura a tasa de caché × tasa de lote, por lo que descontar el precio de lista aquí restaría dinero dos veces de los mismos tokens en caché. Eso también significa que las dos palancas no se suman como parece: con un 100% de elegibilidad de lotes, tu total es exactamente la mitad, sin importar cuán buena sea tu tasa de aciertos de caché.
Gastos generales de infraestructura
Una partida fija del 15% cubre hosting, base de datos vectorial, orquestación y herramientas de observabilidad que escalan con el gasto de API. Ajústalo en la configuración; ponlo en 0 si autoalojas el lado de la infraestructura.
Uniendo todo
effective_cost_per_call = base + retry - cache_savings - batch_savings
monthly_cost = effective_cost_per_call
× calls_per_day × 30 × calls_per_request
× (1 + infra_overhead_pct / 100)
Las tres columnas de salida
- Ingenuo $/mes — costo base × número de llamadas. Sin reintentos, sin caché, sin lotes. El número que calcularías en un papel. Intencionalmente atenuado en la interfaz; nunca se muestra de forma aislada.
- Realista $/mes — tus multiplicadores aplicados según lo definido arriba. El número principal: este es contra el que debes planificar.
- Peor caso $/mes — usa una tasa de reintentos elevada (20% por defecto). Para arquetipos de RAG y agentes de múltiples pasos, los reintentos se acumulan a lo largo de la cadena mediante una fórmula en cascada. Prueba de esfuerzo de cuán expuesto estás a días de tráfico malo.
Tokenización
Los recuentos de tokens impulsan todo el cálculo de costos, por lo que la precisión importa. El desafío es que cada proveedor usa un tokenizador diferente.
La línea base
El modo de pegado ejecuta el tokenizador nativo de OpenAI (o200k_base) localmente en tu navegador mediante WebAssembly. El texto de tu prompt nunca sale de la página.
Ajuste por modelo
Para modelos que no son de OpenAI, el motor de costos multiplica el recuento de o200k_base por una proporción calibrada. Valores aproximados para texto en inglés:
- OpenAI, Azure OpenAI, Llama 3.x, Amazon Nova: 1.00 (línea base)
- Gemini 2.5 Flash: ≈ 0.97 (SentencePiece, ligeramente más eficiente en inglés)
- Mistral Large 3 / Small 4: ≈ 1.03
- Cohere Command R+/R, DeepSeek V4 Flash: ≈ 1.05
- Claude Sonnet 4.6 / Haiku 4.5: ≈ 1.10 (verboso en inglés)
Cuándo verificar
Las proporciones calibradas son precisas aproximadamente ±5% para inglés. Son menos precisas para código intensivo, contenido multilingüe o formato inusual. Si tu carga de trabajo es una de esas, pega una muestra representativa a través del endpoint count_tokens de tu propio proveedor y compárala con el número mostrado en el modo de pegado: divide el recuento del proveedor entre el recuento de o200k_base para obtener tu proporción real.
Al motor de costos no le importan los tokens por encima de la aritmética de precio por millón. Incluso un error del 10% en el tokenizador suele representar menos varianza que tu suposición de tasa de reintentos o tasa de aciertos de caché.
Arquetipos
Siete ajustes predefinidos cubren los perfiles de costo de LLM significativamente diferentes. Cada ajuste rellena recuentos de tokens predeterminados, llamadas por solicitud, tasa de reintentos y (donde corresponda) elegibilidad de lotes. Todos los valores siguen siendo editables después de la selección.
| Arquetipo | Llamadas/solicitud | Tokens entrada / salida | Principal impulsor de costo |
|---|---|---|---|
| Chatbot simple | 1 | 800 / 400 | Volumen de llamadas |
| Chatbot con historial | 1 | 3000 / 600 | Crecimiento del contexto |
| Pipeline RAG | 3–5 | 2000 / 500 | Número de llamadas × caché |
| Enrutador multimodelo | 2–4 | 1000 / 400 | Lógica de enrutamiento + mezcla de modelos |
| Asistente de codificación | 1–2 | 4000 / 1500 | Entrada y salida grandes |
| Procesador de documentos | 1 | 8000 / 800 | Volumen × ahorros por lotes |
| Agente de múltiples pasos | 5–12 | 1500 / 600 | Pasos × reintentos en cascada |
Cada arquetipo, en una línea más un ejemplo típico
Chatbot simple
DefiniciónTu aplicación toma un mensaje del usuario, lo envía a un LLM con algunas instrucciones y devuelve una respuesta. Sin memoria entre sesiones. Cada conversación comienza desde cero.
Ejemplo típicoUn widget de atención al cliente en un sitio de comercio electrónico. El usuario escribe '¿dónde está mi pedido?' — el LLM responde usando un prompt de sistema fijo sobre las políticas de la empresa. Cada sesión es idéntica en estructura.
Chatbot con historial
DefiniciónComo un chatbot simple, pero incluyes mensajes anteriores en cada nuevo prompt para que el LLM 'recuerde' la conversación. Cuantos más turnos, más grande (y más caro) se vuelve cada llamada.
Ejemplo típicoUn asistente de ventas con IA que califica clientes potenciales en una conversación de múltiples turnos. Para el turno 8, el prompt incluye el prompt de sistema + 7 intercambios previos — fácilmente 4,000–6,000 tokens por llamada.
Pipeline RAG
DefiniciónTu aplicación busca en una base de conocimiento (documentos, base de datos, sitio web) y usa lo que encuentra para responder la pregunta. Internamente, esto requiere varias llamadas de LLM, no solo una.
Ejemplo típicoUna base de conocimiento interna de una empresa. El empleado pregunta '¿cuál es nuestra política de licencia parental?' — la aplicación reescribe la consulta, busca en documentos de RR. HH., reordena los resultados y luego genera una respuesta citando la política relevante. 3–5 llamadas de LLM por pregunta.
Enrutador multimodelo
DefiniciónTu aplicación usa una capa de enrutamiento para decidir a qué LLM llamar según la complejidad o el tipo de cada solicitud. Las preguntas simples van a un modelo barato y rápido. Las tareas complejas o sensibles escalan a un modelo de frontera. El costo depende casi por completo de cuán precisamente el enrutador clasifica las tareas.
Ejemplo típicoUna plataforma de soporte B2B. Consultas simples como 'restablecer mi contraseña' se enrutan a GPT-5.4 mini (~0.07¢). Consultas complejas como 'explica por qué falla mi integración empresarial' escalan a GPT-5.4 (~0.7¢). Una tasa de enrutamiento incorrecto del 10% al modelo caro puede multiplicar por 5 el costo esperado.
Asistente de codificación
DefiniciónTu aplicación ayuda a los desarrolladores a escribir, revisar, explicar o depurar código. Los prompts son grandes (archivos de código, diffs, instrucciones) y las salidas son grandes (código generado, explicaciones). Los costos de tokens son más altos que en un chatbot típico.
Ejemplo típicoUna herramienta de revisión de PR. El desarrollador abre una solicitud de extracción — la aplicación envía el diff completo (3,000 tokens) a un LLM y recibe una revisión de código detallada (1,200 tokens). El precio de salida importa mucho aquí.
Procesador de documentos
DefiniciónTu aplicación procesa documentos en volumen — resumiendo, extrayendo datos, clasificando o traduciendo. Esto se ejecuta en segundo plano, no en tiempo real. Como es asíncrono, puedes usar precios por lotes más baratos.
Ejemplo típicoUna herramienta de tecnología legal que resume contratos durante la noche. Se suben 500 contratos — cada uno pasa por una llamada de LLM para extraer cláusulas clave. Ningún usuario está esperando. La API por lotes da un 50% de descuento.
Agente de múltiples pasos
DefiniciónTu aplicación le da a una IA un objetivo y le permite descubrir los pasos por sí misma — usando herramientas, tomando decisiones e iterando hasta terminar. Cada paso es una llamada de LLM separada. Una tarea que toma 10 pasos cuesta 10× una tarea de una sola llamada.
Ejemplo típicoUn agente de investigación autónomo. El usuario dice 'encuentra los 5 mejores competidores de mi SaaS y resume sus precios.' El agente busca en la web, visita cada sitio, extrae precios, compara y escribe un resumen — 8–12 llamadas de LLM por tarea.
Si tu aplicación no encaja limpiamente en ningún ajuste predefinido, elige el más cercano y sobrescribe las entradas de uso. El motor de costos no sabe qué ajuste predefinido elegiste — solo usa los números que proporcionas. El arquetipo afecta solo la lógica de selección de modelos y algunas sugerencias de interfaz.
Selección de modelos — costo modelado más bajo
La tarjeta de modelo es analítica, no de asesoramiento. Muestra el modelo con el costo modelado más bajo para tu carga de trabajo como {model} — $X/mo, los números reales detrás de esa clasificación y una alternativa que representa el equilibrio opuesto (una opción premium si el ganador es de nivel económico, la opción creíble más barata si el ganador es premium) como una comparación de precios simple. Sin rodeos, sin lenguaje de 'mejor ajuste' — los números hacen el caso, y el disparador de sensibilidad debajo de la tarjeta muestra exactamente cuándo dejan de sostenerse.
La clasificación no es un orden ingenuo de más barato primero. Reglas según el arquetipo la ajustan:
Paso 1 — eliminar valores atípicos extremos
Ordena por costo mensual realista ascendente. Descarta cualquier modelo que cueste más de 2× el más barato, con una excepción: un modelo de nivel premium dentro del 20% del más barato recibe un pase por razones de calidad.
Paso 2 — puntuación específica del arquetipo
Pipeline RAG, Agente de múltiples pasos
Omite la eliminación de 2×. Puntuación = monthlyCost − 3 × cacheSavings. La economía de caché domina porque el prompt de sistema + el contexto de recuperación se reenvían en cada llamada. RAG tiene un piso de calidad: si el ganador es de nivel económico, promueve un modelo medio o premium cuya puntuación efectiva esté dentro de 2× — RAG es orientado al cliente.
Procesador de documentos
Puntuación = monthlyCost − batchSavings. Empates resueltos por ventana de contexto más grande. Sesgado hacia modelos elegibles para lotes y de contexto largo.
Chatbot simple, Chatbot con historial
Excluye el nivel premium (excesivo para chat). Elige el más barato, pero excluye DeepSeek a menos que sea más del 50% más barato que la siguiente opción que no sea DeepSeek (cobertura de política de datos para cargas de trabajo sensibles).
Asistente de codificación, Enrutador multimodelo Piso de calidad: excluye el nivel económico por completo. Codificación a 4000 / 1500 tokens y la lógica de enrutamiento necesitan capacidad de razonamiento real; los modelos de clase 8B no califican. Vuelve a ejecutar el descarte 2× sobre el grupo calificado de nivel medio/premium y luego elige el más barato.
Clasificación según el acceso
Los usuarios gratuitos ven el costo modelado más bajo dentro del grupo de nivel gratuito (la tarjeta del modelo en la página principal). Cuando los modelos del catálogo extendido quedan por debajo del ganador gratuito, un banner debajo de la tarjeta indica cuántos modelos de menor costo existen — un conteo neutral, sin precio ni nombre de modelo. Los usuarios Pro ven la clasificación calculada sobre el catálogo completo — consistente entre la tarjeta principal y el modal del catálogo de modelos.
Herramientas de análisis
Cuatro capas de análisis que se apoyan sobre el motor de costos base. Ninguna de ellas cambia lo que aparece en las columnas Naive / Realistic / Worst Case — refinan cómo razonas sobre los insumos. El número principal del sensor de sensibilidad es gratuito; todo lo demás aquí es Pro.
Sensor de sensibilidad y barrido completo
Un solo número de costo es una estimación puntual; el sensor te dice qué tan frágil es. Elige dos modelos cualesquiera (nivel gratuito: los seis modelos gratuitos; Pro: el catálogo completo) y el titular muestra el punto de equilibrio de tasa de reintentos — la tasa de reintentos en la que el modelo más barato deja de ser más barato. Los reintentos vuelven a facturar tokens crudos sin caché, así que un modelo que gana en economía de caché puede perder su ventaja a medida que aumentan los fallos. Si las curvas nunca se cruzan en el rango 0–30%, el titular lo dice — un modelo simplemente domina.
El barrido completo (Pro) extiende el mismo análisis a todas las palancas: tasa de acierto de caché (0–80%), precio de entrada (0.5×–2× del precio de lista actual) y volumen de llamadas. Para cada parámetro, barre el valor a lo largo de su rango, recalcula el costo mensual realista en cada paso e informa dónde se cruzan las curvas del par seleccionado. Todo el cálculo del barrido se ejecuta en el servidor.
Los modelos con precios idénticos entre proveedores (p. ej., GPT-5.4 en OpenAI vs Azure) empatan en cada punto — no hay punto de equilibrio que reportar. Y ten en cuenta que el Export Pass no desbloquea el barrido completo; requiere una suscripción Pro activa.
Desglose de tokens de entrada
Divide el número de tokens de entrada promedio en cuatro capas con nombre — prompt del sistema, contexto de recuperación (RAG), historial de conversación y el mensaje real del usuario. El total alimenta el motor de costos de manera idéntica; el desglose revela qué capa está dominando la factura y qué capa es el mejor candidato para caché (el prompt del sistema y el historial son los más amigables con la caché).
Costo por usuario / MAU
Divide el costo mensual realista entre tu conteo de usuarios activos mensuales. Útil para verificaciones de la página de precios ("estamos en $X / MAU con 1k usuarios, $Y / MAU con 10k") e informes para la junta. Asume que las llamadas por día escalan linealmente con los usuarios — ajusta las llamadas por día según tu curva de uso real si es superlineal o sublineal.
Presupuesto global de reintentos
Reemplaza la heurística de tasa de reintentos del 8% / 15% con un límite determinista: máximo de reintentos por llamada, con un máximo opcional de reintentos por hora. Si tu código tiene retroceso exponencial con un límite duro, esto es más realista que el modelo basado en tasas. La columna Worst Case respeta el límite cuando está configurado.
Servidor MCP (Pro)
beforeyouship ejecuta un servidor MCP (Model Context Protocol) remoto, para que puedas consultar modelos de costos sin salir de tu editor — desde Claude Code, Cursor o cualquier cliente MCP que admita el transporte HTTP Streamable. El mismo motor de costos, los mismos datos de precios, la misma salida Naive / Realistic / Worst Case que el sitio web. También está listado en Smithery.
Herramientas
list_archetypes— los siete arquetipos de aplicación con sus parámetros de uso predeterminados.get_model_prices— precios actuales por 1M de tokens para el catálogo completo, con metadatos de antigüedad.estimate_cost— modelo de costos completo para un arquetipo con un patrón de uso dado: costo mensual Naive / Realistic / Worst Case por modelo, escenarios de crecimiento y la opción de menor costo modelado con su alternativa.
Configuración
- Genera una clave API. Menú de cuenta → API keys → Generate API key. La clave se muestra una sola vez — guárdala en tu gestor de secretos. Hasta cinco claves activas; revócalas en cualquier momento.
- Agrega el servidor. En Claude Code:
claude mcp add --transport http beforeyouship \
https://beforeyouship.dev/api/mcp \
--header "Authorization: Bearer bys_..."
En Cursor u otros clientes MCP, agrega un servidor remoto con la URL https://beforeyouship.dev/api/mcp y el mismo encabezado Authorization.
- Pruébalo. Pega esto en tu editor:
Estimate the monthly cost of a RAG pipeline at 10,000 requests/day
Modo demo
¿Aún no tienes clave? Omite la bandera --header y el servidor se ejecuta en modo demo — las tres herramientas funcionan con los seis modelos de nivel gratuito. Una clave Pro desbloquea el catálogo completo en todos los proveedores.
El acceso al catálogo completo es una función Pro. Las claves sobreviven a una suscripción vencida pero vuelven al modo demo (solo modelos de nivel gratuito) hasta que la suscripción esté activa nuevamente — revoca las claves no utilizadas desde el menú de cuenta.
Modelos y datos de precios
Los precios provienen de las tarjetas de tarifas oficiales de cada proveedor. Se almacenan en /data/prices.json y se revisan mensualmente. Una GitHub Action semanal verifica la antigüedad y notifica al mantenedor si alguna entrada no ha sido reverificada en 30 días.
La advertencia "!"
Cualquier modelo cuyo precio no haya sido reverificado en los últimos 30 días recibe un pequeño "!" ámbar junto a su nombre. Pasa el cursor sobre el ícono para ver la fecha de última verificación y la URL de la fuente. Es un aviso, no un defecto — los precios rara vez cambian entre verificaciones, pero la advertencia evita que se confíe ciegamente en números desactualizados.
Modelos gratuitos vs Pro
El nivel gratuito cubre seis modelos que abarcan los cuatro proveedores más grandes y todo el espectro de calidad: GPT-5.4, GPT-5.4 mini (OpenAI), Claude Sonnet 4.6, Claude Haiku 4.5 (Anthropic), Gemini 2.5 Flash (Google), DeepSeek V4 Flash. Pro agrega doce más en Mistral, Cohere, AWS Bedrock (Nova), Azure OpenAI, Together AI y Groq.
Soporte de caché
No todos los proveedores exponen el caché de prompts en el nivel de API. OpenAI, Anthropic, Google, DeepSeek, Azure OpenAI, Mistral y AWS Nova lo hacen; Cohere, Together y Groq no. Si configuras una tasa de acierto de caché > 0, los modelos sin caché simplemente muestran cero ahorros por caché — su costo mensual realista no se ve afectado.
Deprecaciones de proveedores
Los nombres de endpoint heredados de DeepSeek (deepseek-chat y deepseek-reasoner) se retiraron el 2026-07-24; ambos ya estaban enrutando a V4 Flash de manera transparente. Usa deepseek-v4-flash. Las tarifas actuales están en la página de precios de DeepSeek — cambiaron materialmente en agosto de 2026, así que no las repetimos aquí.
Lo que esta herramienta NO modela
Estos son costos reales que incurrirás en producción, pero la herramienta los omite deliberadamente. Cada uno es demasiado específico del proyecto para modelarse honestamente solo con insumos de uso.
- Alquiler de GPU e inferencia autoalojada. Ejecutar Llama o Mistral en tus propias GPU reemplaza la facturación por token con alquiler de GPU por hora — una estructura de costos completamente diferente que depende de QPS, tamaño de lote y clase de GPU.
- Modelos de embeddings. Los embeddings suelen ser una línea de presupuesto separada (indexación vectorial, búsqueda semántica). Vale la pena modelarlos, pero no en esta herramienta.
- Fine-tuning. Los costos de entrenamiento de fine-tuning y la prima por token del modelo resultante son altamente variables; no están en el alcance.
- Base de datos vectorial. El 15% de gastos generales de infraestructura es un marcador de posición aproximado. Pinecone, Weaviate o pgvector a tu escala deberían modelarse por separado si son una línea de presupuesto significativa.
- Etiquetado humano en el circuito y evaluaciones. El aseguramiento de calidad, los conjuntos de datos de evaluación y el tiempo de revisión humana pueden eclipsar la factura de API en dominios regulados. Fuera del alcance aquí.
- Herramientas de observabilidad. LangSmith, Helicone, PromptLayer, etc. — modeladas implícitamente a través del 15% de gastos generales, pero si tu stack de observabilidad es significativo, contabilízalo por separado.
Preguntas frecuentes
¿Qué tan precisa es la estimación?
El cálculo base de tokens es exacto; los multiplicadores son estimaciones que tú controlas. Con multiplicadores bien elegidos (tu tasa de reintentos real, tu tasa de acierto de caché real), espera ±15% de precisión a pequeña escala y ±25% a escala 10× donde los efectos de límite de tasa comienzan a afectar. Cada fórmula está documentada en la sección de metodología.
¿Puedo guardar mi modelo?
El nivel Pro incluye un cajón de Escenarios Guardados (hasta diez escenarios por cuenta). Cada escenario guardado captura el arquetipo, los insumos de uso y los multiplicadores. El nivel gratuito no persiste escenarios.
¿Puedo compartir un modelo con un compañero?
Sí — el botón Copy link codifica todo tu escenario en la URL. Función del nivel gratuito. Compartir es colaborativo: el destinatario puede ajustar los multiplicadores, pero para conservar su versión ajustada necesita copiar la nueva URL y compartirla de vuelta. No hay sincronización en tiempo real.
¿Por qué el menor costo modelado difiere entre gratuito y Pro?
La clasificación del nivel gratuito se calcula solo con los seis modelos gratuitos; la clasificación Pro considera los dieciocho. Para la mayoría de los arquetipos, el mismo modelo gana en ambos grupos, pero en los arquetipos de chatbot, codificación y enrutador, el grupo Pro a menudo revela una opción significativamente más barata. Los usuarios gratuitos ven un banner con un conteo neutral de cuántos modelos de menor costo existen en el catálogo extendido — sin precio, sin nombre de modelo.
¿Por qué Llama 8B nunca encabeza la clasificación para codificación?
El motor de selección de modelos impone un piso de calidad en los arquetipos de asistente de codificación y enrutador multimodelo — los modelos de nivel económico (clase 8B) se excluyen por completo. Llama 8B es adecuado para chat o resúmenes simples, pero es insuficiente para trabajo de codificación de 4000 entradas / 1500 salidas, sin importar lo barato que sea.
¿Qué es el sensor de sensibilidad?
Elige dos modelos cualesquiera y el sensor muestra la tasa de reintentos en la que el más barato deja de ser más barato — el punto de equilibrio donde se cruzan las curvas de costos. Los reintentos vuelven a facturar tokens crudos sin caché, así que los ahorros impulsados por caché se erosionan a medida que aumentan los fallos. El número principal es gratuito; el barrido completo (Pro) reporta puntos de equilibrio en tasa de acierto de caché, precio de entrada y volumen de llamadas para el mismo par, calculado en el servidor. Si dos modelos nunca se cruzan en el rango, uno simplemente domina — el sensor lo dice en lugar de inventar un número.
¿Cuándo debo activar el procesamiento por lotes?
El procesamiento por lotes ahorra aproximadamente 50% en entrada y salida, pero agrega minutos a horas de latencia. Úsalo para pipelines fuera de línea: resúmenes nocturnos, clasificación masiva, procesamiento de documentos. No lo uses para flujos orientados al usuario. El arquetipo de Procesador de documentos lo habilita por defecto con 80% de elegibilidad.
¿Qué hace Export Pass?
Desbloqueo único de $5 que te da 24 horas de acceso Pro más una exportación incluida en PDF o CSV. Diseñado para usuarios que necesitan un artefacto de costos listo para la junta sin comprometerse a una suscripción mensual.
¿Qué significa el "!" ámbar en un nombre de modelo?
El precio del modelo no ha sido reverificado en los últimos 30 días. Pasa el cursor sobre el ícono para ver la fecha de última verificación y la URL de la fuente. Es un indicador de frescura, no un defecto.
¿Mi texto de prompt sale de mi dispositivo cuando lo pego?
No. El tokenizador se ejecuta completamente en el lado del cliente mediante WebAssembly. Tu texto de prompt nunca sale de la página, nunca llega a un servidor y no se registra. El paquete WASM del tokenizador se carga de manera diferida cuando activas el modo de pegado por primera vez.
¿Con qué frecuencia se actualizan los datos de precios?
El ciclo de revisión manual se ejecuta mensualmente. Una GitHub Action semanal verifica la fecha last_verified en cada modelo y alerta vía Telegram si algo ha quedado desactualizado más allá de 30 días. Los cambios significativos de precios se aplican a medida que se anuncian.
¿Qué pasa si mi arquitectura no encaja en ningún preset?
Elige el arquetipo más cercano y sobrescribe los insumos de uso (llamadas por día, llamadas por solicitud, conteos de tokens, multiplicadores). El arquetipo solo afecta la lógica de selección de modelos y algunas sugerencias de interfaz; el motor de costos trabaja con los números que tú proporcionas.
Glosario
Estimación Naive
Solo cálculo base de tokens — sin reintentos, caché, lotes ni gastos generales de infraestructura.
Estimación Realistic
Naive + tus multiplicadores de reintentos, caché, lotes y gastos generales aplicados.
Worst Case
Realistic con una tasa de reintentos elevada (20% por defecto) y, para arquetipos RAG/agente, reintentos en cascada a lo largo de la cadena.
Tasa de reintentos
Fracción de llamadas que fallan y se reintentan una vez. Por defecto 8% (15% para RAG/agente). Los reintentos se facturan al 30% del costo base de la llamada (regenerando solo la llamada que falló, no la salida completa).
Tasa de acierto de caché Fracción de los tokens de entrada servidos desde la caché de prompts en lugar del precio completo de entrada. Valor predeterminado 40%; rango realista 30–60% en cargas de trabajo con prompts de sistema reutilizables.
Escritura en caché
Tokens escritos por primera vez en la caché. Facturados a 1.25× el precio base de entrada en Anthropic; gratis en OpenAI y Google.
Entrada en caché
Tokens leídos desde la caché en llamadas posteriores. Facturados a 0.1× del precio base de entrada en OpenAI (gpt-5.x), Anthropic y Gemini; 0.02× en DeepSeek V4 Flash.
API por lotes
Nivel de API asíncrona ~50% más barato que en tiempo real tanto en entrada como en salida. Latencia de minutos a horas. Disponible en OpenAI, Anthropic, Google, AWS.
Gastos generales de infraestructura
Porcentaje fijo añadido al costo mensual para cubrir hosting, base de datos vectorial, orquestación y observabilidad. Valor predeterminado 15%; ajustable en Configuración.
Reintentos en cascada
En arquetipos de agente/RAG, un solo reintento puede acumularse en N llamadas encadenadas. El Peor Caso usa esta fórmula en lugar de una tasa de reintento fija.
Proporción de tokenizador
Multiplicador por modelo aplicado al recuento o200k_base para aproximar el tokenizador nativo de ese modelo. Ver sección Tokenización.
Nivel premium / medio / económico
Clasificación interna de calidad utilizada por el motor de selección de modelos. Aproximadamente: modelos de frontera, gama media capaz y modelos pequeños/económicos.
Barrido de sensibilidad
Recalcula el costo mensual realista mientras un parámetro (tasa de reintento, tasa de acierto de caché, precio de entrada o volumen de llamadas) se mueve a lo largo de su rango, manteniendo todo lo demás fijo. Muestra cuán frágil es una clasificación de costos.
Punto de equilibrio (cruce)
El valor del parámetro donde las curvas de costo de dos modelos se cruzan — por debajo de él un modelo es más barato, por encima el otro. El titular de alerta informa el punto de equilibrio de tasa de reintento para tu par elegido; el barrido completo (Pro) informa puntos de equilibrio para cada parámetro barrido.