8 septiembre 2026 EN ES
The Serving Desk

The stack under your AI product — models, serving, and what it costs

Costes

Construir un modelo de costos de inferencia por debajo de $1

Un modelo práctico para fijar precios de funciones de IA cuando los precios de tokens caen, el uso aumenta y la inferencia se convierte en un rubro controlable.

Illustration: Build a Sub-$1 Inference Cost Model

El precio del token es el número equivocado

El equilibrio está entre el precio de lista y el costo efectivo. La tasa de acierto de caché, el loteo y el enrutamiento determinan el precio efectivo. La aritmética es: precio efectivo = precio de lista × (1 − descuento de caché) × descuento de lote × mezcla de enrutamiento. Esa línea decide si la inferencia es controlable o una fuga de margen.

El precio ponderado por volumen de los tokens cerró cerca de $0.97 por millón en agosto, una caída de más de la mitad desde un pico de mayo cercano a $2.05. En OpenRouter, una plataforma de enrutamiento de modelos, el uso de tokens aumentó aproximadamente un 47% mes a mes en agosto, mientras que el gasto en dólares solo subió alrededor del 7%. El uso crece más rápido que el gasto. Esa es la condición que hace necesario un modelo de costos.

Goldman Sachs estimó que cinco proveedores de nube a escala hiper con calificación crediticia tendrían gastos de capital combinados de aproximadamente $737 mil millones en 2026, alrededor del 38% de sus ingresos. A finales de agosto, 78 de los 91 bonos emitidos por proveedores de nube a escala hiper en 2026 se negociaban por debajo del precio de emisión. La construcción de infraestructura es lo suficientemente grande como para que la presión sobre los precios de tokens no sea un bache temporal.

El modelo comienza con el precio efectivo

Mide el precio que realmente pagas

Registra las tarifas de entrada, salida, caché y lote para cada modelo que sirves. Incluye la caché de prompts, la caché de respuestas y cualquier descuento por uso comprometido. El resultado final es una tabla de tarifas que asigna a cada clase de solicitud un precio antes de que la solicitud salga de la cola.

Comienza con el precio de lista del proveedor y luego resta solo los descuentos que realmente recibes. Un descuento por uso comprometido solo se aplica al volumen que esperas alcanzar. Los usuarios de pago por uso no deben tomar prestado un descuento que no han ganado. Estás listo cuando la tabla de tarifas muestra columnas de lista, con descuento y efectivo.

Trata la caché como un descuento

La tasa de acierto de caché cambia el precio del mismo token. Un prompt de sistema repetido, un esquema de herramienta o un fragmento de documento servido desde caché reduce el precio combinado. El error común es tratar un precio de lista más bajo como un costo más bajo cuando los fallos de caché y los lotes pequeños aumentan el consumo de tokens.

Registra la tasa de acierto de caché por función, no por modelo. Una función de chat puede cachear bien los prompts de sistema, mientras que una función de búsqueda puede fallar porque las consultas son nuevas. Una tasa de acierto en descenso eleva el precio efectivo incluso cuando el precio de lista no cambia. La salida es un panel de precios combinados por función y modelo.

Calcula el precio del loteo según la profundidad de la cola

El loteo cambia el costo por token, pero también cambia la latencia. Modela el tamaño mínimo de lote que mantiene tu objetivo de latencia dentro de la experiencia del producto. Estás listo cuando la curva de profundidad de cola muestra una línea de costo y una línea de latencia.

No asumas que el loteo continuo es gratis. Puede reducir el costo por token, pero también puede aumentar el tiempo en cola. Los usuarios que reintentan cuando la latencia sube pueden aumentar el consumo de tokens. Modela el tamaño de lote que mantiene la latencia de cola dentro de tu objetivo. El tamaño de lote, el costo por token y la latencia pertenecen en la tabla.

Enruta según el costo de la tarea

Los niveles de modelos cambian. Muse Spark 1.3 de Meta alcanzó el mismo nivel de referencia que GPT-5.6 Sol y Claude Opus 5, modelos de frontera, tras su lanzamiento el 2 de septiembre. Astra de OpenAI cumplió los umbrales de ciberseguridad bajo su Marco de Preparación, un proceso de revisión de seguridad, el 1 de septiembre, convirtiéndose en el primer modelo en esa categoría. Usa esos cambios para probar si un modelo más barato puede atender una tarea con una calidad aceptable.

Construye un mapa de tareas antes de cambiar modelos. Lista los trabajos que hace cada modelo: clasificación, extracción, resumen, código, revisión de seguridad y respuesta final. Asigna a cada trabajo un umbral de calidad y una tolerancia de precio. Prueba el modelo más barato contra ese umbral. La tabla de enrutamiento contiene tarea, modelo, puerta de calidad y precio efectivo.

Convierte a costo por sesión de pago

Multiplica las solicitudes por sesión por los tokens por solicitud y luego aplica el precio efectivo. Separa las sesiones gratuitas de las de pago, porque el guardarráil solo protege ingresos. El número debe compararse limpiamente con el precio de la suscripción sin una hoja de cálculo de tokens brutos.

Mantén la definición de sesión estable. Una sesión de pago que incluye incorporación, soporte y uso necesita una regla clara sobre qué llamadas cuentan para el guardarráil. Una sesión larga puede ocultar una mala unidad. Divide por nivel de usuario cuando sea necesario. El resultado es un costo por sesión de pago por nivel, no solo por modelo.

Los guardarraíles impiden que el crecimiento oculte la fuga

Establece el guardarráil de ARPU

Establece el guardarráil de ARPU, ingresos promedio por usuario, antes de la próxima revisión de precios. Digamos que limitas el costo efectivo de inferencia al 20% del ARPU para una sesión de pago y permites que el crecimiento de volumen supere la caída de precio en no más del 10%. Por encima de esa línea, la función ya no se autofinancia. Esa regla obliga a una decisión: subir el precio, recortar tokens, mejorar la caché o detener la función.

Incorpora el guardarráil en la revisión de producto

Haz que el guardarráil sea parte de la revisión de producto. Cuando una solicitud de función pida más tokens, exige el impacto en el costo efectivo. Una solicitud que eleve el costo por sesión de pago por encima del tope necesita un cambio de precio, una mejora de caché o un recorte de alcance. El lanzamiento debe esperar hasta que el número esté dentro del tope.

Reejecuta el modelo cuando cambian las entradas

Revisa el modelo cada vez que una entrada cambie: precio de lista, tasa de acierto de caché, tamaño de lote, mezcla de enrutamiento o duración de sesión. Una reducción del precio de tokens es buena noticia solo cuando el costo efectivo por sesión de pago baja. Un nuevo modelo o un cambio de proveedor de caché requiere reejecutar el precio efectivo. Usa la misma fórmula y las entradas actualizadas en la revisión.

Publicidad