Construye un presupuesto mensual de inferencia para un agente de IA
Define un presupuesto mensual de inferencia para un agente de IA a partir de turnos, llamadas a herramientas, crecimiento del contexto, enrutamiento de modelos, reintentos y una reserva de variación.

Antes de aprobar el modelo de un agente, define el límite de gasto por agente. Las cargas de trabajo de codificación agéntica pueden consumir aproximadamente 1,000 veces más tokens que el razonamiento o el chat ordinario, porque los agentes vuelven a leer instrucciones y resultados de herramientas acumulados. El equilibrio está entre la calidad del modelo y el gasto mensual: la factura proviene de turnos, llamadas a herramientas, crecimiento del contexto, enrutamiento y reintentos, no del precio de un solo prompt. La fórmula es (turnos esperados × tokens promedio + tokens de llamadas a herramientas + penalización por crecimiento del contexto) × precio del modelo enrutado × multiplicador de reintentos + reserva de variación, limitada por un límite de gasto por agente y umbrales de kill-switch.
Empieza con el límite, no con el modelo
«Hecho» significa un tope mensual aprobado por producto y finanzas, con un umbral de kill-switch por debajo de él. El tope debe cubrir el camino esperado y el camino adverso, no solo el camino de la demo.
Da a los responsables de producto una vista compacta: gasto mensual esperado, percentil alto y umbral de kill-switch. Obtienes un número que pueden defender en una revisión de presupuesto, no solo un conteo crudo de tokens.
El costo de inferencia de un agente es difícil de predecir. Ejecuciones repetidas de la misma tarea agéntica han mostrado diferencias de hasta 30 veces en el uso de tokens. Un agente en bucle conserva y procesa todo su historial de conversación anterior en cada turno posterior.
Se prevé que el costo de inferencia de cada flujo de trabajo agéntico aumente varias veces para 2028, incluso si los precios por token siguen bajando. Eso convierte al límite mensual en el punto de control. Si el límite es demasiado amplio, la elección del modelo se convierte en un debate de preferencias. Si es demasiado estricto, el agente se detiene antes de terminar.
Construye la fórmula a partir de ejecuciones observadas
- Estima los turnos esperados por tarea a partir de ejecuciones registradas: mediana y percentil alto, no un solo conteo de camino feliz.
- Mide los tokens promedio por turno. Está listo cuando los tokens de entrada y salida están separados, con el prompt de sistema, el esquema de herramientas y el historial contabilizados.
- Añade tokens de llamadas a herramientas. La salida es una partida por cada respuesta de herramienta, incluyendo contenidos de archivos, cargas de API y mensajes de error.
- Aplica una penalización por crecimiento del contexto. Un multiplicador para el historial que crece con cada turno hace que los turnos posteriores cuesten más que los anteriores.
- Calcula el precio del modelo enrutado. El precio por token debe ser el del modelo realmente utilizado, no el del modelo más barato del catálogo.
- Multiplica por un multiplicador de reintentos. El factor debe cubrir turnos fallidos, éxitos parciales y re-ejecuciones tras errores de herramientas.
- Añade una reserva de variación. Si la omites, el presupuesto parecerá limpio hasta que una ejecución lenta lo rompa. Es un colchón para la dispersión entre ejecuciones.
Mantén la fórmula en un solo lugar. Cuando una nueva herramienta o modelo cambie los números, el presupuesto cambia con ellos.
Enruta por tarea, no por costumbre. Usa un modelo más barato para clasificación, extracción y formateo; reserva el modelo más potente para planificación, selección de herramientas y recuperación ante ambigüedad. Mantén una tabla de enrutamiento con una columna de costo junto a cada modelo. Cuando la tabla cambia, el límite mensual cambia con ella.
Limita el camino descontrolado
El motor de políticas CostWall de AICost.ai traduce la configuración de presupuesto, límite de gasto por agente, turnos, tokens y kill-switch en reglas para pasarelas y enrutadores de modelos existentes. El modelo de costos de AICost.ai rastrea tanto los caminos ordinarios como los descontrolados del agente, contemplando reintentos, contexto creciente y márgenes de variación, y luego mide el costo por tarea completada, flujo de trabajo, agente o resultado de negocio.
Aplica esas reglas en el enrutador, no en una hoja de cálculo, para que el gasto se mantenga dentro del límite aprobado.
En flujos de trabajo regulados, los análisis de agentes en producción han encontrado que los tokens representan solo el 20% al 25% del costo variable de ejecución, con la revisión humana componiendo la mayor parte del resto. Eso cambia la pregunta de presupuestación: no solo estás comprando tokens; estás comprando un camino de decisión que puede necesitar revisión, reversión o rehacer.
Define el umbral de kill-switch donde el agente se detiene, no donde la factura te sorprenda. Revisa el límite tras cada cambio de modelo o herramienta, y tras cada cambio de enrutamiento.