Crea una planilla de costo por token que fije el piso de precio de inferencia
Una planilla de seis líneas convierte la economía de los aceleradores en un piso de precio por token defendible antes de fijar el precio de la inferencia.

El dilema no es si un acelerador más rápido parece impresionante en una demostración. Es si tu flota puede sostener suficientes tokens útiles por vatio, con suficiente utilización, para que el piso de precio por token sea menor que el precio que puedes cobrar. Si la respuesta es no, un acelerador más barato o un mejor programador pueden superar a un modelo más grande. La aritmética es simple: el costo total dividido entre los tokens producidos fija el piso. Todo lo demás es margen.
Por eso NVIDIA describe cada vez más un centro de datos no como un lugar que almacena servidores, sino como una fábrica de IA.
Por qué el costo por token es la línea real de margen
Para la inferencia, la métrica operativa que conecta la ingeniería con las finanzas es el costo por token. Los materiales de NVIDIA sobre economía de tokens tratan esa métrica como una métrica operativa clave vinculada al precio de la inferencia y a la rentabilidad.
Las métricas subyacentes no son decorativas. Los tokens por vatio te indican la eficiencia energética. La utilización te indica cuánta capacidad pagada está produciendo trabajo útil. El tiempo de actividad te indica cuánta parte de la flota está disponible cuando los clientes la necesitan. El costo por token es el resultado después de que todas esas fuerzas colisionan.
La utilización de GPU es la variable oculta porque es fácil ocultarla en un panel. Si la red se detiene, la memoria no puede alimentar la computación lo suficientemente rápido, o el software programa mal las cargas de trabajo, entonces el rendimiento teórico de la GPU se vuelve irrelevante.
La planilla: seis líneas que fijan un piso
Construye la planilla en seis líneas. Consérvala en las mismas unidades que usa tu equipo de finanzas, y expresa la respuesta final en dólares de EE. UU. por token. No comiences con una cotización de proveedor; comienza con el comportamiento medido en producción.
- Tokens por segundo por nodo. Mide los tokens de salida durante una ventana sostenida bajo tu mezcla real de tráfico. Incluye la longitud del prompt, la longitud de la salida, el comportamiento de los lotes y la versión del modelo. Si ofreces varios modelos, registra tokens por segundo para cada clase de modelo, no solo para el modelo insignia.
- Tokens por vatio. Divide los tokens por segundo medidos entre el consumo de energía del nodo. Incluye el acelerador, la memoria, la CPU, el almacenamiento y las interfaces de red en la definición del nodo. Esta línea revela si un acelerador más rápido está mejorando la eficiencia energética o solo el rendimiento pico.
- Utilización sostenida. Mide la proporción del tiempo de cómputo disponible que se emplea produciendo tokens útiles. No uses la utilización pico. Usa la ventana que coincide con tu ciclo de precios. Si la utilización es baja, el problema puede ser la gestión de la demanda, la programación, los lotes o el dimensionamiento de la capacidad, no la calidad del modelo.
- Costos de energía, refrigeración y redes. Añade el costo de energía para el cómputo y la red, el sobrecosto de refrigeración y el costo amortizado del tejido de red. La refrigeración no es una nota al pie: los costos de capital en una fábrica de IA incluyen aceleradores, redes, edificios, transformadores, refrigeración, generación de energía y financiación.
- Mezcla de flota. Pondera cada modelo, clase de hardware y región por la proporción de tokens que sirve. Una flota no es una sola máquina. Es un portafolio de curvas de costo. Si un modelo pequeño maneja la mayor parte del tráfico, su costo por token puede dominar tu piso combinado incluso si el modelo grande recibe la atención del marketing.
- Piso de precio por token. Divide el costo total entre los tokens totales. El costo total debe incluir capital amortizado, energía, refrigeración, redes y los sobrecostos operativos necesarios para mantener la flota disponible. El resultado es el precio mínimo que cubre el costo de producción. No es un margen objetivo. Es la línea por debajo de la cual estás comprando crecimiento con pérdidas.
La aritmética es lo esencial. Si el costo total es C y los tokens totales son T, el piso es C dividido entre T. Si cambias la mezcla de flota, la fórmula no cambia; cambian las entradas. Por eso la planilla supera a una prueba de rendimiento puntual. Obliga al equipo a declarar qué supuestos cambiaron: rendimiento, eficiencia, utilización, energía o mezcla.
Cómo usarla antes de fijar precios
Usa la planilla en tres contextos. Primero, antes de comprometerte con un nuevo acelerador o despliegue de modelo, pregunta cuál será el piso bajo la mezcla de tráfico proyectada. Si el piso está por encima del precio que puedes cobrar, el despliegue es un problema de margen, no un problema técnico. Segundo, úsala para comparar opciones de servicio: un modelo más pequeño con menos tokens por segundo puede superar a un modelo más grande si sus tokens por vatio y su utilización son mejores. Tercero, úsala para establecer alertas internas: si el costo por token medido se eleva por encima del piso que usaste en la fijación de precios, el equipo debe saberlo antes de la próxima previsión de ingresos.
Comienza con la flota actual. Mide tokens por segundo, tokens por vatio, utilización y consumo de energía para una carga de trabajo de producción. Construye la planilla de seis líneas. Luego compárala con el precio que cobras. Si el piso está cerca del precio, tu margen es más delgado de lo que parece. Si el piso está muy por debajo del precio, tienes espacio para invertir en programación, lotes o mezcla de flota. El objetivo es saber, antes de la próxima decisión de precios, si el stack puede producir tokens lo suficientemente baratos para sobrevivir.