Estima el coste de inferencia de IA con cinco cifras: la ejecución de 100.000 aceleradores de Z.AI
Una auditoría de inferencia convierte las facturas de IA en aritmética: parámetros activos, tokens por día, aceleradores, coste por token y escalado de prefill/decode.

Antes de comprometerte con un modelo o una pila de hardware, puedes estimar la factura de inferencia a partir de cinco cifras: parámetros activos, tokens por día, aceleradores, coste por token y escalado de prefill/decode. El compromiso está entre el tamaño del modelo y la pipeline que mantiene ocupados los aceleradores. La aritmética es el gasto total de inferencia en dólares dividido entre los tokens servidos. GLM-5.3-Flash se ejecutó en un clúster de aproximadamente 100.000 aceleradores de IA fabricados en China. Ese clúster procesó 100 billones de tokens al día mientras servía GLM-5.3-Flash.
Los parámetros activos marcan el suelo
GLM-5.3-Flash utilizó una arquitectura de mezcla de expertos con 320.000 millones de parámetros totales y solo 18.000 millones activos para una consulta dada. El coste de inferencia sigue la ruta de cómputo activa, no el recuento total de pesos. Un modelo denso paga por cada parámetro en cada solicitud; un modelo enrutado paga por el subconjunto seleccionado mientras almacena el conjunto de pesos más grande. La pregunta de auditoría es si la memoria e interconexión de los aceleradores pueden contener a los expertos inactivos sin limitar la ruta activa.
El tamaño del lote cambia cuántas rutas activas se ejecutan a la vez, por lo que el mismo modelo puede tener un coste por token muy diferente bajo carga ligera y carga pesada. La presión de memoria puede forzar lotes más pequeños, lo que reduce el rendimiento incluso cuando el recuento de parámetros activos no cambia. Los parámetros totales siguen importando para la carga de pesos, el tamaño del checkpoint y el margen de memoria; los parámetros activos importan para la ruta de cómputo por token. Un modelo puede ser rápido por token y aun así ser difícil de desplegar.
El rendimiento es la señal de precio real
GLM-5.3-Flash apareció por primera vez en OpenRouter como Ox Alpha el 20 de agosto, procesó 11 billones de tokens en tres días y captó casi el 31% del tráfico de la plataforma. Esa forma de demanda es la razón por la que una auditoría de inferencia empieza con tokens por día. Un modelo puede parecer barato en un benchmark y aun así consumir aceleradores cuando llegan prompts largos, salidas largas o tráfico en ráfagas. El rendimiento diario convierte una afirmación de calidad en un plan de capacidad. Si el tráfico es irregular, la media no capta el pico que obliga a añadir aceleradores.
Registra los tokens de prompt y los tokens de salida por separado, porque cargan etapas diferentes. Las cargas de trabajo con mucha salida mantienen ocupados a los workers de decode más tiempo; las cargas con mucho prompt tensionan el prefill. Un objetivo diario de tokens es más fácil de defender que un objetivo de solicitudes, porque las solicitudes varían en longitud. Si solo cuentas solicitudes, un chat corto y un documento largo pueden parecer idénticos; el volumen de tokens muestra la diferencia.
El escalado de la pipeline cambia la factura
Z.AI utilizó un diseño de inferencia Encode-Prefill-Decode que permitía escalar las etapas de la pipeline de forma independiente según la demanda. El prefill tiende a ser intensivo en cómputo; el decode tiende a ser intensivo en ancho de banda de memoria. Cuando esas etapas comparten un mismo pool, la etapa más lenta puede limitar a la más rápida. Cuando escalan por separado, puedes añadir capacidad de prefill para prompts largos y capacidad de decode para salidas largas sin sobredimensionar ambas.
El escalado independiente de etapas hace la planificación de capacidad más precisa: puedes identificar la restricción en lugar de depender de la utilización media de los aceleradores. La misma lógica se aplica a la etapa de encode. Si una etapa tiene poca provisión, el resto de la pipeline espera, y la factura de aceleradores sube sin producir más tokens.
El coste por token es la cifra que puedes verificar
Se dijo que GLM-5.3-Flash igualaba el nivel de rendimiento de Claude Opus 4.8 a aproximadamente una décima parte del coste. Esa afirmación relativa es útil, pero no es una cifra de presupuesto. Tu coste por token proviene de la depreciación de aceleradores, energía, red, mano de obra y los tokens que esos recursos sirven realmente. Un precio más bajo puede provenir de parámetros activos más pequeños, más tokens por acelerador o una pipeline que evita etapas inactivas.
Z.AI no reveló qué fabricantes de chips suministraron el clúster de aceleradores de GLM-5.3-Flash. Eso deja la portabilidad del modelo como la comprobación práctica: ¿pueden los mismos pesos ejecutarse en otra familia de aceleradores con un rendimiento aceptable? Si es así, la factura de inferencia es una función de tus propias decisiones de capacidad. Si no, la elección del acelerador se convierte en parte de la estructura de costes del modelo.
Para un equipo de plataforma, mantén el denominador preciso midiendo los tokens realmente devueltos, no los tokens solicitados. Luego compara el resultado con la afirmación relativa y tu propia mezcla de aceleradores. Con esos campos completados, puedes juzgar si un modelo es barato porque es pequeño, barato porque está bien servido, o barato porque la afirmación no está verificada. Si los campos no cuadran, la afirmación de inferencia aún no es un número con el que puedas presupuestar.