8 septiembre 2026 EN ES
The Serving Desk

The stack under your AI product — models, serving, and what it costs

Costes

Usa VCF solo para inferencia si la latencia de vLLM, la programación de GPU y los $/M tokens superan a la API gestionada

Trata VCF como plataforma privada de inferencia solo cuando la latencia de vLLM medida, la programación de GPU y la economía de tokens superen a una API de modelos gestionada.

Illustration: Use VCF for Inference Only If vLLM Latency, GPU Scheduling, and $/M Tokens Beat the Managed API

La compensación es simple: un endpoint privado de VCF reemplaza el gasto de API por token con costos fijos de GPU, almacenamiento, red y operaciones, por lo que solo gana cuando (GPU-horas + almacenamiento + red + operaciones) / tokens es menor que el precio de la API gestionada y el p95 TTFT se mantiene dentro de tu SLO. Si esa aritmética no se cumple, el endpoint privado es un proyecto de cumplimiento o control, no un proyecto de costo.

Broadcom anunció que los principales modelos de IA de proveedores que incluyen Google, NVIDIA, NEC, Alibaba Cloud y Z.ai están validados para ejecutarse en VMware Cloud Foundation. El anuncio indica que VCF permite a los clientes llevar estos modelos de IA a las instalaciones y ofrecer modelo como servicio. Se cita una perspectiva de Broadcom que afirma que el 56% de las empresas ya están ejecutando o planean ejecutar inferencia de IA en producción en la nube privada. Esa dirección del mercado no elimina la prueba de ingeniería: la inferencia privada debe superar a la API en latencia, programación y economía de tokens antes de merecer tráfico de producción.

Costos

Construye la tabla de puntuación en dólares de EE. UU. por M de tokens de salida, no por GPU. El endpoint privado tiene cinco partidas de costo: amortización de hardware, energía y refrigeración, almacenamiento y red, operaciones de plataforma y capacidad ociosa. La API gestionada tiene al menos tres: precio por token, límites de tasa o capacidad reservada, y egreso o manejo de datos si aplica. La regla de decisión no es si VCF puede ejecutar modelos; es si tu $/M tokens privado combinado es menor que el precio de la API después de añadir el costo de cumplir tu SLO.

Ejecuta una ventana de medición corta. Registra tokens de entrada, tokens de salida, aciertos de caché, tamaño de lote, concurrencia y utilización de GPU. Convierte cada partida a $/M tokens de salida. Si tu endpoint privado es más barato solo en utilización máxima, no es más barato para tu tráfico. Si es más barato en tu utilización mediana y p95 reales, es un candidato. Si es más caro pero otorga control de datos, etiquétalo como costo de cumplimiento y asígnale presupuesto como tal.

No consideres la paridad de benchmarks como una afirmación de costo. Se afirma que pruebas de benchmark independientes bajo los estándares de MLPerf Inference v5.1 muestran que VCF ofrece un rendimiento comparable al de bare metal. Eso importa porque la sobrecarga de virtualización puede convertir una GPU barata en una cara cuando la latencia TTFT o inter-token se desvía. El número que necesitas no es los tokens por segundo pico; son los tokens por segundo sostenidos en tu concurrencia objetivo, con p95 TTFT y latencia inter-token dentro de SLO.

Modelos

vLLM se describe como el runtime de modelos predeterminado y se afirma que permite a los clientes ejecutar más de 150 modelos de código abierto en VCF. Ese es el punto de partida de portabilidad. Tu catálogo de modelos debe evaluarse por tres propiedades: soporte de cuantización, longitud de contexto y throughput de servicio en la GPU elegida. Un modelo que se ejecuta en un notebook no es un modelo de servicio. Un modelo que resiste la distribución de prompts de tu producción, con prompts de sistema realistas, llamadas a herramientas y reintentos, es un modelo de servicio.

Para la portabilidad de modelos, prueba el mismo checkpoint en VCF y en una API gestionada que sirva la misma familia de modelos. Compara la calidad en un conjunto de evaluación fijo y luego compara la latencia y el costo. Si el modelo privado es una cuantización diferente, una ventana de contexto diferente o un comportamiento de tokenizador diferente, la comparación no es paridad. Es un cambio de producto. Inclúyelo en el caso de negocio.

Mantén la lista de modelos estrecha. Una plataforma privada de inferencia no es un catálogo de modelos. Es un endpoint de servicio para los modelos que tu producto realmente invoca. Si necesitas muchos modelos pequeños, agrúpales en lotes. Si necesitas un modelo grande, optimízalo. Si necesitas ambos, separa los pools de GPU y el modelo de costos. La tabla de puntuación debe mostrar la portabilidad de modelos como una lista de aprobado/no aprobado: modelo, cuantización, longitud de contexto, p95 TTFT, latencia inter-token, $/M tokens y modo de fallo.

Servicio

El servicio es donde los endpoints privados ganan o pierden. VCF admite cómputo mixto en AMD, Intel y NVIDIA, permitiendo a los clientes elegir hardware de GPU y CPU para cargas de trabajo de IA. Esa flexibilidad es útil, pero también aumenta la superficie de programación. Necesitas una política de pool de GPU que indique qué cargas de trabajo pueden compartir un dispositivo, qué cargas de trabajo obtienen dispositivos exclusivos y qué cargas de trabajo pueden ser preempidas. Sin esa política, un trabajo por lotes de baja prioridad puede llevar el p95 TTFT por encima de SLO.

Prueba bin-packing y preemción bajo carga. Comienza con una carga en estado estable que coincida con producción. Luego añade un pico. Luego añade una solicitud de larga duración. Luego añade un trabajo por lotes preemible. Registra p95 TTFT, latencia inter-token, tiempo de cola y utilización de GPU. El endpoint privado debe mostrar una latencia de cola estable cuando cambia la mezcla. Si la latencia de cola salta cuando aterriza una segunda carga de trabajo, tu programador no está listo para producción.

La red y el almacenamiento no son costos de fondo. El servicio de inferencia es sensible al throughput de NIC, los IOPS de almacenamiento y el ancho de banda de memoria. Un modelo que se carga lentamente aumentará el TTFT. Una caché KV que se desborda a almacenamiento lento aumentará la latencia inter-token. Una ruta de red que añade jitter hará que el autoescalado parezca roto. Mide la ruta, no solo la GPU. Si tu p95 TTFT está dominado por la carga del modelo o un fallo de caché, corrige el almacenamiento y la red antes de comprar más GPUs.

Usa la tabla de puntuación como filtro. Portabilidad de modelos: vLLM puede servir los modelos de código abierto objetivo con calidad aceptable. Programación de GPU: el pool, el bin-packing y la política de preemción mantienen la latencia de cola dentro de SLO. Red y almacenamiento: p95 TTFT y latencia inter-token son estables bajo carga mixta. Paridad de benchmarks: los resultados de benchmarks externos se usan para verificar la sobrecarga de virtualización, no para reemplazar tu propia prueba de tráfico. Economía: el $/M tokens privado es menor que el de la API gestionada, o el valor de control de datos y cumplimiento está explícitamente valorado. Si las cinco pasan, VCF es una plataforma privada de servicio de inferencia. Si alguna falla, mantén la API gestionada y vuelve a evaluar cuando cambie la aritmética.

Publicidad