8 septiembre 2026 EN ES
The Serving Desk

The stack under your AI product — models, serving, and what it costs

Despliegue

Evalúa APIs en la nube, modelos autoalojados e intercambios de inferencia

La topología de servicio es una decisión de ubicación de datos: compara egress, latencia p95, residencia, tenencia y coste de migración antes de elegir.

Illustration: Score cloud APIs, self-hosted models, and inference exchanges

Tu latencia p95 y tu factura de egress las determina la ubicación del modelo respecto a tus datos. Equinix Inference Exchange está previsto para disponibilidad general empresarial en el primer trimestre de 2027. Elegir entre APIs en la nube, modelos autoalojados y un intercambio de inferencia es un compromiso de ubicación de datos. La huella de red marca el punto de partida: más de 280 centros de datos en 77 metros, 230 accesos a la nube y más de 10,500 empresas interconectadas. Si tus datos ya están en esos metros, el intercambio acorta la ruta; si no lo están, la misma huella añade distancia.

Las APIs en la nube cambian egress por velocidad

Una API en la nube es la vía más rápida hacia un modelo: los prompts salen, los tokens fluyen de vuelta y la adquisición de GPUs queda fuera del presupuesto. El coste aparece en el egress y en la distancia entre tus datos y el proveedor. Los registros regulados que salen de tu perímetro aumentan la exposición de residencia, y un presupuesto estricto de p95 convierte la ruta de red en la variable principal.

Mide la ruta completa, no solo la llamada a la API. Incluye DNS, TLS, tamaño de la carga, comportamiento de reintentos y la ruta de retorno para los tokens en streaming. Los registros de clientes en los prompts convierten el egress en un evento de cumplimiento. Una pausa visible para el usuario suele señalar la cola de red, no el modelo.

La tenencia es fácil de ignorar en una API en la nube. Compartes el pool del proveedor y aceptas su modelo de aislamiento. Eso está bien para datos públicos, pero no para cargas de trabajo que requieren capacidad dedicada o una pista de auditoría clara.

Los modelos autoalojados cambian capex por aislamiento

El autoalojamiento sitúa el modelo dentro de tu plano de control. Tú posees las GPUs, la pila de servicio y la ruta de red, lo que reduce el egress a tráfico interno y puede mantener los datos regulados dentro de un perímetro. El coste se traslada al hardware, al personal y a las operaciones del modelo.

La carga operativa es el compromiso. Dimensionas para el tráfico de pico, parcheas la capa de servicio y mantienes la disponibilidad. Cada cambio en el modelo, el pool de GPUs o la ruta de red obliga a revisar el contrato de servicio, el modelo de costes y el presupuesto de latencia. Un catálogo amplio se convierte en un problema de adquisición. Un único modelo con alta utilización es donde el autoalojamiento es más limpio.

El intercambio cambia migración por proximidad

Equinix Inference Exchange fue anunciado junto con Equinix Fabric One en Equinix Horizon. El lanzamiento se vinculó a una ampliación de la asociación Equinix-NVIDIA y a una nueva colaboración Equinix-Together AI. Together AI suministra la capa de software de servicio de inferencia, que soporta más de 200 modelos de código abierto.

Las instalaciones de Equinix ya alojan a ocho de los diez principales proveedores de modelos de IA y a nueve de las diez principales nubes de IA. La plataforma soporta entornos multitenant compartidos y topologías single-tenant dedicadas.

Mapea la ruta real antes de comprometerte: dónde están tus datos, dónde se ejecutará el modelo y dónde se sitúa la conexión a la nube. Documenta qué cruza un perímetro y por qué. Para topologías compartidas, registra los controles de aislamiento. Para topologías dedicadas, registra la reserva de capacidad y la ruta de salida.

La puntuación de topología decide al ganador

Para un ingeniero de plataformas de IA empresarial, la calidad del modelo es solo una entrada. La decisión gira en torno a dónde se sitúa el modelo respecto a tus datos, tu red y tu perímetro de cumplimiento.

  • Coste de egress: el precio de mover datos entre el modelo y los datos, más el tráfico de retorno.
  • Latencia p95: latencia de cola bajo tu mezcla real de tráfico.
  • Exposición de residencia: cuánto dato regulado cruza un perímetro.
  • Aislamiento de tenencia: pool compartido frente a capacidad dedicada.
  • Coste de disponibilidad/migración: tiempo de inactividad, reentrenamiento y recertificación.

Ejecuta la carga de trabajo contra cada topología con una mezcla de prompts, tamaño de datos y restricciones de cumplimiento idénticos. Registra los resultados para cada entrada. El ganador es la topología que mantiene la ruta regulada corta y la ruta operativa clara.

Las APIs en la nube lideran en velocidad hacia producción, pero pierden en egress cuando tus datos son voluminosos. Los modelos autoalojados compran aislamiento a cambio de carga operativa. El intercambio encaja mejor cuando tus datos, tu ruta de red y tus proveedores de modelos ya comparten ubicación. Para una empresa con datos regulados, el veredicto es condicional: presupuestos de p95 impulsados por la distancia favorecen probar el intercambio; una utilización estable favorece el autoalojamiento; la velocidad hacia producción por encima del egress favorece una API en la nube.

Publicidad