8 septiembre 2026 EN ES
The Serving Desk

The stack under your AI product — models, serving, and what it costs

Modelos

Pipeline de enrutamiento de modelos con pesos abiertos por defecto

Enruta la mayoría de los tokens de producción hacia modelos de pesos abiertos y reserva las APIs cerradas para excepciones puntuales que superen las puertas de calidad, coste y latencia.

Illustration: Open-Weights-First Model Routing Pipeline

Tu enrutador de modelos decide qué tokens pagan el recargo de las APIs cerradas. Los pesos abiertos pueden soportar la mayor parte del volumen de tokens de producción a un menor coste unitario, mientras que las APIs cerradas siguen siendo útiles para brechas de capacidad puntuales. Los modelos abiertos soportan aproximadamente el 80% al 90% del volumen de tokens empresarial, representando solo el 10% al 20% de los presupuestos de IA. En el punto medio, el 15% restante de tokens consume el 85% del presupuesto. Usa tres puertas: paridad de calidad, coste por millón de tokens y latencia p95. Haz de los pesos abiertos el carril por defecto y enruta hacia APIs cerradas solo cuando una puerta justifique la excepción.

Pesos abiertos por defecto antes de comprar capacidad de API

El servicio de modelos abiertos es ahora una vía mainstream. La plataforma de Ollama incluye 9 millones de desarrolladores, 178.000 estrellas en GitHub y una adopción que abarca el 85% de la Fortune 500. AT&T ahora enruta el 40% de su consumo de tokens a través de modelos de pesos abiertos. El uso de tokens en Ollama Cloud aumentó 150 veces desde el inicio de 2026. Los agentes de codificación a principios de 2026 y la ola de agentes OpenClaw/Hermes en abril de 2026 fueron los dos puntos de inflexión en el uso de tokens de Ollama Cloud.

El trabajo de agentes de larga duración cambió la ecuación. Las ventanas de contexto de los modelos abiertos se expandieron de 128K a más de 1 millón de tokens, un habilitador clave para el trabajo de agentes largo y de múltiples pasos. Esa expansión convierte el trabajo de contexto largo de un supuesto de API cerrada en una decisión de enrutamiento medible. Si tu función envía un transcript largo, una base de código o un plan de múltiples pasos, la ruta abierta puede manejarlo ahora sin un respaldo cerrado.

  • Inventario de llamadas de modelos. Etiqueta cada llamada con la función, el volumen de tokens, la longitud de contexto y el proveedor actual. Salida: una tabla donde cada endpoint tiene un responsable y un coste medido por millón de tokens.
  • Servicio base de pesos abiertos. Establece una ruta de servicio para el modelo abierto que soportará la ruta por defecto. Lanza cuando el endpoint tenga contadores de tokens, tasas de error y un histograma de latencia.
  • Lista corta de modelos abiertos. Comienza con modelos que ya soportan tráfico real. En la plataforma en la nube de Ollama, los modelos de origen chino dominan el consumo, con DeepSeek a la cabeza y GLM muy cerca. Salida: candidatos que se ajusten a tu longitud de contexto y herramientas.
  • Mide la paridad de calidad. Ejecuta el mismo conjunto de evaluación para el modelo abierto y el modelo cerrado. Aprobado cuando el modelo abierto cumple la barra de calidad de la función en las tareas que importan.
  • Compara el coste por millón de tokens. Coloca ambos endpoints con la misma mezcla de entrada y salida. Salida: una cifra en dólares por millón de tokens, no el precio de lista del proveedor.
  • Verifica la latencia p95. Mide bajo una carga similar a producción, no con una sola solicitud caliente. Aprobado cuando la p95 se ajusta al plazo visible para el usuario.
  • Enruta por función. Vincula cada función del producto a una ruta de modelo, no a un nombre de proveedor. Listo cuando una función puede cambiar de ruta sin un cambio de código.
  • Registra la decisión. Anota qué puerta permitió o bloqueó cada modelo. La pista de auditoría explica por qué una solicitud fue a la ruta abierta o a la ruta cerrada.

Mantén las APIs cerradas como excepciones condicionadas

Una puerta fallida mantiene un modelo fuera de la ruta por defecto. Una puerta superada traslada el tráfico a la ruta abierta. Las APIs cerradas siguen siendo excepciones. Enruta por calidad, coste y latencia p95 medidos, no por nombre de modelo o costumbre del proveedor. Usa la ruta cerrada solo cuando una tarea necesite una capacidad que el modelo abierto no pueda igualar, se aplique una restricción de datos propietarios o un requisito de latencia supere el endpoint abierto. Registra la puerta fallida, el responsable y la fecha de revisión.

Haz que la ruta por defecto sea aburrida

Mantén la ruta por defecto predecible. Versiona el modelo, fija el stack de servicio y prueba las actualizaciones contra el mismo conjunto de evaluación. Un despliegue debería promover, pausar o revertir un nuevo modelo abierto sin tocar el código del producto. Expón el nombre del modelo, la versión del prompt, el recuento de tokens y la decisión de ruta en la misma línea de registro. La traza responde por qué una solicitud tomó la ruta que tomó.

Mide el respaldo como una línea presupuestaria

Informa los resultados de las puertas para cada llamada de modelo. Sigue la proporción de tokens en pesos abiertos, la proporción en APIs cerradas y el coste por millón de tokens de cada ruta. El panel mantiene la ruta de excepción lo suficientemente pequeña como para justificarla. Revisa la lista de excepciones con una cadencia regular. Si un modelo abierto ahora supera la puerta, traslada el tráfico de vuelta. Si la ruta cerrada sigue creciendo, documenta la razón de producto y vuelve a revisar las puertas.

Publicidad