8 septiembre 2026 EN ES
The Serving Desk

The stack under your AI product — models, serving, and what it costs

Modelos

Elige un SLM de 2,4B cuando tu flujo de trabajo supere los umbrales de costo, latencia y privacidad; de lo contrario, paga por un modelo frontera

Usa un modelo de lenguaje pequeño cuando la tarea está acotada, las evaluaciones pasan y el despliegue encaja en tu presupuesto de latencia y privacidad; de lo contrario, compra un modelo frontera.

Illustration: Pick a 2.4B SLM when your workflow clears the cost, latency, and privacy gates; otherwise pay for frontier

Costos

La compensación es simple: un modelo de lenguaje pequeño puede ser la respuesta correcta cuando la tarea está acotada, pero solo si supera tus umbrales de costo, latencia y privacidad. Haz la aritmética antes que la opinión: tokens por solicitud × solicitudes por mes × precio por token, luego compara la latencia de cola contra el umbral del producto. Si el modelo pequeño supera esos umbrales, úsalo; si no, paga por el modelo frontera.

El argumento de costo no se trata de ser barato. Se trata de ajustar el modelo al trabajo. Algunos flujos de trabajo empresariales pueden atenderse mejor con un modelo de lenguaje pequeño o un LLM enfocado.

Construye el umbral de costo a partir del producto, no de la ficha del modelo. Comienza con la latencia de cola máxima aceptable, el precio máximo aceptable por token y la tasa de falla máxima aceptable. Luego haz la misma matemática para el modelo pequeño y el modelo frontera. Si el modelo pequeño está dentro del presupuesto del producto y la tasa de error es aceptable, el modelo frontera es un impuesto a un trabajo que no necesita hacer.

En la práctica, el despliegue de un SLM en el borde puede reducir los costos de capital en la nube, la latencia de red y las preocupaciones por la privacidad de los datos.

Modelos

La elección del modelo debe hacerse según tu evaluación, no según el número de parámetros. Por ejemplo, MiniCPM-2B se describe como un modelo de 2,4 mil millones de parámetros, excluyendo los de incrustación, cuyo rendimiento en pruebas de referencia rivaliza o supera al de modelos históricos más grandes.

Construye un conjunto de evaluación pequeño que se parezca a producción. Incluye los casos difíciles: entradas ambiguas, campos faltantes, texto ruidoso y los casos límite que hicieron doloroso el último lanzamiento. Evalúa el modelo pequeño en coincidencia exacta, precisión a nivel de campo, comportamiento de rechazo y validez de formato. Si falla en los casos que importan, no lo parches con un prompt más grande. Pasa al modelo frontera o rediseña la tarea.

Si la salida es un objeto restringido, una etiqueta o una transformación corta, un modelo abierto ajustado a datos internos puede ser la mejor elección de ingeniería. Si la salida requiere razonamiento de largo horizonte, conocimiento amplio del mundo o planificación multietapa, el modelo frontera puede ser el único que sobreviva a la evaluación.

No trates el modelo pequeño como un modelo frontera más débil. Trátalo como un componente diferente. Debe tener un contrato más estrecho, un esquema más estricto y una ruta de respaldo más clara. Si el modelo pequeño no está seguro, debe decirlo o derivar a un humano, no alucinar una respuesta plausible.

Servicio

El servicio es donde la decisión se vuelve real. Los casos de uso en el dispositivo o en operaciones físicas favorecen modelos eficientes que pueden ejecutarse cerca de donde se generan los datos.

Usa una lista de verificación de cuatro umbrales antes de comprometerte con un modelo de lenguaje pequeño. Primero, la tarea tiene un esquema de salida estrecho. Segundo, el modelo pequeño pasa tu evaluación interna. Tercero, el despliegue puede ser en el borde, en las instalaciones o en un entorno aislado de red. Cuarto, la latencia de cola y el precio por token están por debajo del umbral del producto. Si se superan tres o más umbrales, usa el modelo pequeño. Si no, usa el modelo frontera y conserva el modelo pequeño para las subtareas acotadas que realmente puede manejar.

La prueba final es aburrida: ¿puedes medirla? Si puedes medir la latencia, el costo, la precisión y la tasa de falla, puedes hacer la elección del modelo. Si no puedes, no estás eligiendo una pila. Estás adivinando una factura.

Publicidad