Reduce los costes de tokens de IA con enrutamiento de lecturas masivas y límites de contexto
Un marco de costes en cuatro pasos: clasifica la tarea, enruta por coste del modelo, limita el contexto y mide el ahorro de tokens frente a calidad y latencia.

El coste del modelo por tarea define la factura
El coste del modelo por tarea define la factura. Una prueba en un monorepo de Java demostró que la ruta de lector masivo redujo el uso de tokens de Claude Code en esas lecturas en aproximadamente un 90%. Una previsión de Gartner fechada el 24 de junio de 2026 proyecta que los costes de tokens de IA para programación superarán el salario medio de un desarrollador para 2028. La investigación en enrutamiento de producción encontró que el enrutamiento inteligente de modelos puede reducir las facturas de IA para programación entre un 40% y un 85% sin pérdida visible en la calidad de la salida. La factura depende de qué modelo responde y cuánto contexto ve. Para los agentes de programación con IA, el control duradero es el enrutamiento a nivel de tarea, no el pulido del prompt.
Enruta por clase de tarea antes de generar el prompt
Clasifica la tarea antes de que el modelo la vea. Empieza por la unidad de trabajo, no por el prompt. Las lecturas masivas piden orientación: qué archivos existen, qué símbolos están presentes, qué patrones se repiten. El trabajo de patrones superficiales es búsqueda o transformación mecánica. Las ediciones precisas modifican una región pequeña y conocida. El trabajo de depuración necesita razonamiento causal. El trabajo de juicio requiere análisis de compensaciones. La salida es una etiqueta en cada solicitud: lectura masiva, patrón superficial, edición precisa, depuración o juicio.
La configuración de Portal de Spotify usaba AiKA Modes con una extensión de derivación de Claude Code. Las tareas repetitivas de programación con mucha E/S iban a Gemini 2.5 Flash, mientras que Claude se encargaba del trabajo preciso de archivos, ediciones, depuración y juicio complejo. El modelo económico maneja la entrada y salida de alto volumen. El modelo caro maneja el trabajo donde un error de suposición cuesta un rollback. La división es control de costes a nivel de tarea, no ajuste de prompt a nivel de oración.
Enruta por coste del modelo una vez que existe la etiqueta. La política envía las lecturas masivas a un trabajador más económico y reserva el modelo más potente para ediciones precisas, depuración y juicio complejo. Haz la política declarativa, no una nota en un archivo. El enrutamiento consultivo es fácil de ignorar; un hook es más difícil de eludir. Si falta la etiqueta, usa el modelo caro por defecto y registra la brecha. La regla de enrutamiento permanece visible en la traza, no oculta en un prompt.
Los límites de contexto protegen la calidad
Limita el contexto con hooks de tamaño de archivo antes de que el modelo caro lea un archivo entero. El contexto es el multiplicador. Un modelo económico aún puede consumir tokens si lee un archivo grande, y un modelo caro puede usar más si recibe un repositorio completo. El límite se sitúa antes de la lectura, no después de que se construye el prompt.
El control es un hook que bloquea lecturas por encima de un umbral de líneas. Spotify sustituyó el enrutamiento consultivo de CLAUDE.md por hooks PreToolUse en el plugin de derivación; un hook de prelectura detiene las lecturas por encima del umbral predeterminado de 350 líneas. El hook obliga al agente a solicitar un resumen, un fragmento o una búsqueda dirigida en lugar de enviar un archivo grande al prompt. Haz el umbral configurable por repositorio. Un archivo generado puede merecer un límite diferente que un módulo escrito a mano. Un archivo adyacente a binarios puede no merecer ninguna lectura.
Los límites pueden ocultar el archivo relevante. El trabajador de bajo coste detectó patrones evidentes pero pasó por alto un sutil defecto de seguridad de hilos; Claude lo encontró rápidamente una vez que se le dio el contexto relevante. Un límite recorta contexto, no la línea que importa. Si el modelo caro necesita una región específica, la capa de enrutamiento le entrega esa región, no una suposición.
Mide la factura, no las sensaciones
Mide el ahorro de tokens frente a calidad y latencia. El panel compara tokens por tarea, tasa de error y tiempo de respuesta antes y después del enrutamiento. Registra la ruta económica y la ruta cara por separado. Una victoria de enrutamiento que oculta una pérdida de calidad no es una victoria. Una victoria de latencia que oculta una carga de revisión no es una victoria. El número que importa es el ahorro en las tareas que dominan el gasto, no el ahorro medio.
Las llamadas delegadas añadieron latencia, con respuestas típicas de 10 a 30 segundos y Portal limitando una invocación a 30 segundos. Establece una métrica de tiempo de revisión. Si la ruta económica ahorra tokens pero añade tiempo de revisión, la factura se movió, no desapareció. Compara la factura enrutada con la línea base en el mismo conjunto de tareas. Si la ruta enrutada no supera esa prueba, ajusta el límite o devuelve la tarea al modelo caro.