Economía de modelos
Estrategias de enrutamiento LLM: coste, calidad, latencia y disponibilidad
Compara reglas, coste, latencia y calidad para construir una selección de modelos explicable.

Qué aprenderás
- Define the product objective before selecting a routing strategy.
- Use hard constraints before weighted optimization.
- Log policy version and route inputs so decisions are explainable.
Antes de empezar
- Basic HTTP and API knowledge
Leave with a concrete implementation checklist and a testable starting point.
Conclusiones clave
- Define primero el objetivo del producto.
- Aplica restricciones duras antes de optimizar.
- Registra la versión de política y sus entradas.
Empieza por el objetivo
El enrutamiento es un problema de optimización. Un clasificador puede priorizar coste y latencia; un agente de código puede priorizar calidad y contexto.
Escribe el objetivo y las restricciones antes de elegir el algoritmo.
Comparación
Las reglas son predecibles y auditables; el coste ayuda con mucho volumen; la latencia requiere telemetría; la calidad exige evaluaciones representativas.
Un enfoque híbrido aplica restricciones duras y después pondera los modelos elegibles.
Primera versión segura
Empieza con una lista corta y reglas explícitas. Añade señales en vivo solo cuando puedas explicar cada decisión a partir de los registros.
Cómo elegir
| Criterio | Opción A | Opción B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
Pasos de implementación
- 1
Define restricciones de calidad, coste, latencia y disponibilidad.
- 2
Crea una lista de modelos elegibles.
- 3
Añade una señal de optimización cada vez.
- 4
Evalúa los resultados con tráfico real.
Ejemplo para copiar
eligible = models where endpoint_supported && account_enabled
route = argmin(cost) subject to quality >= threshold and p95 <= budgetPreguntas frecuentes
¿Debe elegir siempre el modelo más barato?
Solo si cumple las restricciones de calidad, latencia y disponibilidad.
Fuentes
- EasyAI documentationFuente verificada 2026-08-27