#672 · Herramienta de IA y tecnología

Calculadora de capacidad de latencia para agentes de IA

Calcula la latencia esperada de un agente de IA a partir del tiempo del modelo, las herramientas secuenciales y la sobrecarga de infraestructura. También compara el resultado con un objetivo de servicio y estima cuántas tareas por minuto puede sostener una cantidad determinada de ejecuciones concurrentes.

Calculadora

Tiempo de respuesta y concurrencia
ms
ms
llamadas
ms
ms
tareas

Cómo usar esta calculadora

  1. Indica la latencia media del modelo.
  2. Añade el tiempo medio de cada herramienta y cuántas se ejecutan en secuencia.
  3. Incluye la sobrecarga de red, colas y orquestación.
  4. Define la latencia objetivo y la concurrencia disponible.

Fórmula

Latencia = modelo + (herramienta × llamadas secuenciales) + sobrecarga

Capacidad/min = concurrencia × 60.000 ÷ latencia en ms

Qué significa el resultado

Una latencia inferior al objetivo deja margen operativo. La capacidad por minuto supone que las ejecuciones concurrentes permanecen ocupadas de forma continua.

No incluye colas externas variables ni límites de tasa del proveedor. Usa percentiles reales, no solo promedios, para compromisos de nivel de servicio.

Ejemplo de cálculo

Con 1.800 ms de modelo, 3 herramientas de 450 ms y 300 ms de sobrecarga, la latencia es 3.450 ms. Con 20 tareas concurrentes, la capacidad teórica es aproximadamente 347,8 tareas por minuto.

Consejos para obtener mejores resultados

  • Paraleliza herramientas independientes.
  • Mide p50, p95 y p99 por separado.
  • Evita cadenas de llamadas innecesariamente largas.
  • Mantén conexiones reutilizables.
  • Añade límites de tiempo y rutas de degradación.

Preguntas frecuentes

¿La calculadora supone llamadas secuenciales?

Sí. Multiplica la latencia de herramienta por el número de llamadas secuenciales.

¿Cómo calculo herramientas en paralelo?

Introduce como latencia de herramienta el tiempo del camino paralelo más lento y ajusta las llamadas secuenciales.

¿La capacidad por minuto incluye tiempos de espera en cola?

No. Es una capacidad teórica basada en la latencia introducida y la concurrencia disponible.

¿Qué latencia debo usar, media o percentil 95?

Para planificación conservadora suele ser más útil el percentil 95.

¿Qué significa un margen negativo?

Indica que la latencia estimada supera el objetivo de servicio.

Componentes de latencia

ComponenteImpacto
ModeloGeneración y razonamiento
HerramientasAPIs, búsquedas y bases de datos
SistemaRed, cola y orquestación

Explora las categorías de calculadoras

22 categorías