#682 · Herramienta de IA y tecnología

Calculadora de capacidad de latencia para inferencia LLM

Calcula cuántas solicitudes simultáneas puede sostener un servicio de inferencia LLM a partir de la latencia objetivo, el tiempo medio de respuesta y el caudal por instancia. El resultado ayuda a dimensionar concurrencia, réplicas y margen de seguridad sin confundir velocidad de procesamiento con tiempo total percibido por el usuario.

Calculadora

Latencia, caudal y concurrencia
sol./s
Solicitudes por segundo durante el pico.
s
Tiempo total medio desde la petición hasta la respuesta.
s
Umbral que deseas no superar.
sol./s
Capacidad sostenible medida por réplica.
%
Capacidad reservada para variaciones y picos.

Cómo usar esta calculadora

  1. Introduce valores representativos de tu carga real.
  2. Revisa unidades, tarifas y porcentajes antes de calcular.
  3. Pulsa «Calcular» para actualizar el resultado y las métricas secundarias.
  4. Compara el resultado con tu límite, plazo o presupuesto y ajusta los supuestos.

Fórmula

Concurrencia = solicitudes por segundo × latencia media

Instancias = techo(demanda ÷ [caudal por instancia × (1 − margen)]).

Qué significa el resultado

La concurrencia aproxima las solicitudes que estarán activas al mismo tiempo. Las instancias recomendadas incorporan la reserva indicada, mientras que el margen de latencia compara la experiencia medida con el objetivo.

La relación usa la ley de Little en régimen estable. Colas, lotes dinámicos y picos muy breves pueden exigir pruebas de carga adicionales.

Ejemplo de cálculo

Una demanda de 25 solicitudes/s con 1,8 s de latencia implica unas 45 solicitudes concurrentes. Con 8 solicitudes/s por instancia y 20 % de reserva se recomiendan 4 instancias.

Consejos para obtener mejores resultados

  • Mide la latencia extremo a extremo, no solo el tiempo del modelo.
  • Usa el caudal sostenible, no el máximo instantáneo.
  • Separa objetivos de primer token y respuesta completa.
  • Prueba picos con la misma distribución de longitud que producción.
  • Aumenta el margen cuando la demanda sea imprevisible.

Preguntas frecuentes

¿La latencia de primer token debe sustituir a la latencia total?

No necesariamente. Usa la métrica que corresponda al objetivo de experiencia; para capacidad global suele ser más útil la duración total.

¿Por qué la concurrencia se calcula multiplicando demanda y latencia?

En un sistema estable, el número medio de solicitudes activas equivale a la tasa de llegada multiplicada por el tiempo que permanecen en el sistema.

¿El margen de seguridad reduce el caudal utilizable?

Sí. Reserva una fracción de la capacidad para variaciones, colas, tareas de mantenimiento y picos no previstos.

¿Cómo trato varias clases de solicitudes?

Calcula cada clase por separado o usa medias ponderadas de latencia y caudal si comparten la misma infraestructura.

¿La calculadora incluye autoescalado?

No modela tiempos de arranque ni reglas de autoescalado; añade capacidad mínima suficiente para cubrir ese retraso.

Resumen de variables

ElementoUso
EntradasDefinen la carga y la capacidad disponible.
Resultado principalResume la decisión operativa más importante.
Métricas secundariasAyudan a comprobar margen, volumen y eficiencia.

Explora las categorías de calculadoras

22 categorías