#684 · Herramienta de IA y tecnología

Calculadora de rendimiento de inferencia LLM

Convierte la capacidad de generación de un sistema LLM en solicitudes por segundo y tareas por hora. Usa el número de GPU, los tokens generados por segundo, la longitud media de salida, la utilización y el porcentaje de sobrecarga para estimar un rendimiento sostenible, no solo un máximo teórico.

Calculadora

Capacidad de generación y eficiencia
GPU
Aceleradores dedicados al servicio.
tok/s
Rendimiento medido por GPU.
tokens
Longitud media de respuesta.
%
Parte del rendimiento disponible realmente aprovechada.
%
Tiempo perdido en colas, transferencia y coordinación.

Cómo usar esta calculadora

  1. Introduce valores representativos de tu carga real.
  2. Revisa unidades, tarifas y porcentajes antes de calcular.
  3. Pulsa «Calcular» para actualizar el resultado y las métricas secundarias.
  4. Compara el resultado con tu límite, plazo o presupuesto y ajusta los supuestos.

Fórmula

Tokens efectivos/s = GPU × tokens/s por GPU × utilización × (1 − sobrecarga)

Solicitudes/s = tokens efectivos/s ÷ tokens de salida por solicitud.

Qué significa el resultado

El rendimiento expresa cuántas respuestas completas pueden terminarse por unidad de tiempo con la salida media indicada. La tasa de tokens efectiva permite separar capacidad bruta y pérdidas operativas.

La entrada también consume cómputo. Si el prefill es significativo, incorpóralo reduciendo la utilización o usando una tasa medida extremo a extremo.

Ejemplo de cálculo

Ocho GPU a 120 tokens/s, con 75 % de utilización y 12 % de sobrecarga, entregan 633,6 tokens/s efectivos. Para respuestas de 300 tokens equivalen a 2,112 solicitudes/s o 7.603 tareas por hora.

Consejos para obtener mejores resultados

  • Usa mediciones sostenidas durante varios minutos.
  • Separa cargas cortas y largas para evitar promedios engañosos.
  • Incluye la degradación causada por concurrencia alta.
  • Revisa la utilización después de cambiar el tamaño de lote.
  • Compara tareas por hora con la demanda del periodo pico.

Preguntas frecuentes

¿Los tokens de entrada están incluidos en el rendimiento?

No de forma directa. Usa una tasa por GPU medida extremo a extremo o ajusta la utilización para reflejar el coste de procesamiento de entrada.

¿Por qué el tamaño de salida reduce las solicitudes por segundo?

Con una tasa de generación fija, cada respuesta más larga ocupa una mayor parte de los tokens disponibles por segundo.

¿La utilización puede ser del 100 %?

Puede introducirse, pero en producción suele ser prudente usar el valor realmente observado, ya que existen burbujas, colas y variabilidad.

¿Cómo afecta el procesamiento por lotes continuo?

Puede elevar la utilización y el rendimiento, aunque el efecto exacto debe reflejarse en la medición de tokens por segundo.

¿Tareas por hora equivale a usuarios por hora?

Solo si cada usuario genera exactamente una tarea. Para sesiones con varias solicitudes, divide por la media de tareas por usuario.

Resumen de variables

ElementoUso
EntradasDefinen la carga y la capacidad disponible.
Resultado principalResume la decisión operativa más importante.
Métricas secundariasAyudan a comprobar margen, volumen y eficiencia.

Explora las categorías de calculadoras

22 categorías