#792 · Herramienta de IA y tecnología

Calculadora de GPU para caché de prompts

Esta herramienta estima el número de GPU requerido después de descontar los tokens de entrada que la caché evita reprocesar. Introduce tus supuestos operativos para obtener un resultado principal, métricas complementarias y una lectura práctica que facilite la planificación. Los cálculos se realizan localmente en el navegador y sirven para comparar escenarios, dimensionar capacidad y detectar cuellos de botella antes de comprometer presupuesto o infraestructura.

Calculadora

Parámetros del escenario
sol/s
tokens
%
%
tokens
tokens/s
%

Cómo usar esta calculadora

  1. Introduce los valores de carga, rendimiento y coste correspondientes a tu escenario.
  2. Revisa que las unidades coincidan con las utilizadas por tu proveedor o equipo.
  3. Pulsa Calcular para actualizar el resultado.
  4. Compara escenarios modificando una variable cada vez.

Fórmula

Tokens efectivos = entrada × (1 − tasa de aciertos × porción reutilizada) + salida. GPU = techo[(solicitudes/s × tokens efectivos) ÷ (tokens/s por GPU × utilización)].

Qué significa el resultado

El entero final es la cantidad mínima teórica de GPU para el promedio especificado.

No incluye límites de memoria, paralelismo del modelo, latencia de interconexión ni redundancia; añade réplicas según tu arquitectura.

Ejemplo de cálculo

Con 25 sol/s, 3.000 tokens de entrada, 65 % de aciertos, 80 % reutilizado, 500 de salida, 18.000 tokens/s por GPU y 75 % de utilización, se requieren 4 GPU.

Consejos para obtener mejores resultados

  • Usa rendimiento medido con tu lote real.
  • Comprueba memoria además de cómputo.
  • Calcula un escenario p95 de solicitudes.
  • Reserva una réplica para mantenimiento cuando sea necesario.

Preguntas frecuentes

¿La caché reduce también los tokens de salida?

No en este modelo; solo reduce el reprocesamiento de la parte reutilizable de entrada.

¿Por qué se redondea hacia arriba?

Una fracción de GPU no cubre la carga por sí sola.

¿La utilización objetivo puede ser 100 %?

Puede introducirse, pero deja poco margen para variaciones y suele ser menos robusto.

¿Incluye redundancia por fallo?

No. Debes añadirla según tu nivel de disponibilidad.

¿Qué rendimiento por GPU debo usar?

El medido con el mismo modelo, precisión, lote y longitud de contexto.

Guía de métricas

MétricaUso
Tokens efectivosCarga computacional después de la caché.
Demanda totalTokens procesados por segundo.
UtilizaciónFracción operativa del rendimiento máximo.

Explora las categorías de calculadoras

22 categorías