#793 · Herramienta de IA y tecnología

Calculadora de rendimiento con caché de prompts

Esta herramienta estima el rendimiento sostenible de solicitudes al reducir los tokens que deben procesarse en cada petición. Introduce tus supuestos operativos para obtener un resultado principal, métricas complementarias y una lectura práctica que facilite la planificación. Los cálculos se realizan localmente en el navegador y sirven para comparar escenarios, dimensionar capacidad y detectar cuellos de botella antes de comprometer presupuesto o infraestructura.

Calculadora

Parámetros del escenario
tokens/s
tokens
tokens
%
%
%

Cómo usar esta calculadora

  1. Introduce los valores de carga, rendimiento y coste correspondientes a tu escenario.
  2. Revisa que las unidades coincidan con las utilizadas por tu proveedor o equipo.
  3. Pulsa Calcular para actualizar el resultado.
  4. Compara escenarios modificando una variable cada vez.

Fórmula

Solicitudes/s = capacidad total × utilización ÷ [entrada × (1 − aciertos × porción reutilizada) + salida].

Qué significa el resultado

El resultado expresa la tasa media que podría sostenerse antes de considerar colas, límites de red o variaciones de longitud.

La salida real depende de batching, planificación, longitud máxima y distribución de solicitudes.

Ejemplo de cálculo

Con 72.000 tokens/s, 4.000 tokens de entrada, 600 de salida, 70 % de aciertos, 75 % reutilizado y 80 % de utilización, el rendimiento es aproximadamente 27,76 solicitudes/s.

Consejos para obtener mejores resultados

  • Mide por separado horas punta y valle.
  • Controla la distribución de longitudes.
  • Evita asumir que todos los aciertos ahorran la misma proporción.
  • Contrasta el resultado con telemetría de cola.

Preguntas frecuentes

¿Qué significa porción reutilizada?

Es la parte de los tokens de entrada que no necesita reprocesarse cuando hay un acierto.

¿Por qué se limita la utilización?

Para evitar planificar sobre el máximo teórico permanente.

¿La herramienta estima tokens de salida por segundo?

La capacidad utilizable mostrada ya está expresada en tokens por segundo.

¿Un mayor contexto siempre reduce el rendimiento?

Normalmente aumenta los tokens efectivos, aunque la caché puede compensar parte del coste.

¿Incluye batching dinámico?

Solo indirectamente, si la capacidad total introducida ya proviene de una medición con batching.

Guía de métricas

MétricaUso
Solicitudes/sTasa de peticiones atendidas.
Tokens efectivosTrabajo medio por petición.
GananciaIncremento relativo frente a no usar caché.

Explora las categorías de calculadoras

22 categorías