#681 · Herramienta de IA y tecnología

Calculadora de presupuesto de tokens para inferencia LLM

Estima cuántos tokens consumirá una carga de inferencia de un modelo de lenguaje y cuánto margen queda dentro de un presupuesto operativo. Combina solicitudes, tokens de entrada, tokens de salida, reintentos y sobrecarga del sistema para mostrar el consumo total, el promedio por solicitud y la cantidad máxima de tareas que admite el límite definido.

Calculadora

Volumen, longitud y margen de tokens
solicitudes
Número total de peticiones durante el periodo.
tokens
Incluye instrucciones, contexto y mensaje del usuario.
tokens
Longitud media de la respuesta generada.
tokens
Tokens adicionales de sistema, herramientas o formato.
%
Porcentaje de solicitudes que deben repetirse.
tokens
Límite operativo disponible para el periodo.

Cómo usar esta calculadora

  1. Introduce valores representativos de tu carga real.
  2. Revisa unidades, tarifas y porcentajes antes de calcular.
  3. Pulsa «Calcular» para actualizar el resultado y las métricas secundarias.
  4. Compara el resultado con tu límite, plazo o presupuesto y ajusta los supuestos.

Fórmula

Tokens totales = solicitudes × (entrada + salida + sobrecarga) × (1 + reintentos ÷ 100)

La capacidad del presupuesto se obtiene dividiendo el límite de tokens entre el consumo efectivo por solicitud.

Qué significa el resultado

El resultado principal representa el volumen total que debe poder procesar el proveedor o la infraestructura. El margen indica si el límite elegido cubre la carga con las hipótesis actuales.

Los tokens reales dependen del tokenizador, el modelo y la estructura exacta de cada solicitud. Utiliza medias observadas cuando dispongas de registros.

Ejemplo de cálculo

Con 10.000 solicitudes, 1.200 tokens de entrada, 350 de salida, 80 de sobrecarga y 3 % de reintentos, el consumo efectivo es 1.678,9 tokens por solicitud y el total es 16.789.000 tokens.

Consejos para obtener mejores resultados

  • Mide por separado entrada y salida en registros reales.
  • Reserva margen para instrucciones del sistema y llamadas a herramientas.
  • Segmenta documentos largos antes de aumentar el contexto.
  • Vigila los reintentos provocados por límites o errores.
  • Recalcula el presupuesto cuando cambie el modelo o el flujo.

Preguntas frecuentes

¿Los tokens del prompt del sistema cuentan en el presupuesto?

Sí. Deben incluirse como sobrecarga o dentro de los tokens de entrada porque también se procesan en cada inferencia.

¿Cómo se incorpora una respuesta almacenada en caché?

Reduce los tokens de entrada medios según la proporción realmente facturada o procesada como caché en tu proveedor.

¿Qué ocurre si una solicitud supera el contexto máximo?

La calculadora no valida el límite de un modelo concreto; debes comparar entrada, salida y sobrecarga con su ventana de contexto.

¿Conviene usar el promedio o el percentil alto de tokens?

El promedio sirve para coste agregado; un percentil alto ofrece una reserva más prudente para capacidad y límites.

¿Por qué se incluye la tasa de reintentos?

Porque cada repetición vuelve a consumir tokens y puede elevar el presupuesto total aunque la tarea lógica sea la misma.

Resumen de variables

ElementoUso
EntradasDefinen la carga y la capacidad disponible.
Resultado principalResume la decisión operativa más importante.
Métricas secundariasAyudan a comprobar margen, volumen y eficiencia.

Explora las categorías de calculadoras

22 categorías