Cómo usar esta calculadora
- Introduce documentos y tokens medios.
- Añade el rendimiento medido por GPU.
- Define ventana y utilización objetivo.
- Revisa GPU, horas-GPU y reserva.
Estima el número de GPU necesario para procesar documentos con IA según volumen, tokens por documento, rendimiento por GPU, ventana de tiempo y utilización objetivo. También muestra horas de GPU y capacidad de reserva para planificar infraestructura.
GPU = techo[(tokens totales ÷ segundos disponibles ÷ rendimiento por GPU) ÷ utilización]
El resultado aproxima la flota mínima de GPU bajo un rendimiento sostenido.
Mide el rendimiento con tu modelo, precisión, longitud de contexto y hardware reales.
100.000 documentos de 4.000 tokens equivalen a 400 millones de tokens. En 24 horas se requieren 4.630 tok/s; con 1.200 tok/s por GPU y 75 % de utilización, se recomiendan 6 GPU.
Utiliza una prueba representativa con el modelo y la configuración reales.
Está orientada a inferencia y procesamiento por lotes.
Puede aumentar el rendimiento, aunque también modificar la latencia y el uso de memoria.
Sí, si necesitas alta disponibilidad o mantenimiento sin detener el servicio.
No; evalúalo como una etapa separada si limita el flujo total.
| Indicador | Uso práctico |
|---|---|
| Horas-GPU | Trabajo computacional total. |
| Reserva | Capacidad no consumida por la carga media. |