Fórmula
GPU por memoria = techo((réplicas × VRAM por réplica + VRAM compartida) ÷ VRAM por GPU)
GPU por capacidad = techo(demanda ÷ (rendimiento × utilización))
Qué significa el resultado
El resultado principal resume la capacidad o el coste del flujo completo. Los indicadores secundarios muestran qué parte corresponde a agentes, coordinación, memoria o capacidad operativa.
La arquitectura real puede incluir ramas condicionales, reintentos parciales y agentes con modelos distintos. Usa promedios ponderados y percentiles representativos.