#678 · Rechner für KI & Technologie

GPU-Bedarfsrechner für Multi-Agent-Workflows

Dieser Rechner dimensioniert GPU-Kapazität für Multi-Agent-Workflows auf Basis der gesamten GPU-Zeit. Er berücksichtigt die Rechenzeit aller Agenten, optionalen GPU-Anteil der Orchestrierung, Tagesvolumen, Betriebsstunden, Zielauslastung und eine Kapazitätsreserve. Das Ergebnis wird auf ganze GPUs aufgerundet.

Rechner

GPU-Last pro Workflow
Agenten
GPU-s
GPU-s
Workflows
h
%
%

So verwendest du diesen Rechner

  1. Miss die GPU-Zeit pro Agentenrolle oder nutze einen repräsentativen Mittelwert.
  2. Ergänze GPU-Zeit der Orchestrierung, falls sie relevant ist.
  3. Trage Tagesvolumen, Betriebsstunden und Zielauslastung ein.
  4. Setze eine Reserve für Lastspitzen und Wachstum.

Formel

GPU-Sekunden/Workflow = Agenten × GPU-Sekunden/Agent + GPU-Sekunden Orchestrierung
GPU-Anzahl = aufrunden[(Tages-GPU-Sekunden ÷ nutzbare GPU-Sekunden je Gerät) × (1 + Reserve)]

Was das Ergebnis bedeutet

Die Rechnung summiert GPU-Zeit über alle Agenten eines Workflows. Parallelität verändert die Wandzeit, aber nicht automatisch die gesamte verbrauchte GPU-Zeit, weshalb hier der Kapazitätsbedarf über GPU-Sekunden geplant wird.

VRAM, Modellplatzierung, Parallelisierung über mehrere GPUs und unterschiedliche GPU-Typen werden nicht separat modelliert.

Beispielrechnung

5 Agenten mit je 1,8 GPU-Sekunden plus 0,2 GPU-Sekunden Orchestrierung ergeben 9,2 GPU-Sekunden je Workflow. Bei 3.000 Workflows sind das 7,67 GPU-Stunden pro Tag.

Tipps für bessere Ergebnisse

  • Behandle GPU-Zeit und VRAM als getrennte Kapazitätsdimensionen.
  • Nutze Messwerte derselben Hardwareklasse wie in Produktion.
  • Prüfe, ob Agenten tatsächlich GPU-bound sind oder auf externe Tools warten.
  • Plane Hochverfügbarkeit zusätzlich zur reinen Rechenkapazität.

Häufig gestellte Fragen

Wie berechne ich den GPU-Bedarf eines Multi-Agent-Systems?

Summiere die GPU-Zeit aller Agenten und der Orchestrierung je Workflow, skaliere mit dem Tagesvolumen und teile durch die nutzbare GPU-Zeit pro Gerät.

Wird parallele Agentenausführung im GPU-Bedarf berücksichtigt?

Die Rechnung basiert auf gesamter GPU-Zeit. Parallelität kann die Wandzeit verkürzen, verändert aber den summierten GPU-Zeitbedarf nicht zwangsläufig.

Kann ich verschiedene GPU-Typen in einer Rechnung mischen?

Nur wenn du ihre Leistung vorher auf eine gemeinsame Referenz normalisierst. Reine GPU-Sekunden sind zwischen unterschiedlichen Hardwareklassen nicht direkt vergleichbar.

Warum brauche ich zusätzlich eine Kapazitätsreserve?

Eine Reserve schafft Spielraum für Lastspitzen, Messunsicherheit, Wachstum und schwankende Agentenpfade.

Berücksichtigt der Rechner Modellgröße und VRAM?

Nein. Speicherbedarf und Modellplatzierung müssen separat geprüft werden, insbesondere bei großen Modellen oder mehreren gleichzeitig geladenen Modellen.

Kennzahlen im Überblick

KennzahlBedeutung
GPU-Sekunden/WorkflowSummierte Rechenzeit aller Agenten und Orchestrierung.
GPU-Stunden/TagTägliche Gesamtlast.
BasisbedarfGerätebedarf vor Kapazitätsreserve.

Rechner-Kategorien entdecken

22 Kategorien