#896 · Rechner für KI & Technologie

KI-Dokumentverarbeitung: Latenz- und Kapazitätsrechner

Dieser Rechner verbindet die durchschnittliche Verarbeitungslatenz eines Dokuments mit der verfügbaren Parallelität. So lässt sich abschätzen, wie viele Dokumente pro Stunde eine KI-Dokumentpipeline verarbeiten kann, welche Auslastung bei gegebener Nachfrage entsteht und wie groß der Kapazitätspuffer ist. Ein Overhead-Faktor bildet Netzwerk-, Queue- und Retry-Zeiten ab.

Rechner

Latenz, Parallelität und Nachfrage
s
Slots
%
%
Dok./h

So verwendest du diesen Rechner

  1. Miss die durchschnittliche End-to-End-Latenz pro Dokument.
  2. Trage die tatsächlich gleichzeitig nutzbaren Worker oder Slots ein.
  3. Berücksichtige System-Overhead und eine Zielauslastung unter 100 %.
  4. Vergleiche die sichere Kapazität mit der erwarteten Nachfrage.

Formel

Effektive Latenz = Basislatenz × (1 + Overhead)
Theoretische Kapazität = Parallelität × 3.600 ÷ effektive Latenz
Sichere Kapazität = theoretische Kapazität × Zielauslastung

Was das Ergebnis bedeutet

Die sichere Kapazität reduziert die theoretische Maximalleistung auf die gewünschte Zielauslastung, damit Schwankungen und Warteschlangen nicht sofort zu Überlast führen.

Die Formel setzt weitgehend unabhängige parallele Verarbeitung voraus. Externe Rate Limits, gemeinsam genutzte Datenbanken und serielle Pipeline-Schritte können die reale Kapazität zusätzlich begrenzen.

Beispielrechnung

Bei 8 Sekunden Basislatenz, 40 parallelen Slots und 15 % Overhead beträgt die effektive Latenz 9,2 Sekunden. Die theoretische Kapazität liegt bei rund 15.652 Dokumenten pro Stunde; bei 80 % Zielauslastung sind rund 12.522 Dokumente pro Stunde als sichere Kapazität angesetzt.

Tipps für bessere Ergebnisse

  • Verwende P50 und P95-Latenzen getrennt für Normal- und Stressszenarien.
  • Berücksichtige Queue-, OCR- und Datenbankzeiten im End-to-End-Wert.
  • Plane Reserve für Lastspitzen und Retries ein.
  • Prüfe externe API-Rate-Limits zusätzlich zur internen Parallelität.

Häufig gestellte Fragen

Wie berechne ich die Dokumentkapazität aus Latenz und Parallelität?

Multipliziere die Zahl paralleler Slots mit 3.600 Sekunden und teile durch die effektive Latenz je Dokument. Für eine sichere Kapazität wird zusätzlich die Zielauslastung angewendet.

Warum sollte die Zielauslastung unter 100 % liegen?

Ein Puffer reduziert Warteschlangen und schafft Reserve für Lastspitzen, langsamere Dokumente und Wiederholungsversuche.

Soll ich P50- oder P95-Latenz verwenden?

Für typische Kapazität eignet sich ein repräsentativer Mittel- oder Medianwert. Für konservative Planung ist eine höhere Perzentil-Latenz wie P95 oft hilfreicher.

Wie wirken API-Rate-Limits auf die berechnete Kapazität?

Sie können die reale Kapazität unter den rechnerischen Wert drücken. Externe Limits müssen separat geprüft und als zusätzliche Obergrenze betrachtet werden.

Was gehört zum System-Overhead bei Dokumentverarbeitung?

Zum Beispiel Queue-Zeit, Netzwerk, Serialisierung, Retries, Vor- und Nachverarbeitung sowie zusätzliche Datenbankzugriffe.

Kapazitätsgrößen

GrößeEinheit
Effektive LatenzSekunden pro Dokument
Parallelitätgleichzeitige Slots
KapazitätDokumente pro Stunde

Rechner-Kategorien entdecken

22 Kategorien