Methodik des System Load Test (AA-SLT)

Überblick

Der Benchmark misst die Systemleistung, indem während der Testphase eine feste Anzahl paralleler Anfragen an das System aufrechterhalten wird. Sobald eine einzelne Anfrage abgeschlossen ist, wird sofort eine neue an die Maschine gesendet. Dadurch wird die Leistung des Systems unter stabiler Last gemessen und zugleich die Varianz des Tests minimiert.

Wir messen die Gesamtzahl der in jeder Phase vom System empfangenen Tokens. Sie fließt in unsere Metrik für den Systemausgabedurchsatz ein. Zudem messen wir die Leistung einzelner Anfragen, die in unsere Metriken pro Anfrage einfließt (üblicherweise als Median oder Mittelwert dargestellt).

Der Benchmark erfolgt phasenweise. Jede Benchmark-Phase dauert 3 Minuten, wobei die Zahl gleichzeitiger Anfragen mit jeder weiteren Phase erhöht wird. Das Benchmarking wird fortgesetzt, bis die Obergrenze des Systemausgabedurchsatzes erreicht ist. Das bedeutet, dass bei höherer Parallelität gegenüber den vorangegangenen Zeiträumen keine zusätzlichen Tokens mehr empfangen werden.

Wichtige technische Spezifikationen

  • Phasendauer: Jede Phase dauert 3 Minuten (ohne Ramp-up- und Cool-down-Phasen).
  • Parallelitätsstufen: 1, 2, 4, 8, 16, 32, 64, anschließend in Schritten von 64, bis der Systemausgabedurchsatz ein Plateau erreicht.
  • Workload-Struktur: 1.000 Eingabetokens und 1.000 Ausgabetokens pro Anfrage.
  • Streaming: Das Benchmarking wird mit aktiviertem Streaming durchgeführt.
Darstellung des System Load Test

Artificial Analysis System Load Test (Beispiel mit 4 gleichzeitigen Anfragen)

Gemessene Hauptmetriken

  • Systemausgabedurchsatz: Die durchschnittliche Gesamtzahl der Ausgabetokens pro Sekunde über alle gleichzeitigen Anfragen während der Benchmark-Phase.
  • Antwortrate: Der Anteil der während der Benchmark-Phase gesendeten Anfragen, für die eine Antwort eingegangen ist (mindestens 1 Ausgabetoken).
  • Ende-zu-Ende-Latenz pro Anfrage: Die Ende-zu-Ende-Antwortzeit jeder Anfrage ab dem Zeitpunkt des Sendens. Die Werte werden als Median der jeweiligen Parallelitätsphase angegeben.
  • Ausgabegeschwindigkeit pro Anfrage: Ausgabetokens pro Sekunde nach Empfang des ersten Tokens jeder Anfrage. Die Werte werden als Median der jeweiligen Parallelitätsphase angegeben.