BLOG · GUIDE ·

LLM-Latenz: Ziele für Time to First Token und Token pro Sekunde bei Chat, RAG und Agenten

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • NVIDIAs Benchmarking-Leitfaden für NIM definiert die Zeit bis zum ersten Token (TTFT) als die Zeit vom Absenden der Anfrage bis zum ersten empfangenen Token, einschließlich Warteschlange, Prefill und Netzwerklatenz, und die Inter-Token-Latenz (ITL) als mittleren Abstand zwischen den Token, auch bekannt als Zeit pro Ausgabe-Token (TPOT)
  • vllm bench serve gibt als TPOT den mittleren Abstand jeder Anfrage nach dem ersten Token aus und als ITL jeden einzelnen Abstand; eine Zahl namens ITL bedeutet in vLLM also etwas anderes als in AIPerf, notieren Sie deshalb zu jeder Zahl das Werkzeug
  • Die TTFT bestimmen die Warteschlange und das Prefill, das rechengebunden ist und mit der Prompt-Länge wächst; die Token pro Sekunde je Nutzer bestimmt das Decode, das durch die Speicherbandbreite begrenzt ist und mit wachsendem Batch langsamer wird
  • Unsere Beispielziele im 95. Perzentil: Chat 1 s bis zum ersten Token und eine TPOT von 100 ms (10 Token pro Sekunde), RAG 2,5 s und 100 ms, Agentenschritte 1 s und 50 ms, Batch-Jobs stattdessen ein Durchsatzziel
  • Wie viele gleichzeitige Nutzer eine GPU bedient, hängt vom Latenzziel ab: Laut NVIDIAs Leitfaden steigt der Gesamtdurchsatz mit der Parallelität, während der Durchsatz je Nutzer sinkt; messen Sie deshalb den Goodput, die Anfragen pro Sekunde, die alle Ziele einhalten

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

LLM-Latenz: Kennzahlen TTFT, Inter-Token-Latenz und Durchsatz

Die LLM-Latenz wird mit vier Zahlen beschrieben: der Zeit bis zum ersten Token (Time to First Token, TTFT), dem Abstand zwischen den Ausgabe-Token, genannt Inter-Token-Latenz (ITL) oder Zeit pro Ausgabe-Token (TPOT), der Ende-zu-Ende-Latenz je Anfrage und dem Durchsatz. Die TTFT ist die Zeit, die ein Nutzer wartet, bevor Text erscheint; der Abstand zwischen den Token bestimmt, wie schnell der Text danach fließt. Beide müssen mit einem Perzentil und mit dem Werkzeug angegeben werden, das sie gemessen hat, weil die Werkzeuge sie unterschiedlich berechnen. Für einen Chat-Assistenten sind unsere Beispielziele, unten hergeleitet, 1 s bis zum ersten Token und 100 ms je Token (10 Token pro Sekunde pro Nutzer) im 95. Perzentil.

NVIDIAs Benchmarking-Leitfaden für NIM, gelesen am 10. Oktober 2026, definiert die TTFT als „die Zeit vom Absenden der Anfrage bis zum ersten empfangenen Token, sofern die Antwort nicht leer ist“, und schreibt, dass sie „im Allgemeinen die Wartezeit der Anfrage in der Warteschlange, die Prefill-Zeit und die Netzwerklatenz einschließt“. Die ITL definiert er als „die durchschnittliche Zeit zwischen aufeinanderfolgenden Token“ und ergänzt, dass sie „auch als Zeit pro Ausgabe-Token (TPOT) bekannt ist“. Die Ende-zu-Ende-Latenz ist die TTFT plus die Generierungszeit, also die Zeit vom ersten bis zum letzten empfangenen Token.

METRIKNVIDIA-NIM-LEITFADENVLLM BENCH SERVEBESTIMMT DURCH
Zeit bis zum ersten TokenAbsenden bis zum ersten empfangenen Token; Warte­schlange, Prefill und Netzwerk eingeschlossenttft, je Anfrage, am ClientWartezeit in der Warte­schlange, Prompt-Länge, Prefill-Rechen­leistung
Inter-Token-Latenzmittlerer Abstand zwischen aufeinander­folgenden Token, Gleich­bedeutend mit TPOTitl, jeder Abstand zwischen AusgabenSpeicher­bandbreite, Batch-Größe, Prefills im selben Schritt
Zeit pro Ausgabe-Tokendieselbe Metrik wie ITLtpot, mittlerer Abstand jeder Anfrage nach dem ersten Tokenwie ITL
Ende-zu-Ende-LatenzAbsenden bis zur Voll­ständigen Antwort: TTFT plus Generierungs­zeite2el, je AnfrageTTFT, Abstand zwischen Token, Antwortlänge
Durchsatz je NutzerAusgabelänge geteilt durch Ende-zu-Ende-Latenz, nähert sich 1/ITLnicht gesondert ausgegebenwie ITL
System­durchsatzToken pro Sekunde und Anfragen pro Sekunde insgesamtDurchsatz an Anfragen und Ausgabe-TokenBatch-Größe, bis die Rechen­leistung sättigt

NVIDIA NIM LLM Benchmarking Guide, Seite zu den Metriken; CLI-Referenz von vllm bench serve und Quellcode des Benchmarks; alle gelesen am 10. Oktober 2026. Die Spalte „Bestimmt durch“ ist unsere Zusammenfassung von NVIDIAs Blog zur Inferenzoptimierung vom 17. November 2023 und des Optimierungsleitfadens von vLLM.

Durchsatz je Nutzer und Systemdurchsatz beantworten unterschiedliche Fragen. Laut NVIDIAs Leitfaden „steigen die TPS des Gesamtsystems, während die TPS je Nutzer sinken, wenn die Latenz steigt“. Für die Auslegung muss eine Angabe in Token pro Sekunde sagen, welcher der beiden Werte gemeint ist.

TTFT vs. TPOT und ITL: wo vLLM und AIPerf sich unterscheiden

Die Definitionen stimmen bei TTFT und Ende-zu-Ende-Latenz überein und gehen beim Abstand zwischen den Token auseinander. NVIDIAs Leitfaden merkt an, dass sich „Werkzeuge darin unterscheiden, ob die TTFT in den Mittelwert eingeht“, und rät, „Ergebnisse nur zu vergleichen, wenn die Definitionen übereinstimmen“.

AIPerf, das Benchmarking-Werkzeug, auf das NVIDIA inzwischen verweist, berechnet die ITL je Anfrage als Ende-zu-Ende-Latenz minus TTFT, geteilt durch die Zahl der Ausgabe-Token minus eins, und gibt die Abstände zwischen allen gestreamten Chunks gesondert als Inter Chunk Latency aus. Sein Ausgabe-Token-Durchsatz je Nutzer ist 1 geteilt durch diese ITL. vllm bench serve berechnet denselben Mittelwert je Anfrage und nennt ihn TPOT, während seine ITL die Liste aller einzelnen Abstände ist, über alle Anfragen zusammengefasst. Ein ITL-Perzentil aus vLLM zeigt deshalb Stockungen, die ein ITL-Perzentil von AIPerf, aus Mittelwerten gebildet, glättet.

Auch der Startpunkt der Messung zählt. Beide Werkzeuge messen vom Client aus, ihre TTFT enthält also das Netzwerk und, wenn der Test darüber läuft, das Gateway vor dem Server. Das eigene Histogramm von vLLM im Server beginnt innerhalb des Servers und lässt beides weg, wie unser Leitfaden zu den Serving-Metriken von vLLM in Prometheus erklärt; ein Ziel, das für die eine Messung formuliert ist, lässt sich nicht an der anderen prüfen. Für Reasoning-Modelle ergänzt AIPerf die Zeit bis zum ersten Ausgabe-Token (Time to First Output Token), die es als Zeit „vom Beginn der Anfrage bis zum ersten Ausgabe-Token, das kein Reasoning-Token ist“ berechnet, also bis zu dem Punkt, an dem der Nutzer die Antwort sieht und nicht das Denken des Modells.

Was die Zeit bis zum ersten Token und die Token pro Sekunde bestimmt

Die TTFT besteht aus zwei Teilen: dem Warten in der Warteschlange und dem Prefill, der Verarbeitung des gesamten Prompts vor dem ersten Token. NVIDIAs Blog zur Inferenzoptimierung beschreibt das Prefill als „eine Matrix-Matrix-Operation, die hochgradig parallelisiert ist“ und „die GPU-Auslastung effektiv sättigt“; seine Dauer wächst also mit der Prompt-Länge und sinkt mit der Rechenleistung. NVIDIAs Benchmarking-Leitfaden ergänzt, dass „die Zeit bis zum ersten Token durch Verzögerung in der Warteschlange steigen kann“ und dass längere Eingabesequenzen die TTFT erhöhen. Ein RAG-Prompt mit mehreren abgerufenen Abschnitten kostet mehr Prefill als eine Chat-Frage, und ein Agent, der seinen wachsenden Kontext erneut sendet, trägt diese Kosten bei jedem Schritt erneut.

Der Abstand zwischen den Token entsteht im Decode, bei dem jeder Schritt die Gewichte und den KV-Cache liest. Derselbe NVIDIA-Blog nennt das „eine speichergebundene Operation“, deren Latenz von der Geschwindigkeit bestimmt wird, mit der Daten aus dem Speicher übertragen werden. Für einen einzelnen Nutzer sind die Token pro Sekunde durch die Speicherbandbreite geteilt durch die je Token gelesenen Bytes begrenzt. Nach dieser Rechnung erreicht Llama 3.3 70B in FP8 höchstens etwa 23 Token pro Sekunde auf einer RTX PRO 6000 Server Edition und etwa 68 auf einer H200 NVL, wie unser Vergleich von RTX PRO 6000 und H200 NVL für LLM-Inferenz zeigt; das sind Obergrenzen, die kein System erreicht.

Prefill und Decode teilen sich die GPU, also wägt der Scheduler das eine gegen das andere ab. In vLLM ist Chunked Prefill, wo möglich, standardmäßig aktiv, und der Scheduler „priorisiert Decode-Anfragen“. Der Optimierungsleitfaden von vLLM schreibt, dass kleinere Werte von max_num_batched_tokens „eine bessere ITL erreichen, weil weniger Prefills die Decodes verlangsamen“, während „höhere Werte eine bessere Zeit bis zum ersten Token erreichen“. Ein Server, der auf RAG-Prompts abgestimmt ist, und ein Server, der auf schnelles Streaming abgestimmt ist, werden unterschiedlich konfiguriert.

Latenz und gleichzeitige Nutzer auf einer GPU

Parallelität erhöht den Gesamtdurchsatz und senkt die Geschwindigkeit je Nutzer, bis die GPU sättigt. NVIDIAs Seite zu den Parametern hält fest, dass „der Durchsatz im Allgemeinen nahe der maximalen Batch-Größe sättigt, während die Latenz stetig steigt“. Jenseits dieses Punkts fügen weitere gleichzeitige Anfragen der TTFT Wartezeit hinzu und bringen keinen zusätzlichen Durchsatz.

Die Zahl der Nutzer, die eine Karte bedient, hängt daher vom Latenzziel ebenso ab wie vom Speicher. Der Speicher entscheidet, wie viele Sitzungen in den KV-Cache passen; unser Leitfaden dazu, wie viele Nutzer eine RTX PRO 6000 bedient, enthält diese Rechnung und die Messreihe über Batch-Größen aus NVIDIAs Tuning-Leitfaden für TensorRT-LLM. Das Latenzziel entscheidet, wie viele dieser Sitzungen gleichzeitig laufen können und es trotzdem einhalten. Liegt das Ziel je Nutzer über der Obergrenze für einen einzelnen Stream, hilft keine Batch-Größe: Ein Ziel von 40 ms entspricht 25 Token pro Sekunde, mehr als die Obergrenze von etwa 23 für ein 70B-Modell in FP8 auf einer RTX PRO 6000 Server Edition. NVFP4-Gewichte, ein kleineres Modell, eine Karte mit mehr Bandbreite, Tensor-Parallelismus über zwei Karten oder spekulatives Dekodieren ändern diese Zahl; mehr Parallelität ändert sie nicht.

Beispielziele für die Latenz bei Chat, RAG, Agenten und Batch-Jobs

Ziele ergeben sich aus dem Anwendungsfall, und die Werte unten sind unsere Beispiele, keine Empfehlungen von Herstellern. Wir haben sie auf Bucket-Grenzen der Histogramme von vLLM gelegt, damit das Monitoring im Produktivbetrieb genau zählen kann, wie viele Anfragen sie einhalten. Unser Leitfaden zu den Nutzern je RTX PRO 6000 setzt das mittlere stille Lesen nach einer Meta-Analyse von 2019 bei etwa 5,3 Token pro Sekunde an; ein Stream mit 10 Token pro Sekunde ist also schneller als ein durchschnittlicher Leser. Die Ziele je Token geben wir als TPOT an, den Mittelwert je Anfrage, den die Goodput-Prüfung von vLLM verwendet und den AIPerf als ITL ausgibt.

ANWENDUNGSFALLBEISPIELZIELEFORM DER ANFRAGENWAS AUSZULEGEN IST
Chat-AssistentTTFT 1 s, TPOT 100 ms, bei p95kurze Prompts, Antworten von einigen hundert TokenKV-Cache für die Spitze an Sitzungen, Bandbreite je Nutzer
RAG-Frage­beantwortungTTFT 2,5 s, TPOT 100 ms, bei p95Prompts von mehreren tausend TokenPrefill-Rechen­leistung, KV-Cache je langem Prompt
Agenten­schrittTTFT 1 s, TPOT 50 ms, dazu eine Zeit je Aufgabeviele Aufrufe, wachsender Kontext, kurze AusgabenPrefill je Schritt, Geschwindigkeit je Nutzer
Reasoning-ModellZeit bis zum ersten Ausgabe-Token, TPOT 50 msHunderte bis Tausende Denk-TokenGeschwindigkeit je Nutzer, Antwortlänge
Batch-DokumenteDokumente pro Stunde, Ende-zu-Ende-Zeit je Dokumentlange Eingabe, kurze AusgabeSystem­durchsatz

Beispielziele und Formen der Anfragen sind unsere, gelegt auf die TTFT-Bucket-Grenzen von vLLM bei 1 und 2,5 s und seine Bucket-Grenzen für Inter-Token-Latenz und TPOT bei 50 und 100 ms; testen Sie sie mit Ihren Nutzern. NVIDIAs Benchmarking-Leitfaden für NIM führt Retrieval unter Zusammenfassung, mit einer ISL um 1.000 und einer OSL um 100 Token.

Rechnen Sie die Ziele in Ende-zu-Ende-Zeiten um, bevor Sie sie vereinbaren. Eine Chat-Antwort von 400 Token mit 1 s bis zum ersten Token und 100 ms je Token dauert 1 + 399 × 0,1, also etwa 41 s, wobei der Nutzer ab der ersten Sekunde mitliest. Eine Agentenaufgabe mit 8 Schritten, jeder mit 1 s bis zum ersten Token und 150 Ausgabe-Token zu je 50 ms, dauert 8 × (1 + 149 × 0,05), etwa 68 s vor den Tool-Aufrufen; bei 100 ms je Token sind es etwa 127 s. Ein Reasoning-Modell, das 1.500 Token lang bei 50 ms nachdenkt, zeigt sein erstes Antwort-Token nach etwa 75 s plus TTFT. Für Agenten und Reasoning-Modelle wiegt der Abstand zwischen den Token schwerer als für Chat, weil die Zwischen-Token ungelesen bleiben und jedes davon die Wartezeit verlängert. Unser Leitfaden zur GPU-Auslegung für KI-Agenten zählt die Aufrufe und Token je Aufgabe.

Wir legen Inferenzserver nach Modellgröße und gleichzeitigen Nutzern aus, mit Konfiguration und Angebot innerhalb eines Werktages. Schicken Sie uns Ihre Beispielziele, das Modell und die Spitzenzahl der Anfragen in Bearbeitung über das Formular unten.

LLM-Latenz messen mit vllm bench serve und AIPerf

Ein Lasttest zeigt, ob eine GPU die Ziele bei einer bestimmten Parallelität einhält. vllm bench serve wird mit vLLM ausgeliefert; --percentile-metrics steht standardmäßig auf ttft, tpot und itl, und --metric-percentiles standardmäßig nur auf dem 99. Perzentil. --goodput nimmt Ziele als Paare aus Metrik und Wert in Millisekunden entgegen und zählt die Anfragen pro Sekunde, die alle davon einhalten. AIPerf wird mit pip install aiperf installiert, Release 0.13.0 vom 24. September 2026, und läuft als aiperf profile mit --streaming für TTFT und ITL und --concurrency für eine feste Zahl an Anfragen in Bearbeitung. Die Dokumentation von GenAI-Perf hält fest, dass es „schrittweise eingestellt wird“, und schreibt: „Für neue Performance-Benchmarks verwenden Sie bitte stattdessen AIPerf“. Unser Leitfaden dazu, was ein privater KI-Pilot messen sollte, behandelt die Datensätze und Flags, mit denen Sie Ihre eigenen Prompts erneut abspielen.

  1. Schreiben Sie jedes Ziel als Metrik, Perzentil und Wert, und geben Sie an, ob es am Client oder im Server gemessen wird.
  2. Spielen Sie Prompts mit den Eingabe- und Ausgabelängen Ihres Anwendungsfalls ab; zufällige Prompts mit 1.024 Token und Antworten mit 128 Token, die Voreinstellung von vLLM, passen zu keinem der Anwendungsfälle oben.
  3. Legen Sie die Zahl der Anfragen in Bearbeitung mit --max-concurrency fest und erhöhen Sie sie schrittweise, 1, 2, 4, 8 und so weiter; ohne diese Option sendet vLLM mit seiner Standard-Anfragerate inf alle Anfragen zum Zeitpunkt 0.
  4. Ergänzen Sie --goodput ttft:1000 tpot:100 und --percentile-metrics ttft,tpot,itl,e2el mit --metric-percentiles 50,95,99.
  5. Nehmen Sie die höchste Parallelität, bei der die 95. Perzentile die Ziele einhalten und der Goodput nahe am Anfragedurchsatz bleibt, und halten Sie dazu GPU, Engine-Version und Einstellungen fest.

Der Goodput von vLLM prüft die TPOT, also den Mittelwert je Anfrage, sodass eine Anfrage mit einer langen Stockung trotzdem als gut zählen kann; lesen Sie die ITL-Perzentile daneben. NVIDIAs Leitfaden rät, „für die meisten Benchmarks Parallelität zu bevorzugen“, weil bei einer festen Anfragerate offene Anfragen „unbegrenzt wachsen können“, sobald mehr Anfragen eintreffen, als das System bedient. Ergebnisse lassen sich nur auf denselben GPU-Typ und dieselben Engine-Einstellungen übertragen.

In unserer Leistung Private AI/ML liefert das technische Assessment einen Pilotplan mit Metriken; der Preis steht vor Beginn fest. Beschreiben Sie im Formular unten den Anwendungsfall, den Sie zuerst messen würden, und die Ziele, die Sie im Blick haben.

Was wir liefern

Wir bauen KI-Server auf Bestellung für Inferenz und RAG, mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern, und wir liefern die Karten auch separat für Server, die Sie bereits betreiben. Für Latenzziele fällt die Wahl zwischen Bandbreite und Speicher: die H200 NVL mit 141 GB HBM3e bei 4,8 TB/s, die RTX PRO 6000 Blackwell in allen drei Editionen mit 96 GB sowie die L40S und die L4 für kleinere Modelle. Karten und Server liefern wir mit Herstellergarantie, Lizenzen für NVIDIA AI Enterprise auf derselben Rechnung wie die Hardware, unter einem EU-Vertrag. Wenn Sie die Ziele und einen Pilotplan mit Metriken für sich ausarbeiten lassen wollen, ist das unsere Leistung Private AI/ML, mit dem Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Was ist Time to First Token bei der LLM-Inferenz?
Die Zeit bis zum ersten Token (Time to First Token, TTFT) ist die Zeit vom Senden einer Anfrage bis zum Empfang des ersten Tokens der Antwort. Laut NVIDIAs Benchmarking-Leitfaden für NIM schließt sie im Allgemeinen die Wartezeit der Anfrage, die Prefill-Zeit und die Netzwerklatenz ein, sie steigt also mit längeren Prompts und mit einer Warteschlange. Die serverseitige Metrik von vLLM beginnt innerhalb des Servers und lässt das Netzwerk weg.
Was ist der Unterschied zwischen TTFT und TPOT?
Die TTFT misst die Wartezeit, bis das erste Token erscheint, und die Zeit pro Ausgabe-Token (TPOT) den mittleren Abstand zwischen den folgenden Token. NVIDIAs Benchmarking-Leitfaden behandelt TPOT und Inter-Token-Latenz als eine Metrik, während vllm bench serve als TPOT den mittleren Abstand jeder Anfrage und als ITL jeden einzelnen Abstand ausgibt. Die TTFT hängt vor allem von Prefill und Warteschlange ab, die TPOT von Speicherbandbreite und Batch-Größe.
Wie viele Token pro Sekunde pro Nutzer braucht ein LLM-Chat?
Das mittlere stille Lesen liegt nach der Meta-Analyse, die unser Leitfaden zu den Nutzern je GPU zitiert, bei etwa 5,3 Token pro Sekunde, ein Stream mit 10 Token pro Sekunde, also 100 ms je Token, bleibt den Lesern damit voraus. Das ist unser Beispielziel für Chat im 95. Perzentil, keine Herstellerangabe. Agenten und Reasoning-Modelle brauchen eine schnellere Generierung, weil jedes Zwischen-Token die Wartezeit verlängert.
Welche LLM-Antwortzeit brauchen Chat, RAG und Agenten?
Unsere Beispiele im 95. Perzentil sind 1 s bis zum ersten Token und eine TPOT von 100 ms für Chat, 2,5 s und 100 ms für RAG mit langen Prompts sowie 1 s und 50 ms je Agentenschritt plus ein Zeitbudget je Aufgabe. Sie liegen auf Bucket-Grenzen der Histogramme von vLLM, sodass das Monitoring genau zählen kann, wie viele Anfragen sie einhalten. Batch-Jobs für Dokumente brauchen statt einer TTFT ein Durchsatzziel, etwa Dokumente pro Stunde.
Welche Kennzahlen beschreiben die LLM-Performance?
Zeit bis zum ersten Token, Inter-Token-Latenz oder Zeit pro Ausgabe-Token, Ende-zu-Ende-Latenz, Durchsatz je Nutzer und Systemdurchsatz in Token oder Anfragen pro Sekunde. Der Goodput, also die Anfragen pro Sekunde, die jedes Latenzziel einhalten, verbindet sie mit einem Service-Level. Jede Zahl braucht ihr Perzentil, die Parallelität, die Längen von Prompt und Antwort und das Werkzeug, das sie ermittelt hat.
Wie messe ich die LLM-Latenz auf meinem eigenen Server?
Führen Sie vllm bench serve oder NVIDIAs AIPerf gegen den Server aus, mit Prompts in den Längen Ihres Anwendungsfalls und bei festen Stufen der Parallelität, beginnend bei eins. Setzen Sie Goodput-Ziele für TTFT und TPOT und lesen Sie das 95. und 99. Perzentil von TTFT und Inter-Token-Latenz ab. Laut NVIDIAs Dokumentation wird GenAI-Perf schrittweise eingestellt, und für neue Benchmarks verweist sie auf AIPerf.

Schicken Sie uns den Anwendungsfall, das Modell und seine Präzision, die Längen von Prompt und Antwort, die Spitzenzahl der Anfragen in Bearbeitung und die Latenzziele, die Sie im Blick haben. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für den GPU-Server, auf den diese Zahlen hinweisen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien