GPU-Energieverbrauch pro Token bei LLM-Inferenz: Leistungsaufnahme, Joule und kWh von H200 NVL, RTX PRO 6000 und L40S
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Die Energie pro Token ist die aufgenommene Leistung geteilt durch die erzeugten Token pro Sekunde, denn ein Watt ist ein Joule pro Sekunde; 1 J pro Token entspricht etwa 278 Wh pro Million Token
- NVIDIA gibt die H200 NVL und die RTX PRO 6000 Server Edition mit bis zu 600 W an, laut Product Briefs mit einem Minimum von 200 W bzw. 300 W, und die L40S mit 350 W; nvidia-smi meldet den Bereich, den jede Karte akzeptiert, als Min Power Limit und Max Power Limit
- MLPerf Inference v6.0 veröffentlicht für beide 600-W-Karten den Durchsatz bei Llama 2 70B, aber keine Leistungsergebnisse; bei 8 × 600 W ergeben die Offline-Ergebnisse nach unserer Rechnung eine Obergrenze von 0,150 J pro Token für acht H200 NVL in FP8 und 0,160 J für acht RTX PRO 6000 in FP4
- Batchgröße und Aufgabe verändern die Energie pro Token stark: ML.ENERGY maß für Qwen3 32B auf einer B200 0,209 J pro Token bei Batchgröße 128 und 0,151 J bei 512 sowie 0,312 J für Antworten zur Problemlösung bei 128
- Messen Sie Ihren eigenen Wert mit dem Energiezähler von DCGM, Feld 156 in Millijoule, und den Token-Zählern von vLLM über dasselbe Zeitfenster, bei Ihrer Parallelität und mit den Leistungsgrenzen, die Sie einsetzen wollen
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Energie pro Token bei LLM-Inferenz: die Formel
Die Energie pro Token, der Energieverbrauch einer GPU bei LLM-Inferenz je erzeugtem Token, ist die aufgenommene Leistung geteilt durch die Token, die die GPU pro Sekunde erzeugt. Ein Watt ist ein Joule pro Sekunde, Watt geteilt durch Token pro Sekunde ergibt also Joule pro Token, und da eine kWh 3,6 Millionen Joule sind, entspricht 1 J pro Token etwa 278 Wh pro Million Token. Eine Karte unter Volllast verteilt ihre Leistung auf viele Token, eine schwach ausgelastete Karte auf wenige; deshalb bestimmen die Batchgröße und die Auslastung des Servers neben dem Kartenmodell einen großen Teil des Ergebnisses.
Stand Oktober 2026 haben wir für die H200 NVL, die RTX PRO 6000 Server Edition und die L40S keine veröffentlichte Messung der Energie pro Token gefunden. MLPerf Inference v6.0 veröffentlicht den Durchsatz der ersten beiden, und zusammen mit ihrer Nennleistung ergibt dieser Durchsatz nach unserer Rechnung eine Obergrenze für die GPU-Energie. Wie Sie Ihren eigenen Wert messen, zeigt der Abschnitt zur Methode weiter unten.
Leistungsaufnahme und Leistungsgrenzen: H200 NVL, RTX PRO 6000 und L40S
| KARTE | SPEICHER, BANDBREITE | MAX. BOARD-LEISTUNG | LEISTUNGSGRENZE |
|---|---|---|---|
| NVIDIA H200 NVL | 141 GB HBM3e, 4,8 TB/s | bis zu 600 W | Minimum 200 W, Power Compliance Limit 350 W; Lenovo nennt 600 W |
| RTX PRO 6000 Server Edition | 96 GB GDDR7, 1.597 GB/s | bis zu 600 W | Minimum 300 W im 600-W- und im 450-W-Modus; Lenovo bietet eine auf 450 W begrenzte Option |
| NVIDIA L40S | 48 GB GDDR6, 864 GB/s | 350 W | NVIDIAs Seite nennt keinen konfigurierbaren Bereich |
NVIDIA-Produktseiten zur H200, zur RTX PRO 6000 Blackwell Server Edition und zur L40S und das Datenblatt 4682150 der Server Edition (Dezember 2025), gelesen am 10. Oktober 2026; NVIDIA-Product-Briefs PB-12128-001_v01 (H200 NVL, 11. April 2025) und SP-12355-001_v02 (Server Edition, 27. Juni 2025); Lenovo-Press-Product-Guides LP2263 (aktualisiert am 28. Juli 2026) und LP1944 (aktualisiert am 7. November 2025).
NVIDIA gibt für die H200 NVL eine maximale Thermal Design Power von „Up to 600W (configurable)“ an und verwendet für die maximale Leistungsaufnahme der RTX PRO 6000 Blackwell Server Edition denselben Wortlaut. NVIDIAs Product Brief PB-12128-001_v01 der H200 NVL vom 11. April 2025 führt 600 W als Maximum und Standard, ein Power Compliance Limit von 350 W und ein Minimum von 200 W. Der Brief SP-12355-001_v02 der Server Edition vom 27. Juni 2025 nennt ein Minimum von 300 W im 600-W- und im 450-W-Kabelmodus. Lenovos Product Guide zur Server Edition führt „600 W (kann zur Unterstützung einer höheren Dichte auch auf 450 W leistungsbegrenzt werden)“, eine Option, mit der vier Karten in Lenovos SR650a V4 passen. Für die L40S nennt NVIDIA 350 W. Wie sich die beiden passiven Karten über die Leistungsaufnahme hinaus unterscheiden, zeigt unser Vergleich von L40S und RTX PRO 6000 Server Edition.
Den Bereich, den eine gelieferte Karte akzeptiert, gibt der Treiber vor. nvidia-smi -q -d POWER zeigt ihr Min Power Limit und ihr Max Power Limit, das NVIDIA so beschreibt: „Der Höchstwert in Watt, auf den die Leistungsgrenze gesetzt werden kann.“ Bei einer Server Edition kann es wegen des Stromkabels auch 450 W anzeigen, wie unser Leitfaden zur Stromversorgung im Rack erklärt. Der Nennwert begrenzt die Karte nach oben, und die Karte nimmt weniger auf, wenn die Arbeit es nicht erfordert. Die Forschenden von ML.ENERGY nennen Energieschätzungen auf Basis der TDP „fast immer eine Überschätzung“, weil eine GPU selten in jedem Moment ihre maximale Leistung aufnimmt.
Wir liefern alle drei Karten und bauen GPU-Server um sie herum. Nennen Sie uns die an der Rack-Position verfügbare Leistung und das Modell, das Sie betreiben wollen, und wir antworten innerhalb eines Werktages mit Konfiguration und Angebot.
Veröffentlichte Ergebnisse: MLPerf Inference v6.0 und ML.ENERGY
Wo MLPerf® Inference Leistung misst, misst es das gesamte System. MLCommons berechnet seine Leistungsmetriken aus „der gemessenen durchschnittlichen AC-Leistung (Energie), die vom gesamten System aufgenommen wird“, während des Benchmarklaufs und hält fest: „MLPerf Power kann nur die Leistung des gesamten Systems messen und validieren.“ In der Datei der zusammengefassten Ergebnisse der Runde v6.0, veröffentlicht am 1. April 2026, enthält keine der 520 Ergebniszeilen eine Leistungsmessung. Die L40S kommt in dieser Runde nur in Ergebnissen zu Bildverarbeitung und Spracherkennung vor, in keinem LLM-Benchmark.
Die Durchsatzergebnisse begrenzen die Energie trotzdem. Acht Karten mit einer Grenze von 600 W nehmen auf ihren Boards höchstens 4.800 W auf, und 4.800 W geteilt durch die Token pro Sekunde eines Ergebnisses ergibt die höchste GPU-Energie, die jedes Token gekostet haben kann. Diese Obergrenzen sind unsere Rechnung, keine Messungen. Die Tabelle stellt sie neben veröffentlichte Messungen des ML.ENERGY-Teams, aufgenommen auf einer B200, einer GPU außerhalb dieses Vergleichs.
| ERGEBNIS | AUFBAU | TOKEN/S | J PRO TOKEN | GRUNDLAGE |
|---|---|---|---|---|
| 6.0-0021, Offline | 8 × H200 NVL, FP8, Llama 2 70B | 32.004,0 | 0,150 | unsere Obergrenze, 8 × 600 W |
| 6.0-0021, Interactive | 8 × H200 NVL, FP8, Llama 2 70B | 16.343,8 | 0,294 | unsere Obergrenze, 8 × 600 W |
| 6.0-0047, Offline | 8 × RTX PRO 6000 SE, FP4, Llama 2 70B | 29.908,4 | 0,160 | unsere Obergrenze, 8 × 600 W |
| 6.0-0004, Interactive | 8 × RTX PRO 6000 SE, FP4, Llama 2 70B | 6.238,1 | 0,769 | unsere Obergrenze, 8 × 600 W |
| ML.ENERGY, Text-Chat | 1 × B200, Qwen3 32B, Batch 128 | nicht angegeben | 0,209 | gemessene GPU-Energie |
| ML.ENERGY, Text-Chat | 1 × B200, Qwen3 32B, Batch 512 | nicht angegeben | 0,151 | gemessene GPU-Energie |
| ML.ENERGY, Problemlösung | 1 × B200, Qwen3 32B, Batch 128 | nicht angegeben | 0,312 | gemessene GPU-Energie |
MLPerf Inference v6.0, veröffentlicht von MLCommons am 1. April 2026, Datacenter-Suite, Closed Division, Kategorie Available, Benchmark llama2-70b-99: Eintrag 6.0-0021 (Dell PowerEdge XE7740, gelistet mit „H200 TGP 600W“), 6.0-0047 (HPE ProLiant Compute DL380a Gen12) und 6.0-0004; aus der Datei der zusammengefassten Ergebnisse von MLCommons zu v6.0; Ergebnisse von der MLCommons Association verifiziert. Die Obergrenzen in J pro Token sind unsere Rechnung (4.800 W ÷ Token pro Sekunde) nur für die GPU-Karten, keine Messungen und keine MLPerf-Metrik. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information. ML.ENERGY-Team, University of Michigan, „Where Do the Joules Go? Diagnosing Inference Energy Consumption“, arXiv 2601.22076v2 (30. Januar 2026), Tabelle 1.
Im Offline-Szenario, in dem die Latenz nicht zählt, liegen die Obergrenzen der beiden 600-W-Karten nah beieinander, bei 0,150 J pro Token für die H200 NVL in FP8 und 0,160 J für die RTX PRO 6000 in FP4. Unter den Latenzgrenzen des interaktiven Szenarios erzeugte ein anderes System mit acht RTX PRO 6000 (6.0-0004) deutlich weniger Token, sodass dieselbe Obergrenze von 4.800 W auf 0,769 J pro Token kommt, gegenüber 0,294 J für die H200 NVL. Keines der beiden Paare vergleicht gemessene Effizienz, denn die Karten können deutlich unter 600 W aufgenommen haben, vor allem unter den Latenzgrenzen. Unser Vergleich von RTX PRO 6000 und H200 NVL für LLM-Inferenz erklärt die Speicherbandbreite hinter diesem Abstand.
Das ML.ENERGY-Team hat die GPU-Energie über 46 Modelle und 1.858 Konfigurationen auf H100- und B200-GPUs gemessen. Die Autoren berichten außerdem von Energieunterschieden um das Drei- bis Fünffache, die auf Unterschiede in der GPU-Auslastung zurückgehen.
Warum Batchgröße und Auslastung die Energie pro Token bestimmen
Bei der Generierung liest jeder Schritt die Gewichte eines dichten Modells wie Llama 2 70B einmal für den ganzen Batch, und jede Anfrage im Batch fügt ihren eigenen KV-Cache-Verkehr hinzu. Ein größerer Batch verteilt dieselben Gewichtszugriffe, und einen großen Teil derselben Board-Leistung, deshalb auf mehr Token. Die ML.ENERGY-Studie formuliert es so: Mit wachsender Batchgröße „sinkt die Energie pro Token zunächst und erreicht dann ein Plateau, wenn sich die GPU-Auslastung der Sättigung nähert“. Im früheren Benchmark-Paper des Teams sank die Energie pro Antwort eines destillierten 8B-Reasoning-Modells auf einer H100 auf etwa 29 Prozent ihres Werts bei einer maximalen Batchgröße von 4, als das Maximum auf 64 angehoben wurde.
Mit der Auslastung über den Tag verhält es sich genauso. Ein Server, der auf Anfragen wartet, nimmt weiterhin Leerlaufleistung auf, und diese Energie gehört zu den Token, die er in den ausgelasteten Stunden erzeugt. Ein Pilot mit einer Handvoll Nutzern meldet deshalb einen deutlich höheren Wert pro Token als derselbe Server unter gleichmäßiger Last; vergleichen Sie Werte also nur bei gleicher Last.
Die Antwortlänge verändert die Energie pro Anfrage stärker als den Wert pro Token. Für Qwen3 32B auf einer B200, jede Aufgabe bei ihrer größten Batchgröße, maß ML.ENERGY 95 J pro Antwort für Textkonversation und 2.192 J für Problemlösung, deren Antworten im Mittel 7.035 Token gegenüber 627 lang waren. Planen Sie bei Reasoning-Modellen die Energie pro Antwort, nicht nur pro Token.
Energie pro Token auf dem eigenen Server messen
Ein Wert für ein Budget muss aus Ihrem Modell, Ihren Prompts und Ihrer Parallelität stammen, und DCGM und vLLM liefern die beiden Zähler, die er braucht.
- Notieren Sie bei geladenem Modell und ohne Anfragen die Leerlaufleistung jeder GPU aus
nvidia-smi -q -d POWER, deren Average Power Draw NVIDIA als „die durchschnittliche Leistungsaufnahme der gesamten Karte in der letzten Sekunde, in Watt“ definiert. - Lesen Sie vor dem Lauf für jede GPU das DCGM-Feld 156, DCGM_
FI_ DEV_ TOTAL_ ENERGY_ CONSUMPTION, definiert als „gesamter Energieverbrauch der GPU in mJ seit dem letzten Neuladen des Treibers“; dcgmi dmon -e 155,156zeigt es neben der Board-Leistung in Watt. - Lesen Sie im selben Moment die vLLM-Zähler
vllm:generation_tokens_totalundvllm:prompt_tokens_totalam Endpunkt/metricsaus. - Fahren Sie für einen festen Zeitraum eine Last mit der Parallelität, der Prompt-Länge und der Antwortlänge Ihres Workloads, und lesen Sie dann beide Zähler erneut.
- Teilen Sie die Energiedifferenz, summiert über alle GPUs und von Millijoule in Joule umgerechnet, durch die erzeugten Token. Geben Sie die Prompt-Token daneben an, denn lange RAG-Prompts fügen Prefill-Energie hinzu, die ein Wert pro Ausgabe-Token verbirgt.
- Wiederholen Sie die Messung bei zwei oder drei Parallelitätsstufen und bei jeder Leistungsgrenze, die Sie in Betracht ziehen, und halten Sie neben jedem Ergebnis die Token pro Sekunde je Nutzer fest.
Die Board-Energie lässt Prozessoren, Arbeitsspeicher, Lüfter und Netzteilverluste außen vor. Für den ganzen Server lesen Sie die Eingangsleistung über denselben Zeitraum am BMC oder an einer PDU mit Messfunktion ab und teilen sie durch dieselbe Token-Zahl. Welche weiteren DCGM-Felder sich zu exportieren lohnen und welche Feldnamen DCGM 4.6 geändert hat, steht in unserem Leitfaden zum Monitoring von GPU-Servern mit DCGM.
Wir bauen KI-Server nach Auftrag und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot machen. Schicken Sie uns das Modell, Ihr tägliches Token-Volumen und das Leistungsbudget der Rack-Position über das Formular unten.
Leistungsgrenzen als Effizienzeinstellung
Auf einer 600-W-Karte setzt nvidia-smi -i 0 -pl 450 eine niedrigere Grenze für die erste GPU. Laut NVIDIAs Dokumentation „muss der Wert zwischen Min und Max Power Limit liegen, wie nvidia-smi sie meldet“, und der Befehl „erfordert root“. Eine niedrigere Grenze senkt Spitzenaufnahme und Wärme pro Karte, und der Durchsatz kann um einen Betrag sinken, der vom Modell, von der Präzision und von der Batchgröße abhängt. Ob die Energie pro Token damit ebenfalls sinkt, beantwortet Schritt 6 oben, bei der Standardgrenze und bei einer oder zwei niedrigeren Grenzen.
Prüfen Sie nach einem Neustart oder dem Neuladen des Treibers, ob die Grenze noch gilt. DCGM meldet sie in DCGM_
Von Joule pro Token zu kWh pro Tag
Zur Umrechnung multiplizieren Sie Joule pro Token mit einer Million und teilen durch 3.600; das ergibt Wh pro Million Token. Die Offline-Obergrenze von 0,150 J pro Token für acht H200 NVL entspricht 41,7 Wh GPU-Board-Energie pro Million Token. Das Ergebnis der RTX PRO 6000 entspricht 44,6 Wh.
Ein Tageswert lässt sich einfacher begrenzen. Acht Karten mit 600 W verbrauchen in 24 Stunden höchstens 115,2 kWh Board-Energie, unabhängig davon, was sie erzeugen, und Leerlaufstunden zählen zu dieser Summe. Die Leistung des Servers an der Steckdose fügt Prozessoren, Lüfter und Netzteilverluste hinzu, und in einem Rechenzentrum kommen Kühlung und Stromverteilung hinzu. All diese Energie endet als Wärme im Raum, die unser Artikel zum GPU-Server im Büro oder kleinen Serverraum in BTU/h umrechnet.
Auf EU-Ebene verpflichtet die Delegierte Verordnung (EU) 2024/1364 der Kommission Betreiber von Rechenzentren mit einem Leistungsbedarf der installierten Informationstechnik von mindestens 500 kW, jährlich an eine europäische Datenbank zu berichten, direkt oder über ein nationales Berichtssystem, unter anderem über den gesamten Energieverbrauch des Rechenzentrums und seiner IT-Ausrüstung in kWh. Ob ein bestimmter Standort darunter fällt, ist eine rechtliche Bewertung für die Rechtsabteilung des Unternehmens.
Was wir liefern
Wir liefern die H200 NVL, die RTX PRO 6000 Server Edition und die L40S als Karten für Server, die Sie bereits betreiben, und in KI-Servern, die wir auf Bestellung bauen, mit Herstellergarantie unter einem EU-Vertrag und auf einer Rechnung. Jeder Server wird montiert und im Burn-in getestet, und wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot machen. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch, und der Treiber enthält nvidia-smi, um die Leistung abzulesen und Grenzen zu setzen. Die vollständige Kartenauswahl mit der Board-Leistung jeder Karte steht auf unserer Seite zu professionellen NVIDIA-GPUs.
FAQ
Wie hoch ist der Energieverbrauch einer GPU pro Token bei LLM-Inferenz?
Wie berechne ich die Energie pro Token bei LLM-Inferenz?
Wie hoch ist der Stromverbrauch eines KI-Servers bei LLM-Inferenz?
Ist die H200 NVL energieeffizienter als die RTX PRO 6000?
Wie viele Token pro Watt liefert eine GPU?
Spart eine niedrigere GPU-Leistungsgrenze Energie?
Schicken Sie uns das Modell und seine Präzision, Ihr erwartetes tägliches Token-Volumen, die Spitzenzahl gleichzeitiger Anfragen und die an der Rack-Position verfügbare Leistung. Wir antworten innerhalb eines Werktages mit Konfiguration und Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot machen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages