LLM-Hardware-Anforderungen je Modell: gpt-oss, Qwen3.8, DeepSeek, Llama 4, GLM-5.3 und Mistral
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Die Gewichte des Checkpoints plus ein KV-Cache je Gespräch müssen in 90 Prozent des vom Treiber gemeldeten Speichers passen, abzüglich 3 GiB je Karte; bei 32K Token braucht ein Gespräch etwa 0,12 GiB FP8-Cache bei DeepSeek-V4-Flash und etwa 3 GiB bei Llama 4 oder GLM-5.3, und bei Tensor-Parallelismus halten DeepSeek, GLM-5.3 und Mistral Small 4 diesen Cache auf jeder Karte
- gpt-oss-20b (13,8 GB), gpt-oss-120b (65,3 GB, MXFP4) und Qwen3.8-27B in FP8 (30,9 GB) laufen auf einem DGX Spark, einer RTX PRO 6000 oder einer H200 NVL; für 20 Gespräche mit 32K braucht gpt-oss-120b eine zweite RTX PRO 6000 oder eine H200 NVL
- Llama 4 Scout in FP8 und Mistral Small 4 (120,9 GB) brauchen zwei RTX PRO 6000 oder eine bis zwei H200 NVL, DeepSeek-V4-Flash-0731 (167 GB, FP4-Experten) zwei RTX PRO 6000; Qwen3.8-Flash-Next (172,78 GiB in FP8) braucht nach unserer Schätzung zwei H200 NVL oder vier bis acht RTX PRO 6000
- Llama 4 Maverick in FP8 (etwa 417 GB) braucht vier H200 NVL oder acht RTX PRO 6000; DeepSeek-V3.2 (690 GB) und GLM-5.3 (756 GB) brauchen acht H200 NVL, die in vLLM 0.31.0 20 Nutzer mit 32K mit Pipeline-Parallelismus zwischen den NVLink-Domänen oder Decode Context Parallelism fassen, DeepSeek-V3.2 auch mit datenparalleler Attention, nicht aber mit Tensor-Parallelismus über alle acht; GLM-5.3 passt in FP8 nicht auf acht RTX PRO 6000
- Metas Nutzungsrichtlinie für Llama 4 (Acceptable Use Policy) gewährt die Rechte nach Abschnitt 1(a) an den multimodalen Modellen von Llama 4 weder natürlichen Personen mit Wohnsitz in der EU noch Unternehmen mit Hauptgeschäftssitz in der EU, mit einer Ausnahme für Endnutzer eines Produkts oder Dienstes, das sie integriert; Qwen3.8-Flash-Next und GLM-5.3 haben eigene Lizenzen ihrer Anbieter, die übrigen Apache 2.0 oder MIT
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
LLM-Hardware-Anforderungen je Modell
LLM-Hardware-Anforderungen folgen aus dem Speicherbedarf des Modells, denn die GPUs müssen die Gewichte des Checkpoints und zusätzlich einen KV-Cache für jedes laufende Gespräch fassen. Stand Oktober 2026 laufen gpt-oss-20b, gpt-oss-120b und Qwen3.8-27B auf einem DGX Spark, einer RTX PRO 6000 oder einer H200 NVL. Llama 4 Scout, Mistral Small 4, DeepSeek-V4-Flash und Qwen3.8-Flash-Next brauchen je nach Modell und Nutzerzahl eine oder zwei H200 NVL oder zwei bis acht RTX PRO 6000. Llama 4 Maverick braucht vier H200 NVL oder acht RTX PRO 6000, und DeepSeek-V3.2 und GLM-5.3 brauchen acht H200 NVL.
Alle Konfigurationen nutzen Hardware, die wir liefern. Die DGX Spark Founders Edition hat 128 GB Unified Memory, die RTX PRO 6000 hat 96 GB je Karte und verbindet Karten nur über PCIe, und die H200 NVL hat 141 GB je Karte, mit NVLink-Brücken für zwei oder vier Karten. Die Konfigurationen sind unsere Schätzungen für einen Nutzer und für 20 gleichzeitige Nutzer mit 32.768 Token.
Modellgrößen, Formate und Kontextfenster im Oktober 2026
| MODELL | PARAMETER | VERÖFFENTLICHT ALS | CHECKPOINT | KONTEXT |
|---|---|---|---|---|
| gpt-oss-20b | 21B, 3,6B aktiv | MXFP4-Experten, Rest BF16 | 13,8 GB | 131.072 |
| gpt-oss-120b | 117B, 5,1B aktiv | MXFP4-Experten, Rest BF16 | 65,3 GB | 131.072 |
| Qwen3.8-27B | 27B, dicht | BF16; FP8-Version | 55,6 GB; FP8 30,9 GB | 262.144, bis 1M |
| Qwen3. | 125B plus 51B N-Gram-Embedding und 4B MTP; 6B aktiv | BF16; FP8-Version | FP8 186 GB | 262.144, bis 1M |
| Deep | 284B plus Draft-Modul, 13B aktiv | FP4-Experten, Rest FP8 | 167 GB | 1M |
| DeepSeek-V3. | 685B mit MTP, 37B aktiv | FP8 | 690 GB | 163.840 |
| Llama 4 Scout | 109B, 17B aktiv | BF16; FP8 und NVFP4 von NVIDIA | FP8 111,6 GB; NVFP4 65,3 GB | 10M |
| Llama 4 Maverick | 400B, 17B aktiv | BF16 und FP8 | FP8 etwa 417 GB | 1M |
| GLM-5.3 | 753B, aktive nicht angegeben | FP8 | 756 GB | 1M |
| Mistral Small 4 | 119B, 6,5B aktiv | FP8; NVFP4-Version | 120,9 GB; NVFP4 70,8 GB | 256K |
Model Cards, Dateilisten und config.json-Dateien auf Hugging Face, abgerufen am 9. Oktober 2026; die aktiven Parameter von DeepSeek-V3.2 aus DeepSeeks Card zu V3, die von V4-Flash aus seiner Preview-Card, der Kontext von GLM-5.3 aus der Dokumentation von Z.ai. Die Größen zählen eine Kopie der Gewichte; die von Maverick wie in unserem Leitfaden zur H200 NVL.
Die RTX PRO 6000 und der DGX Spark rechnen FP4 direkt. Die H200 NVL rechnet FP8, aber nicht FP4, deshalb führt vLLM 4-Bit-Gewichte darauf Weight-only aus, mit 16-Bit-Arithmetik, wie unser Leitfaden zu FP8, NVFP4 und MXFP4 erklärt. Für die RTX PRO 6000 führt die Support-Matrix von TensorRT-LLM nur FP8 mit Skalierung je Tensor, während die FP8-Checkpoints beider Qwen3.8-Modelle, von DeepSeek und von GLM-5.3 Block-Skalierungen von 128 × 128 nutzen; prüfen Sie also, ob Ihre Engine sie auf dieser Karte ausführt.
Wie wir den GPU-Speicher je Modell schätzen
Der Cache ergibt sich aus der jeweiligen Konfigurationsdatei bei 32.768 Token je Gespräch: Layer mit voller Attention halten jedes Token, Sliding-Window-Layer nur das Fenster, wie die Designnotizen von vLLM beschreiben. Gerechnet ist er in 16 Bit, wie in vLLM voreingestellt, außer bei Llama 4, Qwen3.8-Flash-Next und DeepSeek-V4-Flash, für die die vLLM-Rezepte einen FP8-Cache setzen. Wir gehen von vLLM 0.31.0 mit Tensor-Parallelismus über alle Karten aus. Beide DeepSeek-Modelle, GLM-5.3 und Mistral Small 4 halten einen KV-Head je Layer, und der vLLM-Blog vom 7. August 2026 hält fest: „Sobald TP die Zahl der KV-Heads übersteigt, beginnt sich der Cache über die GPUs zu duplizieren.“ Jede Karte hält dann den vollen Cache. Nutzbar sind 90 Prozent dessen, was der Treiber meldet, also von 95,6 GiB je RTX PRO 6000 und 140,4 GiB je H200 NVL, abzüglich 3 GiB je Karte; das ist die Regel aus unserem Leitfaden dazu, wie viel VRAM ein LLM braucht. Für einen DGX Spark (128 GB) setzen wir 102 GB an, das untere Ende des Arbeitsbudgets aus unserem Artikel dazu, was in 128 GB auf einem DGX Spark passt.
Laut OpenAIs Card lässt MXFP4 gpt-oss-120b „auf einer einzelnen 80-GB-GPU laufen“ und gpt-oss-20b „innerhalb von 16 GB Speicher laufen“. Metas Card gibt an, dass Llama 4 Scout „mit Int4-Quantisierung zur Laufzeit auf eine einzelne H100-GPU passen kann“ und dass die FP8-Gewichte von Maverick „auf einen einzelnen H100-DGX-Host passen“. Mistrals vLLM-Befehl für Small 4 setzt --tensor-parallel-size 2.
Mindestkonfiguration für einen und für 20 Nutzer
| MODELL, FORMAT | EIN DGX SPARK | RTX PRO 6000 | H200 NVL |
|---|---|---|---|
| gpt-oss-20b, MXFP4 | ja / ja | 1 / 1 | 1 / 1 |
| gpt-oss-120b, MXFP4 | ja / ja | 1 / 2 | 1 / 1 |
| Qwen3.8-27B, FP8 | ja / ja | 1 / 1 | 1 / 1 |
| Qwen3. | nein / nein | 4 / 8 | 2 / 2 |
| Deep | nein / nein | 2 / 2 | 2 / 2, Weight-only |
| DeepSeek-V3. | nein / nein | 8 / über 8 | 8 / 8 mit PP, DCP oder DP |
| Llama 4 Scout, FP8 | nein / nein | 2 / 2 | 1 / 2 |
| Llama 4 Maverick, FP8 | nein / nein | 8 / 8 | 4 / 4 |
| GLM-5.3, FP8 | nein / nein | über 8 / über 8 | 8 / 8 mit PP oder DCP |
| Mistral Small 4, FP8 | nein / nein | 2 / 2 | 1 / 2 |
Unsere Schätzungen, keine Messungen, der Kartenzahl für ein Gespräch und für 20 gleichzeitige Gespräche mit je 32.768 Token, in Konfigurationen mit 1, 2, 4 oder 8 Karten, mit Tensor-Parallelismus in vLLM 0.31.0; beim DGX Spark zeigt die Tabelle nur, ob der Speicher reicht. PP, DCP und DP: Pipeline-Parallelismus, Decode Context Parallelism und datenparallele Attention, wie im Abschnitt zu acht Karten. Der H200-NVL-Wert für DeepSeek-V4-Flash setzt voraus, dass seine FP4-Experten Weight-only laufen. Die Konfigurationsdatei von Maverick ist zugangsbeschränkt (gated), deshalb rechnet sein Cache mit dem Layout von Scout aus der Transformers-Dokumentation.
Die beiden Werte in einer Zelle unterscheiden sich dort, wo der Cache und nicht die Gewichte die Grenze setzt. Auf einer RTX PRO 6000 lässt gpt-oss-120b 22,2 GiB für den Cache, Platz für 19 Gespräche mit 32K zu je 1,125 GiB. Für 20 Nutzer braucht es deshalb eine zweite Karte, während eine H200 NVL 55 fasst. Mistral Small 4 lässt auf einer H200 NVL 10,8 GiB, genug für ein Gespräch, aber nicht für die 14,1 GiB, die 20 brauchen.
Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Nennen Sie uns das Modell, Ihre Kontextlänge und die Spitzenzahl laufender Anfragen über das Formular unten, und wir antworten mit Konfiguration und Angebot.
Eine Karte oder ein DGX Spark: gpt-oss und Qwen3.8-27B
gpt-oss-20b, gpt-oss-120b und Qwen3.8-27B in FP8 passen für einen Nutzer jeweils auf eine Karte, und eine H200 NVL fasst jedes davon mit 20 Gesprächen bei 32K. gpt-oss hält den ganzen Kontext nur in der Hälfte seiner Layer, während die Attention der anderen Hälfte ein Fenster von 128 Token umfasst. Ein Gespräch mit 32K kostet deshalb bei gpt-oss-20b 0,75 GiB Cache in 16 Bit und bei gpt-oss-120b 1,125 GiB. Qwen3.8-27B hält einen vollen Cache in 16 seiner 64 Layer, mit vier KV-Heads der Dimension 256, und seine Gated-DeltaNet-Layer halten je Gespräch einen festen Zustand, insgesamt etwa 2 GiB je Gespräch mit 32K.
Ein DGX Spark fasst alle drei im Speicher, gpt-oss-120b mit den 20 Gesprächen unserer Tabelle bei 32K in etwa 83 GiB und Platz für etwa 30. Auf einem Spark begrenzt die Geschwindigkeit ein Team früher als der Speicher, denn seine Speicherbandbreite von 273 GB/s liegt unter der beider Karten.
Llama 4 Scout, Mistral Small 4, DeepSeek-V4-Flash und Qwen3.8-Flash-Next
Llama 4 Scout belegt in NVIDIAs FP8-Checkpoint zwei RTX PRO 6000 oder eine H200 NVL, und 20 Gespräche brauchen eine zweite H200 NVL. Wir haben alle 48 Layer mit vollen 32K gerechnet, da wir kein vLLM-Dokument dazu gefunden haben, wie es die Layer mit Chunked Attention speichert. NVIDIAs NVFP4-Checkpoint mit 65,3 GB passt für einen Nutzer auf eine RTX PRO 6000 oder einen Spark, allerdings wählt das Scout-Rezept von vLLM ihn nur bei Compute Capability 10.0, und NVIDIA führt die RTX PRO 6000 mit 12.0.
Mistral Small 4 erscheint in FP8 mit 120,9 GB, und zwei RTX PRO 6000 fassen es für 20 Nutzer, so viele GPUs, wie Mistrals eigener Befehl verwendet. Seine NVFP4-Version mit 70,8 GB passt mit 20 Gesprächen auf eine RTX PRO 6000 oder einen Spark, auf der Karte mit knappem Spielraum.
DeepSeek-V4-Flash-0731, das offizielle Release, braucht für seine 167 GB zwei RTX PRO 6000. Seine komprimierte Attention hält den FP8-Cache nach unserer Schätzung bei etwa 0,12 GiB je Gespräch mit 32K, deshalb bedienen zwei Karten auch dann 20 Nutzer, wenn jede den vollen Cache hält. Das vLLM-Rezept vom 29. September 2026 betreibt es auf acht RTX PRO 6000. Die H200 NVL hat keinen nativen Pfad für seine FP4-Experten, wie unser Leitfaden zur H200 NVL festhält, deshalb fassen zwei Karten das Modell nur, wenn die Engine die Experten in FP4 hält und Weight-only ausführt, was wir in keinem Dokument von DeepSeek oder vLLM gefunden haben. Für die Reasoning-Stufen „high“ und „max“ empfiehlt DeepSeek bis zu 384K Ausgabe-Token, und bei dieser Länge entscheidet der Cache darüber, wie viele Nutzer Platz haben. Das neuere DeepSeek-V4.1-Flash (10. September 2026, etwa 511 GB) dimensioniert unser Leitfaden zu den Hardware-Anforderungen von DeepSeek.
Qwen3.8-Flash-Next braucht für seinen FP8-Checkpoint, den das vLLM-Rezept mit 172,78 GiB angibt, zwei H200 NVL. Das Rezept hält fest, dass „die 80 GB je GPU der H100 unter einfachem TP4 nicht genug Reserve für die 51B große N-Gram/PLE-Embedding-Tabelle bieten“; deshalb dimensionieren wir je Karte. Vier RTX PRO 6000 fassen es nach unserer Schätzung, lassen aber je Karte zu wenig für 20 Gespräche mit 32K. Für 20 Nutzer braucht es acht Karten, oder vier mit der Tabelle im Host-Speicher, wofür das Rezept mindestens 51 GB plus Reserve für die Laufzeit verlangt.
Das Rezept nutzt auf acht H200 Tensor-Expert-Parallelismus (TEP8), weil „einfaches TP8 mit seinen 128 breiten Quantisierungsblöcken nicht kompatibel ist“; acht RTX PRO 6000 bräuchten also dieselbe Aufteilung.
Llama 4 Maverick, DeepSeek-V3.2 und GLM-5.3 auf vier oder acht Karten
Llama 4 Maverick in FP8, etwa 417 GB, passt auf vier H200 NVL, die eine Vierfach-NVLink-Brücke zu einer Domäne mit 564 GB verbindet. Es bleiben etwa 105 GiB, genug für 20 Gespräche mit 32K. Vier RTX PRO 6000 haben 384 GB, zu wenig für die Gewichte, deshalb braucht Maverick acht, über PCIe aufgeteilt.
DeepSeek-V3.2 und GLM-5.3 brauchen acht H200 NVL, die zwei über PCIe verbundene NVLink-Domänen zu je vier Karten bilden, wie unser Leitfaden dazu, wie viele H200 NVL große Modelle brauchen erklärt. Mit Tensor-Parallelismus über alle acht hält jede Karte den vollen Cache jedes Gesprächs, Platz für etwa 18 Gespräche mit 32K bei DeepSeek-V3.2 und 11 bei GLM-5.3. Pipeline-Parallelismus (PP) zwischen den Domänen, die Aufteilung aus diesem Leitfaden, halbiert den Cache je Karte, für etwa 36 und 23. Decode Context Parallelism (DCP, -dcp 8), das vLLM 0.30.0 für Sparse-MLA-Modelle führt, verteilt jeden Cache nach Token auf die Karten, für etwa 144 und 92. Mit datenparalleler Attention (DP, -dp 8), die das V3.2-Rezept von vLLM vorzieht, hält jede Karte nur ihre eigenen Gespräche, wiederholt aber die Gewichte außerhalb der Experten, nach unserer Zählung etwa 88 bei V3.2. Acht RTX PRO 6000 lassen nach den Gewichten von DeepSeek-V3.2 je Karte 2,7 GiB, genug für ein Gespräch mit 32K, oder etwa neun mit -dcp 8. Die FP8-Gewichte von GLM-5.3 belegen 704 GiB, mehr als die 664 GiB, die acht RTX PRO 6000 nach unserer Regel bereitstellen.
Wir bauen Server mit vier oder acht H200 NVL und ihren NVLink-Brücken und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie das Modell, Ihren Rack-Standort und seine Stromversorgung im Formular unten.
Lizenzbedingungen, die die Nutzung eines Modells in der EU einschränken
gpt-oss, Qwen3.8-27B und Mistral Small 4 sind unter Apache 2.0 veröffentlicht, beide DeepSeek-Modelle unter der MIT-Lizenz, wie ihre Model Cards angeben. Für Llama 4 hält Metas Nutzungsrichtlinie für Llama 4 (Acceptable Use Policy), auf die das Llama 4 Community License Agreement verweist, im englischen Original fest, dass für alle in Llama 4 enthaltenen multimodalen Modelle die Rechte nach Abschnitt 1(a) des Llama 4 Community License Agreement natürlichen Personen mit Wohnsitz in der Europäischen Union und Unternehmen mit Hauptgeschäftssitz in der Europäischen Union nicht gewährt werden. Der englische Richtlinientext fährt fort, hier übersetzt: „Diese Einschränkung gilt nicht für Endnutzer eines Produkts oder Dienstes, das solche multimodalen Modelle integriert.“ Metas Card bezeichnet die Llama-4-Modelle als „nativ multimodale KI-Modelle“.
Qwen3.8-Flash-Next steht unter der Qwen Community License 1.0. Ihre Klausel zu Dienstleistungsgeschäften bestimmt sinngemäß: Betreibt der Lizenznehmer oder eines seiner verbundenen Unternehmen ein Geschäft als „Model as a Service“ oder „AI Work Assistant“, muss der Lizenznehmer eine separate Lizenz von Qwen einholen, bevor er die Software oder ihre abgeleiteten Werke für einen kommerziellen Zweck nutzt. Ausgenommen ist eine interne Nutzung, die weder das Modell noch seine Ausgaben oder Fähigkeiten einem Dritten zugänglich macht. Die GLM-5.3 License verlangt von Betreibern von Model-as-a-Service-Angeboten oberhalb einer Umsatzschwelle, eine Sicherheitsprüfung durch Z.AI zu bestehen. Ob eine Klausel Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung. Unser Leitfaden zur privaten ChatGPT-Alternative vergleicht die Lizenzen der Modelle, die er behandelt.
Was wir liefern
Wir liefern die DGX Spark Founders Edition, die RTX PRO 6000 als Workstation, Max-Q und Server Edition sowie die H200 NVL mit ihren Zweifach- und Vierfach-NVLink-Brücken. Sie kommen als Karten oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Konfiguration und Angebot erhalten Sie innerhalb eines Werktages, und unser Sortiment professioneller GPUs führt jede Karte. Modelle, RAG und MLOps auf der Hardware sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Welche Hardware brauche ich, um ein LLM lokal zu betreiben?
Wie viel VRAM braucht gpt-oss-120b?
Welche Hardware braucht DeepSeek lokal?
Wie viel VRAM brauchen Qwen3- und Qwen3.8-Modelle?
Welche Hardware braucht Llama 4?
Welche Hardware brauchen GLM-4.5 und GLM-5.3?
Schicken Sie uns das Modell, die Präzision, mit der Sie es betreiben wollen, die Kontextlänge, die Sie festlegen werden, und die Spitzenzahl gleichzeitiger Anfragen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages