DeepSeek-Hardware-Anforderungen: V4-Flash, V4.1-Flash und V3.2 auf RTX PRO 6000 und H200 NVL
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- DeepSeek-V4-Flash (284B Parameter, 13B aktiv, FP4-Experten und FP8 für den Rest) hat 160 GB, sein offizielles Release -0731 167 GB; nach unserer Schätzung fassen zwei RTX PRO 6000 es für 20 Gespräche mit 32K mit FP8-Cache und vier für 100, zwei H200 NVL dagegen nur, wenn die Engine die FP4-Experten Weight-only ausführt
- Das DeepSeek-V4-Flash-Rezept von vLLM, aktualisiert am 29. September 2026, gibt an, dass das Serving des Checkpoints -0731 ohne spekulatives Decoding auf acht RTX PRO 6000 über PCIe verifiziert wurde, und betreibt ihn auf zwei DGX Spark, weil die 128 GB eines Spark zu klein sind
- DeepSeek-V3.2 (685B mit MTP, 37B aktiv) hat in FP8 690 GB; acht H200 NVL fassen es nach unserer Schätzung im datenparallelen Modus von vLLM mit Cache für etwa 88 Gespräche mit 32K, während acht RTX PRO 6000 Platz für etwa eines lassen
- DeepSeek-V4.1-Flash, veröffentlicht am 10. September 2026, hat etwa 511 GB einschließlich 196,6B Parametern in Engram-Tabellen; vLLM betreibt es auf vier H200 mit diesen Tabellen im Host-Speicher, und acht RTX PRO 6000 fassen es nach unserer Speicherschätzung
- Laut vLLM hält Tensor-Parallelismus den vollen latenten KV-Cache auf jeder Karte, deshalb belegt ein Gespräch mit 32K etwa 0,12 GiB FP8-Cache je Karte bei V4-Flash und 2,4 GiB 16-Bit-Cache bei V3.2; alle diese Checkpoints sind unter der MIT-Lizenz veröffentlicht
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
DeepSeek-Hardware-Anforderungen im Oktober 2026
Die Hardware-Anforderungen von DeepSeek hängen von der Variante ab, und die kleinste Serverkonfiguration für DeepSeek-V4-Flash sind zwei RTX PRO 6000. Sie fassen seinen Checkpoint mit 160 GB, oder 167 GB beim offiziellen Release -0731, mit Platz für 20 Gespräche mit 32.768 Token im FP8-Cache, den das vLLM-Rezept setzt. Hundert solche Gespräche brauchen vier RTX PRO 6000 oder zwei H200 NVL, sofern die Serving-Engine die FP4-Expertengewichte in FP4 hält. DeepSeek-V3.2 braucht für seine 690 GB FP8-Gewichte acht H200 NVL, mit Cache für etwa 88 Gespräche mit 32K bei datenparalleler Attention, sodass 100 solche Nutzer in diesem Modus mehr als acht Karten brauchen. DeepSeek-V4.1-Flash braucht vier H200 NVL oder, nach dem Speicher, acht RTX PRO 6000.
Das sind unsere Schätzungen für Hardware, die wir liefern: die DGX Spark Founders Edition mit 128 GB Unified Memory, die RTX PRO 6000 mit 96 GB an PCIe und die H200 NVL mit 141 GB und NVLink-Brücken für zwei oder vier Karten. Unser Überblick über LLM-Hardware-Anforderungen je Modell stellt DeepSeek neben andere Modellfamilien.
DeepSeek-Modelle auf Hugging Face im Oktober 2026
Das API-Änderungsprotokoll von DeepSeek datiert DeepSeek-V3.2 auf den 1. Dezember 2025, DeepSeek-V4 auf den 24. April 2026, das Update von DeepSeek-V4-Flash auf den 31. Juli 2026 und DeepSeek-V4.1-Flash auf den 10. September 2026. Die Model Card des Juli-Updates bezeichnet es als offizielles Release von DeepSeek-V4-Flash, das die Preview-Version ablöst.
| MODELL | PARAMETER | GEWICHTE | CHECKPOINT | KONTEXT |
|---|---|---|---|---|
| Deep | 284B, 13B aktiv | FP4-Experten, Rest FP8 | 160 GB | 1M |
| Deep | 304B nach NVIDIAs Zählung, 13B aktiv | FP4-Experten, Rest FP8 | 167 GB | 1M |
| DeepSeek-V4. | 552B plus 196,6B Engram; 8B oder 16B aktiv | FP4-Experten, Rest FP8 | etwa 511 GB | 1M |
| Deep | 1,6T, 49B aktiv | FP4-Experten, Rest FP8 | 893 GB | 1M |
| DeepSeek-V3. | 685B mit MTP, 37B aktiv | FP8 | 690 GB | 163.840 |
| DeepSeek-V3. | wie V3.2 | NVFP4 in den linearen Layern | 415 GB | wie V3.2 |
Model Cards, Dateilisten und config.json-Dateien auf Hugging Face sowie die vLLM-Rezepte für V4-Flash und V4.1-Flash, abgerufen am 9. Oktober 2026; die Parameter von V4-Flash-0731 aus NVIDIAs NVFP4-Card, die von V4-Pro aus DeepSeeks Card zu V4, die aktiven Parameter von V3.2 aus DeepSeeks Card zu V3.
Die 7 GB zwischen der Preview und dem Checkpoint -0731 sind ein Draft-Modul für spekulatives Decoding, das das vLLM-Rezept als den Unterschied benennt. Für V4.1-Flash nennt DeepSeeks Release Note 8B aktive Parameter für die Eingabe und 16B für die Ausgabe, und das vLLM-Rezept ergänzt, dass die beiden Engram-Tabellen allein 196,6B Parameter umfassen (etwa 183 GiB).
NVIDIAs NVFP4-Version von V3.2 quantisiert nur die linearen Operatoren der Transformer-Blöcke und verringert laut NVIDIA Plattengröße und GPU-Speicherbedarf um etwa den Faktor 1,66. NVIDIAs NVFP4-Version von V4-Flash-0731 ist laut NVIDIA etwas größer als ihre Quelle und spart deshalb keinen Speicher.
KV-Cache je Gespräch: MLA und komprimierte Attention
Unsere Dimensionierungsregel, erklärt in unserem Leitfaden dazu, wie viel VRAM ein LLM braucht, gibt Gewichten und Cache 90 Prozent des vom Treiber gemeldeten Speichers, abzüglich 3 GiB je Karte: 83,0 GiB je RTX PRO 6000 und 123,4 GiB je H200 NVL. Für einen DGX Spark (128 GB) setzen wir 102 GB je System an. Der Cache ist aus der jeweiligen config.json bei 32.768 Token je Gespräch gerechnet, in 16 Bit für V3.2 und in FP8 für die V4-Modelle, deren vLLM-Rezept in seinem Befehl für die RTX PRO 6000 --kv-cache-dtype fp8 setzt.
DeepSeek-V3.2 nutzt Multi-Head Latent Attention (MLA). Seine config.json setzt kv_lora_rank auf 512 und qk_rope_head_dim auf 64, sodass jeder seiner 61 Layer je Token 576 Werte speichert statt Keys und Values für alle 128 Heads. DeepSeek Sparse Attention fügt einen Indexer mit Keys von 128 Dimensionen je Layer hinzu, den wir in FP8 mit einem Skalierungsfaktor rechnen. Das ergibt etwa 76,5 KiB je Token und 2,39 GiB je Gespräch mit 32K. Nach unserer Lesart verringert die Sparse Attention den Rechenaufwand, während der Cache weiterhin jedes Token hält.
DeepSeek-V4-Flash kombiniert Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA), mit einem KV-Head mit 512 Dimensionen. Die config.json des Release -0731 komprimiert 20 Layer um den Faktor 4 und 19 um den Faktor 128 und lässt vier unkomprimiert; diese nutzen nach unserer Lesart des vLLM-Blogs vom 24. April 2026 ohne Kompression ausschließlich ein Sliding Window für lokale Information und halten nur 128 Token. Nach unserer Rechnung sind das 6,4 KiB je Token in 16 Bit und höchstens 3,9 KiB in FP8, etwa 0,12 GiB je Gespräch mit 32K und 1,5 GiB bei 384K. Für V4.1-Flash zitiert das vLLM-Rezept DeepSeeks Angabe von 890 Byte je Token für den globalen KV, etwa 28 MiB je Gespräch mit 32K.
Der vLLM-Blogbeitrag vom 7. August 2026 hält für MLA-Modelle fest, in deutscher Übersetzung: „Bei normalem TP gibt es nichts, was sich nach Heads aufteilen ließe; der latente KV-Cache wird also vollständig auf jeden TP-Rank repliziert.“ Bei GQA-Modellen beginnt sich der Cache laut dem Beitrag zu duplizieren, sobald die Größe des Tensor-Parallelismus die Zahl der KV-Heads übersteigt; V4-Flash hat einen, also hält nach unserer Lesart ebenfalls jede Karte seinen ganzen Cache. Bei Tensor-Parallelismus vergleichen wir deshalb den Cache je Gespräch mit dem freien Speicher einer Karte. Mit datenparalleler Attention, die die Dokumentation von vLLM für MoE-Modelle mit MLA als vorteilhaft bezeichnet, hat jede DP-Engine einen eigenen KV-Cache, aber jede Karte hält auch die Gewichte außerhalb der Experten vollständig.
Karten für 1, 20 und 100 gleichzeitige Nutzer
| MODELL, FORMAT | DGX SPARK | RTX PRO 6000 | H200 NVL |
|---|---|---|---|
| V4-Flash oder -0731 | 2 / 2 / 2 | 2 / 2 / 4 | 2 / 2 / 2, Weight-only |
| V4.1-Flash | nein / nein / nein | 8 / 8 / 8 | 4 / 4 / 4 |
| V3.2, FP8 | nein / nein / nein | 8, knapp / über 8 / über 8 | 8 / 8 / über 8 |
| V3.2, NVIDIA NVFP4 | nein / nein / nein | 8 / über 8 / über 8 | FP8 nutzen |
Unsere Schätzungen, keine Messungen, für 1, 20 und 100 Gespräche mit je 32.768 Token auf 1, 2, 4 oder 8 Karten oder bis zu vier DGX Spark (nur ob der Speicher reicht), in vLLM mit Tensor-Parallelismus und dem vollen Cache auf jeder Karte; V3.2 auf der H200 NVL mit -dp 8 --enable-expert-parallel in vLLM. Cache in FP8 für die V4-Modelle, wie das vLLM-Rezept ihn setzt, in 16 Bit für V3.2. Die H200-NVL-Werte für die V4-Modelle setzen voraus, dass die FP4-Experten Weight-only laufen.
Zwei RTX PRO 6000 lassen nach den Gewichten von -0731 5,3 GiB je Karte, Platz für etwa 43 Gespräche mit 32K, und nach der Preview 8,5 GiB, etwa 66. Hundert Gespräche brauchen 12,3 GiB auf jeder Karte, deshalb brauchen 100 Nutzer vier Karten.
V3.2 lässt auf acht RTX PRO 6000 2,7 GiB je Karte, etwa ein Gespräch mit 32K. Acht H200 NVL mit Tensor-Parallelismus lassen 43 GiB je Karte, etwa 18 Gespräche. Im datenparallelen Modus von vLLM hält jede Karte nach unserer Rechnung aus der config.json etwa 18,7 GiB Gewichte außerhalb der Experten plus ein Achtel der Experten; das lässt etwa 26,7 GiB je Karte, Platz für je 11 Gespräche und 88 auf acht Karten. Der vLLM-Beitrag vom 29. September 2025 beschreibt für dieses Modell einen FP8-Cache mit 656 Byte je Token und Layer, der etwa 144 erlauben würde, doch das V3.2-Rezept setzt keinen Cache-Typ. Decode Context Parallelism (-dcp 8), das vLLM 0.30.0 für Sparse-MLA-Modelle führt, verteilt jeden Cache nach Token auf die Karten, für etwa 144 auf acht H200 NVL und neun auf acht RTX PRO 6000; kein Rezept, das wir gefunden haben, betreibt V3.2 auf diese Weise.
Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Nennen Sie uns die DeepSeek-Variante, die Sie betreiben wollen, mit welchem Kontext und für wie viele Nutzer in der Spitze, und wir antworten mit Konfiguration und Angebot.
DeepSeek-V4-Flash auf RTX PRO 6000, H200 NVL und zwei DGX Spark
Die RTX PRO 6000 rechnet FP4 auf ihren Blackwell-Tensor-Cores, deshalb läuft DeepSeek-V4-Flash darauf so, wie es veröffentlicht ist. Das vLLM-Rezept hat für den Checkpoint -0731 ein Profil mit der Überschrift „RTX PRO 6000 8× (8×96 GB, sm_120)“ und hält fest, in deutscher Übersetzung: „Serving ohne spekulatives Decoding wurde auf 8× RTX PRO 6000 (PCIe, kein NVLink) verifiziert.“ Zwei Karten sind unsere Speicherschätzung, kein Layout, das das Rezept verifiziert. Laut Rezept setzt Think Max --max-model-len >= 393216 (384K Token) voraus, damit nichts abgeschnitten wird. Bei 384K braucht ein Gespräch etwa 1,5 GiB FP8-Cache auf jeder Karte. Zwei RTX PRO 6000 fassen neben den Gewichten von -0731 etwa drei solche Gespräche, vier etwa 29 und acht etwa 43.
Die H200 NVL hat FP8-, aber keine FP4-Arithmetik, wie unser Leitfaden dazu, wie viele H200 NVL große Modelle brauchen erklärt. Das vLLM-Rezept führt H200-Layouts und empfiehlt Datenparallelismus von vier mit Experten-Parallelismus, der auf H200/B200/B300 vier von acht GPUs je Replikat nutzt. Es verweist auf Berichte, die die Kompatibilität mit Hopper belegen, sagt aber nicht, wie Hopper die FP4-Experten berechnet. Zwei H200 NVL fassen die Gewichte mit etwa 46 GiB Reserve je Karte nur dann, wenn die Experten in FP4 bleiben.
Das Rezept hält fest, dass die 128 GB Unified Memory eines GB10 unter dem Speicherbedarf des FP8/NVFP4-Checkpoints liegen, und betreibt zwei Spark-Systeme mit Tensor-Parallelismus von zwei. Nach unserer Regel lassen zwei DGX Spark etwa 17 GiB je System für den Cache, den jedes System vollständig hält.
DeepSeek-V3.2 und V4.1-Flash auf acht oder vier Karten
DeepSeek-V3.2 belegt in FP8 642,6 GiB, mehr als vier Karten des einen oder anderen Typs fassen können. Acht H200 NVL bilden zwei NVLink-Domänen zu je vier Karten, die über PCIe verbunden sind. Wir haben kein Dokument von vLLM oder DeepSeek gefunden, das V3.2 auf der RTX PRO 6000 betreibt, und seine FP8-Gewichte nutzen Block-Skalierungen von 128 × 128; testen Sie die Engine also zuerst auf dieser Karte.
NVIDIAs NVFP4-Version von V3.2 passt mit 415 GB auf acht RTX PRO 6000, mit etwa 34,7 GiB Reserve je Karte, etwa 14 Gespräche mit 32K bei Tensor-Parallelismus. NVIDIA gibt an, dass dafür 8xB200 GPU und TensorRT LLM ab Version 1.2.0rc8 nötig sind; auf der RTX PRO 6000 ist das also ein ungetesteter Weg.
DeepSeek-V4.1-Flash wiegt etwa 476 GiB. Das vLLM-Rezept, aktualisiert am 3. Oktober 2026, gibt an, dass Tensor-Parallelismus auf der H200 standardmäßig TP4 mit CPU-Offload der Engram-Tabellen nutzt und dass die Tabellen in gepinnten Host-DRAM wandern und über UVA gelesen werden. Der Offload nimmt 23,6 GiB je GPU von der Karte und lässt laut Rezept 81,2 GiB residente Gewichte und 38,5 GiB KV je GPU, sodass vier H200 NVL an einer Vierfach-Brücke den Cache für 100 Gespräche mit 32K fassen. Das Rezept nennt für das H200-Layout keine Größe des Host-Speichers und enthält kein Profil für die RTX PRO 6000; acht dieser Karten fassen die Gewichte nach unserer Regel mit etwa 23,5 GiB Reserve je Karte.
DeepSeek-V4-Pro-0813 übersteigt mit 893 GB nach unserer Regel acht RTX PRO 6000, und acht H200 NVL fassen seine Gewichte nur, wenn die Experten in FP4 bleiben.
Wir bauen Server mit vier oder acht H200 NVL und ihren NVLink-Brücken und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie Ihren Rack-Standort und seine Stromversorgung im Formular unten.
vLLM-Einstellungen für DeepSeek über PCIe und NVLink
Das DeepSeek-V3.2-Rezept von vLLM, aktualisiert am 24. September 2026, beginnt mit --tensor-parallel-size 8 und rät dann davon ab, -tp=8 für DeepSeek-V3.2 mit FlashMLA-Sparse zu nutzen, mit dieser Begründung, in deutscher Übersetzung: „TP=8 ergibt nur 16 Heads (128/8) je Rank, wird aber auf 64 Heads aufgefüllt, was Overhead verursacht und die Leistung mindert.“ Es empfiehlt „TP=1~2 + DP/EP“, zwei auf Hopper, und nennt -dp 8 --enable-expert-parallel den empfohlenen Serving-Modus. Auf acht H200 NVL läuft der Expertenverkehr zwischen den beiden NVLink-Domänen über PCIe.
Für V4-Flash auf der RTX PRO 6000 setzt das Rezept --tensor-parallel-size 8 mit --enable-expert-parallel, --kv-cache-dtype fp8 und --block-size 256 und hält den Indexer-Cache in FP8, weil sm_120 den FP4-Indexer-Cache von SM100 und deep_gemm_mega_moe nicht nutzen kann. Spekulatives Decoding mit dem Draft-Modul von -0731 braucht auf dieser Karte ein Nightly-Image von vLLM. Experten-Parallelismus schickt Token an die Karten, die ihre Experten halten, auf der RTX PRO 6000 über PCIe; unser Artikel zu Tensor-, Pipeline- und Experten-Parallelismus über PCIe und NVLink behandelt die Verbindung und die Peer-to-Peer-Einstellungen.
MIT-Lizenz und Umgang mit Daten
Die DeepSeek-Checkpoints in diesem Artikel sind unter der MIT-Lizenz veröffentlicht, und jede Card hält fest, in deutscher Übersetzung: „Dieses Repository und die Modellgewichte sind unter der MIT-Lizenz lizenziert.“ Die Lizenz erlaubt Nutzung, Änderung und Weitergabe unter der Bedingung, dass der Urheberrechtsvermerk und der Erlaubnisvermerk in Kopien enthalten sind, und schließt jede Gewährleistung aus. Ein Modell, das aus heruntergeladenen Gewichten auf Ihren eigenen Servern läuft, sendet keine Prompts oder Ausgaben an DeepSeek. Ob für Ihre Nutzung weitere Bedingungen gelten, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.
Unser Artikel zum privaten ChatGPT-Server nach Unternehmensgröße setzt diese Konfigurationen in Beziehung zur Mitarbeiterzahl.
Was wir liefern
Wir liefern die DGX Spark Founders Edition, die RTX PRO 6000 als Workstation, Max-Q und Server Edition sowie die H200 NVL mit ihren Zweifach- und Vierfach-NVLink-Brücken. Sie kommen als Karten für einen Server, den Sie bereits betreiben, oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Konfiguration und Angebot erhalten Sie innerhalb eines Werktages, und unser Sortiment professioneller GPUs führt jede Karte. DeepSeek mit vLLM auf diesen Servern bereitzustellen ist Teil unserer Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Welche Hardware-Anforderungen hat DeepSeek?
Wie viel VRAM braucht DeepSeek-V4-Flash?
Wie viel VRAM braucht DeepSeek 671B?
Kann man DeepSeek lokal auf einem DGX Spark betreiben?
Läuft DeepSeek-V4-Flash auf der H200 NVL?
Darf man DeepSeek On-Premise kommerziell nutzen?
Schicken Sie uns die DeepSeek-Variante, die Kontextlänge, die Sie festlegen werden, und die Zahl der gleichzeitig laufenden Gespräche in der Spitze. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages