H200 NVL MIG-Profile: die sieben Instanzgrößen, gültige Kombinationen und MIG-gestützte vGPU
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- NVIDIAs MIG-Leitfaden (11. September 2026) führt die H200 NVL mit bis zu sieben MIG-Instanzen und sieben H200-Profilen: 1g.18gb bis zu 7-mal, 1g.18gb+me einmal, 1g.35gb bis zu 4-mal, 2g.35gb bis zu 3-mal, 3g.71gb bis zu 2-mal, 4g.71gb und 7g.141gb je einmal
- Die Karte hat acht Speicher-Slices und sieben SM-Slices: 1g.18gb belegt 1/8 des Speichers und 1/7 der SMs, 1g.35gb belegt 1/4 des Speichers bei 1/7 der SMs, und 3g.71gb wie 4g.71gb belegen jeweils die Hälfte des Speichers
- NVIDIAs H200-Seite gibt für die H200 NVL „Up to 7 MIGs @16.5GB each“ an, und die statische Konfiguration des MIG Manager im GPU-Operator-Repository von NVIDIA führt 2 × 1g.18gb, 1 × 2g.35gb und 1 × 3g.71gb als ausgewogenes Layout für die H200 NVL
- NVIDIA AI Enterprise 8.2 führt sieben MIG-gestützte vGPU-Typen für die H200 NVL, von H200-1-18C (bis zu 7 je GPU) bis H200-7-141C, alles Compute-Typen (C-Serie), die eine Lizenz für NVIDIA AI Enterprise voraussetzen
- MIG auf der H200 NVL ist nur für Compute gedacht, denn NVIDIAs Leitfaden nennt Grafik-APIs in MIG nur für die RTX PRO 6000 Blackwell, und NCCL läuft nicht in MIG-Instanzen, sodass Multi-GPU-Jobs ganze Karten belegen
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
H200 NVL MIG-Profile im Überblick
Die H200 NVL lässt sich in bis zu sieben MIG-Instanzen aufteilen. NVIDIAs MIG-Leitfaden, zuletzt aktualisiert am 11. September 2026, führt die H200 NVL unter den unterstützten GPUs mit Compute Capability 9.0, 141 GB und höchstens sieben Instanzen. Seine Tabelle der H200-MIG-Profile für das „H200 141GB product“ nennt sieben Profile für GPU-Instanzen, von 1g.18gb, bis zu siebenmal verfügbar, bis 7g.141gb, das die ganze Karte belegt. Die Tabelle unterscheidet nicht zwischen der NVL und dem SXM-Board, während NVIDIAs vGPU-Referenz dieselben sieben Profile namentlich für die H200 NVL aufführt.
| PROFIL | SPEICHER, SM-ANTEIL | ENGINES | MAX. ANZAHL | MIG-GESTÜTZTE VGPU |
|---|---|---|---|---|
| MIG 1g.18gb | 1/8 Speicher und L2, 1/7 SMs | 1 NVDEC, 1 JPEG, 1 Copy-Engine | 7 | H200-1-18C |
| MIG 1g.18gb+me | 1/8 Speicher und L2, 1/7 SMs | 1 NVDEC, 1 JPEG, 1 OFA, 1 Copy-Engine | 1 | H200-1-18CME |
| MIG 1g.35gb | 1/4 Speicher, 1/8 L2, 1/7 SMs | 1 NVDEC, 1 JPEG, 1 Copy-Engine | 4 | H200-1-35C |
| MIG 2g.35gb | 2/8 Speicher und L2, 2/7 SMs | 2 NVDEC, 2 JPEG, 2 Copy-Engines | 3 | H200-2-35C |
| MIG 3g.71gb | 4/8 Speicher und L2, 3/7 SMs | 3 NVDEC, 3 JPEG, 3 Copy-Engines | 2 | H200-3-71C |
| MIG 4g.71gb | 4/8 Speicher und L2, 4/7 SMs | 4 NVDEC, 4 JPEG, 4 Copy-Engines | 1 | H200-4-71C |
| MIG 7g.141gb | gesamter Speicher und L2, 7/7 SMs | 7 NVDEC, 7 JPEG, 1 OFA, 8 Copy-Engines | 1 | H200-7-141C |
NVIDIAs MIG-Leitfaden, „Supported MIG Profiles“, Tabelle 11 „GPU Instance Profiles on H200“ und „Supported GPUs“, aktualisiert am 11. September 2026; vGPU-Typen aus NVIDIA AI Enterprise 8.2, „Hopper H200 vGPU Types“, Tabelle 93, aktualisiert am 2. September 2026.
Die GB-Angaben im Profilnamen sind Nennwerte. NVIDIAs Produktseite zur H200 gibt für die H200 NVL „Up to 7 MIGs @16.5GB each“ an und für die H200 SXM „Up to 7 MIGs @18GB each“; planen Sie eine 1g.18gb-Instanz auf der NVL deshalb mit 16,5 GB und lesen Sie den genauen Wert mit nvidia-smi mig -lgip auf der Karte aus.
Wie sich die Slices zusammensetzen: Speicher, SMs und Engines
NVIDIAs Leitfaden baut jede Instanz aus GPU-Slices auf, die jeweils einen Speicher-Slice, „den kleinsten Anteil am Speicher der GPU, einschließlich der zugehörigen Speichercontroller und des Caches“, mit einem SM-Slice kombinieren. Die H200 hat acht Speicher-Slices und sieben SM-Slices; deshalb laufen die Anteile in der Tabelle in Achteln und Siebteln. Eine 1g.18gb-Instanz enthält von beidem einen. Das Profil 1g.35gb kombiniert zwei Speicher-Slices mit einem einzigen SM-Slice und hat damit so viel Speicher wie ein 2g.35gb, aber nur die Hälfte von dessen Rechenleistung. Die Profile 3g.71gb und 4g.71gb belegen beide die Hälfte des Speichers und unterscheiden sich nur in SMs und Engines.
Decoder und Copy-Engines wachsen mit dem SM-Anteil, und die ganze Karte hat acht Copy-Engines. Jede Instanz hat eigene Videodecoder (NVDEC), JPEG-Decoder und Copy-Engines; die H200-Tabelle führt keine Videoencoder (NVENC). Der Optical Flow Accelerator (OFA) erscheint nur in 1g.18gb+me und im vollen 7g.141gb, und der Leitfaden vermerkt, dass ein einziges 1g-Profil die Media-Erweiterungen enthalten kann; deshalb ist die Anzahl eins. Der Leitfaden definiert außerdem die Varianten -me und +me.all sowie die Grafikvariante +gfx, die er als „neu in GB20X“ kennzeichnet, den Chips der RTX-PRO-Blackwell-Karten. Keine der drei steht in der H200-Tabelle.
Jede Instanz hat eigene Speichercontroller, eigenen Cache und eigene SMs; die Isolation liegt also in der Hardware, und der Job eines Teams kann einem anderen weder Speicher noch Bandbreite wegnehmen. NVIDIAs Leitfaden setzt drei Grenzen, die für die H200 zählen: „NCCL wird derzeit mit MIG nicht unterstützt“, „CUDA IPC über GPU-Instanzen hinweg wird nicht unterstützt“ und „Es werden keine Grafik-APIs unterstützt“, mit einer Ausnahme nur für die RTX PRO 6000 Blackwell.
Welche H200-MIG-Profile sich kombinieren lassen
Ein Layout ist gültig, wenn seine Instanzen ohne Überlappung in die acht Speicher-Slices und sieben SM-Slices passen. NVIDIAs Seite zu den Konzepten beschreibt in ihrem Platzierungsdiagramm, gültige Kombinationen so zu bilden, „dass sich keine zwei Profile vertikal überlappen“. Sie vermerkt außerdem, dass Treiber vor R510 eine Instanz mit (4 Speicher, 4 Compute) neben einer Instanz mit (4 Speicher, 3 Compute) nicht zuließen und dass „diese Einschränkung bei neueren Treibern nicht mehr gilt“; 4g.71gb plus 3g.71gb ist also eine gültige Aufteilung einer H200 NVL.
Die einheitlichen Layouts folgen aus den Höchstzahlen der Tabelle: sieben 1g.18gb, vier 1g.35gb, drei 2g.35gb, zwei 3g.71gb oder eine volle Instanz. Für gemischte Layouts definiert die statische ConfigMap des MIG Manager im GPU-Operator-Repository von NVIDIA, gelesen am 10. Oktober 2026, das Layout „all-balanced“ für die H200 141GB und die H200 NVL als zwei 1g.18gb, ein 2g.35gb und ein 3g.71gb. Das Platzierungsbeispiel des Leitfadens auf einer älteren Karte zeigt, dass eine 3g-Instanz nur bei Slice 0 oder 4 beginnt und kleinere Instanzen auffüllen, was die größeren übrig lassen; legen Sie die großen Instanzen deshalb zuerst an. Bevor Sie ein gemischtes Layout festlegen, lassen Sie sich anzeigen, was die Karte akzeptiert.
- Aktivieren Sie MIG mit
nvidia-smi -i <GPU> -mig 1; laut NVIDIAs Leitfaden braucht das auf Hopper keinen GPU-Reset. - Listen Sie die Profile mit
nvidia-smi mig -lgipund die möglichen Platzierungen mitnvidia-smi mig -lgippauf. - Legen Sie die Instanzen mit
nvidia-smi mig -cgian, gefolgt von einer kommagetrennten Liste von Profilnamen und-Cfür die Compute-Instanzen, zum Beispielnvidia-smi mig -cgi 3g.71gb,2g.35gb -C. - Prüfen Sie das Ergebnis mit
nvidia-smi -L, das jedes MIG-Gerät mit seiner UUID auflistet.
Unser MIG-Runbook für RTX-PRO-Blackwell-Karten beschreibt diese Befehle im Detail; die H200 NVL überspringt dessen Schritte zu vBIOS und Anzeigemodus. Der MIG-Modus auf Hopper „ist nur so lange persistent, wie der Treiber resident ist“; das Layout muss also nach jedem Neustart neu angelegt werden.
Was jedes H200-MIG-Profil trägt
Die Wahl des Profils beginnt bei den Gewichten des Modells plus Platz für seinen KV-Cache und danach bei der Rechenleistung, die der Workload braucht. Die Checkpoint-Größen unten sind die Dateien auf Hugging Face; der Cache für jedes Gespräch kommt hinzu.
| WORKLOAD | BEISPIEL, GEWICHTE | PROFIL |
|---|---|---|
| Notebooks, kleine Versuche | Modelle bis zu einigen GB | 1g.18gb |
| RAG-Embedding und Reranker | Qwen3-Embedding-0. | 1g.18gb |
| Größeres Embedding-Modell | Qwen3-Embedding-8B, etwa 16 GB in BF16 | 1g.35gb oder 2g.35gb |
| Team-Assistent, 14B-Modell | Qwen3-14B FP8, 16,3 GB | 2g.35gb |
| Abteilungsassistent | Qwen3-32B FP8, 34,3 GB | 3g.71gb oder 4g.71gb |
| 70B-Modell in FP8 | Llama 3.3 70B FP8, 72,7 GB | 7g.141gb oder ganze Karte |
| Video mit Optical Flow | OFA-Pipelines, ein NVDEC genügt | 1g.18gb+me |
| Multi-GPU-Fine-Tuning | NCCL über Karten hinweg | ganze Karten, MIG aus |
Checkpoint-Größen von Hugging Face (Qwen/Qwen3-14B-FP8, Qwen/Qwen3-32B-FP8, nvidia/Llama-3.3-70B-Instruct-FP8, Summe der safetensors-Dateien, gelesen am 10. Oktober 2026); Embedding-Gewichte mit zwei Byte je Parameter; die Profile sind unsere Lesart von NVIDIAs Profiltabelle.
Eine 1g.18gb-Instanz mit 16,5 GB fasst ein kleines Modell oder ein Retrieval-Paar mit Platz für Batches, während der Checkpoint von Qwen3-14B mit 16,3 GB ihr kaum Cache ließe. In einer 35-GB-Instanz hat dasselbe Modell neben seinen Gewichten etwa 18 GB Nennspeicher, abzüglich des Eigenbedarfs der Serving-Engine, und ein Gespräch mit 8K belegt in einem FP8-Cache 0,625 GiB, aus seinen 40 Layern und 8 KV-Heads mit je 128 Dimensionen. Wählen Sie 2g.35gb, wenn der Endpunkt viele Nutzer gleichzeitig bedient, und 1g.35gb, wenn Speicher wichtiger ist als Tempo. Qwen3-32B braucht in FP8 34,3 GB für seine Gewichte und 1 GiB je 8K-Gespräch in FP8 und gehört deshalb in eine Instanz mit der halben Karte. Llama 3.3 70B in FP8 passt mit 72,7 GB nicht in 71 GB und belegt die ganze Karte. Unser Leitfaden zur Auslegung von Embedding- und Reranker-Servern erklärt die Retrieval-Modelle.
Wir liefern die H200 NVL als Karten und in auf Bestellung gebauten KI-Servern. Schreiben Sie uns, welche Modelle in welchen Instanzen laufen sollen, mit den Nutzern je Modell, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.
MIG mit Kubernetes und Slurm auf der H200 NVL
In Kubernetes wendet der MIG Manager des GPU Operator ein benanntes Layout aus dem Node-Label nvidia.com/mig.config an, zum Beispiel all-1g.18gb oder all-balanced. NVIDIAs Dokumentation zum Operator, aktualisiert am 23. September 2026, stellt fest: „MIG Manager setzt voraus, dass auf den zu konfigurierenden GPUs keine Benutzer-Workloads laufen“; planen Sie Layoutwechsel deshalb als Wartung ein. Seit Operator v26.3.0 erzeugt der MIG Manager die Layouts jedes Nodes beim Start aus den MIG-Profilen, die seine Karten melden, eines je Profil plus all-balanced; ein Node mit H200 NVL erhält seine Layouts also aus seiner eigenen Profiltabelle. Auf älteren Treibern, die die Profile nicht melden können, nutzt der Operator stattdessen eine statische ConfigMap, und eine eigene ConfigMap mit dem Schlüssel config.yaml setzt jedes Layout, das in der erzeugten Liste fehlt.
Ein Layout mit mehr als einem Profil oder ein Node, auf dem einige Karten ganz bleiben, braucht die Strategie mixed des Device-Plugins, unter der die kleinste Instanz als nvidia.com/mig-1g.18gb erscheint. Unser Leitfaden zum GPU-Sharing in Kubernetes erklärt die Strategien single und mixed. Slurm erwartet, dass die Instanzen vor seinem Start existieren; das behandelt unser Leitfaden zu GPU-Servern für Forschungslabore.
MIG-gestützte vGPU auf der H200 NVL
Stand Oktober 2026 führt NVIDIAs vGPU-Dokumentation MIG-gestützte vGPU für die H200 NVL auf. Die Seite „Hopper H200 vGPU Types“ von NVIDIA AI Enterprise 8.2, aktualisiert am 2. September 2026, nennt sieben MIG-gestützte Typen für die „NVIDIA H200 PCIe 141 GB (H200 NVL)“, einen je Profil für GPU-Instanzen, wie in der ersten Tabelle. H200-1-18C läuft bis zu siebenmal je GPU, und H200-7-141C gibt einer VM die ganze Karte. Eine Fußnote stellt fest, dass H200-1-35C und H200-1-18CME „auf ESXi ab vSphere 8.0 Update 3 unterstützt werden“. Die Typen des SXM-Boards tragen stattdessen das Präfix H200X.
Alle sind Typen für vGPU for Compute, und die Seite nennt „Required license edition: NVIDIA AI Enterprise“. Jede H200 NVL enthält ein Fünf-Jahres-Abonnement für NVIDIA AI Enterprise, das über die Seriennummer aktiviert wird. Dieselbe Seite führt für die H200 NVL Time-Sliced-Typen von H200-4C, bis zu 32 je GPU, bis H200-141C. Die Tabelle der H200 NVL nennt eine vGPU je GPU-Instanz, und Time-Sliced-vGPU-Typen innerhalb von MIG-Instanzen haben wir für diese Karte nicht aufgeführt gefunden. Unser Vergleich von MIG und vGPU je Karte behandelt die Hypervisoren und Lizenzen.
H200 NVL MIG vs. RTX PRO 6000 MIG
Die RTX PRO 6000 Blackwell teilt sich in höchstens vier Instanzen, 1g.24gb bis zu viermal, 2g.48gb zweimal oder 4g.96gb einmal, jeweils auch als +gfx-Variante für Grafik-APIs. Auf der Server Edition können MIG-Instanzen Grafik-vGPUs für virtuelle Workstations aufnehmen. Die H200 NVL teilt sich in sieben kleinere Instanzen nur für Compute, mit 141 GB HBM3e bei 4,8 TB/s und NVLink-Bridges für ganze Karten. Für CAD und Desktops in MIG-Instanzen wählen Sie die RTX PRO 6000 Server Edition; für viele isolierte Compute-Nutzer oder große Modelle auf ganzen Karten die H200 NVL. Für einen vorhandenen Bestand an H100 NVL führt unser Vergleich H200 NVL vs. H100 NVL die Profile der älteren Karte auf.
Rechenbeispiel: vier H200 NVL, zwei partitioniert für 20 Data Scientists
Als Beispiel teilt sich ein Team von 20 Data Scientists einen Server mit vier H200 NVL. Wir nehmen an, dass höchstens etwa zehn Notebooks gleichzeitig laufen und dass das Team außerdem einen gemeinsamen Modell-Endpunkt und Platz für Fine-Tuning braucht.
Karte 1 betreibt sieben 1g.18gb-Instanzen für Notebooks und kleine Experimente. Karte 2 betreibt das ausgewogene Layout aus NVIDIAs ConfigMap für den MIG Manager: zwei weitere 1g.18gb-Instanzen, ein 2g.35gb mit Qwen3-14B in FP8 als Assistent des Teams und ein 3g.71gb für größere Evaluierungsläufe. Das ergibt neun Notebook-Instanzen für die Spitze von etwa zehn, und ein Scheduler stellt den Rest in die Warteschlange. Die Karten 3 und 4 bleiben ganz, verbunden über eine 2-Wege-NVLink-Bridge mit 900 GB/s, für Fine-Tuning und jeden Job, der NCCL über Karten hinweg braucht.
Der Node braucht dann in Kubernetes die Strategie mixed, da er mehrere Profile und ganze Karten trägt. Für Slurm müssen die Instanzen beim Start neu angelegt werden, bevor es läuft. Wächst der Bedarf an Notebooks, kann Karte 2 in einem Wartungsfenster auf sieben 1g.18gb-Instanzen wechseln, insgesamt also vierzehn, wobei Assistent und Evaluierungsläufe auf Karte 3 oder 4 umziehen. Jede Karte enthält ihr Fünf-Jahres-Abonnement für AI Enterprise, für MIG-gestützte vGPU oder NIM. Diese Zahlen sind ein Beispiel, keine Auslegung für Ihr Team.
Wir bauen KI-Server mit vier H200 NVL auf Bestellung und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie Ihr Team, seine Modelle und seine Spitzenlast im Formular unten, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.
Was wir liefern
Wir liefern die NVIDIA H200 NVL mit ihren NVLink-Bridges und die RTX PRO 6000 Server Edition, als Karten oder in nach Auftrag gebauten KI-Servern, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente. Lizenzen für NVIDIA AI Enterprise und vGPU kommen auf denselben EU-Vertrag und dieselbe Rechnung, und das Fünf-Jahres-Abonnement, das jede H200 NVL enthält, ist Teil des Angebots. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch. Die vollständige Plattform darauf, mit Kubernetes, Modellen und RAG, ist unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Welche MIG-Profile unterstützt die H200 NVL?
Wie viel Speicher hat eine MIG-Instanz 1g.18gb auf der H200 NVL?
nvidia-smi mig -lgip zeigt den genauen Speicher auf der Karte.Was ist der Unterschied zwischen 1g.35gb und 2g.35gb auf der H200?
Welche H200-MIG-Profile lassen sich auf einer Karte kombinieren?
nvidia-smi mig -lgipp listet die Platzierungen auf, die die Karte akzeptiert.Unterstützt die H200 NVL vGPU mit MIG?
H200 MIG vs. RTX PRO 6000 MIG: Welche Karte passt besser zu meinen Workloads?
Schicken Sie uns die Workloads, die Sie in MIG-Instanzen betreiben wollen, die Modelle und ihre Präzision, die Zahl der Nutzer und ob sie auf Bare Metal, Kubernetes, Slurm oder vGPU laufen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für H200-NVL-Karten und den Server und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages