Nemotron-Hardware-Anforderungen: Nemotron 3 Nano, Super und Ultra On-Premise, mit NIM
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Nach unserer Speicherschätzung läuft Nemotron 3 Super (120B, 12B aktiv) für einen Nutzer in seinem NVFP4-Checkpoint mit 80,3 GB auf einer RTX PRO 6000 oder einem DGX Spark (128 GB) und in seiner FP8-Version mit 128,4 GB auf einer H200 NVL oder zwei RTX PRO 6000
- Nur 8 der 88 Layer von Super sind Attention-Layer, deshalb kostet ein Gespräch mit 32K etwa 0,28 GiB FP8-Cache und Mamba-Zustand, und eine RTX PRO 6000 fasst neben den NVFP4-Gewichten 29 solche Gespräche
- Nemotron 3 Nano 30B-A3B (32,7 GB in FP8), Nemotron 3.5 Lightning (21,6 GB in NVFP4) und Nano 4B passen auf eine Karte oder einen Spark, mit Platz für 100 Gespräche mit 32K
- Nemotron 3 Ultra (550B, 55B aktiv) erscheint in NVFP4 mit 352,3 GB, ohne FP8-Checkpoint auf Hugging Face, und braucht nach unserer Schätzung vier H200 NVL oder acht RTX PRO 6000
- NVIDIAs NIM-Support-Matrix vom 6. Oktober 2026 führt die H200 NVL und die RTX PRO 6000 Server Edition als verifizierte GPUs für Nano und Super, nicht aber für Ultra; Nano, Super und Nano 4B stehen unter der NVIDIA Nemotron Open Model License, Ultra und 3.5 Lightning unter OpenMDW-1.1
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Nemotron-Hardware-Anforderungen im Überblick
Nemotron 3 Super, NVIDIAs offenes Modell mit 120B Parametern vom März 2026, davon 12B aktiv, läuft für einen Nutzer in seinem NVFP4-Checkpoint mit 80,3 GB auf einer RTX PRO 6000 oder einem DGX Spark und in seiner FP8-Version mit 128,4 GB auf einer H200 NVL oder zwei RTX PRO 6000. Nemotron 3 Nano 30B-A3B, Nemotron 3.5 Lightning und Nano 4B passen auf eine Karte oder einen Spark, mit Platz für 100 Gespräche. Nemotron 3 Ultra mit 550B Parametern erscheint als NVFP4-Checkpoint mit 352,3 GB und braucht vier H200 NVL oder acht RTX PRO 6000.
Das sind unsere Speicherschätzungen für Gespräche mit 32.768 Token, auf Grundlage der Hugging-Face-Dateien von NVIDIA, abgerufen am 9. Oktober 2026. Die meisten Layer von Nemotron 3 halten keinen KV-Cache, deshalb entscheiden meist die Gewichte über die Zahl der GPUs. Unser Überblick über LLM-Hardware-Anforderungen je Modell wendet dieselbe Methode auf andere Modellfamilien an.
Nemotron-Modelle auf Hugging Face im Oktober 2026
| MODELL | PARAMETER | CHECKPOINTS | KONTEXT | LIZENZ |
|---|---|---|---|---|
| Nemotron 3 Nano 4B | 3,97B, keine Experten | BF16 7,9 GB; FP8 5,3 GB | 262K | Nemotron Open Model |
| Nemotron 3 Nano 30B-A3B | 30B, 3,5B aktiv | BF16 63,2 GB; FP8 32,7 GB; NVFP4 19,3 GB | 1M | Nemotron Open Model |
| Nemotron 3.5 Lightning | 30B, 3B aktiv | BF16 65,8 GB; NVFP4 21,6 GB | 1M | OpenMDW-1.1 |
| Nemotron 3 Super | 120B, 12B aktiv | BF16 247,2 GB; FP8 128,4 GB; NVFP4 80,3 GB | 1M | Nemotron Open Model |
| Nemotron 3 Ultra | 550B, 55B aktiv | NVFP4 352,3 GB; BF16 | 1M | OpenMDW-1.1 |
| Llama 3.3 Nemotron Super 49B | 50B, dicht | FP8 52,0 GB; NVFP4 31,1 GB | 128K | NVIDIA Open Model, Llama 3.3 |
Model Cards, Dateilisten und config.json-Dateien auf huggingface.co/nvidia, abgerufen am 9. Oktober 2026; die Größen sind die Summen der safetensors-Dateien. Veröffentlichungsdaten laut den Cards: Nano 30B-A3B 15. Dezember 2025, Super 11. März 2026, Nano 4B 16. März 2026, Ultra 4. Juni 2026, 3.5 Lightning 11. August 2026, Super 49B v1.5 25. Juli 2025.
Nemotron 3 Nano, Super und Ultra wechseln Mamba-2-Layer mit Mixture-of-Experts-Layern (MoE) ab und ergänzen einige Attention-Layer. Die config.json von Super führt 88 Layer: 40 Mamba-2, 40 MoE und 8 Attention, mit 512 Experten, von denen 22 je Token aktiv sind. Seine Card nennt den Aufbau „LatentMoE“ und ergänzt einen Multi-Token-Prediction-Layer (MTP). Ultra hat 106 Layer, 12 davon mit Attention, und Nano 30B-A3B und 3.5 Lightning haben 52 Layer, 6 davon mit Attention, mit 6 von 128 aktiven Experten. Nano 4B hat 42 Layer, vier davon mit Attention, und keine Experten.
Llama-3.
Die RTX PRO 6000 und der DGX Spark rechnen FP4 direkt, die H200 NVL rechnet FP8, aber nicht FP4. Auf NVIDIAs Hugging-Face-Seiten haben wir keinen FP8-Checkpoint von Ultra gefunden, und seine NIM-Dokumentation hält im englischen Original fest, hier übersetzt, dass FP8-Profile nicht veröffentlicht wurden, „weil NVFP4-Profile auf allen getesteten GPUs der Hopper-Architektur funktionieren (zum Beispiel H100 und H200)“.
KV-Cache und Mamba-Zustand je Nemotron-Gespräch
Nur Attention-Layer halten einen KV-Cache, der mit dem Kontext wächst: je Token Attention-Layer × KV-Heads × Head-Dimension × 2 (Key und Value) × Bytes. Bei Super sind das in FP8 8 × 2 × 128 × 2 × 1 Byte, also 4 KiB je Token, gegenüber 160 KiB bei Llama 3.3 70B mit FP8-Cache. Jeder Mamba-2-Layer hält stattdessen je Gespräch einen festen Zustand: Heads × Head-Dimension × Zustandsgröße, bei Super 128 × 64 × 128 Werte oder 4 MiB in float32, wie es das vLLM-Rezept mit --mamba-ssm-cache-dtype float32 setzt, dazu ein kleiner Puffer für die Faltung (Convolution). Die allgemeine Methode beschreibt unser Leitfaden dazu, wie viel VRAM ein LLM braucht.
| MODELL | ATTENTION-LAYER | KV JE TOKEN | MAMBA-ZUSTAND | 32K; 1M |
|---|---|---|---|---|
| Nano 4B | 4 von 42, 8 KV-Heads | 8 KiB | 80 MiB | 0,33 GiB; 2,1 GiB bei 262K |
| Nano 30B-A3B, 3.5 Lightning | 6 von 52, 2 KV-Heads | 3 KiB | 47 MiB | 0,14 GiB; 3,0 GiB |
| Nemotron 3 Super | 8 von 88, 2 KV-Heads | 4 KiB | 162 MiB | 0,28 GiB; 4,2 GiB |
| Nemotron 3 Ultra | 12 von 106, 2 KV-Heads | 6 KiB | 193 MiB | 0,38 GiB; 6,2 GiB |
| Super 49B v1.5 | 49 von 80, 8 KV-Heads | 196 KiB, 16 Bit | keiner | 6,1 GiB; maximal 128K |
Unsere Rechnung aus den config.json-Dateien, abgerufen am 9. Oktober 2026. KV-Cache in FP8, wie ihn NVIDIAs vLLM-Befehle mit --kv-cache-dtype fp8 setzen; Mamba-Zustand in float32 als Obergrenze, der von Ultra in float16, wie seine Card ihn setzt. Super 49B in 16 Bit, der Voreinstellung von vLLM, da der Befehl in seiner Card keinen Cache-Typ setzt.
Unser Budget folgt dem VRAM-Leitfaden: 90 Prozent des vom Treiber gemeldeten Speichers, abzüglich 3 GiB je Karte, das lässt 83,0 GiB je RTX PRO 6000 und 123,4 GiB je H200 NVL. Für einen DGX Spark (128 GB) setzen wir 102 GB an. Bei Tensor-Parallelismus rechnen wir den ganzen Cache und Zustand eines Nemotron-3-Modells auf jeder Karte, eine Obergrenze. Der Cache von Super 49B teilt sich nach seinen acht KV-Heads auf 2, 4 oder 8 Karten auf, denn, wie der vLLM-Blog vom 7. August 2026 festhält, hier übersetzt: „TP teilt den KV-Cache zuerst nach diesen Heads auf“.
GPUs für 1, 20 und 100 Nutzer je Nemotron-Modell
| MODELL, FORMAT | EIN DGX SPARK | RTX PRO 6000 | H200 NVL |
|---|---|---|---|
| Nemotron 3 Nano 4B, BF16 | ja / ja / ja | 1 / 1 / 1 | 1 / 1 / 1 |
| Nemotron 3 Nano 30B, FP8 | ja / ja / ja | 1 / 1 / 1 | 1 / 1 / 1 |
| 3.5 Lightning, NVFP4 | ja / ja / ja | 1 / 1 / 1 | 1 / 1 / 1, W4A16 |
| Nemotron 3 Super, NVFP4 | ja / ja / nein | 1 / 1 / 2 | siehe FP8 |
| Nemotron 3 Super, FP8 | nein / nein / nein | 2 / 2 / 4 | 1 / 2 / 2 |
| Nemotron 3 Super, BF16 | nein / nein / nein | 4 / 4 / 8 | 2 / 2 / 4 |
| Nemotron 3 Ultra, NVFP4 | nein / nein / nein | 8 / 8 / 8 | 4 / 4 / 4, Weight-only |
| Super 49B v1.5, FP8 | ja / nein / nein | 1 / 4 / 8 | 1 / 2 / 8 |
Unsere Schätzungen, keine Messungen: Karten für 1, 20 und 100 gleichzeitige Gespräche mit je 32.768 Token, in Konfigurationen mit 1, 2, 4 oder 8 Karten mit Tensor-Parallelismus, Cache wie in der Tabelle oben. Beim DGX Spark zeigt die Tabelle nur, ob der Speicher reicht. W4A16 ist das NIM-Profil mit 4-Bit-Gewichten für 3.5 Lightning, geführt für Ampere oder neuer.
Nano 30B-A3B in FP8 lässt auf einer RTX PRO 6000 Platz für 377 Gespräche, die Karte wird also nach Geschwindigkeit gewählt, nicht nach Speicher. Super 49B v1.5 verhält sich wie ein dichter Transformer: Bei 6,1 GiB je Gespräch mit 32K fasst eine RTX PRO 6000 neben den FP8-Gewichten fünf, 20 Nutzer brauchen also vier Karten oder zwei H200 NVL, und acht Karten fassen 100 ohne Reserve. Ein FP8-Cache, gesetzt mit --kv-cache-dtype fp8, halbiert den Cache je Gespräch.
Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Schicken Sie uns die Nemotron-Variante, ihr Format, Ihre Kontextlänge und die Spitzenzahl der Anfragen über das Formular unten.
Nemotron 3 Super auf RTX PRO 6000, DGX Spark oder H200 NVL
Das vLLM-Rezept für Nemotron 3 Super, aktualisiert am 8. Oktober 2026, hält fest, hier übersetzt: „Die NVFP4-Variante läuft auf einer einzigen RTX Pro 6000 mit TP=1.“ Es setzt vLLM 0.24.0 oder neuer voraus. Sein Befehl setzt --gpu-memory-utilization 0.92, laut Rezept „um einen OOM beim Start zu vermeiden“, zusammen mit --kv-cache-dtype fp8, --mamba-ssm-cache-dtype float32, --max-num-seqs 8 und spekulativem Decoding per MTP mit drei Token. Nach unserer Regel bleiben neben den 74,8 GiB Gewichten 8,2 GiB, Platz für 29 Gespräche mit 32K; für 20 Nutzer muss --max-num-seqs über 8 angehoben werden. Wir rechnen einen Mamba-Zustand je Gespräch, auch wenn das Prefix Caching des Rezepts mehr davon halten kann.
NVIDIAs NVFP4-Card nennt „1× B200 OR 1× DGX Spark“ als Mindestanforderung an die GPU, und ihr Befehl für den Spark setzt --max-model-len 1000000 mit --max-num-seqs 4. Nach unserer Schätzung fasst ein Spark vier Gespräche mit 1M Token zu je 4,2 GiB. Seine Speicherbandbreite beträgt 273 GB/s, gegenüber 1.597 GB/s bei der RTX PRO 6000 Server Edition, deshalb begrenzt die Geschwindigkeit ein Team früher als der Speicher.
Die Card des FP8-Checkpoints nennt „2× H100-80GB“ als Mindestanforderung an die GPU. Eine H200 NVL fasst die 119,5 GiB FP8-Gewichte mit 3,8 GiB Reserve, Platz für 13 Gespräche mit 32K, 20 Nutzer brauchen also eine zweite Karte, verbunden über eine NVLink-Brücke.
Die RTX PRO 6000 hat kein NVLink, deshalb teilt der FP8-Checkpoint auf zwei Karten jeden Layer über PCIe auf, wie unser Leitfaden zu einem Modell auf mehreren GPUs erklärt. Der NVFP4-Checkpoint braucht keine Aufteilung, und vier Kopien auf vier Karten fassen 116 Gespräche, während zwei Karten mit Tensor-Parallelismus nach unserer Schätzung 160 fassen.
Nemotron 3 Ultra auf vier H200 NVL oder acht RTX PRO 6000
Die Card von Ultra führt „4xGB200, 4xB200, 4x GB300, 4x B300, 8xH100“ als Mindestanforderung an die GPU. Ihr vLLM-Befehl für vier B200 ergänzt --tensor-parallel-size 4 um Experten-Parallelismus und setzt --mamba-ssm-cache-dtype float16.
Nach unserer Schätzung fassen vier H200 NVL die 328,1 GiB NVFP4-Gewichte mit 41,3 GiB Reserve je Karte, Platz für 109 Gespräche mit 32K. Eine Vierfach-NVLink-Brücke verbindet sie zu einer Domäne, wie unser Leitfaden dazu, wie viele H200 NVL große Modelle brauchen beschreibt, und die Hopper-Karte führt die 4-Bit-Gewichte Weight-only aus. Vier RTX PRO 6000 fassen die Gewichte, lassen aber je Karte nur 1,0 GiB für den Cache, keine brauchbare Konfiguration, nicht einmal für einen Nutzer. Acht sind das Minimum und lassen je Karte 42,0 GiB für 111 Gespräche, über PCIe aufgeteilt. Der NIM-Eintrag von Ultra führt keine der beiden Karten unter seinen verifizierten GPUs, und seine Card nennt acht H100 (640 GB) als Hopper-Minimum, gegenüber 564 GB auf vier H200 NVL; diese Aufteilung beruht also allein auf unserer Speicherschätzung.
Wir bauen Server mit vier oder acht H200 NVL und ihren NVLink-Brücken und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie das Nemotron-Modell, Ihren Rack-Standort und seine Stromversorgung im Formular unten.
Nemotron NIM: Support-Matrix und NVIDIA AI Enterprise
Die aktuelle Support-Matrix von NIM for LLMs, zuletzt aktualisiert am 6. Oktober 2026 und ohne Release-Nummer, führt NIMs für Nemotron 3 Nano, Super, Ultra, 3.5 Lightning und Super 49B v1.5. Super hat BF16-, FP8- und NVFP4-Profile mit Tensor-Parallelismus von 1, 2, 4 oder 8, und laut der Matrix, hier übersetzt, „unterstützen einige verifizierte GPUs nur TP4- oder TP8-Profile“. Zu den verifizierten GPUs für Nano und Super 49B gehören die H200 NVL, die RTX PRO 6000 Blackwell Server Edition und der GB10, der Chip im DGX Spark; die Liste von Super enthält die ersten beiden, nicht aber den GB10. Für 3.5 Lightning nennt sie mindestens 30 GB je GPU für NVFP4 bei TP1 und 66 GB für BF16, ohne „zusätzliche Reserve für große KV-Caches“.
Die Card von Super hält fest, hier übersetzt: „Der NIM-Container unterliegt dem NVIDIA Software License Agreement“, und der produktive Einsatz von NIM braucht eine NVIDIA-AI-Enterprise-Lizenz je GPU, wie unser Leitfaden zur Lizenzierung von NVIDIA AI Enterprise erklärt. NVIDIA gibt an, dass die „H200 NVL mit einem fünfjährigen Abonnement von NVIDIA AI Enterprise geliefert wird“, aktiviert über die Seriennummer, während die RTX PRO 6000 Server Edition keines enthält und DGX Spark ein eigenes AI-Enterprise-Produkt hat. Ohne NIM bedient vLLM, das unter Apache 2.0 steht, dieselben Checkpoints.
Nemotron-Lizenzen: Nemotron Open Model License und OpenMDW
Nano 4B, Nano 30B-A3B und Super sind unter der NVIDIA Nemotron Open Model License veröffentlicht, zuletzt geändert am 15. Dezember 2025, die festhält, hier übersetzt: „Werke sind kommerziell nutzbar.“ Die Lizenz endet für ein Werk, wenn Sie einen Patent- oder Urheberrechtsstreit mit der Behauptung beginnen, dass es Rechte verletzt. Ultra und 3.5 Lightning stehen unter dem OpenMDW License Agreement, Version 1.1, das bei der Weitergabe eine Kopie der Vereinbarung und die Urheberrechtshinweise verlangt und bei einem solchen Rechtsstreit ebenfalls endet, außer er antwortet auf eine zuerst gegen Sie erhobene Klage. Die Card von Ultra hält fest, hier übersetzt: „Dieses Modell ist für die kommerzielle und nicht kommerzielle Nutzung bereit.“ Super 49B v1.5 nennt die NVIDIA Open Model License und das Llama 3.3 Community License Agreement, und seine Card trägt den Hinweis „Built with Llama“. Ob eine Klausel Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.
Was wir liefern
Wir liefern die DGX Spark Founders Edition, die RTX PRO 6000 als Workstation, Max-Q und Server Edition sowie die H200 NVL mit ihren NVLink-Brücken, als Karten oder in nach Auftrag gebauten KI-Servern. NVIDIA-AI-Enterprise-Lizenzen für NIM, die auf unserer Seite zu Software und Lizenzen stehen, kommen unter einem EU-Vertrag und auf einer Rechnung mit der Hardware und ihrer Herstellergarantie. Die Modelle, RAG und MLOps darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Welche Hardware-Anforderungen hat Nemotron 3 Super?
Wie viel VRAM braucht NVIDIA Nemotron?
Kann ich Nemotron lokal auf einem DGX Spark betreiben?
Welche GPUs unterstützt Nemotron NIM?
Welche GPU braucht Llama Nemotron Super 49B?
Wie viel VRAM braucht Nemotron Nano?
Schicken Sie uns das Nemotron-Modell und das Format, die Kontextlänge, die Sie konfigurieren werden, Ihre Spitzenzahl gleichzeitiger Anfragen und ob Sie NIM oder vLLM einsetzen wollen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages