BLOG · GUIDE ·

NVIDIA-NIM-Anforderungen auf dem eigenen Server: GPUs, Treiber, Support-Matrix und Lizenz

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • NIM for LLMs 2.0.13 braucht einen NVIDIA-Treiber 580 oder neuer, Docker 24.0 oder neuer und das NVIDIA Container Toolkit 1.14.0 oder neuer auf Linux für AMD64 oder ARM64, empfohlen ist Ubuntu 22.04 LTS oder neuer (NVIDIAs Voraussetzungen, 6. Oktober 2026)
  • Die Support-Matrix vom 6. Oktober 2026 führt die H200 NVL, die RTX PRO 6000 Blackwell Server Edition und die L40S als verifizierte GPUs für die NIMs von Llama 3.1 8B und Llama 3.3 70B, gpt-oss sowie Nemotron 3 Nano und Super; die L4 steht in keiner dieser Listen
  • NIM wählt ein Profil (Genauigkeit und Tensor-Parallelismus) nach der GPU und ihrem Speicher; list-model-profiles zeigt, welche Profile auf Ihrem Host lauffähig sind, zu wenig Speicher haben oder inkompatibel sind
  • Modelle liegen im Cache unter /opt/nim/.cache, und ein abgeschotteter Host läuft aus einem Cache oder Model Store, der auf einem Rechner mit Internetverbindung vorbereitet wurde, ohne gesetzten NGC- oder Hugging-Face-Schlüssel
  • NIM Certified Production Branch erfordert ein NVIDIA-AI-Enterprise-Abonnement, lizenziert je GPU, und NVIDIAs NIM-FAQ verlangt eines für jeden produktiven Einsatz, während die Seite zu den Angebotsformen den Feature Branch kostenfrei führt; jede H200 NVL enthält fünf Jahre

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

NVIDIA-NIM-Anforderungen im Überblick

NVIDIA NIM für große Sprachmodelle läuft auf einem Linux-Host mit einem NVIDIA-Treiber aus dem Zweig 580 oder neuer, Docker 24.0 oder neuer und dem NVIDIA Container Toolkit 1.14.0 oder neuer, auf einer GPU, für die es ein passendes Profil des Modells gibt. NVIDIAs Support-Matrix vom 6. Oktober 2026 nennt die H200 NVL, die RTX PRO 6000 Blackwell Server Edition und die L40S unter den verifizierten GPUs für die NIMs von Llama, gpt-oss sowie Nemotron 3 Nano und Super. Für den produktiven Einsatz verlangt NVIDIAs NIM-FAQ eine NVIDIA-AI-Enterprise-Lizenz, gezählt je GPU, und jede H200 NVL enthält ein Fünf-Jahres-Abonnement; den Feature Branch, den NVIDIA kostenfrei anbietet, behandelt der Abschnitt zur Lizenz weiter unten.

Dieser Leitfaden behandelt NIM for LLMs im Release 2.0.13, auf dem Stand der NVIDIA-Dokumentation, als wir sie am 10. Oktober 2026 gelesen haben. Embedding- und andere NIM-Familien haben eigene Support-Matrizen. Zählung, Aktivierung und Verlängerung von AI Enterprise behandelt unser Leitfaden zur Lizenzierung von NVIDIA AI Enterprise.

Was ein NIM-Container enthält

Ein NIM ist ein Container-Image, das eine Serving-Engine, eine OpenAI-kompatible API auf Port 8000 und eine Reihe von Modellprofilen vereint. NVIDIAs rechtlicher Hinweis zu NIM for LLMs hält fest, dass es „vLLM direkt als Inferenz-Backend paketiert“, und die Release Notes von 2.0.13 nennen vLLM 0.28.0. Ein Profil ist eine Kombination aus Genauigkeit, etwa BF16, FP8, NVFP4 oder MXFP4, und Tensor-Parallelismus (TP), also der Zahl der GPUs, auf die eine Kopie des Modells aufgeteilt wird.

Es gibt zwei Arten von Images. Ein modellspezifischer NIM, etwa nim/meta/llama-3.1-8b-instruct:2.0.13 in NVIDIAs Registry nvcr.io, bringt die Profile mit, die NVIDIA für dieses Modell gebaut hat, und lädt die Gewichte beim ersten Start herunter. Der modellunabhängige NIM bedient ein Modell, auf das Sie ihn mit NIM_MODEL_PATH verweisen; als Quellen nennt NVIDIA NGC, Hugging Face, Amazon S3, Google Cloud Storage, ModelScope und lokalen Speicher.

Anforderungen an den Host: Treiber, CUDA und Container-Runtime

NVIDIAs Seite zu den Voraussetzungen, zuletzt aktualisiert am 6. Oktober 2026, setzt diese Mindestanforderungen und nennt keine Werte für Arbeitsspeicher, CPU-Kerne oder Festplattenplatz.

ANFORDERUNGANGABE VON NVIDIAUNSERE LESART
CPU-ArchitekturAMD64, ARM64x86-Server und Arm-Hosts kommen beide infrage
Betriebs­systemUbuntu 22.04 LTS oder neuer empfohlenandere Distributionen „wurden nicht offiziell validiert“
GPU-Treiber580 oder neuerR580 und R595 erfüllen beide die Vorgabe
CUDA SDK12.9 oder neuerdas Image bringt seine eigene CUDA-Runtime mit
Docker24.0 oder neuerfür Kubernetes gibt es eigene Leitfäden
NVIDIA Container Toolkit1.14.0 oder neuerauf jedem GPU-Host nötig
GPU-Speicherje ModellLlama 3.1 8B Instruct: mindestens 24 GB
NVIDIA-ZugangDeveloper Program oder AI EnterpriseNGC Personal API Key für Modelle des Production Branch

Seiten Prerequisites und Quickstart von NVIDIA NIM for LLMs, beide aktualisiert am 6. Oktober 2026 und abgerufen am 10. Oktober 2026; die rechte Spalte ist unsere Lesart.

R580, ein Long Term Support Branch bis Juni 2028, und R595, ein Production Branch bis März 2027, erfüllen beide die Vorgabe, wie unser Leitfaden zu NVIDIA-Treiberzweigen und CUDA-Versionen erklärt. Die Release Notes von 2.0.13 aktualisieren das Paket cuda-compat-13-0 im Image auf 580.159.03 und ergänzen: „Die zugehörigen Schwachstellen im Hosttreiber erfordern ein Update des GPU-Treibers auf dem Host.“ Die korrigierten Versionen in NVIDIAs Sicherheitsbulletin vom 30. September 2026 sind 580.178.04 und 595.91.07. Auf RTX-PRO-Blackwell-Karten muss der Treiber die offenen Kernelmodule nutzen.

Den NGC Personal API Key brauchen Sie nur, um Modelle des Production Branch oder NIMs vor Release 2.0.10 herunterzuladen, und die Seite warnt: „Legacy-API-Schlüssel werden von NIM LLM und VLM nicht unterstützt.“

Unterstützte GPUs in der NIM-Support-Matrix

Die Support-Matrix „führt unterstützte Modelle, Deployment-Profile und verifizierte Hardware-SKUs für NIM LLM und VLM auf“. Jedes Modell hat eine eigene Liste verifizierter GPUs. Was die Verifizierung umfasst, definiert die Seite nicht; eine fehlende Karte lesen wir als von NVIDIA für dieses Modell nicht getestet, nicht als vom Container gesperrt.

MODELLPROFILEH200 NVLRTX PRO 6000 SEL40S
Llama 3.1 8B InstructBF16, FP8, NVFP4; TP1verifiziertverifiziertverifiziert
Llama 3.3 70B InstructBF16, FP8, NVFP4; TP1 bis 8verifiziertverifiziertverifiziert
gpt-oss-120bMXFP4; TP1 bis 8verifiziertverifiziertverifiziert
gpt-oss-20bMXFP4; TP1 bis 8verifiziertverifiziertverifiziert
Nemotron 3 NanoBF16, FP8, NVFP4; TP1 bis 8verifiziertverifiziertverifiziert
Nemotron 3 Super 120BBF16, FP8, NVFP4; TP1 bis 8verifiziertverifiziertverifiziert
Llama 3.3 Nemotron Super 49BBF16, FP8, NVFP4; TP1 bis 8verifiziertverifiziertverifiziert
Nemotron 3 Ultra 550BBF16 TP8; NVFP4 TP2, 4, 8nicht gelistetnicht gelistetnicht gelistet
GLM-5.2FP8, NVFP4; TP4, TP8nicht gelistetnicht gelistetnicht gelistet
DeepSeek V4 Pro 0813FP8; TP8nicht gelistetnicht gelistetnicht gelistet

Support-Matrix von NVIDIA NIM for LLMs, zuletzt aktualisiert am 6. Oktober 2026, abgerufen am 10. Oktober 2026. Die meisten Profile gibt es auch mit LoRA-Adaptern. SE: Server Edition.

Jede Liste in der Tabelle, die die RTX PRO 6000 Server Edition nennt, nennt auch die RTX PRO 4500 Blackwell Server Edition. Der GB10, der Chip im DGX Spark, ist für Llama 3.1 8B, gpt-oss-20b, Nemotron 3 Nano und Llama 3.3 Nemotron Super 49B verifiziert. Keine der Listen oben nennt die L4, die RTX PRO 5000 oder die Workstation- und Max-Q-Editionen der RTX PRO 6000.

Die drei größten Modelle der Tabelle sind auf SXM- und Grace-basierten GPUs wie der H200 (SXM), der B200 und der GB200 verifiziert, und die Liste von Ultra nennt zusätzlich die H100 NVL; keine der drei Listen nennt eine Karte, die wir liefern. NVIDIAs Hinweis zu Super besagt, dass Profile mit niedrigerem TP deutlich mehr Speicher je Gerät brauchen, sodass „einige verifizierte GPUs nur TP4- oder TP8-Profile unterstützen“. Den Speicher je Modell und je Nutzer behandeln unsere Nemotron-Hardware-Anforderungen und unser Leitfaden dazu, wie viel VRAM ein LLM braucht.

Mit Release 2.0.13 ist Llama 3.1 70B in BF16 bei TP2 „auf der NVIDIA RTX PRO 6000 Blackwell Server Edition unterstützt“. Dasselbe Release führt das BF16-LoRA-Profil von Nemotron 3 Super bei TP2 als auf der H200 NVL nicht unterstützt und mehrere LoRA-Profile von Llama 3.3 70B als auf der L40S nicht unterstützt, weil der GPU-Speicher nicht reicht.

Wir bauen KI-Server auf Bestellung mit der RTX PRO 6000 Server Edition, der L40S oder der H200 NVL. Schicken Sie uns die NIMs, die Sie betreiben wollen, und Ihre Spitzenzahl an Nutzern, und wir schlagen Karten vor, die die Matrix für diese Modelle führt.

Modellprofile und GPU-Speicher

Ist kein Profil gesetzt, „wählt NIM anhand Ihrer Hardware automatisch das beste kompatible Profil aus dem Manifest“, nach dem GPU-Modell, seinem Speicher und den Einstellungen für die Parallelisierung. Wird das Image mit list-model-profiles gestartet, zeigt es das Ergebnis vor einem Deployment. Es sortiert die Profile in „Compatible with system and runnable“, „Compatible with system but low memory“ und „Incompatible with system“; Letzteres bedeutet, dass schon die Modellgewichte allein den GPU-Speicher übersteigen. NIM_MODEL_PROFILE legt ein Profil über seine ID oder Beschreibung fest, sodass mehrere Hosts dasselbe Profil ausführen.

Die Genauigkeit hängt auch von der Architektur ab. Für Nemotron 3.5 Lightning nennt die Matrix für jedes Profil ein Minimum je GPU und eine Architektur. NVFP4 bei TP1 braucht 30 GB und „Blackwell oder neuer (SM 10.0+)“, was die RTX PRO 6000 mit der Compute Capability 12.0 erfüllt. Die H200 NVL ist eine Hopper-Karte und nimmt deshalb stattdessen das W4A16-Profil (32 GB bei TP1) oder BF16 (66 GB bei TP1). Auf einer L40S mit 48 GB passt das W4A16-Profil auf eine Karte, während BF16 TP2 mit 35 GB je GPU braucht.

NVIDIA merkt an, dass diese Mindestwerte die Gewichte und die Allokationen der Laufzeit abdecken, ohne Reserve für einen großen KV-Cache. Der Speicher, der nach den Gewichten übrig bleibt, entscheidet, wie viele Gespräche eine Kopie des Modells bedient, und eine Karte, die ein Minimum erfüllt, kann trotzdem zu wenige Nutzer fassen.

Modell-Cache, Speicherplatz und Air-Gap-Installation

Der NIM legt die Modelldateien im Container unter /opt/nim/.cache ab, gesetzt über NIM_CACHE_PATH, und der Quickstart bindet dort ein Host-Verzeichnis ein, das die Voraussetzungen auf ~/.cache/nim setzen. NVIDIAs Seite zum Modell-Download nennt keinen Wert für den Speicherplatz. Der Cache hält die Gewichte jedes heruntergeladenen Profils, und download-to-cache --all lädt sie alle; planen Sie also lokalen NVMe-Speicher mindestens für die Checkpoints der Profile ein, die Sie betreiben werden. Bei Nemotron 3 Super belegt allein der NVFP4-Checkpoint auf Hugging Face 80,3 GB.

Der Air-Gap-Leitfaden, aktualisiert am 6. Oktober 2026, teilt die Arbeit in eine Phase mit Internetverbindung und eine Offline-Phase.

  1. Führen Sie auf einem Rechner mit Internetzugang list-model-profiles aus und notieren Sie die Profil-ID für Ihre GPU und TP-Größe.
  2. Führen Sie download-to-cache -p mit dieser ID aus, oder create-model-store -p mit einem Ausgabeverzeichnis, das Sie mit -m setzen.
  3. Kopieren Sie den Cache oder den Model Store auf den Offline-Host, als Archiv, per rsync oder auf physischen Datenträgern.
  4. Starten Sie den NIM dort mit eingebundenem Cache und NIM_MODEL_PROFILE auf der Profil-ID, oder mit NIM_MODEL_PATH auf dem Model Store, und ohne NGC_API_KEY oder HF_TOKEN; NVIDIA schreibt: „Setzen Sie in der Air-Gap-Phase weder NGC_API_KEY noch HF_TOKEN.“

Auf Kubernetes muss „jedes Image, auf das das heruntergeladene Helm-Chart verweist, aus einer Registry verfügbar sein, die der abgeschottete Cluster erreichen kann“, einschließlich der Images des GPU Operators. AI Enterprise braucht für Container auf Bare Metal keinen Lizenzserver, ein Offline-Host muss also keine Lizenzprüfung erreichen.

NIM-Lizenz: NIM, NIM Certified und NVIDIA AI Enterprise

NVIDIAs Seite zu den Angebotsformen, aktualisiert am 6. Oktober 2026, beschreibt NIM und zwei Branches von NIM Certified. „NIM ist unter den geltenden Lizenzbedingungen kostenfrei verfügbar“; es erscheint innerhalb von etwa 72 Stunden nach dem Upstream-Modell, ist „auf einer kleinen Auswahl von NVIDIA-GPUs als funktionsfähig validiert“ und „nicht durch den NVIDIA-Enterprise-Support abgedeckt“. Die Seite hält fest, dass der „NIM Certified Feature Branch unter den geltenden Lizenzbedingungen kostenfrei verfügbar“ ist, und führt ihn für „produktive Deployments, die neuere Funktionen priorisieren und häufige Software-Updates übernehmen können“, mit Enterprise-Support nur unter einem AI-Enterprise-Abonnement. Zum anderen Branch heißt es: „NIM Certified Production Branch erfordert ein aktives NVIDIA-AI-Enterprise-Abonnement.“

Andere Dokumente von NVIDIA ziehen engere Grenzen. Die NIM General FAQ, zuletzt geändert am 6. August 2026, hält fest: „Der Einsatz von NIM in der Produktion erfordert eine NVIDIA-AI-Enterprise-Lizenz.“ Sie definiert Produktion als jede Nutzung außer Entwicklung, Test, Forschung oder Evaluierung und beschränkt die selbst gehostete Nutzung über das Developer Program auf diese Zwecke und auf bis zu 16 GPUs. Die rechtliche Seite zu NIM verweist auf NVIDIAs Product-Specific Terms for AI Products, zuletzt geändert am 15. April 2026, die festhalten: „Software, die als Teil des Developer Program angeboten wird, ist nicht für Nutzung, Weitergabe oder Bereitstellung in der Produktion bestimmt.“ Ihr Abschnitt zu NIMs für Workstations erlaubt dafür vorgesehene NIMs ohne Abonnement auf einem PC oder einer Workstation mit NVIDIA-RTX-GPUs, die „nicht in einem kommerziellen Kiosk, Server oder anderen System eingesetzt wird, das mehreren Nutzern dient“.

Mit Stand 10. Oktober 2026 sagen diese Seiten nicht an einer Stelle, ob ein NIM aus dem Feature Branch ohne Abonnement Mitarbeitende in der Produktion bedienen darf; lassen Sie deshalb im Angebot festhalten, welche Angebotsform eingesetzt wird und auf welcher Lizenz sie beruht. Der Production Branch und der NVIDIA-Support brauchen in jedem Fall AI Enterprise, gezählt je GPU. Die H200 NVL enthält ein Fünf-Jahres-Abonnement, aktiviert über die Seriennummer der Karte; die RTX PRO 6000 Server Edition, die L40S und die L4 enthalten keines, und für DGX Spark gibt es ein eigenes AI-Enterprise-Produkt. Ob ein bestimmter Einsatz nach diesen Bedingungen als Produktion gilt, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Wir liefern NVIDIA-AI-Enterprise-Lizenzen unter einem EU-Vertrag und auf einer Rechnung mit den GPUs, auf denen sie laufen. Nennen Sie uns, wie viele GPUs NIM in der Produktion ausführen sollen, und welche Karten Sie bereits besitzen, und das Angebot zeigt, was jede Karte enthält.

NIM in virtuellen Maschinen und auf Kubernetes

NVIDIAs vGPU-Seite zum Deployment von NIM verlangt, „NVIDIA-vGPU-Software auf dem Hypervisor-Host zu installieren und zu lizenzieren“, und verwendet in ihren Beispielen Compute-Profile der C-Serie. Sie merkt außerdem an, dass „der nutzbare GPU-Framebuffer in der VM kleiner ist als die konfigurierte Größe des vGPU-Profils“; lassen Sie also eine Reserve, wenn Sie das vGPU-Profil für einen NIM wählen. Compute-vGPU-Profile (C-Serie) werden nur über AI Enterprise lizenziert, je GPU.

Auf Kubernetes dokumentiert NVIDIA NIM mit Helm, KServe, OpenShift, Run:ai und dem NIM Operator, dessen Ressource NIMCache Modelle auf Netzwerkspeicher herunterlädt. Unser Artikel über eine private LLM-Plattform auf Kubernetes zeigt, wo NIM neben vLLM und KServe steht.

Was wir liefern

Wir liefern die Karten, die dieser Leitfaden behandelt, die RTX PRO 6000 Server Edition, die RTX PRO 4500 Server Edition, die L40S und die H200 NVL, als Karten oder in nach Auftrag gebauten KI-Servern, und wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Auf Wunsch kommen die Server mit installiertem Betriebssystem, Treibern, CUDA und einer Container-Runtime. NVIDIA-AI-Enterprise-Lizenzen für NIM, die auf unserer Seite zu AI-Enterprise- und vGPU-Lizenzen stehen, kommen auf dieselbe Rechnung wie die Hardware, für die Herstellergarantie gilt. Die Modelle, RAG und MLOps darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Welche Anforderungen hat NVIDIA NIM?
NIM for LLMs 2.0.13 braucht einen NVIDIA-Treiber 580 oder neuer, Docker 24.0 oder neuer, das NVIDIA Container Toolkit 1.14.0 oder neuer und einen Linux-Host mit AMD64 oder ARM64, empfohlen ist Ubuntu 22.04 LTS oder neuer. Die GPU braucht genug Speicher für ein Profil des Modells, bei Llama 3.1 8B Instruct zum Beispiel mindestens 24 GB. Zugang gibt es über das NVIDIA Developer Program oder eine AI-Enterprise-Lizenz.
Welche GPUs unterstützt NVIDIA NIM laut Support-Matrix?
Jedes Modell in NVIDIAs Support-Matrix hat eine eigene Liste verifizierter GPUs. Mit Stand 6. Oktober 2026 sind die H200 NVL, die RTX PRO 6000 Blackwell Server Edition, die RTX PRO 4500 Blackwell Server Edition und die L40S für die NIMs von Llama 3.1 8B und Llama 3.3 70B, gpt-oss sowie Nemotron 3 Nano und Super verifiziert. Die größten Modelle, etwa Nemotron 3 Ultra und GLM-5.2, sind auf keiner dieser vier Karten verifiziert.
Läuft NIM auf der RTX PRO 6000?
Die RTX PRO 6000 Blackwell Server Edition ist in der Matrix vom 6. Oktober 2026 eine verifizierte GPU für die NIMs von Llama, gpt-oss sowie Nemotron 3 Nano und Super, zusammen mit der RTX PRO 4500 Server Edition. Die Workstation- und Max-Q-Editionen erscheinen in diesen Listen nicht.
Läuft NIM auf der H200 NVL?
Ja, die H200 NVL ist in der Matrix vom 6. Oktober 2026 eine verifizierte GPU für die NIMs von Llama, gpt-oss sowie Nemotron 3 Nano und Super. NIM wählt das Profil nach den 141 GB der Karte und ihrer Hopper-Architektur, und Profile, die Blackwell voraussetzen, etwa das NVFP4-Profil von Nemotron 3.5 Lightning, kommen für sie nicht infrage. Jede H200 NVL enthält ein fünfjähriges Abonnement von NVIDIA AI Enterprise.
Brauche ich für NIM eine Lizenz von NVIDIA AI Enterprise?
Für die Produktion sagt NVIDIAs NIM-FAQ vom 6. August 2026 ja, und NIM Certified Production Branch erfordert ein aktives AI-Enterprise-Abonnement, gezählt je GPU, während NVIDIAs Seite zu den Angebotsformen vom 6. Oktober 2026 NIM und den Feature Branch unter den geltenden Lizenzbedingungen kostenfrei führt. Lassen Sie im Angebot festhalten, auf welcher Angebotsform und Lizenz ein Produktionsserver beruht. Entwicklung und Tests über das Developer Program brauchen kein Abonnement, und NVIDIA bietet eine Testlizenz über 90 Tage.
Kann NVIDIA NIM On-Premise ohne Internetzugang laufen?
Ja. NVIDIAs Air-Gap-Leitfaden bereitet auf einem Rechner mit Internetverbindung einen Modell-Cache oder Model Store mit download-to-cache oder create-model-store vor und betreibt den NIM danach offline, ohne gesetzten NGC_API_KEY oder HF_TOKEN. Auf Kubernetes muss jedes Image des Helm-Charts in eine Registry gespiegelt werden, die der Cluster erreichen kann.

Schicken Sie uns die NIM-Modelle, die Sie betreiben wollen, die GPUs oder Server, die Sie bereits haben, gegebenenfalls den Hypervisor und ob der NIM Mitarbeitende in der Produktion bedienen soll. Wir antworten innerhalb eines Werktages mit einer Konfiguration, der Zahl der AI-Enterprise-Lizenzen und einem schriftlichen Angebot.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien