BLOG · GUIDE ·

Kleine Sprachmodelle auf L4 und RTX PRO 2000: GPU-Dimensionierung für Filialen und Edge-Server

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Nach unserer Speicherschätzung hält eine L4, RTX PRO 4000 SFF oder RTX PRO 4000 mit 24 GB jedes von zehn aktuellen Modellen mit 2B bis 14B mit mindestens zwei Gesprächen von 8.192 Token, und acht davon mit mindestens zwei von 32.768 Token
  • Die RTX PRO 2000 mit 16 GB hält Gemma 4 E2B, Qwen3.5-4B, Ministral 3 3B, Nemotron 3 Nano 4B, Gemma 4 12B in Googles 4-Bit-QAT-Version und die 8B-Modelle in FP8, die 8B-Modelle nur für ein oder zwei kurze Gespräche
  • Hybride Modelle halten weit weniger KV-Cache als dichte 8B-Modelle: 0,30 GiB je 8K-Gespräch bei Qwen3.5-4B und 0,14 GiB bei Nemotron 3 Nano 4B, gegenüber 1 GiB bei Llama 3.1 8B und 1,06 GiB bei Ministral 3 8B
  • Die L4 ist eine passive Single-Slot-Karte mit halber Bauhöhe und 72 W für Server; die RTX PRO 4000 SFF ist eine aktiv gekühlte Dual-Slot-Karte mit halber Bauhöhe und 70 W, die RTX PRO 2000 eine Dual-Slot-Karte mit 70 W im selben Format von 2,7 × 6,6 Zoll; die RTX PRO 4000 ist eine Single-Slot-Karte mit 145 W und 672 GB/s
  • Die Quantisierungstabelle von vLLM führt llm-compressor FP8 und die 4-Bit-Formate AWQ und GPTQ als unterstützt auf Ada, der Architektur der L4; die drei RTX-PRO-Blackwell-Karten rechnen auch in FP4, die L4 nicht

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Kleine Sprachmodelle auf einer GPU mit geringer Leistungsaufnahme

Kleine Sprachmodelle mit etwa 2 bis 14 Milliarden Parametern laufen auf einer GPU mit 70 bis 145 W. Nach unserer Speicherschätzung hält eine Karte mit 24 GB (die NVIDIA L4, die RTX PRO 4000 SFF oder die RTX PRO 4000) jedes der zehn Modelle dieses Artikels mit mindestens zwei Gesprächen von 8.192 Token, und acht davon mit mindestens zwei Gesprächen von 32.768 Token. Die RTX PRO 2000 mit 16 GB hält die Modelle mit 2B bis 4B, Gemma 4 12B in Googles 4-Bit-QAT-Version und ein 8B-Modell in FP8, das 8B-Modell nur für ein oder zwei kurze Gespräche.

Das sind Speicher-Obergrenzen aus den Hugging-Face-Dateien der Herausgeber, keine Messungen. Wir verwenden die Regel aus unserem Leitfaden dazu, wie viel VRAM ein LLM braucht: 90 Prozent des Kartenspeichers, abzüglich 3 GiB, für Gewichte und KV-Cache. Das lässt 18,6 GiB auf einer Karte mit 24 GB und 11,4 GiB auf einer Karte mit 16 GB. Die Kontextlänge, die Sie je Gespräch zulassen, verändert das Ergebnis stärker als die Parameterzahl.

L4, RTX PRO 2000, RTX PRO 4000 SFF und RTX PRO 4000

KARTESPEICHERBANDBREITELEISTUNGBAUFORM, KÜHLUNG
NVIDIA L424 GB GDDR6300 GB/s72 Whalbe Bauhöhe, Single Slot, passiv
RTX PRO 2000 Blackwell16 GB GDDR7288 GB/s70 W2,7 × 6,6 Zoll, Dual Slot, aktiv
RTX PRO 4000 SFF Blackwell24 GB GDDR7432 GB/s70 Whalbe Bauhöhe, Dual Slot, aktiv
RTX PRO 4000 Blackwell24 GB GDDR7672 GB/s145 Wvolle Bauhöhe, Single Slot, aktiv

NVIDIA-Produktseiten der vier Karten und NVIDIAs Datenblatt der RTX PRO 2000 (Juni 2026), gelesen am 10. Oktober 2026; die passive Kühlung der L4 aus Lenovos Product Guide zum ThinkEdge SE455 V3. Alle vier haben ECC-Speicher; keine der drei 70-W-Karten unterstützt MIG.

NVIDIA beschreibt die L4 als „1-Slot, Low Profile“ und schreibt, sie arbeite „in einem Low-Power-Rahmen von 72 W“. Sie ist eine passive Rechenzentrumskarte, die ihren Luftstrom von den Lüftern des Servers bezieht. Die RTX PRO 2000 und die RTX PRO 4000 SFF messen 2,7 × 6,6 Zoll, belegen zwei Steckplätze und haben eigene Lüfter; sie eignen sich daher für kompakte Desktops ebenso wie für Server, die sie unterstützen. NVIDIA bezeichnet die SFF-Karte als Karte mit halber Bauhöhe. Für die RTX PRO 2000 nennen Produktseite und Datenblatt nur die Maße, und das Datenblatt führt PCIe 5.0 x8 auf einem Steckverbinder voller Länge; prüfen Sie also, ob der Hersteller die Karte für Gehäuse und Steckplatz listet. Die RTX PRO 4000 zieht die doppelte Leistung der L4 und hat das 2,2-Fache ihrer Bandbreite, als Single-Slot-Karte mit voller Bauhöhe. Unser Vergleich von RTX PRO 4000 SFF, RTX PRO 2000 und L4 behandelt Steckplatzleistung, Displayausgänge, Video-Engines und vGPU.

NVIDIA gibt die drei Blackwell-Karten in „AI TOPS“ an, die ihre Seiten und Datenblätter als FP4-TOPS mit Sparsity ausweisen: 545 für die RTX PRO 2000, 770 für die RTX PRO 4000 SFF und 1.290 für die RTX PRO 4000. Die L4 hat FP8-Tensor-Kerne, angegeben mit 485 TFLOPS mit Sparsity und der Hälfte ohne, und kein FP4.

Welche kleinen Modelle in 16 und 24 GB passen

Den KV-Cache je Gespräch liefert die config.json des Modells, als 2 × Layer × KV-Heads × Head-Dimension × Bytes pro Wert für jeden Layer, der den gesamten Kontext hält, plus einen festen Betrag für Layer, die ein Fenster oder einen Zustand halten.

MODELL, FORMATGEWICHTECACHE JE 8K16 GB: 8K / 32K24 GB: 8K / 32K
Gemma 4 E2B, BF1610,2 GB0,05 GiB36 / 9172 / 47
Gemma 4 E4B, BF1616,0 GB0,14 GiBpasst nicht25 / 7
Gemma 4 12B, QAT W4A1610,3 GB0,44 GiB4 / 220 / 11
Qwen3.5-4B, BF169,3 GB0,30 GiB9 / 233 / 9
Qwen3.5-9B, BF1619,3 GB0,30 GiBpasst nicht2 / keines
Ministral 3 3B, FP84,7 GB0,81 GiB8 / 217 / 4
Ministral 3 8B, FP810,4 GB1,06 GiB1 / keines8 / 2
Ministral 3 14B, FP815,7 GB1,25 GiBpasst nicht3 / keines
Llama 3.1 8B, NVIDIA FP89,1 GB1,00 GiB2 / keines10 / 2
Nemotron 3 Nano 4B, FP85,3 GB0,14 GiB45 / 1997 / 41

Unsere Schätzungen, keine Messungen: gleichzeitige Gespräche mit vollen 8.192 oder 32.768 Token, ausgehend von 90 Prozent des Nennspeichers abzüglich 3 GiB. KV-Cache in 16 Bit, außer bei Nemotron 3 Nano 4B in FP8, wie NVIDIAs vLLM-Befehl ihn setzt. Gewichte aus den Dateilisten auf Hugging Face und Cache aus der jeweiligen config.json, gelesen am 10. Oktober 2026. 16 GB steht für die RTX PRO 2000; 24 GB für die L4, RTX PRO 4000 SFF oder RTX PRO 4000.

Die Gemma-Werte bei 32K stammen aus unserem Hardware-Leitfaden zu Gemma 4, der die Sliding-Window-Layer erklärt und begründet, warum sein Wert für das 12B eine Obergrenze ist.

Auch die übrigen hybriden Modelle halten wenig Cache. Qwen3.5-4B und Qwen3.5-9B haben je 32 Layer, von denen 8 volle Attention mit vier KV-Heads der Dimension 256 nutzen, 32 KiB je Token in 16 Bit; die 24 Gated-DeltaNet-Layer halten einen festen Zustand von etwa 48 MiB in float32. Nemotron 3 Nano 4B hält in 4 seiner 42 Layer einen Cache, und unser Hardware-Leitfaden zu Nemotron nennt seinen Zustand. Die dichten Modelle halten in jedem Layer einen Cache: 128 KiB je Token bei Llama 3.1 8B (32 Layer, acht KV-Heads) und 136 KiB bei Ministral 3 8B (34 Layer), das Vierfache des Qwen3.5-Werts.

Qwen3.5-9B ist ein Fall, in dem die Gewichte zu wenig Platz lassen. Sein BF16-Checkpoint mit 19,3 GB lässt von den 18,6 GiB Budget auf einer Karte mit 24 GB noch 0,6 GiB übrig, und seine Model Card verweist auf 558 quantisierte Versionen, die wir nicht bewertet haben. Mistral veröffentlicht die Instruct-Modelle von Ministral 3 in FP8, und laut seinen Model Cards passt das 8B „in FP8 in 12 GB VRAM“ und das 3B „in 8 GB“. Unsere Rechnung stimmt damit überein: Das 8B mit einem Gespräch von 8.192 Token kommt auf etwa 10,8 GiB.

Gemma 4, Qwen3.5-4B und 9B sowie Ministral 3 stehen unter Apache 2.0. Llama 3.1 8B steht unter der Llama 3.1 Community License und Nemotron 3 Nano 4B unter der NVIDIA Nemotron Open Model License. Ob eine Klausel auf Ihr Unternehmen zutrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Wir liefern die L4, RTX PRO 2000, RTX PRO 4000 und RTX PRO 4000 SFF als Karten oder in nach Auftrag gebauten Servern. Nennen Sie uns das Modell, seine Kontextlänge und die Nutzer je Standort zur Spitzenzeit, und wir nennen Ihnen die Karte, die sie hält.

Kontextlänge und Thinking-Modus bestimmen die Nutzerzahl

Eine Serving-Engine reserviert Cache für den Kontext, den Sie angeben. vLLM übernimmt ihn aus der Modellkonfiguration, sofern --max-model-len ihn nicht festlegt, und Qwen3.5 und Ministral 3 geben 262.144 Token an. Bei dieser Länge braucht ein einziges Gespräch mit Ministral 3 8B nach unserer Rechnung 34 GiB Cache in 16 Bit, mehr als jede Karte in diesem Artikel fasst. Für Klassifizierung oder Extraktion kurzer Texte geben Sie 8K oder weniger an; für einen Filialassistenten, der aus wenigen abgerufenen Passagen antwortet, 8K bis 32K.

Qwen3.5-Modelle „arbeiten standardmäßig im Thinking-Modus“, und Qwens Model Card empfiehlt, „eine Kontextlänge von mindestens 128K Token beizubehalten“, damit dieser Modus gut funktioniert. Bei 128K hält Qwen3.5-4B in BF16 nach unserer Schätzung zwei Gespräche auf einer Karte mit 24 GB. Für Extraktion und Routing lässt sich Thinking je Anfrage abschalten, indem enable_thinking auf false gesetzt wird; das hält die Ausgaben kurz und den Kontext klein. Dieselbe Model Card dokumentiert --language-model-only, das den Vision-Encoder auslässt, sodass dessen Speicher dem KV-Cache zugutekommt.

Ein FP8-KV-Cache, in vLLM mit --kv-cache-dtype fp8 gesetzt wie in NVIDIAs Befehl für Nemotron 3 Nano 4B, halbiert den Attention-Cache je Token und verdoppelt die Werte der dichten Modelle in der Tabelle nahezu. Der feste Zustand der hybriden Layer schrumpft nicht. Prüfen Sie zuerst, ob die Engine das auf Ihrer Karte unterstützt.

FP8- und 4-Bit-Formate auf Ada und Blackwell

Die Quantisierungsdokumentation von vLLM, laut Fußzeile vom 14. September 2026, führt llm-compressor FP8 (W8A8) als unterstützt auf Ada- und Hopper-GPUs, und ebenso AWQ, GPTQ und die Marlin-Kernel für GPTQ-, AWQ-, FP8- und FP4-Gewichte auf Ada. Die L4 ist eine Ada-Lovelace-Karte ohne eigene FP4-Arithmetik. Die FP8-Checkpoints von Ministral 3 und Llama 3.1 8B und Googles QAT W4A16 liegen in eigenen Formaten ihrer Herausgeber vor, die die Tabelle nicht nennt, und sie hat keine Spalte für Blackwell. Prüfen Sie jeden Checkpoint mit dem vLLM-Release, das Sie auf Ihrer Karte betreiben.

Keiner der Checkpoints in unserer Tabelle liegt in NVFP4 vor, NVIDIAs 4-Bit-Format für Blackwell; unsere Leitfäden zu Gemma und Nemotron nennen NVFP4-Versionen der größeren Modelle dieser Familien.

Generierungstempo bei 288 bis 672 GB/s

Ein dichtes Modell liest für jedes erzeugte Token alle seine Gewichte aus dem Speicher; die Bandbreite geteilt durch die Größe der Gewichte setzt daher eine Obergrenze für das Tempo, das ein Nutzer sieht. Auf dieser Grundlage liegt die Obergrenze der RTX PRO 4000 beim selben Modell etwa beim 2,2-Fachen der L4, die der RTX PRO 4000 SFF etwa beim 1,4-Fachen und die der RTX PRO 2000 etwa auf dem Niveau der L4. Das sind Verhältnisse aus den Spezifikationen, keine gemessenen Geschwindigkeiten. Mehrere Nutzer teilen sich jeden Lesevorgang der Gewichte, der Gesamtdurchsatz steigt also mit gleichzeitigen Anfragen, bis Cache oder Rechenleistung erschöpft sind.

Wo ein kleines Modell reicht und wo nicht

Kleine Modelle passen zu Aufgaben mit kurzen Eingaben und eingeschränkten Ausgaben: Tickets oder E-Mails klassifizieren, Felder aus Formularen als JSON extrahieren, eine Anfrage an die richtige Warteschlange oder an ein größeres Modell weiterleiten und Routinefragen in einer Filiale über RAG aus einem begrenzten Bestand an Dokumenten beantworten. Mistrals Model Card für Ministral 3 3B nennt es „ideal für leichtgewichtige Echtzeitanwendungen auf Edge-Geräten oder Geräten mit geringen Ressourcen“. NVIDIA bezeichnet Nemotron 3 Nano 4B als „ein Edge-fähiges kleines Sprachmodell“. Ein Positionspapier auf arXiv (2506.02153, überarbeitet am 22. September 2026), dessen Abstract auf eine Seite von NVIDIA Research verweist, argumentiert, dass kleine Modelle für viele agentische Aufrufe „ausreichend leistungsfähig“ sind und dass Systeme mit allgemeinem Gesprächsbedarf mehrere Modelle kombinieren.

Die Grenzen folgen aus der Speicherrechnung. Lange Verträge, vollständig gelesene Berichte oder viele Nutzer mit langen Gesprächen brauchen mehr Cache, als 16 oder 24 GB neben den Gewichten fassen, und breites Wissen sowie mehrstufiges Schlussfolgern über Dokumente hinweg sprechen für ein größeres Modell. Eine Aufteilung hält das kleine Modell für Routing und Extraktion in der Filiale und schickt den Rest an ein größeres Modell im Rechenzentrum, auf einer RTX PRO 6000 oder einer H200 NVL.

Filial- und Edge-Server: halbe Bauhöhe, SFF und geringe Tiefe

Für einen Server in einer Filiale oder in einer Fertigungshalle ist die L4 die einzige der vier, die für den Luftstrom eines Servers ausgelegt ist. Lenovos Product Guide zum ThinkEdge SE455 V3, aktualisiert am 25. August 2026, beschreibt einen „2U-Rack-Server mit geringer Tiefe (438 mm Tiefe, ab dem vorderen EIA-Rackflansch)“ und führt bis zu sechs L4-Karten darin. Unser Vergleich von L4 und L40S für Inferenz nennt Rechenzentrumsserver, die bis zu acht L4 in 2U aufnehmen. Von den drei 70-W-Karten unterstützt nur die L4 vGPU, mit dem ein Filialhost mehreren virtuellen Maschinen GPU-Anteile zuweisen kann.

Wo es keinen Serverraum gibt, betreibt eine RTX PRO 2000 oder RTX PRO 4000 SFF in einem kompakten Desktop ein kleines Modell aus dem PCIe-Steckplatz, sofern der Hersteller diese Karte, mit 70 W und 2,7 Zoll Höhe, für das Gehäuse listet. Vier L4-Karten ziehen bei ihrer Nennleistung 288 W, weniger als eine RTX PRO 6000 Server Edition mit 600 W; das zählt dort, wo ein Filialrack nur eine kleine Zuleitung hat.

Wir bauen GPU-Workstations und Server mit geringer Tiefe für Filialstandorte nach Auftrag und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie den Filialstandort, seine Racktiefe oder den Platz am Schreibtisch und die verfügbare Leistung im Formular unten.

Was wir liefern

Wir liefern die NVIDIA L4, die RTX PRO 2000, die RTX PRO 4000 und die RTX PRO 4000 SFF als Karten, in konfigurierten Workstations oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Wir legen die Karte nach dem Modell, seiner Präzision, der Kontextlänge und den Nutzern je Standort aus und bestätigen, dass das Gehäuse die Karte in diesem Steckplatz aufnimmt und kühlen kann. vGPU-Lizenzen für L4-Hosts kommen auf derselben Rechnung wie die Hardware. Unser Sortiment professioneller GPUs führt jede Karte, und die Modelle, RAG und MLOps darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Welche GPU brauche ich für ein 8B-Modell?
Ein 8B-Modell in FP8 belegt etwa 9 bis 10,4 GB, eine Karte mit 24 GB wie die L4, RTX PRO 4000 SFF oder RTX PRO 4000 hält also nach unserer Schätzung mit KV-Cache in 16 Bit Llama 3.1 8B mit zehn Gesprächen von 8.192 Token und Ministral 3 8B mit acht. Eine RTX PRO 2000 mit 16 GB hält jedes der beiden Modelle für ein oder zwei solche Gespräche. Ein FP8-Cache verdoppelt diese Zahlen ungefähr, wo die Engine ihn auf Ihrer Karte unterstützt.
Läuft ein LLM auf der NVIDIA L4?
Ja. Die L4 hat 24 GB mit 300 GB/s und führt Modelle bis etwa 14B Parameter in FP8 aus, das die Quantisierungstabelle von vLLM auf ihrer Ada-Lovelace-Architektur als unterstützt führt. Nach unserer Schätzung hält sie Qwen3.5-4B in BF16 mit 33 Gesprächen von 8.192 Token und Ministral 3 14B in FP8 mit drei, wobei die Karte keine FP4-Arithmetik hat.
Kann die RTX PRO 2000 ein LLM ausführen?
Sie kann kleine Modelle in ihren 16 GB ausführen. Nach unserer Schätzung hält sie Gemma 4 E2B, Qwen3.5-4B, Ministral 3 3B und Nemotron 3 Nano 4B mit mehreren Gesprächen und Gemma 4 12B in Googles 4-Bit-QAT-Version mit vier Gesprächen von 8.192 Token. Gemma 4 E4B in BF16, Qwen3.5-9B in BF16 und Ministral 3 14B passen nicht.
Was ist ein kleines Sprachmodell (SLM)?
Der Begriff wird für Modelle mit etwa 1 bis 14 Milliarden Parametern verwendet, die auf einer GPU mit geringer Leistungsaufnahme oder einem Edge-Gerät laufen. Aktuelle Beispiele sind Gemma 4 E2B, E4B und 12B, Qwen3.5-4B und 9B, Ministral 3 mit 3B, 8B und 14B, Llama 3.1 8B und Nemotron 3 Nano 4B, das NVIDIA als „ein Edge-fähiges kleines Sprachmodell“ bezeichnet. Sie eignen sich für Klassifizierung, Extraktion, Routing und Filialassistenten über einem begrenzten Bestand an Dokumenten.
Wie viel VRAM braucht ein kleines Sprachmodell?
Die Gewichte belegen bei den Modellen dieses Artikels je nach Größe und Format 4,7 bis 19,3 GB, und jedes Gespräch bringt KV-Cache hinzu. Dichte 8B-Modelle brauchen etwa 1 GiB Cache in 16 Bit je 8.192 Token, hybride Modelle wie Qwen3.5-4B und Nemotron 3 Nano 4B dagegen 0,30 und 0,14 GiB. Planen Sie 90 Prozent des Kartenspeichers, abzüglich 3 GiB, für Gewichte plus Cache ein.
Welche GPU eignet sich für einen Edge-LLM-Server?
Im Server ist die L4 eine passive Single-Slot-Karte mit halber Bauhöhe und 72 W, die in Edge-Server mit geringer Tiefe passt; Lenovo listet bis zu sechs davon in seinem 2U-ThinkEdge SE455 V3 mit 438 mm Tiefe. Ohne Server-Luftstrom passt die aktiv gekühlte RTX PRO 2000 oder RTX PRO 4000 SFF mit 70 W in einen kompakten Desktop, dessen Hersteller diese Karte für den Steckplatz listet. Von diesen Karten unterstützt nur die L4 vGPU.

Schicken Sie uns das Modell, seine Präzision, die Kontextlänge, die Zahl der Standorte und die Nutzer je Standort zur Spitzenzeit, und ob die Karte in einen Server oder einen kompakten Desktop kommt. Wir antworten innerhalb eines Werktages mit der Karte, die zu Steckplatz, Kühlung und benötigtem Speicher passt, und einem schriftlichen Angebot.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien