Llama-4-Hardware-Anforderungen: VRAM von Scout und Maverick, GPUs für 1 bis 100 Nutzer und die Lizenz
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Llama 4 Scout (109B Parameter, 17B aktiv, 16 Experten) passt für einen Nutzer mit NVIDIAs NVFP4-Checkpoint mit 65,3 GB auf eine RTX PRO 6000 oder einen DGX Spark, mit NVIDIAs FP8-Checkpoint mit 111,6 GB auf eine H200 NVL
- Llama 4 Maverick (400B Parameter, 17B aktiv, 128 Experten) hat in Metas FP8-Version 416,8 GB und braucht für einen bis 20 Nutzer vier H200 NVL oder acht RTX PRO 6000
- Nach unserer Schätzung braucht ein Gespräch mit 32.768 Token bei FP8-KV-Cache mit beiden Modellen bis zu 3 GiB; 100 solche Gespräche brauchen für Scout acht RTX PRO 6000 oder vier H200 NVL und für Maverick acht H200 NVL
- Das Scout-Rezept von vLLM (24. September 2026) stellt NVIDIAs FP8-Checkpoint auf Hopper bereit und den FP4-Checkpoint nur auf GPUs mit Compute Capability 10.0, mit tensor-parallel-size 1 und FP8-KV-Cache; setzen Sie den maximalen Kontext selbst, denn die Card von Scout nennt 10M Token
- Metas Nutzungsrichtlinie für Llama 4 (Acceptable Use Policy) gewährt die Rechte nach Abschnitt 1(a) an den multimodalen Modellen von Llama 4 weder natürlichen Personen mit Wohnsitz in der EU noch Unternehmen mit Hauptgeschäftssitz in der EU, außer Endnutzern eines Produkts oder Dienstes, das sie integriert
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Llama-4-Hardware-Anforderungen für Scout und Maverick
Die Hardware-Anforderungen von Llama 4 hängen vom Modell und vom Checkpoint-Format ab. Llama 4 Scout passt für einen Nutzer mit NVIDIAs NVFP4-Checkpoint mit 65,3 GB auf eine RTX PRO 6000 oder einen DGX Spark, mit NVIDIAs FP8-Checkpoint mit 111,6 GB auf eine H200 NVL. Zwanzig gleichzeitige Nutzer mit je 32K Token brauchen zwei RTX PRO 6000 oder zwei H200 NVL, 100 Nutzer acht RTX PRO 6000 oder vier H200 NVL. Llama 4 Maverick in Metas FP8-Version mit 416,8 GB braucht für einen bis 20 Nutzer vier H200 NVL oder acht RTX PRO 6000 und für 100 Nutzer acht H200 NVL.
Das sind unsere Schätzungen für den Betrieb von Llama 4 On-Premise mit Gesprächen von je 32.768 Token, die zur selben Zeit laufen, auf Grundlage der Repositories auf Hugging Face, abgerufen am 9. Oktober 2026. Sie stimmen mit der kurzen Tabelle in unserer Übersicht der LLM-Hardware-Anforderungen je Modell überein.
Llama 4 Scout und Maverick: Experten, Attention und Kontext
Stand 9. Oktober 2026 führt Metas Organisation auf Hugging Face kein Llama-Sprachmodell, das neuer ist als Llama 4 Scout und Maverick, die beide am 5. April 2025 erschienen sind; die späteren Einträge sind die Sicherheitsmodelle Llama Guard 4 und Llama Prompt Guard 2. Metas Ankündigung hielt fest, dass Llama 4 Behemoth „sich noch im Training befindet“, und veröffentlichte Gewichte dafür haben wir nicht gefunden.
Beide Modelle sind Mixture-of-Experts-Modelle mit 17B aktiven Parametern. Scout hat 16 Experten und insgesamt 109B Parameter, Maverick 128 Experten und 400B, wobei die Transformers-Dokumentation und der Eintrag auf Hugging Face das größere Modell mit 402B angeben. Bei Maverick geht laut Metas Ankündigung jedes Token an einen gemeinsamen Experten (Shared Expert) und an einen der 128 gerouteten Experten. Die GPUs halten deshalb alle 400B Parameter, während jedes erzeugte Token die Gewichte von etwa 17B liest.
Meta nennt das Attention-Design iRoPE, wobei das „i“ für verschränkte (interleaved) Attention-Layer steht. Der Launch-Beitrag von vLLM beschreibt das Muster: „Llama 4 verschränkt globale Attention (ohne RoPE) mit Chunked Local Attention (mit RoPE) im Verhältnis 1:3.“ Die Transformers-Konfiguration setzt den Chunk standardmäßig auf 8.192 Token. Die Model Cards nennen einen Kontext von 10M Token für Scout und 1M für Maverick, und laut Metas Ankündigung wurde Scout „sowohl im Pre-Training als auch im Post-Training mit einer Kontextlänge von 256K trainiert“.
Llama-4-Checkpoints: Dateigrößen in BF16, FP8 und NVFP4
| CHECKPOINT | VERÖFFENTLICHT VON | FORMAT | GRÖSSE | NATIV AUF |
|---|---|---|---|---|
| Scout Instruct | Meta | BF16 | 217,3 GB | allen drei |
| Scout Instruct FP8 | NVIDIA | FP8 | 111,6 GB | allen drei |
| Scout Instruct NVFP4 | NVIDIA | NVFP4 | 65,3 GB | RTX PRO 6000, Spark |
| Maverick Instruct | Meta | BF16 | 803,2 GB | allen drei |
| Maverick Instruct FP8 | Meta | FP8 | 416,8 GB | allen drei |
| Maverick Instruct FP8 | NVIDIA | FP8 | 404,5 GB | allen drei |
Summen der safetensors-Dateien in jedem Hugging-Face-Repository (meta-llama und nvidia), abgerufen am 9. Oktober 2026; Formate aus den Model Cards und dem Scout-Rezept von vLLM; „Nativ auf“ folgt NVIDIAs Spezifikationen für die H200 NVL, die RTX PRO 6000 und den DGX Spark. Einen NVFP4-Checkpoint von Maverick haben wir weder von Meta noch von NVIDIA gefunden.
Meta hat Scout nur in BF16 veröffentlicht, und seine Model Card gibt an, dass es „mit Int4-Quantisierung zur Laufzeit auf eine einzelne H100-GPU passen kann“. Wie viel Speicher eine Quantisierung beim Laden kostet, hängt von der Engine ab. NVIDIAs NIM-Dokumentation für Vision Language Models, Version 1.5.0, zuletzt aktualisiert am 19. Dezember 2025, gibt an, dass ihr FP8-Profil für Scout „denselben Speicher wie BF16“ braucht, weil die Quantisierung zur Laufzeit erfolgt. NVIDIAs Card zur NVFP4-Version gibt an, dass diese Plattenplatz und GPU-Speicher „um etwa das 3,3-Fache“ reduziert.
Die H200 NVL rechnet FP8, hat aber keine FP4-Arithmetik, und das Scout-Rezept von vLLM nennt für Hopper nur den FP8-Checkpoint. Die RTX PRO 6000 und der DGX Spark sind Blackwell-Systeme, die FP4 direkt rechnen, wie unser Leitfaden zu FP8, NVFP4 und MXFP4 erklärt. Das Startskript des Rezepts wählt den FP4-Checkpoint nur auf GPUs mit Compute Capability 10.0, und NVIDIA führt die RTX PRO 6000 mit 12.0 und den DGX Spark mit 12.1. Prüfen Sie, ob Ihr vLLM-Release Mixture-of-Experts-Layer in NVFP4 auf diesen Systemen ausführt, oder dimensionieren Sie für den FP8-Checkpoint.
KV-Cache je Gespräch bei Llama 4
Unsere Schätzungen nehmen 90 Prozent des vom Treiber gemeldeten Speichers, abzüglich 3 GiB je Karte, für Gewichte und Cache: 83,0 GiB je RTX PRO 6000 und 123,4 GiB je H200 NVL. Für einen DGX Spark (128 GB) setzen wir 102 GB an. Die Methode beschreibt unser Leitfaden dazu, wie viel VRAM ein LLM braucht.
Der Cache je Token beträgt 2 × Layer × KV-Heads × Head-Dimension × Bytes je Wert. Die Konfigurationsdateien in den Llama-4-Repositories sind zugangsbeschränkt (gated), deshalb verwenden wir die Standardwerte von Transformers, die die Dokumentation als ähnlich zu Scout beschreibt: 48 Layer, 8 KV-Heads und eine Head-Dimension von 128. Mit dem FP8-Cache, den das Rezept von vLLM setzt, sind das 96 KiB je Token, 3 GiB je Gespräch mit 32.768 Token und 6 GiB in 16 Bit. Für Maverick nehmen wir dasselbe Layout an, wie in unserer Übersicht. Über mehrere Karten wird der Speicher für den Cache zusammengefasst, denn laut dem vLLM-Blog vom 7. August 2026 gilt für Grouped-Query Attention: „TP teilt den KV-Cache zuerst nach diesen Heads auf“, und Tensor-Parallelismus mit 2, 4 oder 8 teilt die 8 KV-Heads gleichmäßig, während Pipeline-Parallelismus die Layer aufteilt. Kopien mit datenparalleler Attention werden nicht zusammengefasst, prüfen Sie deshalb die Zeile „GPU KV cache size“, die vLLM beim Start protokolliert.
Diese Werte zählen alle 48 Layer mit voller Länge, obwohl drei von vier Layern Attention nur innerhalb von Chunks mit 8.192 Token berechnen. Die Designnotizen von vLLM führen Llama 4 als „3 local : 1 full“, sagen aber nicht, wie viele Token die lokalen Layer halten; betrachten Sie unsere Werte deshalb als Obergrenze. Ein Gespräch mit 1M Token (1.048.576) braucht nach dieser Methode 96 GiB FP8-Cache, mehr als die 83,0 GiB, die eine RTX PRO 6000 nach unserer Regel für Gewichte und Cache bietet.
GPUs für 1, 20 und 100 Nutzer
| VARIANTE, FORMAT | EIN DGX SPARK | RTX PRO 6000 | H200 NVL |
|---|---|---|---|
| Scout, NVFP4 | ja / nein / nein | 1 / 2 / 8 | FP8 nutzen |
| Scout, FP8 | nein / nein / nein | 2 / 2 / 8 | 1 / 2 / 4 |
| Scout, BF16 | nein / nein / nein | 4 / 4 / 8 | 2 / 4 / 8 |
| Maverick, FP8 (Meta) | nein / nein / nein | 8 / 8 / über 8 | 4 / 4 / 8 |
| Maverick, BF16 | nein / nein / nein | über 8 | 8 / 8 / über 8 |
Unsere Schätzungen, keine Messungen: Kartenzahl für 1, 20 und 100 gleichzeitige Gespräche mit je 32.768 Token bei FP8-KV-Cache, in Konfigurationen mit 1, 2, 4 oder 8 Karten; beim DGX Spark zeigt die Tabelle nur, ob der Speicher reicht. Gewichte aus den Repository-Größen oben; Cache-Layout aus den Transformers-Standardwerten für Scout.
Bei den meisten dieser Stufen bestimmt der Cache die Kartenzahl, weil die Gewichte auf weniger Karten passen. Scout in FP8 lässt auf einer H200 NVL etwa 19 GiB frei, Platz für sechs Gespräche, während zwei Karten 47 fassen. Auf zwei RTX PRO 6000 lässt derselbe Checkpoint 62,2 GiB, genug für 20 Gespräche ohne Reserve, und der NVFP4-Checkpoint lässt Platz für 35. Eine RTX PRO 6000 fasst mit NVFP4-Gewichten sieben Gespräche und ein Spark etwa 11, deshalb bedienen zwei separate Kopien auf zwei Karten 14, weniger als eine über beide Karten aufgeteilte Kopie.
Bei 100 Nutzern braucht Scout in FP8 acht RTX PRO 6000, weil vier davon 76 Gespräche fassen, während vier H200 NVL 129 fassen. Maverick in Metas FP8-Version lässt auf acht RTX PRO 6000 Platz für 92 Gespräche und NVIDIAs Version mit 404,5 GB für 95, beide unter 100. Bei 8.192 Token je Gespräch beträgt der Cache ein Viertel dieser Werte, sodass dieselben Karten etwa viermal so viele Nutzer fassen.
Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Nennen Sie uns die Llama-4-Variante, Ihre Kontextlänge und die Spitzenzahl laufender Gespräche über das Formular unten.
Llama 4 mit vLLM bereitstellen: Einstellungen aus dem Rezept
Das „Quick Start Recipe for Llama 4 Scout on vLLM“ von vLLM, aktualisiert am 24. September 2026, stellt NVIDIAs Checkpoint mit --tensor-parallel-size 1 in vLLM v0.12.0 bereit und rät für maximalen Durchsatz: „TP für das FP4-Modell auf 1 und für das FP8-Modell auf 2 setzen.“ Seine Konfigurationsdateien für Blackwell und Hopper setzen beide kv-cache-dtype: fp8, max-num-batched-tokens: 8192, async-scheduling: true und no-enable-prefix-caching: true. Das Rezept merkt an, dass die Batchgröße „durch die Menge an GPU-Speicher begrenzt ist, die nach dem Laden der Gewichte für den KV-Cache verfügbar ist“.
Setzen Sie den maximalen Kontext selbst, zum Beispiel mit --max-model-len 32768, denn laut Rezept ist das Maximum des Modells voreingestellt, und die Card von Scout nennt 10M Token. Ein kleineres Limit lässt vLLM auf weniger Karten starten. Auch Bilder zählen als Eingabe. Der Launch-Beitrag von vLLM vom April 2025 erhöht das Limit je Anfrage mit --limit-mm-per-prompt image=10, wobei ein Bild voreingestellt ist, und neuere Releases erwarten möglicherweise eine andere Syntax. Sein Befehl für Scout mit langem Kontext schaltet attn_temperature_tuning ein.
NVIDIAs NIM-Dokumentation für Vision Language Models, Version 1.5.0, hält für das NIM-Release 1.4.0 fest, dass „Llama 4 Maverick 17B 128E Instruct nur auf einem Knoten mit acht GPUs eines der folgenden Typen unterstützt wird“, und führt darunter die H200 NVL; die Aufteilung auf vier Karten weiter unten gilt also für vLLM, nicht für dieses NIM. NIM in Produktion braucht eine Lizenz für NVIDIA AI Enterprise, und jede H200 NVL bringt ein fünfjähriges Abonnement mit, wie unser Leitfaden zur H200 NVL festhält.
Llama 4 Maverick auf vier oder acht Karten: NVLink und PCIe
Vier H200 NVL, die eine Vierfach-NVLink-Brücke verbindet, bilden eine Domäne mit 564 GB, und Maverick in Metas FP8-Version lässt davon etwa 105 GiB für den Cache, Platz für 35 Gespräche mit 32K. Für 100 Nutzer bilden acht Karten zwei NVLink-Domänen zu je vier, die über PCIe verbunden sind, wie unser Leitfaden dazu, wie viele H200 NVL große Modelle brauchen erklärt. Eine verbreitete Aufteilung ist Tensor-Parallelismus innerhalb jeder Domäne und Pipeline-Parallelismus zwischen beiden, was Platz für etwa 199 Gespräche lässt.
Acht RTX PRO 6000 fassen 768 GB, haben aber kein NVLink, sodass jede Aufteilung über PCIe 5.0 läuft. vLLM empfiehlt für GPUs ohne NVLink Pipeline-Parallelismus, und für ein Mixture-of-Experts-Modell wie Maverick ist Experten-Parallelismus eine weitere Option. Unser Artikel über ein Modell auf mehreren GPUs über PCIe und NVLink vergleicht die drei Verfahren. Acht Karten der Server Edition mit bis zu 600 W je Karte ziehen bis zu 4,8 kW, ohne Prozessoren und Lüfter.
Wir bauen Server mit vier oder acht H200 NVL und ihren NVLink-Brücken und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Nennen Sie uns den Rack-Standort, seine Stromversorgung und die Zahl der Nutzer, die Maverick bedienen soll.
Lizenzbedingungen von Llama 4 und die EU-Klausel
Beide Modelle stehen unter dem Llama 4 Community License Agreement, dessen Seite als Datum „Llama 4 Version Effective Date: April 5, 2025“ angibt. Sein Abschnitt 2 beginnt im englischen Original sinngemäß so: Hatten die Produkte oder Dienste, die vom Lizenznehmer oder für ihn oder von seinen verbundenen Unternehmen bereitgestellt werden, am Veröffentlichungsdatum der Llama-4-Version im vorangegangenen Kalendermonat mehr als 700 Millionen monatlich aktive Nutzer, muss der Lizenznehmer bei Meta eine Lizenz beantragen, die Meta nach eigenem Ermessen erteilen kann. Wer die Modelle oder ein Produkt oder einen Dienst, der sie enthält, weitergibt oder zugänglich macht, muss eine Kopie der Vereinbarung beifügen und gut sichtbar „Built with Llama“ anzeigen. Ein KI-Modell, das mit den Modellen oder ihren Ausgaben erstellt oder verbessert und weitergegeben oder zugänglich gemacht wird, muss „Llama“ am Anfang seines Namens tragen.
Abschnitt 1.b.iv macht die Llama 4 Acceptable Use Policy zum Bestandteil der Lizenz. Diese Nutzungsrichtlinie hält im englischen Original fest, dass für alle in Llama 4 enthaltenen multimodalen Modelle die Rechte nach Abschnitt 1(a) des Llama 4 Community License Agreement natürlichen Personen mit Wohnsitz in der Europäischen Union und Unternehmen mit Hauptgeschäftssitz in der Europäischen Union nicht gewährt werden. Der englische Richtlinientext fährt fort, hier übersetzt: „Diese Einschränkung gilt nicht für Endnutzer eines Produkts oder Dienstes, das solche multimodalen Modelle integriert.“ Metas Model Card bezeichnet die Llama-4-Modelle als „nativ multimodale KI-Modelle“. Die Cards von NVIDIAs FP8- und NVFP4-Checkpoints geben an, dass ihre Nutzung der NVIDIA Open Model License unterliegt, und nennen zusätzlich das Llama 4 Community License Agreement. Ob eine Klausel Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.
Was wir liefern
Wir liefern die DGX Spark Founders Edition, die RTX PRO 6000 als Workstation, Max-Q und Server Edition sowie die H200 NVL mit ihren Zweifach- und Vierfach-NVLink-Brücken. Sie kommen als Karten oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Konfiguration und Angebot erhalten Sie innerhalb eines Werktages, ausgelegt auf die Llama-4-Variante, die Kontextlänge und die Nutzerzahl, die Sie uns nennen, und wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Die Bereitstellung des Modells, RAG und MLOps auf der Hardware sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Welche Hardware braucht Llama 4?
Wie viel VRAM braucht Llama 4 Scout?
Wie viel VRAM braucht Llama 4 Maverick?
Kann ich Llama 4 lokal auf einer GPU betreiben?
Welche GPU brauche ich für Llama 4 Scout?
Können Unternehmen in der EU Llama 4 nutzen?
Schicken Sie uns die Llama-4-Variante, das Checkpoint-Format, die Kontextlänge und die Zahl der Gespräche, die gleichzeitig laufen müssen. Wir antworten innerhalb eines Werktages mit Konfiguration und Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages