BLOG · GUIDE ·

Gemma-Hardware-Anforderungen: VRAM und GPUs für Gemma 4 von E2B bis 31B On-Premise

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Jede Größe von Gemma 4 läuft für einen Nutzer auf einer GPU, die wir liefern: E2B und E4B auf einer RTX PRO 4000 oder L4 mit 24 GB in BF16, das 12B auf 24 GB in Googles 4-Bit-QAT-Version und das 26B A4B und das 31B auf einer RTX PRO 6000, einer H200 NVL oder einem DGX Spark in BF16
  • Das 31B hält nach unserer Zählung einen KV-Cache in 16 Bit von bis zu etwa 3,3 GiB je Gespräch mit 32.768 Token, das Vierfache des 12B oder des 26B A4B, weil seine 10 Layer mit voller Attention vier KV-Heads der Dimension 512 haben
  • Fünfzig der 60 Layer des 31B arbeiten mit einem Sliding Window von 1.024 Token und halten deshalb je Gespräch feste 0,78 GiB; ein Gespräch mit 256K belegt insgesamt etwa 20,8 GiB
  • Für 20 Gespräche mit 32K bedient eine RTX PRO 6000 jede Größe außer dem 31B, das zwei braucht; 100 Gespräche mit dem 31B brauchen nach unserer Schätzung vier H200 NVL oder je nach Format sechs bis acht RTX PRO 6000
  • Gemma 4 ist unter Apache 2.0 veröffentlicht, während Gemma 3, Gemma 3n und die übrigen Modelle im Anhang der Gemma Terms of Use unter diesen Bedingungen und ihrer Prohibited Use Policy bleiben

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Gemma-Hardware-Anforderungen im Überblick

Gemma 4, Stand Oktober 2026 Googles aktuelle offene Modellfamilie, gibt es in fünf Größen, und jede davon läuft für einen Nutzer auf einer GPU, die wir liefern. Gemma 4 E2B und E4B passen in BF16 auf eine RTX PRO 4000 oder L4 mit 24 GB. Das 12B braucht in BF16 eine Karte mit 32 GB, in Googles 4-Bit-QAT-Version 24 GB. Das 26B A4B und das 31B passen in BF16 auf eine RTX PRO 6000, eine H200 NVL oder einen DGX Spark.

Für 20 gleichzeitige Gespräche mit 32.768 Token bedient eine RTX PRO 6000 jede Größe außer dem 31B, das eine zweite Karte braucht. Für 100 Gespräche braucht das 31B vier H200 NVL oder je nach Format sechs bis acht RTX PRO 6000. Unsere Schätzungen beruhen auf Googles Dateien auf Hugging Face, abgerufen am 9. Oktober 2026, und auf der Regel aus unserem Leitfaden dazu, wie viel VRAM ein LLM braucht: 90 Prozent des vom Treiber gemeldeten Speichers, abzüglich 3 GiB je Karte. Unser Artikel zu LLM-Hardware-Anforderungen je Modell vergleicht andere Modellfamilien auf derselben Grundlage.

Gemma-4-Größen, Checkpoints und Kontext im Oktober 2026

MODELLPARAMETERGOOGLE-CHECKPOINTSKONTEXTEINGABEN
Gemma 4 E2B5,1B mit Embeddings, 2,3B effektivBF16, 10,2 GB128KText, Bild, Audio, Video
Gemma 4 E4B8B mit Embeddings, 4,5B effektivBF16, 16 GB128KText, Bild, Audio, Video
Gemma 4 12B11,95B, dichtBF16 23,9 GB; QAT W4A16 10,3 GB256KText, Bild, Audio, Video
Gemma 4 26B A4B25,2B MoE, 3,8B aktivBF16, 51,6 GB256KText, Bild, Video
Gemma 4 31B30,7B, dichtBF16 62,6 GB; QAT W4A16 23,3 GB256KText, Bild, Video

Model Card von Gemma 4 31B, Dateilisten und config.json-Dateien auf huggingface.co/google, abgerufen am 9. Oktober 2026. Video wird als Einzelbilder gelesen.

Googles Release Notes führen Gemma 4 in den Größen E2B, E4B, 31B und 26B A4B am 31. März 2026 und das 12B Unified am 3. Juni 2026. Das „E“ steht für effektive Parameter; die Checkpoints enthalten zusätzlich die Per-Layer Embeddings. Das 26B A4B hat 128 Experten, von denen je Token acht aktiv sind, plus einen gemeinsamen Experten (Shared Expert).

Google veröffentlicht mit Quantisierung trainierte Versionen (Quantisation-Aware Training, QAT) als W4A16-Checkpoints, also 4-Bit-Gewichte mit 16-Bit-Aktivierungen, die die Cards als gemacht „für native, optimierte Inferenz mit vLLM“ beschreiben, und als Q4_0-GGUF-Dateien. FP8-Versionen kommen von Red Hat, NVFP4-Versionen von NVIDIA und Red Hat. Red Hats FP8-Checkpoints haben 33,3 GB beim 31B und 28,6 GB beim 26B A4B, NVIDIAs NVFP4-Checkpoints 32,6 GB und 18,8 GB. Die RTX-PRO-Karten und der DGX Spark rechnen FP4 direkt; die H200 NVL, die L4 und die L40S tun das nicht.

Googles eigene Speichertabelle, zuletzt aktualisiert am 8. Juli 2026, setzt das 31B in BF16 zum Laden mit 69,9 GB an, mit 20 Prozent Overhead, und merkt an, dass die Werte „den zusätzlichen VRAM für unterstützende Software oder das Kontextfenster nicht enthalten“.

KV-Cache je Gespräch mit Sliding-Window-Layern

Der Cache je Token ergibt sich aus der config.json: 2 × Layer × KV-Heads × Head-Dimension × Bytes pro Wert, gezählt nur für die Layer, die den ganzen Kontext halten. Laut Model Card „wechselt“ Gemma 4 „lokale Sliding-Window-Attention mit voller globaler Attention ab, wobei der letzte Layer immer global ist“. Sliding-Window-Layer halten nur die letzten 1.024 Token (512 bei E2B und E4B), eine feste Menge je Gespräch.

Das 31B führt 60 Layer, davon 10 mit voller Attention und vier KV-Heads der Dimension 512. Das ergibt 80 KiB je Token in 16 Bit. Seine 50 Sliding-Window-Layer haben 16 KV-Heads der Dimension 256 und halten 0,78 GiB je Gespräch. Ein Gespräch mit 32K belegt deshalb etwa 3,3 GiB, eines mit 256K etwa 20,8 GiB.

Das 12B hat 8 volle Layer mit einem KV-Head, das 26B A4B 5 mit zwei. Beide kommen auf etwa 0,8 GiB je Gespräch mit 32K, ein Viertel des Werts beim 31B. Bei E2B und E4B markiert die Konfiguration 20 von 35 und 18 von 42 Layern als KV-shared, und das Gemma-4-Rezept von LMCache hält fest, dass es „nur die Layer speichert, die einen Cache besitzen“. Wir zählen die 15 und 24 Layer mit eigenem Cache, davon drei und vier mit voller Attention.

Das 12B, das 26B A4B und das 31B setzen außerdem attention_k_eq_v auf true; laut der Transformers-Dokumentation bedeutet diese Einstellung, dass „die Ausgabe der Key-Projektion als Value-Projektion wiederverwendet wird“. Wir haben kein vLLM-Dokument gefunden, nach dem die Engine dann einen Tensor statt zwei speichert, deshalb zählen wir beide, und unsere Cache-Werte für diese drei Modelle sind Obergrenzen. Mit einem Tensor belegt ein Gespräch mit 32K beim 31B etwa 2,0 GiB.

Welche Karte welche Gemma-Größe fasst

MODELL, FORMATCACHE JE 32KKARTE MIT 24 GBKARTE MIT 32 GBKARTE MIT 48 GB
E2B, BF160,19 GiB4784158
E4B, BF160,52 GiB72048
12B, BF160,81 GiBpasst nicht422
12B, QAT W4A160,81 GiB111937
26B A4B, FP80,82 GiBpasst nichtpasst nicht16
26B A4B, NVFP40,82 GiB11027
31B, QAT W4A163,28 GiBpasst nicht15
31B, FP83,28 GiBpasst nichtpasst nicht2

Unsere Schätzungen, keine Messungen: Gespräche mit 32.768 Token, die mit einem Cache in 16 Bit auf eine Karte passen, Keys und Values in jedem Layer gezählt, ausgehend vom Nennspeicher dieser Karten; die Zahlen sind also Obergrenzen. 24 GB steht für die RTX PRO 4000 oder L4, 32 GB für die RTX PRO 4500, 48 GB für die RTX PRO 5000 mit 48 GB oder die L40S; die NVFP4-Zeile gilt nur für die RTX-PRO-Karten. Gewichte aus den Dateilisten auf Hugging Face, 9. Oktober 2026.

Eine Karte mit 24 GB lässt nach unserer Regel 18,6 GiB für Gewichte und Cache. Das reicht für E2B und E4B in BF16 und für das 12B in seiner QAT-Version mit 11 Gesprächen bei 32K. Die RTX PRO 5000 mit 72 GB fasst das 31B in FP8 mit neun Gesprächen und das 26B A4B in FP8 mit 42. Unser Vergleich von RTX PRO 6000, 5000 und 4500 behandelt diese Karten über den Speicher hinaus.

Die L4 und die L40S sind Ada-Lovelace-Karten mit FP8, aber ohne FP4. Die Gemma-4-Rezepte von vLLM nennen für die FP8-Checkpoints Hopper und Blackwell; prüfen Sie FP8 auf einer Ada-Karte deshalb zuerst mit Ihrer Engine-Version. Unser Vergleich von L4 und L40S für Inferenz behandelt beide Karten.

Wir liefern jede Karte aus dieser Tabelle, als Karte oder in nach Auftrag gebauten Servern. Nennen Sie uns die Gemma-Größe, die Sie betreiben wollen, ihr Format und die Nutzer in der Spitze, und wir antworten innerhalb eines Werktages mit Konfiguration und Angebot.

GPUs für 1, 20 und 100 Nutzer je Gemma-Größe

MODELL, FORMATEIN DGX SPARKRTX PRO 6000H200 NVL
E4B, BF16ja / ja / ja1 / 1 / 11 / 1 / 1
12B, BF16ja / ja / nein1 / 1 / 21 / 1 / 1
26B A4B, BF16ja / ja / nein1 / 1 / 21 / 1 / 2
26B A4B, FP8ja / ja / nein1 / 1 / 21 / 1 / 1
31B, BF16ja / nein / nein1 / 2 / 81 / 2 / 4
31B, FP8ja / nein / nein1 / 2 / 61 / 1 / 4
31B, QAT W4A16ja / ja / nein1 / 2 / 61 / 1 / 4

Unsere Schätzungen, keine Messungen: Karten für 1, 20 und 100 gleichzeitige Gespräche mit 32.768 Token und einem Cache in 16 Bit, als identische Kopien des Modells auf je einer, zwei oder vier Karten; beim DGX Spark zeigt die Tabelle nur, ob der Speicher reicht, ausgehend von einem Arbeitsbudget von 102 GB. E2B passt für alle drei Lasten auf eine Karte oder einen Spark.

Die Werte in einer Zelle unterscheiden sich dort, wo der Cache die Grenze setzt. Das 31B in BF16 lässt auf einer RTX PRO 6000 24,7 GiB, Platz für sieben Gespräche mit 32K. In FP8 lässt es 52 GiB, Platz für 15, und eine H200 NVL fasst 28. Ein DGX Spark fasst das 31B in FP8 mit 19 Gesprächen, eines weniger als die 20 der Tabelle, und seine QAT-Version mit 22. Laut Model Card „läuft“ das 26B A4B „fast so schnell wie ein Modell mit 4B Parametern“, braucht aber Speicher für alle 25,2B Parameter.

Ein volles Gespräch des 31B mit 256K, etwa 20,8 GiB Cache, passt in BF16 auf eine RTX PRO 6000 oder einen DGX Spark, und eine H200 NVL fasst drei. Das 31B-Rezept von vLLM hält fest, dass ein FP8-Cache, --kv-cache-dtype fp8, „rund 50 % KV-Speicher spart“.

Gemma 4 31B und 26B A4B auf mehreren GPUs

Das vLLM-Rezept für das 31B, aktualisiert am 11. Mai 2026, betreibt es auf zwei A100 oder H100 mit --tensor-parallel-size 2 und einem Kontext von 32.768 Token, das 26B A4B auf einer. Das Rezept für das 26B A4B, aktualisiert am 12. September 2026, setzt die Speicherauslastung auf dem DGX Spark mit seinen „128 GB, die mit der CPU geteilt werden“, auf 0,8 und auf der RTX PRO 6000 auf 0,92. Das entspricht unseren 102 GB für einen Spark.

Tensor-Parallelismus teilt die KV-Heads auf die Karten auf. Das 31B hat in seinen vollen Layern vier KV-Heads, das 26B A4B zwei und das 12B einen; jenseits dieser Kartenzahl wird der Cache der vollen Layer deshalb dupliziert statt weiter aufgeteilt, und beim 12B hält jede Karte ihn vollständig. Für 100 Nutzer des 31B nutzen identische Kopien auf je einer, zwei oder vier Karten den Speicher daher besser als eine Kopie über acht Karten. Die RTX PRO 6000 hat kein NVLink, eine Aufteilung auf zwei Karten läuft also über PCIe, wie unser Leitfaden zu einem Modell auf mehreren GPUs erklärt. Für das 26B A4B hält das Rezept fest, dass „die Strategien TEP (Tensor-Expert-Parallelismus) und DEP (Data-Expert-Parallelismus) bei großen Knotenzahlen besser skalieren als reines TP“.

Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Nennen Sie uns die Gemma-Größe, Ihre Kontextlänge und die Spitzenzahl laufender Anfragen über das Formular unten, und wir antworten mit Konfiguration und Angebot.

vLLM-Einstellungen und -Versionen für Gemma 4

Der Rezeptindex von vLLM nennt vLLM 0.19.1 als Mindestversion für E2B, E4B und das 31B, 0.23.0 für das 12B und 0.25.0 für das 26B A4B. Das Rezept für das 12B, aktualisiert am 4. Juni 2026, gibt an, dass der Kontext aus der config.json auf 131.072 Token festgelegt ist, während die von uns gelesene config.json 262.144 nennt; prüfen Sie also, welche Grenze Ihre vLLM-Version anwendet.

Google hat am 16. April 2026 Draft-Modelle für Multi-Token Prediction (MTP) veröffentlicht, als „assistant“-Repositories mit 78M bis 0,5B Parametern. Das 31B-Rezept von vLLM vom 11. Mai 2026 hält fest, dass „MTP-Speculative-Decoding für Gemma 4 nur im Nightly-Build von vLLM verfügbar ist“, und LMCache merkt an: „Die Draft-Layer haben ihren eigenen KV-Cache“.

Das 31B-Rezept gibt für NVIDIAs NVFP4-Version „Blackwell (B200/B300)“ als Voraussetzung an, während das Rezept für das 26B A4B NVIDIAs NVFP4-Version als validiert auf Blackwell-Systemen mit einer GPU führt, darunter der DGX Spark und die RTX PRO 6000. Für das 31B ist Googles QAT-W4A16-Checkpoint kleiner.

Gemma 3 27B und frühere Gemma-Modelle

Gemma 3 27B, die vorherige Generation, hat in BF16 54,8 GB und passt auf eine RTX PRO 6000, eine H200 NVL, einen DGX Spark oder eine RTX PRO 5000 mit 72 GB, aber nicht auf eine Karte mit 48 GB. Googles QAT-Version in Q4_0-GGUF hat 17,2 GB plus einen Vision-Projektor mit 858 MB. Sein Repository ist zugangsbeschränkt (gated), deshalb haben wir seine config.json nicht gelesen und nennen hier keinen Cache-Wert.

Gemma-Lizenz: Apache 2.0 und die Gemma Terms of Use

Die Model Cards von Gemma 4 nennen Apache 2.0, und Googles Entwicklerseite verlinkt ihre Seite zu Apache 2.0 als „Gemma 4 license“. Die Gemma Terms of Use, zuletzt geändert am 1. April 2026, halten fest, hier übersetzt: „Zu den Bedingungen für Gemma 4 siehe die Gemma-4-Lizenz.“ Sie gelten für die Modelle in ihrem Anhang, darunter Gemma 3, Gemma 3n und TranslateGemma. Ihr Abschnitt 3.2 untersagt die Nutzung der Gemma Services für die eingeschränkten Nutzungen in der Gemma Prohibited Use Policy und hält fest, hier übersetzt, dass „Google sich das Recht vorbehält, die Nutzung (aus der Ferne oder anderweitig) einzuschränken“, wenn Google vernünftigerweise annimmt, dass sie gegen die Vereinbarung verstößt. Ob eine Klausel Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Was wir liefern

Wir liefern die RTX PRO 4000, 4500, 5000 und 6000, die L4 und die L40S, die H200 NVL und die DGX Spark Founders Edition, als Karten oder in nach Auftrag gebauten KI-Servern. Wir legen die Karte oder den Server nach der Gemma-Größe, ihrem Format, Ihrem Kontext und Ihren Spitzenanfragen aus und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Alles kommt unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie, und unser Sortiment professioneller GPUs führt jede Karte. Modelle, RAG und MLOps auf der Hardware sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Welche Hardware-Anforderungen hat Gemma 4?
Jede Größe von Gemma 4 läuft für einen Nutzer auf einer GPU: E2B und E4B auf einer Karte mit 24 GB wie der RTX PRO 4000 oder L4, das 12B auf 32 GB in BF16 oder 24 GB in seiner 4-Bit-QAT-Version und das 26B A4B und das 31B auf einer RTX PRO 6000, einer H200 NVL oder einem DGX Spark. Für 20 Gespräche mit 32.768 Token bedient eine RTX PRO 6000 jede Größe außer dem 31B, das zwei braucht. Das sind unsere Schätzungen aus Googles Dateien auf Hugging Face, abgerufen am 9. Oktober 2026.
Wie viel VRAM braucht Gemma 4 31B?
Die Gewichte belegen 62,6 GB in BF16, 33,3 GB in der FP8-Version von Red Hat und 23,3 GB in Googles QAT-W4A16-Version. Jedes Gespräch mit 32.768 Token bringt etwa 3,3 GiB KV-Cache in 16 Bit hinzu, ein volles Gespräch mit 256K etwa 20,8 GiB. Nach unserer Schätzung fasst eine RTX PRO 6000 das BF16-Modell mit sieben Gesprächen bei 32K, eine H200 NVL mit 19.
Wie viel VRAM braucht Gemma 27B?
Gemma 3 27B hat in BF16 54,8 GB, etwa 51 GiB, und passt damit auf eine RTX PRO 6000 mit 96 GB, eine H200 NVL, einen DGX Spark oder eine RTX PRO 5000 mit 72 GB, aber nicht auf eine Karte mit 48 GB. Googles QAT-Version in Q4_0-GGUF hat 17,2 GB plus einen Vision-Projektor mit 858 MB. Der KV-Cache kommt hinzu und hängt vom konfigurierten Kontext ab.
Kann ich Gemma lokal auf einer einzelnen GPU betreiben?
Ja, jede Größe von Gemma 4 passt für einen einzelnen Nutzer auf eine Karte. Eine RTX PRO 4000 oder L4 mit 24 GB fasst E2B und E4B in BF16 und das 12B in seiner QAT-Version, eine RTX PRO 5000 mit 48 GB oder eine L40S fasst das 26B A4B in FP8, und das 31B in BF16 passt auf eine RTX PRO 6000, eine H200 NVL oder einen DGX Spark. Mehr Nutzer brauchen mehr Speicher für den KV-Cache, nicht für die Gewichte.
Läuft Gemma 4 auf einem DGX Spark?
Alle fünf Größen von Gemma 4 passen in BF16 in die 128 GB eines DGX Spark. Mit einem Arbeitsbudget von 102 GB, das der Speicherauslastung von 0,8 im vLLM-Rezept für den Spark entspricht, fasst ein Spark das 26B A4B in BF16 mit 57 Gesprächen mit 32K und das 31B in seiner QAT-Version mit 22. Das 31B in BF16 passt nach unserer Schätzung mit 11 solchen Gesprächen.
Darf man Gemma kommerziell nutzen?
Gemma 4 ist unter Apache 2.0 veröffentlicht, wie seine Model Cards und Googles Entwicklerseite angeben, und diese Lizenz gewährt, hier übersetzt, eine „dauerhafte, weltweite, nicht exklusive, kostenlose“ Urheberrechtslizenz. Gemma 3, Gemma 3n und die übrigen Modelle im Anhang der Gemma Terms of Use bleiben unter diesen Bedingungen, die die Gemma Prohibited Use Policy einbeziehen und Google erlauben, eine Nutzung einzuschränken, von der Google vernünftigerweise annimmt, dass sie gegen die Vereinbarung verstößt. Ob eine Klausel Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Schicken Sie uns die Gemma-Größe und das Format, die Kontextlänge, die Sie konfigurieren werden, die Spitzenzahl gleichzeitiger Anfragen und den Rack-Platz oder die Workstation, in die das System kommt. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für diese Karte oder diesen Server, nachdem wir Rack, Strom und Luftstrom geprüft haben.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien