BLOG · GUIDE ·

Mistral-Hardware-Anforderungen: Mistral Small 4, Devstral, Medium 3.5 und Large 3 On-Premise

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Nach unserer Speicherschätzung läuft Mistral Small 4 (119B, 6,5B aktiv) für einen Nutzer auf einer RTX PRO 6000 oder einem DGX Spark in seiner NVFP4-Version mit 70,8 GB und auf zwei RTX PRO 6000 oder einer H200 NVL in seiner FP8-Version mit 120,9 GB; Mistrals eigene Mindestangabe für den Produktivbetrieb ist größer
  • Ministral 3 14B (15,7 GB) und Devstral Small 2 (25,8 GB) passen auf eine Karte oder einen Spark, aber ihr Cache belegt 5 GiB je Gespräch mit 32K, deshalb brauchen 20 Nutzer nach unserer Schätzung zwei RTX PRO 6000
  • Die dichten 128B-Modelle, Mistral Medium 3.5 und Devstral 2, brauchen 11 GiB Cache in 16 Bit je Gespräch mit 32K: zwei Karten für einen Nutzer, vier H200 NVL oder acht RTX PRO 6000 für 20
  • Mistral Large 3 (675B) braucht für 20 Nutzer mit 32K acht H200 NVL in FP8 (682 GB) oder für einen Nutzer vier H200 NVL in seiner NVFP4-Version mit 403 GB, die das vLLM-Rezept für Kontexte unter 64K Token führt
  • Small 4, Large 3, Ministral 3 und Devstral Small 2 stehen unter Apache 2.0; die modifizierte MIT-Lizenz von Medium 3.5 und Devstral 2 gewährt Unternehmen oberhalb einer monatlichen Umsatzschwelle keine Rechte

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Mistral-Hardware-Anforderungen im Überblick

Mistral Small 4, das offene 119B-Modell von Mistral AI vom März 2026, läuft für einen Nutzer auf einer RTX PRO 6000 oder einem DGX Spark in seiner NVFP4-Version mit 70,8 GB und auf zwei RTX PRO 6000 oder einer H200 NVL in seiner FP8-Version mit 120,9 GB. Ministral 3 14B und Devstral Small 2 passen auf eine Karte, gleich welchen Typs. Die dichten 128B-Modelle, Mistral Medium 3.5 und Devstral 2, brauchen für einen Nutzer zwei Karten und für 20 vier H200 NVL oder acht RTX PRO 6000. Mistral Large 3 mit 675B Parametern braucht acht H200 NVL in FP8 oder vier in seiner NVFP4-Version.

Das sind unsere Speicherschätzungen für Gespräche mit 32.768 Token, auf Basis von Mistrals Dateien auf Hugging Face, abgerufen am 9. Oktober 2026. Mistrals eigene Mindestangaben sind größer, wie unten erläutert. In seiner Datenschutzerklärung bezeichnet sich Mistral AI im englischen Original als „a French company incorporated in Paris“, und ein selbst gehostetes Mistral-Modell läuft auf Hardware unter Ihrer Kontrolle. Unser Vergleich der LLM-Hardware-Anforderungen je Modell stellt Mistral Small 4 anderen Modellfamilien gegenüber.

Mistral-Modelle mit offenen Gewichten im Oktober 2026

MODELLPARAMETERCHECKPOINTKONTEXTLIZENZ
Ministral 3 14B13,5B plus 0,4B VisionFP8, 15,7 GB256KApache 2.0
Devstral Small 224BFP8, 25,8 GB256KApache 2.0
Mistral Small 4119B MoE, 6,5B aktivFP8 120,9 GB; NVFP4 70,8 GB256KApache 2.0
Devstral 2123B, dichtFP8, etwa 128 GB256Kmodifizierte MIT
Mistral Medium 3.5128B, dichtFP8, 133,6 GB256Kmodifizierte MIT
Mistral Large 3675B MoE, 41B aktivFP8 682 GB; NVFP4 403 GB256KApache 2.0

Model Cards und Dateilisten auf huggingface.co/mistralai, abgerufen am 9. Oktober 2026; „dicht“ nach Mistrals Ankündigungsbeiträgen vom 9. Dezember 2025 (Devstral 2) und 22. Mai 2026 (Medium 3.5). Die Größen zählen eine Kopie der Gewichte, da mehrere Repositories dieselben Gewichte doppelt enthalten, als konsolidierte Dateien von Mistral und als Hugging-Face-Dateien.

Mistral Small 4 hat 128 Experten, von denen je Token vier aktiv sind. Seine Card nennt 6,5B aktivierte Parameter, während Mistrals Ankündigungsbeitrag vom 16. März 2026, hier übersetzt, „6B aktive Parameter je Token (8B einschließlich Embedding- und Ausgabe-Layern)“ angibt. Alle sechs Cards nennen Function Calling, und alle außer der Card von Devstral 2 nennen Bildeingabe. Ministral 3 gibt es auch in den Größen 3B und 8B.

Die FP8-Gewichte tragen eine Skalierung je Tensor, außer denen von Mistral Large 3, die Blöcke von 128 × 128 nutzen; die Support-Matrix von TensorRT-LLM führt für die RTX PRO 6000 nur FP8 mit Skalierung je Tensor. Mistral veröffentlicht NVFP4-Versionen nur von Small 4 und Large 3. Die RTX PRO 6000 und der DGX Spark rechnen FP4 direkt, während die H200 NVL FP8 rechnet, aber nicht FP4. Für die A100 und die H100 hält das Mistral-Large-3-Rezept von vLLM (24. September 2026) fest, dass vLLM „auf Marlin FP4 zurückfallen“ kann, mit Speichergewinn, aber ohne Beschleunigung gegenüber FP8, und auch die H200 NVL ist eine Hopper-Karte. Unser Leitfaden zu FP8, NVFP4 und MXFP4 erklärt die Formate.

Mistral kündigte am 6. Oktober 2026 Mistral Large 4 an, mit 1 Billion Parametern, davon 52B aktiv, und schrieb, hier übersetzt: „Wir werden die Gewichte bis Ende des Monats veröffentlichen.“ Format, Größe und Kontext nennt Mistral dafür nicht, deshalb dimensionieren wir es hier nicht. Mistrals Dokumentation führt alle Magistral-Versionen unter „Deprecated & retired models“.

KV-Cache je Gespräch: MLA und Grouped-Query-Attention

Der Cache je Token ergibt sich aus der config.json des jeweiligen Modells, bei Large 3 aus seiner params.json. Mistral Small 4 und Mistral Large 3 nutzen Multi-Head Latent Attention (MLA), die je Layer und Token einen komprimierten Vektor speichert. Small 4 hat 36 Layer mit einem 256 breiten Latent-Anteil und einem 64 breiten Positionsanteil, das sind 22,5 KiB je Token in 16 Bit oder 0,70 GiB je Gespräch mit 32K. Large 3 hat 61 Layer mit 512 plus 64, also 68,6 KiB je Token oder 2,14 GiB je Gespräch.

Die dichten Modelle nutzen Grouped-Query-Attention mit acht KV-Heads der Dimension 128. Ministral 3 14B und Devstral Small 2 haben 40 Layer, was 160 KiB je Token und 5 GiB je Gespräch mit 32K ergibt. Medium 3.5 und Devstral 2 haben 88 Layer, 352 KiB je Token und 11 GiB je Gespräch, etwa das 16-Fache des Caches von Small 4.

Für Grouped-Query-Attention hält der Blogbeitrag von vLLM vom 7. August 2026 fest, dass „TP den KV-Cache zuerst nach diesen Heads aufteilt“, sodass bei zwei Karten jede die Hälfte des Caches hält, bis zu acht Karten für die acht KV-Heads dieser Modelle. Für MLA heißt es dort, dass „der latente KV-Cache vollständig auf jedem TP-Rank repliziert wird“, sodass jede Karte den ganzen Cache hält. Unser Budget folgt der Regel aus unserem Leitfaden dazu, wie viel VRAM ein LLM braucht: 90 Prozent des vom Treiber gemeldeten Speichers, abzüglich 3 GiB je Karte, was 83,0 GiB je RTX PRO 6000 und 123,4 GiB je H200 NVL lässt. Für einen DGX Spark (128 GB) setzen wir 102 GB an, und der Cache ist in 16 Bit gerechnet, wie in vLLM voreingestellt.

GPUs für 1, 20 und 100 Nutzer je Mistral-Modell

MODELL, FORMATEIN DGX SPARKRTX PRO 6000H200 NVL
Ministral 3 14B, FP8ja / nein / nein1 / 2 / 81 / 1 / 8
Devstral Small 2, FP8ja / nein / nein1 / 2 / 81 / 2 / 8
Mistral Small 4, NVFP4ja / ja / nein1 / 1 / 41 / 1 / 2, Weight-only
Mistral Small 4, FP8nein / nein / nein2 / 2 / 81 / 2 / 4
Devstral 2, FP8nein / nein / nein2 / 8 / über 82 / 4 / über 8
Mistral Medium 3.5, FP8nein / nein / nein2 / 8 / über 82 / 4 / über 8
Mistral Large 3, NVFP4nein / nein / nein8 / über 8 / über 84 / 8 / über 8, Weight-only
Mistral Large 3, FP8nein / nein / nein8 / über 8 / über 88 / 8 / über 8

Unsere Schätzungen, keine Messungen: Karten für 1, 20 und 100 gleichzeitige Gespräche mit je 32.768 Token und einem Cache in 16 Bit, in 1, 2, 4 oder 8 Karten mit Tensor-Parallelismus und weiteren Kopien auf weiteren Karten; MLA-Cache vollständig auf jeder Karte, Grouped-Query-Cache aufgeteilt. Jedes Gespräch ist gleichzeitig mit voller Länge gerechnet, eine Obergrenze. Beim DGX Spark zeigt die Tabelle nur, ob der Speicher reicht. Hugging-Face-Dateien abgerufen am 9. Oktober 2026.

Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Nennen Sie uns das Mistral-Modell, sein Format, Ihre Kontextlänge und die Spitzenzahl laufender Anfragen über das Formular unten.

Mistral Small 4 in FP8 und NVFP4

Die FP8-Version lässt auf einer H200 NVL 10,8 GiB, Platz für 15 Gespräche mit 32K, deshalb brauchen 20 Nutzer eine zweite Karte. Zwei RTX PRO 6000 halten je die Hälfte der Gewichte und auf beiden den vollen Cache, mit 26,7 GiB je Karte für 38 Gespräche. Mit dem Wert --gpu_memory_utilization 0.8 aus der Card behält jede etwa 17 GiB, Platz für 24.

Mistrals Ankündigungsbeitrag vom 16. März 2026 nennt als „Minimum infrastructure“ 4x NVIDIA HGX H100, 2x NVIDIA HGX H200 oder 1x NVIDIA DGX B200. Die nächste Zeile empfiehlt 4x HGX H100, 4x HGX H200 oder 2x DGX B200 „for optimal performance“, also für optimale Leistung. Für keine der beiden Angaben nennt Mistral Kontextlänge, Last oder Geschwindigkeit. Unsere Werte rechnen nur den Speicher, ohne Reserve für den Durchsatz unter Last, deshalb ist Mistrals Minimum für produktives Serving der eigene Ausgangspunkt des Herstellers.

Die NVFP4-Version hat 70,8 GB und lässt auf einer RTX PRO 6000 17,1 GiB, Platz für 24 Gespräche mit 32K. Ein DGX Spark fasst sie mit 20 Gesprächen in etwa 80 GiB. Die Speicherbandbreite des Spark liegt bei 273 GB/s, gegenüber 1.597 GB/s bei der RTX PRO 6000 Server Edition, deshalb begrenzt auf einem Spark die Geschwindigkeit ein Team früher als der Speicher.

Für 100 Nutzer des FP8-Modells auf RTX PRO 6000 rechnet die Tabelle mit vier Kopien auf je zwei Karten, denn größere Aufteilungen halten den vollen Cache auf jeder Karte und bleiben unter 100. Der Leitfaden von vLLM zum datenparallelen Deployment sagt, dass es für MoE-Modelle mit MLA „vorteilhaft sein kann, für die Attention-Layer Datenparallelismus zu nutzen“, sodass jede Karte nur den Cache ihrer eigenen Gespräche hält. Vier RTX PRO 6000 würden dann nach unserer Schätzung 100 fassen, aber wir haben kein Dokument gefunden, das dieses Layout mit Small 4 testet.

Devstral 2 und Mistral Medium 3.5: zwei dichte 128B-Modelle

Keines der beiden passt auf einen DGX Spark oder, mit einem Gespräch mit 32K, auf eine H200 NVL. Zwei RTX PRO 6000 fassen jedes davon mit Platz für drei bis vier Gespräche mit 32K, zwei H200 NVL mit Platz für 11. Zwanzig Nutzer brauchen vier H200 NVL (33 Gespräche) oder acht RTX PRO 6000 (49), da vier RTX PRO 6000 nur 18 oder 19 fassen. Mistral schrieb, hier übersetzt, am 9. Dezember 2025, dass Devstral 2 „für das Deployment mindestens 4 GPUs der H100-Klasse benötigt“, und am 22. Mai 2026, dass Self-Hosting bei Medium 3.5 „auf nur vier GPUs möglich“ ist. Keine der beiden Aussagen nennt Kontext oder Last, während unser Wert von zwei Karten nur den Speicher rechnet; planen Sie produktives Serving deshalb mit mindestens vier GPUs.

Ein FP8-Cache, in vLLM gesetzt mit --kv-cache-dtype fp8, halbiert die 11 GiB je Gespräch. Nach unserer Schätzung fassen acht H200 NVL dann 100 Gespräche mit 32K, während acht RTX PRO 6000 knapp unter 100 bleiben. Ein dichtes Modell liest für jedes erzeugte Token alle seine Gewichte, deshalb setzen die 4,8 TB/s der H200 NVL eine höhere Obergrenze je Nutzer als die RTX PRO 6000. Unser Leitfaden zu GPUs für einen privaten Coding-Assistenten dimensioniert Devstral Small 2 für Entwicklerteams.

Mistral Large 3 auf vier oder acht H200 NVL

Das vLLM-Rezept hält fest, dass „das FP8-Format von Mistral-Large-3-Instruct auf einem 8xH200-Knoten genutzt werden kann“. Der FP8-Checkpoint mit 682 GB lässt auf acht H200 NVL 44,0 GiB je Karte, genug für 20 Gespräche mit 32K. Acht H200 NVL bilden zwei über PCIe verbundene NVLink-Domänen zu je vier Karten, wie unser Leitfaden dazu, wie viele H200 NVL große Modelle brauchen erklärt. Acht RTX PRO 6000 fassen die FP8-Gewichte mit 3,6 GiB Reserve je Karte, genug für ein Gespräch mit 32K, und brauchen eine Engine, die blockskaliertes FP8 auf dieser Karte ausführt.

Die NVFP4-Version hat 403 GB. Vier H200 NVL fassen sie Weight-only mit Platz für 13 Gespräche mit 32K, und acht RTX PRO 6000 berechnen sie nativ mit Platz für 16. Das vLLM-Rezept führt sie „für < 64k Kontextlänge“ und verweist darüber hinaus auf FP8. Mistrals Card vermerkt einen Leistungsabfall oberhalb von 64K, und ein Update darauf vom 9. September 2026 sagt, die neu kalibrierten Gewichte „sollten zu einer ähnlichen Long-Context-Leistung wie beim ursprünglichen Mistral-Large-3 führen“. Testen Sie die NVFP4-Version mit Ihrer eigenen Kontextlänge, bevor Sie darauf dimensionieren.

Wir bauen Server mit vier oder acht H200 NVL und ihren NVLink-Brücken und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie das Modell, Ihren Rack-Standort und seine Stromversorgung im Formular unten.

vLLM-Einstellungen in Mistrals Model Cards

Die vLLM-Befehle der Cards setzen --tensor-parallel-size 2 für Small 4 und Devstral Small 2 und 8 für Medium 3.5, Devstral 2 und Large 3 in FP8. Die Cards von Small 4 und Devstral Small 2 setzen --max-model-len 262144, und die vLLM-Rezepte merken an, dass ein niedrigerer Wert Speicher spart. Die Card von Small 4 wählt ein MLA-Attention-Backend, FLASH_ATTN_MLA für FP8 und TRITON_MLA für NVFP4. Die RTX PRO 6000 hat kein NVLink, deshalb läuft jede Aufteilung über PCIe, und unser Leitfaden zu einem Modell auf mehreren GPUs erklärt, was Tensor-Parallelismus je Token überträgt.

Lizenzen der offenen Mistral-Modelle

Mistral Small 4, Mistral Large 3, die Ministral-3-Modelle und Devstral Small 2 sind unter Apache 2.0 veröffentlicht. Mistral Medium 3.5 und Devstral 2 stehen unter einer „Modified MIT License“, deren zweiter Abschnitt im englischen Original mit „You are not authorized to exercise any rights under this license if the global consolidated monthly revenue of your company“ beginnt: Sie haben danach keine Rechte aus der Lizenz, wenn der weltweite konsolidierte Monatsumsatz Ihres Unternehmens (oder Ihres Arbeitgebers) eine in der Lizenz festgelegte Schwelle übersteigt. Stand 9. Oktober 2026 nennt Mistral keine Lizenz für Large 4, das seine Dokumentation als „Open“ kennzeichnet. Ob eine Klausel Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung. Die Sprachabdeckung behandelt unser Leitfaden zu offenen LLMs für europäische Sprachen.

Was wir liefern

Wir liefern die DGX Spark Founders Edition, die RTX PRO 6000 als Workstation, Max-Q und Server Edition sowie die H200 NVL mit ihren NVLink-Brücken, als Karten oder in nach Auftrag gebauten KI-Servern. Den Server dimensionieren wir nach Modell, Format, Ihrem Kontext und Ihrer Spitzenzahl an Anfragen. Alles kommt unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie; unser Sortiment professioneller GPUs führt jede Karte. Modelle, RAG und MLOps auf der Hardware sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Welche Hardware braucht Mistral Small 4?
Mistral Small 4 hat 119B Parameter, davon 6,5B aktiv je Token, und erscheint in FP8 mit 120,9 GB, was nach unserer Speicherschätzung für einen Nutzer auf zwei RTX PRO 6000 oder eine H200 NVL passt, während seine NVFP4-Version mit 70,8 GB mit 20 Gesprächen von 32K Token auf eine RTX PRO 6000 oder einen DGX Spark passt. Mistrals Ankündigungsbeitrag nennt als größere „Minimum infrastructure“ 4x NVIDIA HGX H100, 2x NVIDIA HGX H200 oder 1x NVIDIA DGX B200, ohne Kontextlänge oder Last. Für 100 gleichzeitige Gespräche mit 32K braucht das FP8-Modell nach unserer Schätzung vier H200 NVL oder acht RTX PRO 6000.
Wie viel VRAM braucht Mistral Small 4?
Die Gewichte belegen 120,9 GB in FP8 oder 70,8 GB in NVFP4, wie die Dateilisten auf Hugging Face zeigen. Seine Multi-Head Latent Attention fügt je Gespräch mit 32.768 Token nur etwa 0,7 GiB KV-Cache in 16 Bit hinzu, sodass eine H200 NVL das FP8-Modell mit 15 solchen Gesprächen fasst. Mit Tensor-Parallelismus hält vLLM diesen Cache vollständig auf jeder Karte.
Kann ich Mistral lokal auf einem DGX Spark betreiben?
Ministral 3 14B, Devstral Small 2 und die NVFP4-Version von Mistral Small 4 passen in die 128 GB eines Spark, Small 4 nach unserer Schätzung mit 20 Gesprächen mit 32K in etwa 80 GiB. Mistral Small 4 in FP8, Medium 3.5, Devstral 2 und Large 3 übersteigen, was ein Spark fasst. Die Speicherbandbreite des Spark von 273 GB/s begrenzt die Geschwindigkeit früher als sein Speicher.
Wie viel VRAM braucht Devstral?
Devstral Small 2 (24B) hat in FP8 25,8 GB und passt auf eine RTX PRO 6000, eine H200 NVL oder einen DGX Spark, mit 5 GiB KV-Cache in 16 Bit je Gespräch mit 32K. Devstral 2 (123B, dicht) hat in FP8 etwa 128 GB und braucht 11 GiB Cache je Gespräch mit 32K, also zwei Karten für einen Nutzer und vier H200 NVL oder acht RTX PRO 6000 für 20. Laut Mistral benötigt Devstral 2 für das Deployment mindestens vier GPUs der H100-Klasse.
Welche GPUs braucht Mistral Large 3?
Mistral Large 3 hat 675B Parameter, davon 41B aktiv, und sein FP8-Checkpoint mit 682 GB läuft nach unserer Schätzung auf acht H200 NVL mit Platz für etwa 20 Gespräche mit 32K; das vLLM-Rezept nennt einen 8xH200-Knoten. Die NVFP4-Version mit 403 GB passt auf vier H200 NVL, die die 4-Bit-Gewichte Weight-only ausführen, oder auf acht RTX PRO 6000. Das vLLM-Rezept führt die NVFP4-Version für Kontexte unter 64K Token und darüber FP8, während Mistrals Card eine Neukalibrierung vom 9. September 2026 meldet, die die Long-Context-Leistung nahe an das ursprüngliche Modell bringen soll.
Darf ich Mistral-Modelle selbst hosten und kommerziell nutzen?
Mistral Small 4, Mistral Large 3, die Ministral-3-Modelle und Devstral Small 2 sind unter Apache 2.0 veröffentlicht, die kommerzielle Nutzung erlaubt. Mistral Medium 3.5 und Devstral 2 nutzen eine modifizierte MIT-Lizenz, die Unternehmen keine Rechte gewährt, deren weltweiter konsolidierter Monatsumsatz eine in der Lizenz festgelegte Schwelle übersteigt. Ob das Ihr Unternehmen betrifft, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Schicken Sie uns das Mistral-Modell und sein Format, die Kontextlänge, die Sie konfigurieren werden, Ihre Spitzenzahl gleichzeitiger Anfragen und die Stromversorgung am Rack-Standort. Wir antworten innerhalb eines Werktages mit Konfiguration und Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien