FLUX GPU-Anforderungen: VRAM, Lizenzen und RTX-PRO-Karten für die Bildgenerierung On-Premise
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- FLUX.1 [dev] und [schnell] haben 12 Milliarden Parameter und einen vollständigen Checkpoint von etwa 23 GB; NVIDIA gibt das Modell FLUX.1 Kontext [dev] mit 24 GB an, in FP8 mit 12 GB und in FP4 mit 7 GB
- FLUX.2 [dev] hat 32 Milliarden Parameter und braucht nach NVIDIAs Angabe 90 GB, um vollständig zu laden; FP8 senkt das um 40 Prozent, nach unserer Rechnung auf etwa 54 GB, was auf die RTX PRO 5000 mit 72 GB oder die RTX PRO 6000 mit 96 GB passt
- Der Speicher entscheidet, welches Modell und welche Auflösung passen; die Zeit pro Bild folgt der Rechenleistung, deshalb beschleunigen FP8 und FP4 sie: Ein Schritt von FLUX.1 Kontext dauert auf einer RTX PRO 6000 laut NVIDIA 607 ms in BF16 und 254 ms in FP4, bei einer Auflösung, die NVIDIA nicht nennt
- FLUX.1 [schnell], FLUX.2 [klein] 4B und Qwen-Image stehen unter Apache 2.0; FLUX.1 [dev], FLUX.2 [dev] und [klein] 9B sind nicht kommerziell lizenziert, und die Lizenz von Stable Diffusion 3.5 endet oberhalb der Umsatzschwelle, die sie festlegt
- NVIDIA führt eine RTX PRO 6000 Server Edition mit 0,20 FLUX-Bildern pro Sekunde in FP4 bei Batch 1, etwa 720 pro Stunde, und eine L40S mit 0,08 in FP8; keiner der beiden Werte nennt Auflösung oder Schritte
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
FLUX GPU-Anforderungen im Überblick
Für die Bildgenerierung on-premise richten sich die FLUX GPU-Anforderungen zuerst nach der Modellgröße. FLUX.1 [dev] und FLUX.1 [schnell] sind Modelle mit 12 Milliarden Parametern, deren vollständiger Checkpoint in 16 Bit etwa 23 GB groß ist; eine Karte mit 24 GB führt sie daher in FP8 oder FP4 aus. Für das 16-Bit-Modell mit dem 16-Bit-Text-Encoder T5 empfiehlt ComfyUI mehr als 32 GB VRAM, also eine Karte mit 48 GB oder mehr. FLUX.2 [dev] mit 32 Milliarden Parametern braucht nach NVIDIAs Angabe 90 GB, um vollständig zu laden, und nach unserer Rechnung etwa 54 GB in FP8; das spricht für die RTX PRO 5000 mit 72 GB oder die RTX PRO 6000 mit 96 GB. Der Speicher entscheidet, welches Modell und welche Auflösung auf eine Karte passen. Die Zeit pro Bild hängt von der Rechenleistung ab, weil ein Diffusionsmodell seinen gesamten Transformer in jedem Entrauschungsschritt einmal durchläuft.
Ein LLM erzeugt ein Token nach dem anderen, und für einen einzelnen Nutzer folgt seine Geschwindigkeit der Speicherbandbreite, wie unsere Übersicht der Benchmarks der RTX PRO 6000 erklärt. Ein Bildmodell verarbeitet in jedem Schritt das gesamte latente Bild, deshalb verkürzt eine geringere Genauigkeit den Schritt und senkt zugleich den Speicherbedarf. NVIDIA hat einen Entrauschungsschritt von FLUX.1 Kontext [dev] auf der RTX PRO 6000 Blackwell mit 607 ms in BF16, 317 ms in FP8 und 254 ms in FP4 gemessen (NVIDIA Technical Blog, 2. Juli 2025). Die Auflösung nennt der Blog nicht.
Die Zahl der Schritte vervielfacht diese Zeit. Die Model Card von BFL sagt, FLUX.1 [schnell] erzeuge Bilder „in nur 1 bis 4 Schritten“, und das Diffusers-Beispiel für FLUX.2 [klein] 4B verwendet 4. Für FLUX.1 [dev] setzt der Diffusers-Code standardmäßig 28 Schritte, während dieselbe Seite sagt, die guidance-destillierte Variante „braucht etwa 50 Sampling-Schritte für eine Generierung in guter Qualität“.
FLUX.1 lädt außerdem zwei Text-Encoder, CLIP-L und T5-XXL, und einen VAE, der das latente Bild in Pixel umsetzt. Das FLUX-Tutorial von ComfyUI empfiehlt den 16-Bit-Encoder T5, „wenn Ihr VRAM größer als 32 GB ist“, und bietet für kleinere Karten einen FP8-Encoder an. NVIDIA nennt Mistral Small 3 als Text-Encoder von FLUX.2 [dev] (Januar 2026). Höhere Auflösungen brauchen mehr Speicher für die Berechnung, und FLUX.2 erzeugt laut NVIDIA Bilder mit „bis zu 4 Megapixel Auflösung“.
Das Auslagern in den Systemspeicher lässt große Modelle auf kleinen Karten laufen, kostet aber Geschwindigkeit: Die Diffusers-Dokumentation nennt CPU-Offloading „extrem langsam“, und NVIDIA sagt, das Weight Streaming von ComfyUI funktioniere, „wenn auch mit gewissen Leistungseinbußen“. Für ein Team, das den ganzen Tag generiert, wählen Sie eine Karte, die das Modell und seine Encoder in der gewählten Genauigkeit vollständig aufnimmt.
Offene Bildmodelle: Parameter, Lizenzen und Speicher
| MODELL | PARAMETER | LIZENZ | SPEICHER LAUT QUELLE |
|---|---|---|---|
| FLUX.1 [schnell] | 12 Mrd. | Apache 2.0 | etwa 23 GB für die originalen FLUX. |
| FLUX.1 [dev], Kontext [dev] | 12 Mrd. | FLUX.1 [dev] Non-Commercial License | Kontext: 24 GB, 12 GB in FP8, 7 GB in FP4 (NVIDIA) |
| FLUX.2 [dev] | 32 Mrd. | FLUX Non-Commercial License | 90 GB für vollständiges Laden; FP8 senkt das um 40 Prozent (NVIDIA) |
| FLUX.2 [klein] 4B | 4 Mrd. | Apache 2.0 | etwa 13 GB (BFL) |
| FLUX.2 [klein] 9B | 9 Mrd. | FLUX Non-Commercial License | nicht angegeben |
| Stable Diffusion 3.5 Large | 8 Mrd. | Stability AI Community License | über 18 GB; 11 GB in FP8 (NVIDIA) |
| Qwen-Image | 20 Mrd. | Apache 2.0 | nicht angegeben; nach unserer Rechnung 40 GB BF16-Gewichte für den Transformer |
Hugging-Face-Model-Cards von black-forest-labs, stabilityai und Qwen, gelesen am 10. Oktober 2026; ComfyUI-Tutorial zu FLUX.1; NVIDIA-Blogs vom 12. Juni 2025 (SD 3.5), 13. August 2025 (Kontext NIM) und 25. November 2025 (FLUX.2). Der Wert für Qwen-Image ergibt sich aus 20 Milliarden Parametern zu je 2 Byte, ohne Text-Encoder.
Die Speicherwerte messen Verschiedenes: NVIDIAs Wert für FLUX.2 umfasst das Laden der gesamten Pipeline, die Kontext-Werte die Modellgröße in der jeweiligen Genauigkeit. Rechnen Sie eine Reserve für die geplante Auflösung und für ein zweites Modell hinzu, das geladen bleibt.
FLUX-Lizenzen: welche Modelle ein Unternehmen produktiv betreiben darf
Prüfen Sie als Unternehmen die Lizenz, bevor Sie die GPU dimensionieren. FLUX.1 [schnell], FLUX.2 [klein] 4B und Qwen-Image stehen unter Apache 2.0. Die Card von BFL für [schnell] sagt, darunter „kann das Modell für persönliche, wissenschaftliche und kommerzielle Zwecke genutzt werden“, und die Card von [klein] 4B nennt dessen Gewichte „für die kommerzielle Nutzung unter der Apache-2.0-Lizenz verfügbar“.
FLUX.1 [dev] steht unter der FLUX.1 [dev] Non-Commercial License v1.1.1. Sie gewährt (in unserer Übersetzung) die Nutzung „ausschließlich für Ihre nicht kommerziellen Zwecke“, nimmt die Nutzung „für umsatzgenerierende Tätigkeiten“ von diesem Zweck aus und untersagt die Nutzung „für kommerzielle oder produktive Zwecke“. Zu den erzeugten Bildern sagt die Lizenz: „Sie dürfen den Output für jeden Zweck nutzen (auch für kommerzielle Zwecke), soweit dies hierin nicht ausdrücklich untersagt ist.“ Die Model Card von FLUX.2 [dev] sagt, BFL habe die Gewichte „unter einer nicht kommerziellen Lizenz veröffentlicht, um Forschung und Entwicklung durch Dritte zu unterstützen“, und die Modelle [klein] 9B fallen unter dieselbe FLUX Non-Commercial License. Für den Betrieb dieser Modelle im eigenen Workflow eines Unternehmens bietet BFL selbst gehostete kommerzielle Lizenzen unter seiner FLUX Commercial Weights License an, in Stufen mit einem monatlichen Bildkontingent; seine Lizenzseite führt FLUX.2 [dev] und die [klein]-Modelle auf und nennt FLUX.1 [dev] in keiner Stufe.
Stable Diffusion 3.5 steht unter der Stability AI Community License, zuletzt aktualisiert am 5. Juli 2024 auf der Website von Stability AI und auf Hugging Face. Sie gilt für Personen und Organisationen, deren Jahresumsatz unter einer in der Lizenz festgelegten Schwelle bleibt. Oberhalb dieser Schwelle „enden alle Lizenzen, die Ihnen im Rahmen dieser Vereinbarung gewährt wurden“, und eine Lizenz muss bei Stability AI angefragt werden. Die kommerzielle Nutzung setzt außerdem eine Registrierung bei Stability AI voraus, und die Outputs gehören Ihnen, „soweit nach geltendem Recht zulässig“.
Die Lizenz von FLUX.1 [dev] verbietet, Outputs zum Training eines Modells zu verwenden, das mit FLUX.1 [dev] „im Wettbewerb steht“, und die Lizenz von Stability verbietet, sie zur Erstellung oder Verbesserung „irgendeines generativen KI-Basismodells“ außer den eigenen Modellen von Stability zu nutzen. Ob eine bestimmte interne Nutzung nach diesen Lizenzen als kommerziell gilt, ist eine rechtliche Bewertung für die Rechtsabteilung des Unternehmens.
FP8, FP4 und TensorRT auf RTX PRO Blackwell
NVIDIAs Blog zu FLUX.1 Kontext meldet für den Transformer „etwa 2- und 3-fache Speichereinsparungen“ von BF16 zu FP8 und zu FP4; quantisiert wurde mit dem TensorRT Model Optimizer, die Engines wurden mit TensorRT gebaut. NVIDIAs Blog zum Kontext-NIM gibt die FP8-Größe für „NVIDIA-GPUs der Ada-Generation“ und die FP4-Größe für die „NVIDIA-Blackwell-Architektur“ an. Unter den Karten, die wir liefern, bedeutet Blackwell die Reihe RTX PRO 2000 bis 6000 und den DGX Spark, während die L40S, die L4 und die Karten der RTX-Ada-Generation FP8 ausführen. NVIDIAs Blog zu SD 3.5 sagt: „Die Ada-Lovelace-Generation der NVIDIA-RTX-PRO-GPUs unterstützt FP8-Quantisierung“.
Für Stable Diffusion 3.5 Large kamen NVIDIA und Stability AI mit FP8 von über 18 GB auf 11 GB, und NVIDIA sagt: „FP8 TensorRT steigert die Leistung von SD3.5 Large um das 2,3-Fache gegenüber BF16 PyTorch“. Für FLUX.2 sagt NVIDIA, FP8-Checkpoints senkten „den VRAM-Bedarf um 40 % bei vergleichbarer Qualität“. BFL veröffentlicht ONNX-Exporte von FLUX.1 [dev] in „BF16-, FP8- und FP4-Genauigkeit“, unter derselben nicht kommerziellen Lizenz.
NVIDIA veröffentlicht für diese Formate Gegenüberstellungen von Bildern, keine Qualitätsmetriken; erzeugen Sie daher dieselben Prompts und Seeds in BF16 und im quantisierten Format und lassen Sie die Personen urteilen, die die Bilder verwenden, bevor Sie für FP4 dimensionieren.
Bilder pro Minute: veröffentlichte Werte für RTX PRO und L40S
NVIDIAs Seite zur KI-Inferenzleistung, laut ihren Metadaten vom 5. Oktober 2026, führt eine RTX PRO 6000 Server Edition mit 0,20 FLUX-Bildern pro Sekunde in FP4 bei Batch 1 und einer Latenz von 5,0 Sekunden, und eine L40S mit 0,08 Bildern pro Sekunde in FP8, also 12,5 Sekunden pro Bild. Keine der beiden Zeilen nennt die FLUX-Variante, die Auflösung oder die Zahl der Schritte, und unsere Übersicht der Benchmarks führt NVIDIAs Zeilen für Stable Diffusion XL und Video daneben auf.
Nach unserer Rechnung sind 0,20 Bilder pro Sekunde 12 pro Minute und 720 pro Stunde je Karte. Aus NVIDIAs Kontext-Werten pro Schritt ergibt sich für eine Bearbeitung mit 28 Schritten auf einer RTX PRO 6000 eine Zeit im Transformer von etwa 7,1 Sekunden in FP4, 8,9 in FP8 und 17 in BF16, vor Text-Encoding und VAE-Decoding. Für den DGX Spark hat NVIDIA FLUX.1 [schnell] in FP4 bei 1024×1024 mit 4 Schritten mit 23 Bildern pro Minute gemessen (24. Oktober 2025).
Unser Vergleich von RTX PRO 6000 und RTX 5090 behandelt die Geschwindigkeit pro Einzelbild auf beiden Karten und die Klausel der GeForce-Treiberlizenz zum Einsatz im Rechenzentrum.
Welche GPU für welches Team: Konfigurationen
Dimensionieren Sie einen Bildserver in vier Schritten; die Tabelle zeigt unsere Schätzungen auf Basis der obigen Werte.
- Wählen Sie die Modelle, die die Lizenz für Ihre Nutzung erlaubt, und die Genauigkeit, die Sie nach einer Qualitätsprüfung akzeptieren.
- Entnehmen Sie den Speicher der Tabelle oben, rechnen Sie die Text-Encoder und eine Reserve für die größte Auflösung hinzu und wählen Sie die Karte, die jedes Modell aufnimmt, das geladen bleibt.
- Schätzen Sie die Sekunden pro Bild bei Ihrer Schrittzahl und Auflösung und teilen Sie die Bilder der Spitzenstunde durch die Bilder, die eine Karte pro Stunde liefert.
- Prüfen Sie die Wartezeit: Bei Batch 1 warten zehn Personen, die gleichzeitig absenden, nacheinander auf zehn Bilder; deshalb bestimmt oft die Zahl der Personen, die in der Spitze gleichzeitig generieren, die Kartenzahl, bevor es das Tagesvolumen tut.
| EINSATZ IM TEAM | MODELLE | KONFIGURATION | SCHÄTZGRUNDLAGE |
|---|---|---|---|
| Ein Designer, Evaluierung | FLUX.2 [klein] 4B, FLUX.1 in FP8, SD 3.5 Large in FP8 | Workstation mit einer RTX PRO 4500, 32 GB, oder RTX PRO 4000, 24 GB | Modelle mit 11 bis 13 GB, Option FP4 auf Blackwell |
| Designteam, [dev] lizenziert | FLUX.1 [dev] oder FLUX.2 [dev] in FP8 | RTX PRO 5000, 72 GB, oder RTX PRO 6000 Workstation oder Max-Q, 96 GB | FLUX.2 in FP8 etwa 54 GB; unquantisiert mit 90 GB nur auf der 96-GB-Karte, mit wenig Reserve |
| Mehrbenutzer, kleine Modelle | [klein] 4B, SD 3.5 Large in FP8 | eine RTX PRO 6000 Server Edition, per MIG in vier Instanzen zu 24 GB geteilt | eine isolierte Instanz je Nutzer oder Workflow |
| Produktion, Tausende pro Tag | FLUX in FP4 oder FP8 | Server mit 2 bis 4 RTX PRO 6000 Server Edition, eine Instanz je Karte | 720 Bilder pro Stunde je Karte nach NVIDIAs Wert bei Batch 1 |
| Vorhandene L40S-Server | FLUX.1 in FP8, SD 3.5 Large | L40S, 48 GB | 12,5 s pro FLUX-Bild in FP8 (NVIDIA) |
| Evaluierung am Schreibtisch | FLUX.2 [dev] unquantisiert | ein DGX Spark, 128 GB | das Modell mit 90 GB lädt; 23 Bilder mit [schnell] pro Minute in FP4 |
Schätzungen von Eurokommerz aus Tabelle 1 und aus NVIDIAs veröffentlichten Werten; Kartenspeicher laut NVIDIAs Produktseiten. Messen Sie Ihren eigenen Workflow bei Ihrer Auflösung und Schrittzahl, bevor Sie mehrere Karten bestellen.
Als Rechenbeispiel: Ein Marketingteam von 20 Personen, das an einem arbeitsreichen Tag 2.000 Bilder erzeugt, davon die Hälfte in einer Spitzenstunde, braucht 1.000 Bilder in dieser Stunde. Bei NVIDIAs 720 Bildern pro Stunde je Karte sind das zwei Karten RTX PRO 6000, und unsere Schätzung steigt proportional, wenn Ihre Schrittzahl oder Auflösung höher ist als in NVIDIAs Test, dessen Bedingungen nicht genannt sind. Unser Vergleich von RTX PRO 6000, 5000 und 4500 enthält Speicher, Bandbreite und MIG-Profile jeder Stufe.
Wir liefern jede Karte aus der Tabelle und bauen Server und Workstations um sie herum. Nennen Sie uns die Modelle, die Auflösung und die Bilder pro Tag im Formular unten, und wir antworten innerhalb eines Werktages mit einer Konfiguration.
ComfyUI und Serving auf einem gemeinsamen GPU-Server
ComfyUI, das BFL und NVIDIA beide für den lokalen Betrieb von FLUX.2 nennen, steht unter GPL-3.0, führt Flux.1, Flux.2, SD3.5 und Qwen Image unter seinen unterstützten Bildmodellen und beschreibt „asynchronous queueing“. Auf einem Teamserver sorgt eine ComfyUI-Instanz je GPU oder je MIG-Instanz dafür, dass ein langer Auftrag nicht alle anderen aufhält.
MIG auf der RTX PRO 6000 liefert bis zu vier isolierte Instanzen zu 24 GB, genug für FLUX.2 [klein] 4B oder Stable Diffusion 3.5 Large in FP8 je Instanz, und braucht auf Bare Metal keine Lizenz. Vier Max-Q-Karten in einem Tower geben einem Designteam 384 GB ohne Serverraum; unser Leitfaden zur Workstation mit vier Max-Q-Karten behandelt das Netzteil und die rund 2 kW Abwärme.
Wir bauen KI-Server mit zwei oder vier Karten RTX PRO 6000 Server Edition und installieren auf Wunsch Betriebssystem, Treiber, CUDA und eine Container-Runtime. Beschreiben Sie Ihre Bild-Workflows im Formular unten, mit der Zahl der Personen, die in der Spitze generieren.
Was wir liefern
Wir liefern die Karten, die dieser Artikel behandelt, die RTX PRO 4000, 4500, 5000 (48 und 72 GB) und 6000 in allen drei Editionen, die L40S und den DGX Spark, mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. Die GPU-Seite nennt Speicher und Leistungsaufnahme jeder Karte. Wir bauen KI-Server auf Bestellung für die Bildgenerierung, ausgelegt nach Modellen, Auflösung und der Zahl der Nutzer in der Spitze, montiert und im Burn-in getestet, und wir prüfen Rack, Strom und Luftstrom vor dem Angebot. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung, wo das Setup sie braucht.
FAQ
Welche GPU braucht man für FLUX?
Wie viel VRAM braucht FLUX.1 dev?
Wie viel VRAM braucht FLUX.2?
Wie viel VRAM braucht Stable Diffusion 3.5 Large?
Darf man FLUX kommerziell nutzen?
Wie viele Bilder pro Minute erzeugt eine RTX PRO 6000 mit FLUX?
Schicken Sie uns die Bildmodelle, die Sie betreiben wollen, die Auflösung, die Zahl der Bilder pro Tag und wie viele Personen gleichzeitig generieren. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot; Rack, Strom und Luftstrom prüfen wir vor dem Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages