KI-Server für medizinische Bildgebung: GPU-Speicher für MONAI, 3D-Segmentierung und Radiologiemodelle
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Eine CT- oder MRT-Untersuchung ist ein 3D-Volumen aus Hunderten Schichten, daher trainieren Modelle der medizinischen Bildgebung auf 3D-Patches und brauchen je Sample weit mehr GPU-Speicher als 2D-Bildmodelle; Inferenz im Sliding-Window-Verfahren braucht weniger
- Das MONAI-Bundle für die Ganzkörper-CT-Segmentierung verlangt für das Training 48 GB GPU-Speicher; bei einem CT mit 512 × 512 × 397 belegte sein 1,5-mm-Modell bei der Inferenz 28,73 GB und sein 3,0-mm-Modell 5,89 GB
- NVIDIAs Modelle für synthetisches CT (NV-Generate-CT, aufgebaut auf MAISI) erreichen in der Spitze 15,0 GB für ein Volumen mit 256 × 256 × 128 und 49,7 GB für 512 × 512 × 768, gemessen auf einer A100 80 GB
- Die NIM-Support-Matrizen für VISTA-3D und MAISI führen die A100, H100, L40S und RTX 6000 Ada in FP32 auf; von den Karten, die wir liefern, stehen mit Stand Oktober 2026 die L40S und die RTX 6000 Ada darauf, keine Blackwell-Karte
- Software, die ihr Hersteller für die Diagnose bestimmt, kann nach Artikel 2 Nummer 1 der EU-MDR ein Medizinprodukt sein, und Gesundheitsdaten gehören nach Artikel 9 DSGVO zu den besonderen Kategorien personenbezogener Daten; beides bewerten die für Recht und Regulatorik zuständigen Stellen des Krankenhauses
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
GPU-Anforderungen für KI in der medizinischen Bildgebung
Ein KI-Server für die medizinische Bildgebung wird stärker nach der Größe des 3D-Volumens dimensioniert als nach der Zahl der Nutzer. Eine CT- oder MRT-Untersuchung umfasst Hunderte Schichten, daher trainieren Segmentierungsmodelle auf 3D-Patches, und jedes Sample belegt weit mehr GPU-Speicher als ein 2D-Foto. Das MONAI-Bundle für die Ganzkörper-CT-Segmentierung verlangt für das Training 48 GB GPU-Speicher. Die Inferenz ist leichter: Bei einem CT mit 512 × 512 × 397 Voxeln belegte das 3,0-mm-Modell desselben Bundles 5,89 GB und sein 1,5-mm-Modell 28,73 GB. Das Training spricht daher für Karten mit 48 GB und mehr, etwa die RTX PRO 6000 mit 96 GB oder die H200 NVL mit 141 GB, während die meiste Inferenz auf eine L4 mit 24 GB oder eine L40S mit 48 GB passt.
| WORKLOAD | BESTIMMT DURCH | ANGEGEBENER SPEICHER | KARTE (SORTIMENT) |
|---|---|---|---|
| Training 3D-Segmentierung | Patchgröße, Batch, Kanäle | 48 GB Ganzkörper-CT; mindestens 32 GB Swin UNETR | RTX PRO 6000, H200 NVL |
| Segmentierung, Inferenz | Volumen, Ausgabekanäle, Zusammensetzen | 5,89 GB bei 3,0 mm, 28,73 GB bei 1,5 mm | L4 (3,0 mm), L40S, RTX PRO 5000 |
| Synthetisches CT, Inferenz | Größe des Ausgabevolumens | 15,0 bis 49,7 GB Spitze | L40S für kleinere Volumen, RTX PRO 6000 |
| Synthetisches CT, Training | Größe des Latent Space | 39 GB bei 512³, 58 GB bei 512 × 512 × 768 | RTX PRO 6000, H200 NVL |
| MONAI-Deploy-App | das paketierte Modell | mindestens 8 GB Video-RAM | L4, RTX PRO 4000 |
READMEs im MONAI Model Zoo (wholeBody_ct_segmentation, swin_
Warum 3D-Volumen den GPU-Speicher füllen
Ein CT mit 512 × 512 × 397 Voxeln enthält nach unserer Rechnung etwa 104 Millionen Werte, in FP32 416 MB, bevor das Netz irgendetwas berechnet hat. Netze nehmen ein solches Volumen nicht am Stück auf. Das Ganzkörper-Bundle und das Swin-UNETR-Bundle trainieren beide auf Patches mit 96 × 96 × 96 Voxeln, also 884.736 Voxeln, mehr als das Dreifache einer Schicht mit 512 × 512. Jede 3D-Faltung hält ihre Aktivierungen je Voxel und je Kanal für den Backward-Pass vor, daher wächst der Speicher beim Training mit dem Patchvolumen, der Zahl der Kanäle und der Batchgröße. Das Swin-UNETR-Bundle trainiert mit gemischter Genauigkeit (AMP) und verlangt mindestens 32 GB.
Für die Inferenz verschiebt MONAIs SlidingWindowInferer das Fenster über das Volumen und verarbeitet sw_batch_size Fenster je Forward-Pass. Die Ausgabe wird auf dem Device der Eingabe zusammengesetzt, sofern device nichts anderes festlegt, und MONAIs Docstring merkt an, dass bei einer Ausgabe auf der CPU „der GPU-Speicherverbrauch geringer ist“. Nach unserer Rechnung entfällt etwa die Hälfte der 28,73 GB, die für das 1,5-mm-Modell gemessen wurden, auf die Ausgabe: 105 Ausgabekanäle über das neu abgetastete Volumen mit 287 × 287 × 397 belegen in FP32 13,7 GB. Die README des Bundles beziffert ein CT mit 300 Schichten auf etwa 27 GB und empfiehlt für größere Scans mehr GPU-Speicher, das 3,0-mm-Modell oder Inferenz auf der CPU.
Auch der Arbeitsspeicher des Systems zählt. MONAIs CacheDataset hält vorverarbeitete Volumen im RAM, und das Ganzkörper-Bundle nennt 83 GB System-RAM mit einer GPU für 1.000 Volumen bei einer Cache-Rate von 0,4 und 666 GB mit acht GPUs. Ein Trainingsserver für 3D-Modelle braucht daher System-RAM, der für den Cache ebenso ausgelegt ist wie für die GPUs, und NVMe-Kapazität für die Datensätze.
MONAI, VISTA-3D und NVIDIAs offene Bildgebungsmodelle
NVIDIAs Clara-Seiten unter nvidia.com/clara beschreiben MONAI als „das offene KI-Framework für medizinische Bildgebung“, auf Basis von PyTorch, mit „über 50 hochwertigen vortrainierten Modellen“. Die oben genannten Bundles aus dem MONAI Model Zoo veröffentlicht das MONAI Consortium unter der Lizenz Apache 2.0. NVIDIAs eigene Bildgebungsmodelle liegen inzwischen in der Organisation NVIDIA-Medtech auf GitHub, die sich selbst als „offene Foundation-Modelle für physische KI und medizinische Bildgebung“ beschreibt. Der MAISI-Ordner in MONAIs Tutorials ist seit Oktober 2025 als veraltet markiert und verweist auf NV-Generate-CTMR.
VISTA-3D segmentiert CT-Aufnahmen automatisch oder anhand von Punktklicks. Laut seinem Repository wurde es mit 11.454 Volumen trainiert, die 127 Arten menschlicher anatomischer Strukturen und verschiedene Läsionen abdecken, und NVIDIA bietet es als NIM an, in der Support-Matrix mit Modellversion 0.5.7, gelesen am 10. Oktober 2026. NV-Segment-CTMR startet vom Checkpoint von NV-Segment-CT, teilt die Architektur von VISTA3D-CT und wurde mit über 30.000 CT- und MRT-Scans für mehr als 300 Klassen per Fine-Tuning angepasst. Außerhalb von NVIDIA passt MedSAM2, am 4. April 2025 auf arXiv veröffentlicht, das Segment Anything Model 2 per Fine-Tuning mit über 455.000 Paaren aus 3D-Bild und Maske sowie 76.000 Videobildern an, um medizinische 3D-Bilder und Videos zu segmentieren.
| MODELL | AUFGABE | LIZENZ DER GEWICHTE | SPEICHER LAUT ANGABE |
|---|---|---|---|
| Ganzkörper-CT (MONAI-Bundle) | 104 Strukturen, SegResNet | Apache 2.0 | 48 GB Training; 5,89 oder 28,73 GB Inferenz |
| VISTA-3D | CT, automatisch und per Punktklick | „commercial friendly“ laut Repository | NIM nennt GPUs mit 48 und 80 GB |
| NV-Segment-CTMR | CT und MRT, 345+ Klassen | „Non-Commercial“ laut Repository | nicht angegeben |
| NV-Generate-CT | synthetisches CT mit Masken für 132 Klassen | NVIDIA Open Model | 15,0 bis 49,7 GB Spitze bei Inferenz |
| NV-Reason-CXR-3B | Reasoning auf Thorax-Röntgenbildern (VLM) | NVIDIA OneWay Non-Commercial | 3B laut Karte, BF16; kein Wert |
Repositorys von MONAI Model Zoo, VISTA, NV-Segment-CTMR und NV-Generate-CTMR auf GitHub, Support-Matrix des NIM für VISTA-3D (ohne Aktualisierungsdatum) und Modellkarte von NV-Reason-CXR-3B auf Hugging Face, gelesen am 10. Oktober 2026.
Drei von NVIDIAs Bildgebungsmodellen haben mit Stand Oktober 2026 nicht kommerzielle Gewichte: NV-Segment-CTMR („Non-Commercial“ in seinem Repository), der MRT-Generator NV-Generate-MR („NVIDIA Non-Commercial“) und NV-Reason-CXR-3B („NVIDIA OneWay Non-Commercial License for academic research purposes“). Ob eine geplante Nutzung unter eine solche Lizenz fällt, ist eine Bewertung für die Rechtsabteilung des Krankenhauses. NV-Reason-CXR-3B ist laut seiner Modellkarte ein Fine-Tuning von Qwen2.5-VL-3B-Instruct und wurde auf der A100, H100 und L40S getestet; die Karte nennt 3B Parameter, die Metadaten der Dateien zeigen 4B.
Training und Inferenz: welche GPUs
Für das Training passen die 48 GB, die das Ganzkörper-Bundle verlangt, auf beide Karten, die wir für diese Arbeit liefern, mit Reserve für größere Patches oder Batches. Die RTX PRO 6000 Server Edition hat 96 GB GDDR7 mit 1.597 GB/s und zieht bis zu 600 W; die H200 NVL hat 141 GB HBM3e mit 4,8 TB/s und verbindet 2 oder 4 Karten über eine NVLink-Bridge. Diffusionstraining mit 512 × 512 × 768 passt mit 58 GB Spitze auf beide. Unser Vergleich von H200 NVL und RTX PRO 6000 für das Training behandelt Tensor-Raten und die Verbindung zwischen den Karten. Das Fine-Tuning eines Vision-Language-Modells wie NV-Reason-CXR-3B folgt den Regeln für Sprachmodelle, die unser Leitfaden zum GPU-Speicher für Fine-Tuning mit LoRA und QLoRA beschreibt.
Für die Inferenz hält eine L40S mit 48 GB das 1,5-mm-Ganzkörpermodell mit 28,73 GB, und eine L4 mit 24 GB bei 72 W hält das 3,0-mm-Modell und erfüllt die 8 GB, die das MONAI Deploy App SDK verlangt; unser Vergleich von L4 und L40S behandelt Leistungsaufnahme und Dichte je Server. MIG teilt eine RTX PRO 6000 in vier Instanzen mit 24 GB oder zwei mit 48 GB und eine H200 NVL in bis zu sieben, sodass sich mehrere Inferenzmodelle eine Karte mit isoliertem Speicher teilen können.
Die NIM-Support-Matrizen für VISTA-3D und MAISI führen die A100, H100, L40S und RTX 6000 Ada auf, alle in FP32, und verlangen eine CUDA Compute Capability von 7.0 oder höher. Von den Karten, die wir liefern, stehen mit Stand Oktober 2026 die L40S und die RTX 6000 Ada, beide mit 48 GB, auf diesen Listen. Beide Seiten nennen Ampere und Hopper als unterstützte Architekturen, was die H200 NVL als Hopper-Karte einschließt, Blackwell nennen sie jedoch nicht, NVIDIA gibt also keine Support-Aussage für die RTX-PRO-Karten; führen Sie den NIM-Microservice auf der Zielkarte aus, bevor Sie damit planen. Die MAISI-Seite, zuletzt aktualisiert am 5. Juni 2026, markiert Grenzen der Bildgröße für die Karten mit 48 GB und nennt für ein Volumen mit 512 × 512 × 768 eine Spitze von 55 GB.
Wir liefern die L4, L40S, RTX 6000 Ada, RTX PRO 6000 und H200 NVL als Karten oder in KI-Servern, die wir auf Bestellung bauen. Nennen Sie uns Ihre Modelle und die Auflösung, mit der sie arbeiten, und ob Sie trainieren oder nur Inferenz betreiben.
Anbindung an das PACS mit MONAI Deploy
In der Radiologie gelangen die Untersuchungen aus dem PACS zum Inferenzserver, und die Ergebnisse gehen dorthin zurück. Das MONAI Deploy App SDK bietet nach den Worten seiner README „ein Framework und zugehörige Werkzeuge, um KI-gestützte Anwendungen zu entwerfen, zu entwickeln und zu verifizieren“, und verpackt eine Inferenzanwendung „mit einem einzigen Befehl“ in ein MONAI Application Package. Es hat integrierte Operatoren zum Laden von DICOM-Daten, und Version 3.0.0 vom 22. April 2025 erweiterte seinen DICOM-Segmentation-Operator so, dass er DICOM-Tags mit Informationen zum KI-Modell füllt. Version 4.0.0, am 13. Juni 2026 auf PyPI veröffentlicht, verlangt Ubuntu 22.04 mit glibc 2.35 oder neuer, CUDA 13.0 oder höher und eine NVIDIA-GPU mit mindestens 8 GB Video-RAM und hängt von NVIDIAs Holoscan SDK für CUDA 13 ab. Die Release-Seite des Projekts auf GitHub zeigt weiterhin 3.0.0, basierend auf Holoscan SDK v3, als aktuelles Release; prüfen Sie daher, mit welcher Version eine paketierte Anwendung gebaut wurde.
Das MONAI Deploy Informatics Gateway „erleichtert die Integration mit DICOM-konformen Systemen, ermöglicht die Übernahme von Bilddaten“, so die Beschreibung seines Repositorys, und überträgt Ergebnisse an PACS-Systeme, über DICOM und FHIR. Für den Aufbau von Trainingsdatensätzen ist MONAI Label ein „intelligentes Open-Source-Werkzeug zum Labeln von Bildern und zum Lernen“, das mit 3D Slicer, OHIF und anderen Viewern arbeitet und sich über DICOMweb mit einem PACS verbindet. Ein Server, der Untersuchungen aus dem PACS empfängt, steht im klinischen Netz, daher brauchen sein BMC, seine Treiber und seine Inferenz-Endpunkte die Härtung aus unserem Leitfaden zum Absichern eines GPU-Servers.
EU-MDR und DSGVO für KI in der Bildgebung
Nach Artikel 2 Nummer 1 der Medizinprodukteverordnung (EU) 2017/745 (MDR) kann Software ein Medizinprodukt sein, wenn der Hersteller sie für Zwecke bestimmt, zu denen Diagnose, Verhütung, Überwachung, Vorhersage, Prognose, Behandlung oder Linderung von Krankheiten gehören. Erwägungsgrund 19 ergänzt, dass Software für allgemeine Zwecke auch dann kein Medizinprodukt ist, wenn sie im Gesundheitswesen eingesetzt wird. NVIDIA gibt an, dass VISTA-3D „für Forschungszwecke und nicht für den klinischen Einsatz bestimmt ist“, und die Karte von NV-Reason-CXR-3B sagt, das Modell „sollte nicht für klinische Diagnosen oder Behandlungsentscheidungen verwendet werden“. Artikel 9 Absatz 1 DSGVO nennt Gesundheitsdaten unter den besonderen Kategorien personenbezogener Daten, deren Verarbeitung untersagt ist, sofern nicht eine Ausnahme nach Artikel 9 Absatz 2 greift. Ob eine bestimmte Nutzung ein Medizinprodukt ist und auf welcher Rechtsgrundlage Bilder verarbeitet werden, ist eine Bewertung für die für Recht und Regulatorik zuständigen Stellen des Krankenhauses; die Wahl des Servers ändert daran nichts.
Allgemeine Information zum EU-Recht mit Stand Oktober 2026: Verordnung (EU) 2017/745, Artikel 2 Nummer 1 und Erwägungsgrund 19, sowie Verordnung (EU) 2016/679, Artikel 9 Absatz 1, amtliche Texte auf eur-lex.europa.eu.
Beispielkonfigurationen für Krankenhäuser und Forschungslabore
Die folgenden Konfigurationen sind unsere Schätzungen aus den Speicherwerten oben, keine Empfehlungen der Hersteller. Jede geht von 3D-CT oder 3D-MRT in den Auflösungen aus, die die Modelle dokumentieren.
| EINSATZ | WORKLOAD | GESCHÄTZTER AUFBAU |
|---|---|---|
| Radiologie-Inferenz | CT-Segmentierung über MONAI Deploy | 1 bis 2 L40S in einem 2U-Server; L4 für Modelle mit 3,0 mm |
| Annotations-Workstation | MONAI Label mit 3D Slicer oder OHIF | RTX PRO 5000 (72 GB) oder RTX PRO 6000 Workstation Edition |
| Training im Forschungslabor | MONAI-Bundles, Swin UNETR, Ganzkörper-CT | 2 bis 4 RTX PRO 6000 Server Edition, RAM passend zum Daten-Cache |
| Synthetische Daten | NV-Generate-CT bis 512 × 512 × 768 | 1 bis 2 RTX PRO 6000 Server Edition |
| Training in großem Maßstab | Foundation-Modelle auf großen Datensätzen | 4 oder 8 H200 NVL mit NVLink-Bridges |
Unsere Schätzungen aus den angegebenen Speicherwerten in den Tabellen oben; System-RAM aus den CacheDataset-Werten des Ganzkörper-Bundles.
Der Private-KI-Starter mit zwei Karten auf unserer Seite zu KI-Servern kombiniert zwei Karten der RTX PRO 6000 Server Edition mit einem Prozessor und 256 GB RAM, was nach unserer Schätzung zu Inferenz und kleineren Trainingsdatensätzen passt. Für Training mit großem Cache im Arbeitsspeicher planen Sie den System-RAM ausgehend von den 83 GB, die das Ganzkörper-Bundle für eine GPU nennt, dazu NVMe-Kapazität für die Roh- und die vorverarbeiteten Volumen und eine Netzwerkverbindung zum PACS oder zum Forschungsarchiv.
Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Beschreiben Sie Ihre Scanvolumen, Modelle und Ihren Standort im Formular unten, und wir antworten innerhalb eines Werktages mit Konfiguration und Angebot.
Was wir liefern
Wir liefern die GPUs, die zu Aufgaben der medizinischen Bildgebung passen, die L4, L40S, RTX 6000 Ada, RTX PRO 5000, RTX PRO 6000 und H200 NVL, als Karten oder in auf Bestellung gebauten KI-Servern, montiert und im Burn-in getestet, mit Herstellergarantie und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch. Deployment der Modelle, RAG und MLOps darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Wie viel GPU-Speicher braucht MONAI?
Welche GPU braucht man für 3D-Segmentierung medizinischer Bilder?
Kann ein Krankenhaus Radiologie-KI on-premise betreiben?
Was ist NVIDIA Clara für die medizinische Bildgebung?
Welche GPUs unterstützt VISTA-3D als NIM?
Ist KI-Software für medizinische Bildgebung ein Medizinprodukt nach der MDR?
Schicken Sie uns die Modelle, die Sie betreiben wollen, die Untersuchungsarten und ihre Auflösung, die Zahl der Untersuchungen pro Tag und ob Sie Modelle trainieren oder nur Inferenz betreiben. Wir antworten innerhalb eines Werktages mit Konfiguration und Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages