KI-Server für die Fertigung: visuelle Inspektion, Engineering und Assistenten auf einer GPU-Plattform
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Ein Fertigungsunternehmen mit 500 bis 2.000 Mitarbeitern betreibt drei KI-Workloads an zwei Orten: Bildverarbeitungsmodelle für die Inspektion auf Edge-Knoten an der Linie sowie Simulation, digitale Zwillinge, Modelltraining und Assistenten auf zentralen GPU-Servern
- Die Karten an der Linie sind klein: die passive L4 (24 GB, 72 W, Single Slot, halbe Bauhöhe) für Edge-Server mit Server-Luftstrom, die aktiv gekühlte RTX PRO 4000 SFF (24 GB, 70 W) und die RTX PRO 2000 (16 GB, 70 W) für Industrie-PCs und Schaltschränke
- Digitale Zwillinge auf Omniverse und Isaac Sim brauchen RTX-GPUs mit RT-Kernen; NVIDIAs Server-Empfehlung für Omniverse sind acht Karten RTX PRO 6000 Server Edition, während CFD in doppelter Genauigkeit auf die H200 NVL mit 30 TFLOPS FP64 weist
- Assistenten über Handbücher, Qualitätsberichte und Service-Tickets werden nach den Anfragen in Bearbeitung ausgelegt: Mit den Beispielwerten unseres Leitfadens nach Unternehmensgröße brauchen 1.000 Mitarbeiter zwei Server mit je vier RTX PRO 6000, drei davon für Modellkopien, und 2.000 Mitarbeiter zwei Server mit je zwei H200 NVL
- IEC 62443-3-2 legt Anforderungen an die Aufteilung eines Systems in Zonen und Conduits mit einem Ziel-Security-Level für jede fest; Edge-GPU-Knoten liegen meist in der Zone der Zelle, zentrale Server in der IT, und Modell-Updates laufen in geplanten Produktionsstillständen über einen definierten Conduit
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
KI-Server in der Fertigung: drei Workloads und ihr Standort
KI-Server in einem Industrieunternehmen mit 500 bis 2.000 Mitarbeitern tragen meist drei Arten von KI-Workloads, und jede gehört an einen anderen Ort. Bildverarbeitungsmodelle für die visuelle Inspektion laufen an der Linie auf kleinen Edge-Karten wie der L4, der RTX PRO 2000 oder der RTX PRO 4000 SFF, damit die Prüfung auch bei einem Ausfall des WAN oder des Rechenzentrums weiterläuft. Engineering, Simulation und digitale Zwillinge laufen auf Karten der RTX PRO 6000, mit der H200 NVL für Solver in doppelter Genauigkeit. Assistenten und RAG über Maschinenhandbücher, Qualitätsberichte und Service-Tickets laufen auf zentralen GPU-Servern, ausgelegt nach den Anfragen in Bearbeitung.
| WORKLOAD | STANDORT | KARTE | BEGRÜNDUNG |
|---|---|---|---|
| Inspektion an der Linie | Edge-Knoten je Linie oder Zelle | L4 mit Server-Luftstrom; RTX PRO 4000 SFF oder RTX PRO 2000 ohne | läuft ohne WAN; 70 bis 72 W je Karte |
| Kameraanalyse am Standort | Serverraum des Werks | L4, RTX PRO 6000 Server Edition | viele Streams laufen auf einem Server zusammen; die Decoder setzen die Grenze |
| Training der Prüfmodelle | zentraler Server | RTX PRO 6000 Server Edition, ganze Karte oder MIG-Instanz | Bilder bleiben am Standort; Nachtraining nach Produktänderungen |
| CFD in einfacher Genauigkeit | zentraler Server oder Workstation | RTX PRO 6000, im Server die Server Edition | 96 GB und 120 TFLOPS FP32 je Karte der Server Edition |
| CFD in doppelter Genauigkeit | zentraler Server | H200 NVL | 30 TFLOPS FP64 |
| Digitaler Zwilling/ | zentraler Server oder Workstation | RTX PRO 6000 oder eine andere RTX-Karte | RT-Kerne erforderlich |
| Assistent, RAG für Personal | zentraler Serverraum oder EU-Rechenzentrum | RTX PRO 6000 Server Edition oder H200 NVL; L4 für RAG-Modelle | ein Dienst für alle Werke |
Karten und Werte aus NVIDIAs Produktseiten, dem Product Brief der L4 (März 2023), den Anforderungen von Isaac Sim (aktualisiert am 18. September 2026) und den technischen Anforderungen von Omniverse (aktualisiert am 8. Oktober 2026), gelesen am 10. Oktober 2026; die Zuordnung ist unsere Zusammenfassung des Designs.
Visuelle Inspektion an der Linie: Edge-GPUs und NVIDIA Metropolis
Eine Prüfstation nimmt Bilder im Linientakt auf, ein Detektions- oder Segmentierungsmodell entscheidet über Gut oder Schlecht, und das Ergebnis steuert eine Ausschleusung oder gibt ein Signal an die Liniensteuerung. Auf einem Knoten neben der Linie hängt dieser Regelkreis weder vom Rechenzentrum noch vom WAN ab.
Die Karten für einen solchen Knoten sind klein. Die L4 hat 24 GB, vier NVDEC-Videodecoder, vier JPEG-Decoder und maximal 72 W in einer Single-Slot-Karte mit halber Bauhöhe. NVIDIAs Product Brief beschreibt sie als passiv gekühlt und „zum Betrieb auf Systemluftstrom angewiesen“, sie gehört also in einen Edge-Server mit Server-Luftstrom. In einem Industrie-PC oder einem Schaltschrank ohne diesen Luftstrom passen die aktiv gekühlte RTX PRO 4000 SFF (24 GB, 70 W) und die RTX PRO 2000 (16 GB, 70 W), beides Dual-Slot-Karten mit 2,7 × 6,6 Zoll, dort, wo der Hersteller des PCs sie für dieses Gehäuse und die Temperatur im Schrank aufführt. Für schwerere Modelle in einem Steckplatz mit voller Bauhöhe bietet die Single-Slot-Karte RTX PRO 4000 24 GB und 672 GB/s bei 145 W.
NVIDIAs DeepStream-Streamzahlen gelten für Kamera-Pipelines mit leichten Detektoren und nicht für Prüfmodelle. Legen Sie die Karte einer Station nach der Inferenzzeit Ihres eigenen Modells je Bild im Linientakt aus, gemessen auf der Karte, bevor Sie für alle Linien bestellen. Kameraanalyse für Hallen, Höfe und Laderampen, bei der Dutzende oder Hunderte Streams auf einem Server zusammenlaufen, ist eine eigene Auslegungsaufgabe, die unser Leitfaden zu GPU-Servern für Videoanalyse behandelt.
NVIDIA bezeichnet Metropolis als „eine Anwendungsplattform und ein Partner-Ökosystem für Vision-KI“, und die Metropolis-Seite schreibt, dass angepasste Vision-KI-Modelle helfen können, „visuelle Defekte in Anwendungen der industriellen Sichtprüfung genau zu lokalisieren“. Dieselbe Seite stellt Vision-Foundation-Modelle vor, die mit NVIDIA TAO angepasst und als NIM-Microservices bereitgestellt werden. NVIDIAs NIM-FAQ hält fest: „Die Nutzung von NIM in der Produktion erfordert eine NVIDIA-AI-Enterprise-Lizenz“; ein Plan, der NIM an der Linie betreibt, zählt die Edge-Karten also ebenfalls im Lizenzplan mit.
Wir liefern die L4 und die RTX PRO 2000, 4000 und 4000 SFF für Edge-Systeme, die Sie bereits betreiben, nach einer Kompatibilitätsprüfung von Plattform, Strom und Kühlung. Nennen Sie uns Ihre Prüfstationen und die Edge-Hardware an den Linien.
Engineering, Simulation und digitale Zwillinge auf der RTX PRO 6000
Engineering-Teams bringen CFD- und Strukturrechnungen, digitale Zwillinge von Linien und Roboterzellen sowie Rendering mit, und der Solver oder die Anwendung bestimmt die Karte. NVIDIA gibt für die H200 NVL 30 TFLOPS FP64 an, was zu Solvern in doppelter Genauigkeit passt, während Solver in einfacher und gemischter Genauigkeit die 120 TFLOPS FP32 und 96 GB der RTX PRO 6000 Server Edition nutzen. Unser CFD-Vergleich von H200 NVL und RTX PRO 6000 rechnet den Speicher je Million Zellen und die Solver-Lizenzen durch.
Digitale Zwillinge auf Basis von Omniverse und Isaac Sim brauchen RTX-GPUs mit RT-Kernen. Die Anforderungsseite von Isaac Sim, aktualisiert am 18. September 2026, hält fest: „GPUs ohne RT-Kerne (A100, H100) werden nicht unterstützt“, und nennt die RTX PRO 6000 Blackwell als ideale GPU. NVIDIAs technische Anforderungen für Omniverse, aktualisiert am 8. Oktober 2026, empfehlen für eine Kit-Workstation eine RTX PRO 6000 Blackwell mit 128 bis 256 GB RAM und für einen Server „8x RTX Pro 6000 Blackwell Server Edition mit 768 GB GPU-Speicher“ mit 64 oder mehr CPU-Kernen. Unser Leitfaden zu den Serveranforderungen von Omniverse behandelt Treiber, Streaming und Lizenzen für digitale Zwillinge.
Ein zentraler Server mit RTX PRO 6000 Server Edition kann Simulation, Rendering und das Training von Prüfmodellen nacheinander bedienen. NVIDIAs Seite zur Karte nennt bis zu vier vollständig isolierte MIG-Instanzen, sodass sich kleinere Trainings- und Testjobs eine Karte teilen können, und die H200 NVL lässt sich in bis zu sieben Instanzen mit je 16,5 GB aufteilen.
Assistenten und RAG über Handbücher, Qualitätsberichte und Service-Tickets
Der dritte Workload ist ein Assistent, der aus Maschinenhandbüchern, Arbeitsanweisungen, Qualitätsberichten, 8D-Berichten und Service-Tickets antwortet. Gescannte Formulare und Zeichnungen in diesen Quellen brauchen OCR oder ein Vision-Language-Modell, bevor sie indexiert werden können, und die RAG-Pipeline ergänzt ein Embedding-Modell, einen Reranker und einen Vektorindex.
Der Server wird nach den Anfragen in Bearbeitung in der Spitze ausgelegt, nicht nach der Kopfzahl, wie unser Leitfaden zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße erklärt. Mit dessen Beispielwerten erzeugen 500 Mitarbeiter rund 20 Anfragen in Bearbeitung und 2.000 rund 80. Mit gpt-oss-120b bei deklarierten 32K Kontext hält eine RTX PRO 6000 nach der Schätzung dieses Leitfadens rund 19 Gespräche und eine H200 NVL rund 55. Die Beispielwerte gehen von Büronutzung aus; wo viele Mitarbeiter ohne Schreibtisch in der Fertigung arbeiten, kann der Anteil in der Spitzenstunde abweichen, entnehmen Sie ihn also den Gateway-Logs eines Piloten. Die Embedding- und Reranker-Modelle mit 0,6B aus diesem Leitfaden passen auf eine L4 mit 24 GB oder auf eine MIG-Instanz einer größeren Karte.
vLLM, eine Open-Source-Engine unter der Lizenz Apache 2.0, unterstützt auch multimodale und Embedding-Modelle. NVIDIA beschreibt seine NIM-Microservices als „Teil von NVIDIA AI Enterprise“, und laut NVIDIAs Produktseite kommt jede H200 NVL mit einem Fünf-Jahres-Abonnement für NVIDIA AI Enterprise.
Ein zentraler GPU-Server oder Edge-Knoten je Werk
Ein Edge-Knoten führt nur Inferenz aus, mit einer festen Modellversion, und arbeitet weiter, wenn die Verbindung zum zentralen Standort ausfällt. Die zentralen Server trainieren und validieren Modelle, veröffentlichen freigegebene Versionen für die Linien, betreiben die Engineering-Workloads und hosten den Assistenten für alle Werke. Bei mehreren Werken steht der Assistent an einem Ort, entweder im Hauptserverraum oder in einem EU-Rechenzentrum, und jedes Werk behält seine Edge-Knoten und, wo es Kameraanalyse betreibt, einen Server im eigenen Serverraum.
Jeder Edge-Knoten ist ein System, das gepatcht, überwacht und ersetzt werden muss. Halten Sie über alle Werke hinweg ein oder zwei Kartentypen und ein Edge-Gehäuse, damit ein Ersatzknoten viele Linien abdeckt und ein ausgefallener Knoten in einem kurzen Stillstand getauscht wird. Legen Sie den Uplink des Werks für Bilder zum Nachtraining, die gebündelt gesendet werden, und für die zurückkommenden Modellpakete aus, nicht für Live-Video.
OT- und IT-Trennung für GPU-Server nach IEC 62443
Die Normenreihe IEC 62443 wurde nach den Worten der IEC „entwickelt, um industrielle Automatisierungs- und Steuerungssysteme (IACS) über ihren gesamten Lebenszyklus abzusichern“. Teil 3-2 von 2020, „Security risk assessment for system design“, legt Anforderungen an die „Aufteilung des SUC in Zonen und Conduits“ und an die „Festlegung des Ziel-Security-Levels (SL-T) für jede Zone und jeden Conduit“ fest, und Teil 3-3 bestimmt die Sicherheitsanforderungen an das System und die Security-Level. Ein GPU-Edge-Knoten an der Linie gehört meist zur Zone seiner Zelle und die zentralen Server zur IT, und der Verkehr zwischen ihnen, Modellpakete nach unten sowie Bilder und Ergebnisse nach oben, ist ein Conduit mit eigenen Regeln. NIST SP 800-82 Rev. 3 (September 2023) nennt eine DMZ-Netzwerkarchitektur mit Firewalls unter den Möglichkeiten, Verkehr daran zu hindern, „direkt zwischen dem Unternehmens- und dem OT-Netz zu fließen“. Die Risikobeurteilung des Werks bestimmt die Zonen und die Ziel-Level. Unser Leitfaden zu Netzwerksegmentierung und Mikrosegmentierung beschreibt die OT-Zone und ihre DMZ in einem IT-Netz. Auch der Zugriff von Lieferanten für Modell-Updates sollte über den Conduit laufen und nicht über einen direkten Weg in die Zelle.
Produktionsstillstand und Wartungsfenster
Ein GPU-Knoten an der Linie ist Teil der Produktion, seine Änderungen folgen also dem Kalender der Produktion. Updates von Treiber, CUDA und Containern sowie neue Modellversionen werden in geplanten Produktionsstillständen eingespielt, nach einem Test auf einem Staging-Knoten mit derselben Karte und demselben Modell. Halten Sie die vorherige Modellversion und den vorherigen Treiber bereit, damit sich eine Änderung im selben Stillstand zurücknehmen lässt.
- Legen Sie Treiberzweig und Container-Image je Kartentyp fest und dokumentieren Sie beides für jeden Edge-Knoten.
- Validieren Sie eine neue Modellversion auf dem Staging-Knoten mit Bildern von der Linie, gegen Abnahmekriterien, die die Qualitätssicherung freigegeben hat.
- Rollen Sie sie zuerst an einer Linie aus und vergleichen Sie deren Gut- und Schlechtraten mit der vorherigen Version.
- Behalten Sie die vorherige Version auf jedem Knoten, bis der nächste geplante Stillstand die neue bestätigt.
Werke mit Dreischichtbetrieb haben auch für den zentralen Assistenten keine ruhigen Stunden. Zwei Server, von denen jeder die ganze Spitze trägt, wie im Leitfaden nach Unternehmensgröße, erlauben es, einen Server zu aktualisieren, während der andere alle Nutzer bedient.
Konfigurationen für 500 bis 2.000 Mitarbeiter
Die Tabelle wendet diese Zuordnung auf drei Werksprofile an. Mit den Beispielwerten des Leitfadens nach Unternehmensgröße ergeben 1.000 Mitarbeiter rund 40 Anfragen in Bearbeitung in der Spitze, und drei Kopien von gpt-oss-120b auf einem Server halten rund 57.
| WERKE, MITARBEITER | EDGE AN DER LINIE | ENGINEERING | ASSISTENT UND RAG |
|---|---|---|---|
| 1 Werk, 500 | ein Knoten mit L4 oder RTX PRO 4000 SFF je Prüfstation, ein Ersatzknoten | Workstations mit RTX PRO 6000 für Simulation und digitale Zwillinge | zwei Server mit je 2 × RTX PRO 6000 Server Edition und 1 × L4 |
| 2 bis 3 Werke, 1.000 | dasselbe je Station, ein Ersatzknoten je Kartentyp | ein Server, 4 × RTX PRO 6000 Server Edition, für Simulation und Modelltraining | zwei Server mit je 4 × RTX PRO 6000 Server Edition: drei Modellkopien und eine Karte im MIG-Modus für RAG-Modelle |
| 4 Werke, 2.000 | dasselbe je Station, ein Ersatzknoten je Werk | ein Server, 8 × RTX PRO 6000 Server Edition; 4 × H200 NVL, wenn CFD in doppelter Genauigkeit läuft, mit NVLink-Brücken, wo der Solver sie nutzt | zwei Server mit je 2 × H200 NVL und 1 × L4 |
Unsere Schätzungen, keine Messungen. Größen der Assistenten aus unserem Leitfaden nach Unternehmensgröße (gpt-oss-120b, 32K Kontext, 16-Bit-KV-Cache; 40 Prozent Nutzer in der Spitzenstunde, 6 Anfragen pro Stunde, 30 Sekunden, Spitzenfaktor 2); der Server mit acht Karten folgt NVIDIAs Server-Empfehlung für Omniverse; die Edge-Knoten setzen wenige Kameras je Station und einen Test mit Ihrem Modell voraus.
Jede Auslegung des Assistenten hält die ganze Spitze auf einem Server, wenn der andere ausfällt: 38 Gespräche für 500 Mitarbeiter, 57 für 1.000 und 110 für 2.000. Die Spalte Engineering richtet sich mehr nach den Anwendungen als nach der Kopfzahl.
Wir bauen die zentralen Server auf Bestellung, liefern die Edge-Karten und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Werke, Stationen, Engineering-Anwendungen und Mitarbeiterzahl über das Formular unten, und Konfiguration und Angebot folgen innerhalb eines Werktages.
Was wir liefern
Wir liefern die Karten für jede Ebene dieser Plattform: die L4, RTX PRO 2000, RTX PRO 4000 und RTX PRO 4000 SFF für die Linien, die RTX PRO 6000 in den Editionen Workstation, Max-Q und Server für das Engineering sowie die H200 NVL mit NVLink-Brücken und die L40S für zentrale Server. Sie kommen als professionelle NVIDIA-GPUs für Systeme, die Sie bereits betreiben, oder in auf Bestellung gebauten KI-Servern, montiert und im Burn-in getestet, mit Herstellergarantie und mit Lizenzen für NVIDIA AI Enterprise und vGPU unter einem EU-Vertrag und auf einer Rechnung. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch. Die Assistenten, RAG und MLOps darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Welchen KI-Server braucht ein Industrieunternehmen?
Welche GPU eignet sich für die visuelle Inspektion an der Produktionslinie?
Sollte KI in der Produktion on-premise oder in der Cloud laufen?
Kann ein GPU-Server Simulation, digitale Zwillinge und LLMs gemeinsam betreiben?
Wie wirkt sich IEC 62443 auf den Standort von KI-Servern in der Fabrik aus?
Wie viele GPUs braucht ein LLM-Assistent für 1.000 Mitarbeiter in der Fertigung?
Schicken Sie uns Ihre Werke, Prüfstationen und Kameras, die Engineering-Anwendungen, die Mitarbeiterzahl und die Rack-Positionen, die Sie nutzen wollen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages