KI-Infrastruktur für Banken und Versicherer: GPU-Server für On-Premise-LLMs, Isolation und DORA
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Banken und Versicherer betreiben on-premise interne Assistenten mit RAG, die Prüfung von Schadenfall-, KYC- und AML-Dokumenten, Gesprächstranskription und Code-Assistenten; jeder Anwendungsfall ist ein anderer Modelltyp, und die Karte ergibt sich aus dem Modell und der Spitzenzahl der Anfragen in Bearbeitung
- Mit den Beispielwerten unseres Leitfadens zur Unternehmensgröße senden 2.000 Mitarbeiter in der Spitze rund 80 Anfragen in Bearbeitung; zwei Server mit je acht RTX PRO 6000 Server Edition können nach unserer Schätzung jeweils gpt-oss-120b für diese Spitze tragen, dazu ein Coding-Modell, ein Dokumentmodell und vier MIG-Instanzen mit 24 GB
- DORA gilt seit dem 17. Januar 2025 unter anderem für Kreditinstitute und Versicherungsunternehmen, und ihre RTS 2024/1774 verlangen die Verschlüsselung gerade verwendeter Daten, soweit erforderlich, Netzwerksegmentierung, Zugriff nach dem Prinzip der minimalen Rechte und Logs, die vor Manipulation geschützt sind
- Anhang III Nummer 5 des AI Act führt die Kreditwürdigkeit natürlicher Personen und die Preisbildung bei Lebens- und Krankenversicherungen als Hochrisiko-Nutzungen auf; nach dem geänderten Artikel 113 gelten diese Vorschriften ab dem 2. Dezember 2027, und Finanzinstitute bewahren die Logs in ihrer Dokumentation nach dem Finanzdienstleistungsrecht auf
- MIG teilt eine H200 NVL in bis zu 7 Instanzen und eine RTX PRO 6000 in bis zu 4, mit eigenem Speicher und Cache; NVIDIA nennt Confidential Computing für die H200 NVL, und seine Seite zu Confidential Containers nennt Single-GPU-Passthrough für die RTX PRO 6000 Server Edition und die H200, wobei jede GPU des Hosts einer vertraulichen VM zugewiesen wird
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
KI-Infrastruktur für Banken und Versicherer: was auf den GPUs läuft
On-Premise-LLMs können in einer Bank oder bei einem Versicherer fünf Arten von Arbeit übernehmen: einen internen Assistenten mit RAG auf Richtlinien und Arbeitsanweisungen, die Prüfung von Schadenfall-, KYC- und AML-Dokumenten, Transkription und Zusammenfassung von Kundengesprächen, Code-Assistenten für die eigenen Entwickler und Batch-Zusammenfassungen von Archiven. Jede davon ist ein anderer Modelltyp mit eigenem Speicherprofil; KI-Infrastruktur für Banken und Versicherer wird deshalb aus der Liste der Anwendungsfälle und der Spitzenzahl der Anfragen in Bearbeitung geplant, nicht aus der Mitarbeiterzahl. Die Modelle laufen auf Servern, die das Institut kontrolliert, im eigenen Rechenzentrum oder in einem gehosteten Rack.
Die Auslegung je Modell behandelt unser Leitfaden zum privaten ChatGPT-Server nach Unternehmensgröße, der die Mitarbeiterzahl in Anfragen in Bearbeitung umrechnet. Dieser Artikel ergänzt die Punkte, die im Finanzsektor zählen: die EU-Vorschriften, die den Rahmen für die Infrastruktur setzen, die Isolation zwischen Geschäftsbereichen, Confidential Computing, Offline-Installation und Logs.
Anwendungsfälle, Modelltypen und GPU-Karten
Die Tabelle ordnet die üblichen Anwendungsfälle Modelltypen und den Karten zu, die wir liefern. Die Zahlen stammen von den Modellseiten der Hersteller und aus den Schätzungen unserer Sizing-Leitfäden, die ihre Methode angeben.
| ANWENDUNGSFALL | MODELLTYP | KARTE UND AUFTEILUNG |
|---|---|---|
| Interner Assistent und RAG | allgemeines LLM wie gpt-oss-120b, dazu Embedding- und Reranker-Modelle | eine RTX PRO 6000 oder H200 NVL je Kopie des LLM; Retrieval-Modelle auf einer MIG-Instanz mit 24 GB oder einer L4 |
| Schadenfälle, KYC und AML | OCR-Modelle mit 0,9B bis 8,3B oder ein Vision-Language-Modell wie Qwen3.8-27B | kleine OCR-Modelle auf einer L4 oder RTX PRO 4000; ein 27B-Modell auf einer RTX PRO 6000 oder H200 NVL |
| Gesprächstranskription | Whisper large-v3 oder Parakeet, dazu ein LLM für Zusammenfassungen | Whisper large braucht rund 10 GB, also eine MIG-Instanz, eine L4 oder eine L40S |
| Code-Assistent | Coding-Modell wie Qwen3-Coder-30B-A3B | eine RTX PRO 6000 hält seine FP8-Gewichte und rund 19 Sitzungen mit 64K bei einem FP8-Cache |
VRAM von Whisper aus OpenAIs Whisper-Repository; Größen der OCR-Modelle und von Qwen3.8-27B aus unserem Leitfaden zu Dokument-KI; Sitzungen von Qwen3-Coder aus unserem Leitfaden zum Coding-Assistenten; gpt-oss-120b aus unserem Leitfaden zur Unternehmensgröße; MIG-Profile aus NVIDIAs MIG User Guide (11. September 2026). Alle Sitzungszahlen sind unsere Schätzungen.
Die Dokumentenprüfung ist meist ein Batch-Job mit Termin, während der Assistent und der Code-Assistent interaktiv sind und für die Spitzenstunde ausgelegt werden. Getrennte Karten verhindern, dass ein großer Batch von Schadenfall-Dokumenten den Assistenten während der Bürozeiten verlangsamt.
Ein Rechenbeispiel: zwei GPU-Server für 2.000 Mitarbeiter
Nehmen Sie eine Bank oder einen Versicherer mit 2.000 Beschäftigten und die Beispielwerte unseres Leitfadens zur Unternehmensgröße: 40 Prozent der Mitarbeiter nutzen den Assistenten in der Spitzenstunde, jeder sendet 6 Anfragen pro Stunde, eine Anfrage ist 30 Sekunden in Bearbeitung, und die Spitze liegt beim Doppelten des Stundenmittels. Das ergibt rund 80 Anfragen in Bearbeitung. Mit gpt-oss-120b bei deklarierten 32K Kontext und einem 16-Bit-KV-Cache hält eine RTX PRO 6000 nach unserer Schätzung rund 19 Gespräche; fünf Karten mit je einer Kopie halten also 95.
Jeder von zwei Servern mit acht RTX PRO 6000 Server Edition kann dann alle Anwendungsfälle des Dienstes allein tragen:
- Karten 1 bis 5: je eine Kopie von gpt-oss-120b, 95 Gespräche bei 32K, über der Spitze von 80.
- Karte 6: Qwen3-Coder-30B-A3B in FP8 für den Code-Assistenten, rund 19 Sitzungen mit 64K bei einem FP8-Cache.
- Karte 7: ein Vision-Language-Modell wie Qwen3.8-27B (30,9 GB in FP8) für Schadenfall- und KYC-Dokumente.
- Karte 8: per MIG in vier Instanzen mit 24 GB aufgeteilt, für das Embedding-Modell, den Reranker, Whisper und ein kleines OCR-Modell.
Weil jeder Server die ganze Spitze hält, läuft der Dienst weiter, wenn ein Server wegen eines Ausfalls oder eines Treiber-Updates nicht verfügbar ist. Mit der H200 NVL schätzt derselbe Leitfaden rund 55 Gespräche je Karte bei 32K; zwei Karten je Server tragen also den Assistenten, und die übrigen Anwendungsfälle brauchen eigene Karten. Acht Karten mit 600 W ziehen 4,8 kW vor Prozessoren und Lüftern, was an jedem Rackplatz eine Drehstromversorgung erfordert.
Die beiden Server können in zwei Räumen oder an zwei Standorten stehen, was das Risiko eines Strom- oder Kühlungsausfalls verteilt. Ob der zweite Standort im Notfallplan des Instituts auch als Ausweichstandort dient, gehört zu seiner DORA-Planung, die unser Leitfaden zu DORA, Backup und Resilienztests behandelt.
Inferenzserver bauen wir mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Schicken Sie uns über das Formular unten Ihre Mitarbeiterzahl, die Anwendungsfälle und die Modelle, die Sie in Betracht ziehen, und wir liefern innerhalb eines Werktages Konfiguration und Angebot.
DORA und AI Act: der EU-Rahmen für KI-Infrastruktur
Die Verordnung (EU) 2022/2554 über die digitale operationale Resilienz im Finanzsektor (DORA) nennt in Artikel 2 Absatz 1 unter den Finanzunternehmen, für die sie gilt, Kreditinstitute sowie Versicherungs- und Rückversicherungsunternehmen, und nach ihrem Artikel 64 gilt sie ab dem 17. Januar 2025. Artikel 6 Absatz 1 verlangt einen soliden, umfassenden und gut dokumentierten IKT-Risikomanagementrahmen, und die Delegierte Verordnung (EU) 2024/1774 der Kommission vom 13. März 2024, die RTS zum IKT-Risikomanagement, regelt dessen Richtlinien und Tools in Titel II, von der Verschlüsselung über die Datenaufzeichnung bis zur Zugangskontrolle; Finanzunternehmen, die unter den vereinfachten Rahmen nach Artikel 16 Absatz 1 DORA fallen, folgen stattdessen Titel III. Die Definition der IKT-Dienstleistungen in Artikel 3 Nummer 21 DORA umfasst auch Hardware als Dienstleistung und Hardwaredienstleistungen, einschließlich technischer Unterstützung durch Software- oder Firmware-Aktualisierungen des Hardwareanbieters; ein Supportvertrag für GPU-Server kann also darunter fallen.
Der AI Act ergänzt Vorschriften für bestimmte Nutzungen, nicht für Infrastruktur. Anhang III Nummer 5 führt KI-Systeme auf, die „bestimmungsgemäß für die Kreditwürdigkeitsprüfung und Bonitätsbewertung natürlicher Personen verwendet werden sollen“, mit einer Ausnahme für die Aufdeckung von Finanzbetrug, und Systeme für Risikobewertung und Preisbildung „in Bezug auf natürliche Personen im Fall von Lebens- und Krankenversicherungen“. Nach Artikel 113 in der Fassung der Verordnung (EU) 2026/1744, der Digital-Omnibus-Verordnung zur KI, gelten die Vorschriften für Systeme nach Anhang III ab dem 2. Dezember 2027. Für Betreiber solcher Hochrisiko-Systeme, die Finanzinstitute sind, bestimmt Artikel 26 Absatz 6, dass sie die Protokolle als Teil der Dokumentation aufbewahren, die sie nach dem einschlägigen Finanzdienstleistungsrecht der Union führen. Ein interner Assistent, der Entwürfe schreibt und zusammenfasst, gehört nicht zu den Zwecken nach Anhang III, und unser Leitfaden zum EU AI Act für Unternehmen, die LLMs betreiben behandelt die Betreiberpflichten. Ob ein bestimmtes System hochriskant ist und ob ein Supportvertrag eine IKT-Dienstleistung für eine kritische oder wichtige Funktion im Sinne von Artikel 3 Nummer 22 DORA ist, ist eine rechtliche Bewertung, die den Rechts- und Compliance-Abteilungen des Instituts obliegt.
Geschäftsbereiche mit MIG und getrennten Karten isolieren
Eine Bank oder ein Versicherer muss unter Umständen Geschäftsbereiche trennen, deren Daten sich nicht mischen dürfen, etwa das Privatkundenkreditgeschäft, die Vermögensverwaltung und die interne Revision. Auf einem GPU-Server gibt es drei Stufen der Trennung, und die Wahl ergibt sich aus den Daten und der Modellgröße.
Die erste ist die Anwendungsebene: Ein Modell bedient mehrere Bereiche, und die RAG-Plattform filtert Dokumente nach den Zugriffsrechten jedes Nutzers, bevor sie in den Prompt gelangen. Die zweite ist MIG, das NVIDIA als Möglichkeit beschreibt, eine GPU „in bis zu sieben separate GPU-Instanzen“ aufzuteilen. Sein User Guide hält fest, dass „L2-Cache-Bänke, Speichercontroller und DRAM-Adressbusse jeweils exklusiv einer einzelnen Instanz zugewiesen werden“ und dass MIG „eine definierte Dienstgüte (QoS) mit Fehlerisolation für verschiedene Clients“ bietet. Mit Stand 11. September 2026 nennt NVIDIAs Tabelle der unterstützten GPUs 7 Instanzen für die H200 NVL und 4 für jede Edition der RTX PRO 6000; eine RTX PRO 6000 gibt Geschäftsbereichen also bis zu vier Instanzen mit 24 GB. Die dritte Stufe ist eine ganze Karte oder ein ganzer Server je Bereich, was große Modelle ohnehin brauchen: Die Gewichte von gpt-oss-120b belegen rund 60,8 GiB einer Karte mit 96 GB, MIG passt also zu den kleinen Retrieval-, Spracherkennungs- und OCR-Modellen, nicht zum Haupt-LLM.
Bereiche, die ein Modell, aber keine Dokumente teilen dürfen, arbeiten auf der ersten Stufe. Bereiche, deren Daten Speicher oder Cache nicht mit anderen teilen dürfen, erhalten eine eigene MIG-Instanz oder Karte. MIG-Instanzen auf einer Karte teilen sich weiterhin den Host und seinen GPU-Treiber; die Instanz jedes Bereichs läuft deshalb zusätzlich in einer eigenen virtuellen Maschine oder einem eigenen Container, mit Zugriffsregeln, die in der Dokumentation der Plattform festgehalten sind.
Confidential Computing, Offline-Installation und Logs
Die RTS verlangen die „Verschlüsselung von Daten, die gerade verwendet werden, soweit erforderlich“; ist das nicht möglich, verarbeiten die Finanzunternehmen diese Daten „in einer getrennten und geschützten Umgebung oder ergreifen gleichwertige Maßnahmen“. Auf GPUs werden Daten während der Verarbeitung durch Confidential Computing geschützt, das eine Host-CPU mit AMD SEV-SNP oder Intel TDX und eine GPU im Confidential-Computing-Modus braucht. NVIDIAs Produktseite zur H200 führt Confidential Computing für die H200 SXM und die H200 NVL als „Supported“. Seine Seite zu Confidential Containers, aktualisiert am 22. September 2026, nennt die RTX PRO 6000 Blackwell Server Edition und die „NVIDIA H200“, ohne die Edition anzugeben, für Single-GPU-Passthrough. Ein Hinweis auf dieser Seite besagt: „Nur einen Teil der GPUs eines Knotens für Confidential Computing zu konfigurieren, wird nicht unterstützt“, und alle GPUs des Hosts müssen einer einzigen virtuellen Maschine für Confidential Containers zugewiesen werden. Nach unserem Verständnis betreibt ein Host in diesem Stack eine vertrauliche virtuelle Maschine mit einer dieser Karten; vertrauliche Workloads laufen also auf eigenen Servern. Ein Modell wie gpt-oss-120b, das auf einer Karte läuft, passt zu dieser Aufteilung. Multi-GPU-Passthrough führt die Seite für die H200 nur im Modus Protected PCIe, den unser Leitfaden zu Confidential Computing auf H200 NVL und RTX PRO 6000 den HGX-Boards mit 8 GPUs zuordnet; er behandelt außerdem die Attestierung und die unterstützten Modi.
Wo Inferenzserver ohne Internetzugang laufen, werden Treiber, Container-Images und Modellgewichte auf einem verbundenen Staging-Host in festen Versionen geholt, gegen ein SHA-256-Manifest geprüft und aus internen Spiegeln installiert, wie unser Leitfaden zur Offline-Installation eines Air-Gapped LLM-Servers beschreibt. Die festgehaltenen Hashes geben dem Asset-Inventar dann einen überprüfbaren Nachweis jeder Modellversion.
Für Logs nennen die RTS Ereignisse aus Zugangskontrolle und Identitätsmanagement, Kapazitätsmanagement, Änderungsmanagement, IKT-Betrieb und Netzwerkverkehr und verlangen „Maßnahmen zum Schutz von Datenaufzeichnungssystemen und -informationen vor Manipulation, Löschung und unbefugtem Zugriff“. Für einen LLM-Dienst entsteht der nützliche Datensatz am Gateway: Nutzeridentität, Modell und Version, Zeit und, wo die Richtlinie es erlaubt, Prompts und Antworten. Ein Gateway, das jeden Nutzer authentifiziert, unterstützt außerdem die Vorschrift der RTS zur Rechenschaftspflicht der Nutzer, die die Nutzung generischer und gemeinsam genutzter Benutzerkonten beschränkt.
Unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO, umfasst die Protokollierung von Anfragen und Antworten sowie Daten- und Berechtigungsverwaltung. Beschreiben Sie im Formular unten, welche Geschäftsbereiche die Plattform teilen werden und was jeder davon sehen darf.
Kontrollerwartungen und technische Maßnahmen
Die Tabelle stellt Erwartungen aus den EU-Texten technischen Maßnahmen auf einer GPU-Plattform gegenüber. Eine Maßnahme unterstützt eine Kontrolle; ob das Institut den Text erfüllt, beurteilt es selbst.
| QUELLE | ERWARTUNG | TECHNISCHE MASSNAHME |
|---|---|---|
| RTS Art. 6 Abs. 2 Buchst. b | Verschlüsselung gerade verwendeter Daten, soweit erforderlich | Confidential Computing auf dedizierten Servern oder eine eigene Karte oder MIG-Instanz mit eigener VM |
| RTS Art. 13 Buchst. a | Trennung und Segmentierung von Systemen und Netzwerken | GPU-Server und ihre BMCs in getrennten Segmenten; Inferenz-API nur vom Gateway erreichbar |
| RTS Art. 21 | Kenntnis nur, wenn nötig, minimale Rechte, identifizierbare Nutzer | Single Sign-on am Gateway, keine gemeinsamen API-Schlüssel, eigene Administratorkonten |
| RTS Art. 12 | Datenaufzeichnung, geschützt vor Manipulation und Löschung | Gateway-Datensätze an einen zentralen Log-Speicher mit eingeschränktem Schreibzugriff |
| RTS Art. 9 | Kapazitäts- und Leistungsmanagement | GPU-Speicher, Auslastung und Anfragen in Bearbeitung je Modell, verglichen mit der ausgelegten Spitze |
| AI Act Art. 26 Abs. 6 | Protokolle von Hochrisiko-Systemen, mindestens sechs Monate | Aufbewahrung je System, abgelegt bei der Dokumentation nach dem Finanzdienstleistungsrecht |
Delegierte Verordnung (EU) 2024/1774 der Kommission (RTS zum IKT-Risikomanagement, Titel II) und Verordnung (EU) 2024/1689 in der konsolidierten Fassung vom 27. Juli 2026, gelesen im Text des Amtsblatts und im AI Act Service Desk der Kommission am 10. Oktober 2026. Die Maßnahmen sind technische Beispiele, keine Aussage über die Einhaltung der Vorschriften.
Was wir liefern
Wir liefern die RTX PRO 6000 Server Edition, die H200 NVL mit NVLink-Bridges, die L40S, die L4 und die kleineren RTX-PRO-Karten, als Karten oder in nach Auftrag gebauten KI-Servern mit 2 bis 8 GPUs je Knoten, im Burn-in getestet, mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung, und das Kartensortiment steht auf unserer Seite zu professionellen GPUs. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch. Die Plattform darüber, private LLMs, RAG mit Zugriffsrechten, Protokollierung der Anfragen und MLOps, ist unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO, auf Ihren Servern oder in einem Tier-3-Rechenzentrum in Litauen.
FAQ
Welche KI-Infrastruktur braucht eine Bank für On-Premise-LLMs?
Wie viele GPUs braucht eine Versicherung mit 2.000 Mitarbeitern für ein LLM?
Gilt DORA für KI-Infrastruktur in Banken?
Ist Kreditscoring mit KI nach dem EU AI Act hochriskant?
Wie isoliert man Geschäftsbereiche auf einem GPU-Server?
Funktioniert Confidential Computing auf RTX PRO 6000 und H200?
Schicken Sie uns Ihre Mitarbeiterzahl, die geplanten Anwendungsfälle (Assistent, Dokumentenprüfung, Gesprächstranskription, Code), die Modelle, die Sie in Betracht ziehen, und die Standorte, an denen die Server stehen werden. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages