Managed KI-Server und private KI: wer die LLM-Plattform nach dem Go-live betreibt und was das Support-SLA abdeckt
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Nach dem Go-live braucht eine private LLM-Plattform Verantwortliche für Updates von Modellen und Serving-Engine, Updates von GPU-Treibern und Firmware, Kapazitätsprüfungen, die Verwaltung von Zugriffen und Query-Log, Störungen und den Nutzersupport
- Ein Unternehmen deckt das mit eigenem Personal ab, mit dem Support eines Anbieters unter einem vereinbarten SLA oder mit einer Mischung, in der es die Entscheidungen über Modelle, Daten und Aufbewahrung behält und der Anbieter vereinbarte technische Aufgaben ausführt
- Die Update-Last ist stetig: vLLM strebt alle 2 Wochen ein reguläres Release an, und NVIDIA veröffentlicht pro Jahr zwei Production Branches für Treiber, jeder mit Bugfixes und Sicherheitsupdates für bis zu 1 Jahr
- Eine betreute Plattform kann on-premise auf den Servern des Unternehmens laufen oder auf dedizierter Hardware in einem EU-Rechenzentrum; in beiden Fällen sollte der Supportanbieter unter den Zugriffsregeln des Unternehmens arbeiten
- Das Support-SLA legt Umfang, Servicezeiten, Prioritäten und Reaktionszeiten, Wartungsfenster und Änderungsfreigabe, die Protokollierung der Zugriffe, Berichte und den Ausstieg fest, mit Werten, die die Parteien für ihren Fall vereinbaren
Eurokommerz × Vixen.UNO: Private AI/ML Experten kontaktieren →
Managed private KI: wer die Plattform nach dem Go-live betreibt
Nach dem Go-live braucht eine private LLM-Plattform eine verantwortliche Stelle für Updates von Modellen und Serving-Engine, Updates von GPU-Treibern und Firmware, Kapazitätsprüfungen, die Verwaltung von Zugriffen und Query-Log, Störungen und Fragen der Nutzer. Ein Unternehmen kann das mit eigenem Personal abdecken, mit dem Support eines Anbieters unter einem vereinbarten SLA oder mit einer Mischung, in der es die Entscheidungen behält und der Anbieter vereinbarte technische Aufgaben ausführt. Managed private KI, ein Managed KI-Server oder ein Managed Service für private LLMs meint meist die zweite oder dritte Variante, wobei die Modelle weiterhin auf Hardware laufen, die dem Unternehmen dediziert zur Verfügung steht.
Nehmen Sie eine Plattform für 1.200 Mitarbeitende auf zwei GPU-Servern. Darauf laufen ein Chat-Modell, ein Embedding-Modell und ein Reranker auf vLLM, ein Gateway mit Query-Log, ein Chat-Frontend und ein Vektorindex, der aus sechs Dokumentquellen gespeist wird. Das Release-Dokument von vLLM sagt: „Wir streben alle 2 Wochen ein reguläres Release an“. Die Seite von NVIDIA zum Lebenszyklus der Treiber, aktualisiert am 9. September 2026, besagt, dass pro Jahr zwei Production Branches erscheinen, jeder mit Bugfixes und Sicherheitsupdates „für bis zu 1 Jahr“. Jedes Release muss gelesen, getestet und in einem Wartungsfenster eingespielt werden.
Was nach dem Go-live zu betreiben ist
Unser Leitfaden zum Betrieb einer privaten LLM-Plattform beschreibt die Day-2-Arbeit im Detail: Release-Zyklen, Canary-Rollouts, Runbooks für Störungen und Prüfungen der Zugriffsrechte. Für die Frage, wer sie erledigt, teilen Sie die Arbeit in drei Arten ein.
Die technische Plattformarbeit umfasst die GPU-Server, Firmware und Treiber, Kubernetes, die Serving-Engine, das Gateway, das Frontend und den Index. Sie verlangt Fähigkeiten, die ein mittelständisches IT-Team selten doppelt besetzt hat, und sie ist der Teil, den ein Supportanbieter übernehmen kann. Entscheidungen über Inhalte und Risiken betreffen, welches Modell bereitgestellt wird, welche Dokumente für welche Verzeichnisgruppen in den Index gelangen, wie lange das Query-Log aufbewahrt wird und welche Aufgaben eine öffentliche API nutzen dürfen. Sie bleiben beim Unternehmen, weil sie auf seinen Daten und seinen Richtlinien beruhen. Die Arbeit mit den Nutzern umfasst Fragen, Zugriffsanträge, Schulungen und Rückmeldungen, und sie passt in den Service Desk, den das Unternehmen bereits betreibt.
Laut PeopleCert erschien ITIL 4 im Jahr 2019 mit Leitlinien für 34 Managementpraktiken. Wo die IT bereits damit arbeitet, schließt sich die KI-Plattform den bestehenden Praktiken an, statt eigene zu bekommen. Störungen gehen an Incident Management und Problem Management, Zugriffsanträge an Service Request Management, und Updates von Modellen und Engine durchlaufen Change Enablement und Deployment Management. Unser KI-Einführungsplan für 1.000 Mitarbeiter richtet die Kategorie im Service Desk mit drei Wegen ein: Zugriff, Plattform und Inhalte.
Drei Betriebsmodelle: eigenes Personal, Support unter SLA oder Mischung
Mit eigenem Personal besetzt das Unternehmen jede Rolle selbst. Unser Day-2-Leitfaden nennt vier: einen Plattform-Owner, einen Modell-Owner, einen Daten-Owner für jede Dokumentquelle und die IT-Sicherheit. Eine Person kann zwei Rollen innehaben, aber jede technische Fähigkeit braucht eine zweite Person für Urlaub und Krankheit; planen Sie für 1.200 Nutzer also mindestens zwei Personen mit Kenntnissen in GPU, Kubernetes und LLM-Serving ein, neben ihren übrigen Aufgaben.
Mit Support unter einem SLA erledigt der Anbieter die technische Plattformarbeit innerhalb der Zeiten und Reaktionszeiten, die die Vereinbarung festlegt. Das Unternehmen entscheidet weiterhin, was hineinkommt und wer es lesen darf. Das AI Risk Management Framework des NIST (NIST AI 100-1, Januar 2023) verlangt in GOVERN 2.1, dass Rollen, Verantwortlichkeiten und Kommunikationswege für das Erfassen, Messen und Steuern von KI-Risiken dokumentiert und für Personen und Teams in der gesamten Organisation klar sind, und eine Supportvereinbarung ersetzt diese Dokumentation nicht.
Die Mischung passt zu einem Unternehmen, das ein IT-Team hat, aber keine zweite Person für jede Plattformfähigkeit. Das Unternehmen behält den Modell-Owner, die Daten-Owner, die IT-Sicherheit und den First Level im Service Desk; der Anbieter ist der Second Level für Störungen der Plattform und führt Upgrades in vereinbarten Fenstern durch. Die Aufteilung kann sich ändern, sobald das Unternehmen einen eigenen Plattform-Owner ausgebildet hat.
Nach dem Aufbau lässt Ihnen unsere Leistung Private AI/ML die Wahl: Ihr eigenes Personal oder unser Support unter einem vereinbarten SLA. Schreiben Sie uns, welche Aufgaben Sie im eigenen Haus behalten möchten und wer Ihre Systeme heute betreibt.
RACI für eine private LLM-Plattform: Unternehmen und Supportanbieter
Eine RACI-Matrix gibt jeder Aufgabe eine Partei mit der Gesamtverantwortung (A), die Parteien, die sie ausführen (R), diejenigen, die vorher konsultiert werden (C), und diejenigen, die danach informiert werden (I). Für das Mischmodell kann die Aufteilung so aussehen.
| AUFGABE | UNTERNEHMEN | SUPPORTANBIETER |
|---|---|---|
| Treiber- und Firmware-Update | A: genehmigt Fenster und Änderung | R: testet auf einem Knoten, spielt Knoten für Knoten ein, berichtet |
| Upgrade der Serving-Engine | A: Modell-Owner gibt die Evaluationsergebnisse frei | R: führt das Upgrade durch, lässt den Evaluationssatz laufen, hält das Rollback bereit |
| Modellwechsel oder -update | A und R: Modell-Owner wählt den Checkpoint | C: Speicher, Durchsatz und Serving-Einstellungen |
| Dokumentquellen und Zugriff | A und R: Daten-Owner und IT-Sicherheit legen die Verzeichnisgruppen fest | C: ordnet die Verzeichnisgruppen den Quellen im Index zu |
| Aufbewahrung des Query-Logs | A: IT-Sicherheit und Rechtsabteilung legen die Frist fest | R: richtet die automatisierte Löschung und den Zugriff auf das Log ein |
| Kapazitätsprüfung | A: entscheidet über weitere GPUs oder Server | R: bereitet Werte der Spitzenstunde und Optionen vor |
| Störung der Plattform | A: Service-Owner, I: Nutzer über den Service Desk | R: Diagnose und Wiederherstellung innerhalb der vereinbarten Zeiten |
| Nutzerfragen und Zugriff | R: Service Desk, First Level | C: Second Level für Störungen der Plattform |
| Öffentliche APIs (hybrid) | A: entscheidet je Aufgabe und Datenklasse | R: schaltet den Weg frei und protokolliert, was hinausgeht |
Beispielhafte Aufteilung für eine Plattform mit 500 bis 2.000 Nutzern, keine Beschreibung eines bestimmten Vertrags; die Rollen folgen unserem Day-2-Leitfaden und NIST AI RMF GOVERN 2.1.
Die Kapazitätsprüfung stützt sich auf die Serving-Metriken aus unserem Leitfaden zum LLM-Monitoring mit vLLM-Metriken, und die Entscheidung über den nächsten Server behandelt unser Leitfaden zur GPU-Kapazitätsplanung.
Managed KI-Server on-premise oder in einem EU-Rechenzentrum
Der Standort ändert, wer Raum, Strom und physischen Zugang stellt, aber nicht, wer über die Daten entscheidet. On-premise stehen die Server im Serverraum des Unternehmens, und der Supportanbieter erreicht sie über eine Verbindung, die das Unternehmen kontrolliert. In einem EU-Rechenzentrum auf dedizierter Hardware stellt der Betreiber des Rechenzentrums Strom, Kühlung, physische Sicherheit und Anbindung bereit, und die Plattform wird über ein VPN oder eine Standleitung erreicht. Unser Artikel zum Hosting privater LLMs in einem EU-Rechenzentrum vergleicht die Hosting-Optionen im Detail.
| DEPLOYMENT-OPTION | BEIM UNTERNEHMEN | VON DRITTEN BETREUT |
|---|---|---|
| On-Premise, eigenes Personal | Raum, Strom, Netzwerk, Server und der gesamte Software-Stack | nur Herstellergarantie und Herstellersupport |
| On-Premise, Support mit SLA | Raum, Strom, Netzwerk, Entscheidungen über Modelle, Daten und Aufbewahrung | vereinbarte Plattformaufgaben innerhalb der Servicezeiten |
| EU-Rechenzentrum, dediziert | Entscheidungen über Modelle, Daten, Zugriff und Aufbewahrung | Strom, Kühlung, physische Sicherheit durch den Betreiber; vereinbarte Plattformaufgaben |
| Hybrid mit öffentlichen APIs | die Entscheidung je Aufgabe und Datenklasse | der API-Anbieter betreibt sein Modell; das Query-Log zeigt, was hinausging |
Deployment-Optionen wie auf unserer Seite Private AI/ML; die Aufteilung der Aufgaben ist unser Beispiel.
Mit unserer Leistung Private AI/ML laufen die Modelle auf Ihrer Hardware oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen, und Sie wählen die Option im Assessment. Beschreiben Sie im Formular unten, wo Ihre Plattform laufen soll.
Was ein Support-SLA für eine interne KI-Plattform festlegen sollte
Das SRE-Buch von Google definiert ein SLA als „einen expliziten oder impliziten Vertrag mit Ihren Nutzern, der Konsequenzen für das Erreichen (oder Verfehlen) der darin enthaltenen SLOs umfasst“. Eine interne KI-Plattform hat zwei Arten von Vereinbarung. Das SLO des Unternehmens für den Assistenten, zum Beispiel Antworten ohne Fehler während der Geschäftszeiten, hängt auch von Komponenten ab, die das Unternehmen selbst betreibt, etwa vom Verzeichnisdienst, vom Netzwerk und von den Dokumentquellen. Das SLA des Anbieters deckt die Aufgaben ab, die der Anbieter verantwortet. Halten Sie beide schriftlich fest und trennen Sie sie, damit sich ein verfehltes Ziel auf seine Ursache zurückführen lässt. Ein SLA für den Plattformsupport sollte diese Punkte festlegen:
- Den Umfang, also die Server, Komponenten und Modelle, die abgedeckt sind, und die, die es nicht sind.
- Die Servicezeiten und ob eine Störung außerhalb dieser Zeiten bearbeitet wird oder bis zum nächsten Arbeitstag wartet.
- Prioritätsstufen mit der Reaktionszeit für jede Stufe, in Werten, die beide Parteien für ihren Fall vereinbaren.
- Wartungsfenster, Ankündigungsfristen und die Änderungsfreigabe, mit einem Rollback-Plan für jede Änderung.
- Die Konten des Anbieters, die Systeme, die sie erreichen, die Anmeldung mit Multi-Faktor-Authentifizierung und die Protokollierung jeder Sitzung.
- Berichte zu Störungen, Änderungen und Kapazität und eine Review-Besprechung in einem festen Abstand.
- Die Meldung von Vorfällen durch den Anbieter an das Unternehmen und den Umgang mit Schwachstellen im Stack.
- Den Ausstieg, mit der Übergabe von Konfiguration, Runbooks und Dokumentation und der Entsorgung der Daten, die der Anbieter hatte.
Die Durchführungsverordnung (EU) 2024/2690 gilt für die in ihrem Artikel 1 aufgezählten Anbieter, darunter Anbieter von Cloud-Computing-Diensten, Anbieter von Rechenzentrumsdiensten und Anbieter verwalteter Dienste; für andere Unternehmen ist ihr Anhang ein brauchbarer Maßstab. Nach Nummer 5.1.4 des Anhangs legen die betreffenden Einrichtungen in ihren Verträgen mit Anbietern und Diensteanbietern, soweit angemessen „im Rahmen von Leistungsvereinbarungen“, unter anderem eine Pflicht zur unverzüglichen Meldung von Sicherheitsvorfällen, das Recht auf Prüfung, die Behebung von Schwachstellen und Pflichten bei Vertragskündigung fest. Nummer 5.1.7 ergänzt, dass die Einrichtungen „die Berichte über die Umsetzung der Leistungsvereinbarungen regelmäßig verfolgen“, soweit anwendbar.
Herstellersupport hinter einer Managed-LLM-Plattform
Ein Supportanbieter ist auf die Hersteller hinter dem Stack angewiesen. Für NVIDIA AI Enterprise beschreibt NVIDIAs Supportseite, Stand Oktober 2026, ein „Abonnement für Support, Upgrades und Wartung, das in jeder Softwarelizenz von NVIDIA AI Enterprise enthalten ist“, mit Experten, die „während der lokalen Geschäftszeiten“ verfügbar sind. Dieselbe Seite führt NVIDIA-Certified Systems unter den unterstützten Infrastrukturoptionen auf; prüfen Sie also die Zertifizierung der GPU-Server. NVIDIA verkauft außerdem für ausgewählte Produkte Business Critical Support, den es als seine Premium-Stufe bezeichnet, mit einer Reaktionszeit von einer Stunde für Fälle mit Severity Level 1. Unser Leitfaden zur Lizenzierung von NVIDIA AI Enterprise erklärt, was das Abonnement abdeckt.
vLLM ist ein Open-Source-Projekt ohne eigenes Support-SLA; kommerziellen Support für eine Laufzeitumgebung auf Basis von vLLM verkaufen Anbieter wie Red Hat, auf dessen Seite zu AI Inference „Powered by vLLM and llm-d“ steht. vLLM veröffentlicht Sicherheitshinweise auf seiner Security-Seite bei GitHub, den jüngsten davon am 27. Juli 2026. Für kritische Probleme und solche mit hohem Schweregrad besagt seine Richtlinie, dass Fixes vor der öffentlichen Bekanntgabe in einem privaten Security-Fork entwickelt werden. Der Betreiber der Plattform muss diese Hinweise verfolgen, beurteilen, ob ein Fix die eingesetzte Version betrifft, und das Upgrade einplanen; das SLA sollte festlegen, wer das tut.
GPU-Server sind durch die Herstellergarantie abgedeckt. Das SLA sollte benennen, wer den Garantiefall eröffnet, wer die vom Hersteller verlangte Diagnose durchführt und wer das Teil vor Ort tauscht.
Zugriff, Datenschutz und Ausstieg in einem Managed-Vertrag
Ein Supportanbieter mit Administratorrechten auf den GPU-Servern kann Prompts, Antworten, den Index und das Query-Log lesen, die personenbezogene Daten enthalten. Artikel 28 Absatz 3 DSGVO verlangt, dass die Verarbeitung durch einen Auftragsverarbeiter „auf der Grundlage eines Vertrags oder eines anderen Rechtsinstruments“ erfolgt, in dem Gegenstand und Dauer, Art und Zweck der Verarbeitung, die Art der personenbezogenen Daten, die Kategorien betroffener Personen und die Pflichten und Rechte des Verantwortlichen festgelegt sind. Ob der Anbieter für Ihre Daten als Auftragsverarbeiter handelt, ist eine rechtliche Bewertung für Ihre Rechtsabteilung. Geben Sie dem Anbieter namentliche Konten im Verzeichnisdienst, beschränken Sie sie auf die Plattform und protokollieren Sie jede Sitzung.
Planen Sie den Ausstieg bei der Unterzeichnung. Konfigurations- und Deployment-Dateien gehören in ein Repository, das dem Unternehmen gehört, Runbooks in die Dokumentation des Unternehmens, und die Zugangsdaten des Anbieters werden am letzten Tag widerrufen. GOVERN 6.2 des NIST verlangt „Notfallprozesse“ für den Umgang mit Ausfällen oder Vorfällen in Daten oder KI-Systemen Dritter, die als hochriskant eingestuft werden; wo ein Anbieter die Plattform betreibt, gehört ein schriftlicher Übergabeplan für das Vertragsende dazu.
Was wir tun
Unsere Leistung Private AI/ML baut und betreut die Plattform und schult Ihr Team, sie zu betreiben und weiterzuentwickeln; danach ist es Ihre Wahl: Ihr eigenes Personal oder unser Support unter einem vereinbarten SLA. Die Modelle laufen on-premise auf Ihren Servern oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen, mit Protokollierung von Anfragen und Antworten sowie Daten- und Berechtigungsverwaltung, und öffentliche APIs kommen nur dort zum Einsatz, wo Sie sie freigeben. Unser Engineering-Partner Vixen.UNO arbeitet in Ihrer Umgebung unter Ihren Zugriffsregeln und nimmt keine Kopien von Produktivdaten mit, mit NDA vor technischen Details und Auftragsverarbeitungsvertrag auf Anfrage, wie unsere Seite Sicherheit & Compliance beschreibt. Eurokommerz hält den Vertrag und liefert die GPU-Server, und ein fester Projektleiter von Eurokommerz bleibt Ihr zentraler Ansprechpartner. Das erste Gespräch ist kostenlos, und der Preis des technischen Assessments steht vor Beginn fest.
FAQ
Was ist ein Managed Service für private KI?
Wer betreibt eine private KI-Plattform nach Projektende?
Was umfasst der Betrieb einer Managed-LLM-Plattform?
Was sollte ein SLA für den Betrieb einer KI-Plattform festlegen?
Kann ein Managed KI-Server in einem EU-Rechenzentrum laufen?
Ist bei NVIDIA AI Enterprise Support enthalten?
Schicken Sie uns die Modelle und GPU-Server, die Sie betreiben oder planen, die Zahl der Nutzer, wo die Plattform laufen soll und welche Aufgaben Ihr eigenes Personal behalten wird. Wir antworten innerhalb eines Werktages, und im ersten Gespräch gehen wir Prozess und Daten mit Ihnen durch, sodass Sie mit 2 bis 3 möglichen Lösungsszenarien herausgehen. Das erste Gespräch ist kostenlos.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages