BLOG · GUIDE ·

Managed KI-Server und private KI: wer die LLM-Plattform nach dem Go-live betreibt und was das Support-SLA abdeckt

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Nach dem Go-live braucht eine private LLM-Plattform Verantwortliche für Updates von Modellen und Serving-Engine, Updates von GPU-Treibern und Firmware, Kapazitätsprüfungen, die Verwaltung von Zugriffen und Query-Log, Störungen und den Nutzersupport
  • Ein Unternehmen deckt das mit eigenem Personal ab, mit dem Support eines Anbieters unter einem vereinbarten SLA oder mit einer Mischung, in der es die Entscheidungen über Modelle, Daten und Aufbewahrung behält und der Anbieter vereinbarte technische Aufgaben ausführt
  • Die Update-Last ist stetig: vLLM strebt alle 2 Wochen ein reguläres Release an, und NVIDIA veröffentlicht pro Jahr zwei Production Branches für Treiber, jeder mit Bugfixes und Sicherheitsupdates für bis zu 1 Jahr
  • Eine betreute Plattform kann on-premise auf den Servern des Unternehmens laufen oder auf dedizierter Hardware in einem EU-Rechenzentrum; in beiden Fällen sollte der Supportanbieter unter den Zugriffsregeln des Unternehmens arbeiten
  • Das Support-SLA legt Umfang, Servicezeiten, Prioritäten und Reaktionszeiten, Wartungsfenster und Änderungsfreigabe, die Protokollierung der Zugriffe, Berichte und den Ausstieg fest, mit Werten, die die Parteien für ihren Fall vereinbaren

Eurokommerz × Vixen.UNO: Private AI/ML  Experten kontaktieren →

Managed private KI: wer die Plattform nach dem Go-live betreibt

Nach dem Go-live braucht eine private LLM-Plattform eine verantwortliche Stelle für Updates von Modellen und Serving-Engine, Updates von GPU-Treibern und Firmware, Kapazitätsprüfungen, die Verwaltung von Zugriffen und Query-Log, Störungen und Fragen der Nutzer. Ein Unternehmen kann das mit eigenem Personal abdecken, mit dem Support eines Anbieters unter einem vereinbarten SLA oder mit einer Mischung, in der es die Entscheidungen behält und der Anbieter vereinbarte technische Aufgaben ausführt. Managed private KI, ein Managed KI-Server oder ein Managed Service für private LLMs meint meist die zweite oder dritte Variante, wobei die Modelle weiterhin auf Hardware laufen, die dem Unternehmen dediziert zur Verfügung steht.

Nehmen Sie eine Plattform für 1.200 Mitarbeitende auf zwei GPU-Servern. Darauf laufen ein Chat-Modell, ein Embedding-Modell und ein Reranker auf vLLM, ein Gateway mit Query-Log, ein Chat-Frontend und ein Vektorindex, der aus sechs Dokumentquellen gespeist wird. Das Release-Dokument von vLLM sagt: „Wir streben alle 2 Wochen ein reguläres Release an“. Die Seite von NVIDIA zum Lebenszyklus der Treiber, aktualisiert am 9. September 2026, besagt, dass pro Jahr zwei Production Branches erscheinen, jeder mit Bugfixes und Sicherheitsupdates „für bis zu 1 Jahr“. Jedes Release muss gelesen, getestet und in einem Wartungsfenster eingespielt werden.

Was nach dem Go-live zu betreiben ist

Unser Leitfaden zum Betrieb einer privaten LLM-Plattform beschreibt die Day-2-Arbeit im Detail: Release-Zyklen, Canary-Rollouts, Runbooks für Störungen und Prüfungen der Zugriffsrechte. Für die Frage, wer sie erledigt, teilen Sie die Arbeit in drei Arten ein.

Die technische Plattformarbeit umfasst die GPU-Server, Firmware und Treiber, Kubernetes, die Serving-Engine, das Gateway, das Frontend und den Index. Sie verlangt Fähigkeiten, die ein mittelständisches IT-Team selten doppelt besetzt hat, und sie ist der Teil, den ein Supportanbieter übernehmen kann. Entscheidungen über Inhalte und Risiken betreffen, welches Modell bereitgestellt wird, welche Dokumente für welche Verzeichnisgruppen in den Index gelangen, wie lange das Query-Log aufbewahrt wird und welche Aufgaben eine öffentliche API nutzen dürfen. Sie bleiben beim Unternehmen, weil sie auf seinen Daten und seinen Richtlinien beruhen. Die Arbeit mit den Nutzern umfasst Fragen, Zugriffsanträge, Schulungen und Rückmeldungen, und sie passt in den Service Desk, den das Unternehmen bereits betreibt.

Laut PeopleCert erschien ITIL 4 im Jahr 2019 mit Leitlinien für 34 Managementpraktiken. Wo die IT bereits damit arbeitet, schließt sich die KI-Plattform den bestehenden Praktiken an, statt eigene zu bekommen. Störungen gehen an Incident Management und Problem Management, Zugriffsanträge an Service Request Management, und Updates von Modellen und Engine durchlaufen Change Enablement und Deployment Management. Unser KI-Einführungsplan für 1.000 Mitarbeiter richtet die Kategorie im Service Desk mit drei Wegen ein: Zugriff, Plattform und Inhalte.

Drei Betriebsmodelle: eigenes Personal, Support unter SLA oder Mischung

Mit eigenem Personal besetzt das Unternehmen jede Rolle selbst. Unser Day-2-Leitfaden nennt vier: einen Plattform-Owner, einen Modell-Owner, einen Daten-Owner für jede Dokumentquelle und die IT-Sicherheit. Eine Person kann zwei Rollen innehaben, aber jede technische Fähigkeit braucht eine zweite Person für Urlaub und Krankheit; planen Sie für 1.200 Nutzer also mindestens zwei Personen mit Kenntnissen in GPU, Kubernetes und LLM-Serving ein, neben ihren übrigen Aufgaben.

Mit Support unter einem SLA erledigt der Anbieter die technische Plattformarbeit innerhalb der Zeiten und Reaktionszeiten, die die Vereinbarung festlegt. Das Unternehmen entscheidet weiterhin, was hineinkommt und wer es lesen darf. Das AI Risk Management Framework des NIST (NIST AI 100-1, Januar 2023) verlangt in GOVERN 2.1, dass Rollen, Verantwortlichkeiten und Kommunikationswege für das Erfassen, Messen und Steuern von KI-Risiken dokumentiert und für Personen und Teams in der gesamten Organisation klar sind, und eine Supportvereinbarung ersetzt diese Dokumentation nicht.

Die Mischung passt zu einem Unternehmen, das ein IT-Team hat, aber keine zweite Person für jede Plattformfähigkeit. Das Unternehmen behält den Modell-Owner, die Daten-Owner, die IT-Sicherheit und den First Level im Service Desk; der Anbieter ist der Second Level für Störungen der Plattform und führt Upgrades in vereinbarten Fenstern durch. Die Aufteilung kann sich ändern, sobald das Unternehmen einen eigenen Plattform-Owner ausgebildet hat.

Nach dem Aufbau lässt Ihnen unsere Leistung Private AI/ML die Wahl: Ihr eigenes Personal oder unser Support unter einem vereinbarten SLA. Schreiben Sie uns, welche Aufgaben Sie im eigenen Haus behalten möchten und wer Ihre Systeme heute betreibt.

RACI für eine private LLM-Plattform: Unternehmen und Supportanbieter

Eine RACI-Matrix gibt jeder Aufgabe eine Partei mit der Gesamtverantwortung (A), die Parteien, die sie ausführen (R), diejenigen, die vorher konsultiert werden (C), und diejenigen, die danach informiert werden (I). Für das Mischmodell kann die Aufteilung so aussehen.

AUFGABEUNTERNEHMENSUPPORTANBIETER
Treiber- und Firmware-UpdateA: genehmigt Fenster und ÄnderungR: testet auf einem Knoten, spielt Knoten für Knoten ein, berichtet
Upgrade der Serving-EngineA: Modell-Owner gibt die Evaluations­ergebnisse freiR: führt das Upgrade durch, lässt den Evaluations­satz laufen, hält das Rollback bereit
Modell­wechsel oder -updateA und R: Modell-Owner wählt den CheckpointC: Speicher, Durchsatz und Serving-Einstellungen
Dokument­quellen und ZugriffA und R: Daten-Owner und IT-Sicherheit legen die Verzeichnis­gruppen festC: ordnet die Verzeichnis­gruppen den Quellen im Index zu
Aufbewahrung des Query-LogsA: IT-Sicherheit und Rechts­abteilung legen die Frist festR: richtet die automatisierte Löschung und den Zugriff auf das Log ein
Kapazitäts­prüfungA: entscheidet über weitere GPUs oder ServerR: bereitet Werte der Spitzen­stunde und Optionen vor
Störung der PlattformA: Service-Owner, I: Nutzer über den Service DeskR: Diagnose und Wieder­herstellung innerhalb der vereinbarten Zeiten
Nutzerfragen und ZugriffR: Service Desk, First LevelC: Second Level für Störungen der Plattform
Öffentliche APIs (hybrid)A: entscheidet je Aufgabe und DatenklasseR: schaltet den Weg frei und protokolliert, was hinausgeht

Beispielhafte Aufteilung für eine Plattform mit 500 bis 2.000 Nutzern, keine Beschreibung eines bestimmten Vertrags; die Rollen folgen unserem Day-2-Leitfaden und NIST AI RMF GOVERN 2.1.

Die Kapazitätsprüfung stützt sich auf die Serving-Metriken aus unserem Leitfaden zum LLM-Monitoring mit vLLM-Metriken, und die Entscheidung über den nächsten Server behandelt unser Leitfaden zur GPU-Kapazitätsplanung.

Managed KI-Server on-premise oder in einem EU-Rechenzentrum

Der Standort ändert, wer Raum, Strom und physischen Zugang stellt, aber nicht, wer über die Daten entscheidet. On-premise stehen die Server im Serverraum des Unternehmens, und der Supportanbieter erreicht sie über eine Verbindung, die das Unternehmen kontrolliert. In einem EU-Rechenzentrum auf dedizierter Hardware stellt der Betreiber des Rechenzentrums Strom, Kühlung, physische Sicherheit und Anbindung bereit, und die Plattform wird über ein VPN oder eine Standleitung erreicht. Unser Artikel zum Hosting privater LLMs in einem EU-Rechenzentrum vergleicht die Hosting-Optionen im Detail.

DEPLOYMENT-OPTIONBEIM UNTERNEHMENVON DRITTEN BETREUT
On-Premise, eigenes PersonalRaum, Strom, Netzwerk, Server und der gesamte Software-Stacknur Hersteller­garantie und Hersteller­support
On-Premise, Support mit SLARaum, Strom, Netzwerk, Entscheidungen über Modelle, Daten und Aufbewahrungvereinbarte Plattform­aufgaben innerhalb der Service­zeiten
EU-Rechen­zentrum, dediziertEntscheidungen über Modelle, Daten, Zugriff und AufbewahrungStrom, Kühlung, physische Sicherheit durch den Betreiber; vereinbarte Plattform­aufgaben
Hybrid mit öffentlichen APIsdie Ent­scheidung je Aufgabe und Datenklasseder API-Anbieter betreibt sein Modell; das Query-Log zeigt, was hinausging

Deployment-Optionen wie auf unserer Seite Private AI/ML; die Aufteilung der Aufgaben ist unser Beispiel.

Mit unserer Leistung Private AI/ML laufen die Modelle auf Ihrer Hardware oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen, und Sie wählen die Option im Assessment. Beschreiben Sie im Formular unten, wo Ihre Plattform laufen soll.

Was ein Support-SLA für eine interne KI-Plattform festlegen sollte

Das SRE-Buch von Google definiert ein SLA als „einen expliziten oder impliziten Vertrag mit Ihren Nutzern, der Konsequenzen für das Erreichen (oder Verfehlen) der darin enthaltenen SLOs umfasst“. Eine interne KI-Plattform hat zwei Arten von Vereinbarung. Das SLO des Unternehmens für den Assistenten, zum Beispiel Antworten ohne Fehler während der Geschäftszeiten, hängt auch von Komponenten ab, die das Unternehmen selbst betreibt, etwa vom Verzeichnisdienst, vom Netzwerk und von den Dokumentquellen. Das SLA des Anbieters deckt die Aufgaben ab, die der Anbieter verantwortet. Halten Sie beide schriftlich fest und trennen Sie sie, damit sich ein verfehltes Ziel auf seine Ursache zurückführen lässt. Ein SLA für den Plattformsupport sollte diese Punkte festlegen:

  1. Den Umfang, also die Server, Komponenten und Modelle, die abgedeckt sind, und die, die es nicht sind.
  2. Die Servicezeiten und ob eine Störung außerhalb dieser Zeiten bearbeitet wird oder bis zum nächsten Arbeitstag wartet.
  3. Prioritätsstufen mit der Reaktionszeit für jede Stufe, in Werten, die beide Parteien für ihren Fall vereinbaren.
  4. Wartungsfenster, Ankündigungsfristen und die Änderungsfreigabe, mit einem Rollback-Plan für jede Änderung.
  5. Die Konten des Anbieters, die Systeme, die sie erreichen, die Anmeldung mit Multi-Faktor-Authentifizierung und die Protokollierung jeder Sitzung.
  6. Berichte zu Störungen, Änderungen und Kapazität und eine Review-Besprechung in einem festen Abstand.
  7. Die Meldung von Vorfällen durch den Anbieter an das Unternehmen und den Umgang mit Schwachstellen im Stack.
  8. Den Ausstieg, mit der Übergabe von Konfiguration, Runbooks und Dokumentation und der Entsorgung der Daten, die der Anbieter hatte.

Die Durchführungsverordnung (EU) 2024/2690 gilt für die in ihrem Artikel 1 aufgezählten Anbieter, darunter Anbieter von Cloud-Computing-Diensten, Anbieter von Rechenzentrumsdiensten und Anbieter verwalteter Dienste; für andere Unternehmen ist ihr Anhang ein brauchbarer Maßstab. Nach Nummer 5.1.4 des Anhangs legen die betreffenden Einrichtungen in ihren Verträgen mit Anbietern und Diensteanbietern, soweit angemessen „im Rahmen von Leistungsvereinbarungen“, unter anderem eine Pflicht zur unverzüglichen Meldung von Sicherheitsvorfällen, das Recht auf Prüfung, die Behebung von Schwachstellen und Pflichten bei Vertragskündigung fest. Nummer 5.1.7 ergänzt, dass die Einrichtungen „die Berichte über die Umsetzung der Leistungsvereinbarungen regelmäßig verfolgen“, soweit anwendbar.

Herstellersupport hinter einer Managed-LLM-Plattform

Ein Supportanbieter ist auf die Hersteller hinter dem Stack angewiesen. Für NVIDIA AI Enterprise beschreibt NVIDIAs Supportseite, Stand Oktober 2026, ein „Abonnement für Support, Upgrades und Wartung, das in jeder Softwarelizenz von NVIDIA AI Enterprise enthalten ist“, mit Experten, die „während der lokalen Geschäftszeiten“ verfügbar sind. Dieselbe Seite führt NVIDIA-Certified Systems unter den unterstützten Infrastrukturoptionen auf; prüfen Sie also die Zertifizierung der GPU-Server. NVIDIA verkauft außerdem für ausgewählte Produkte Business Critical Support, den es als seine Premium-Stufe bezeichnet, mit einer Reaktionszeit von einer Stunde für Fälle mit Severity Level 1. Unser Leitfaden zur Lizenzierung von NVIDIA AI Enterprise erklärt, was das Abonnement abdeckt.

vLLM ist ein Open-Source-Projekt ohne eigenes Support-SLA; kommerziellen Support für eine Laufzeitumgebung auf Basis von vLLM verkaufen Anbieter wie Red Hat, auf dessen Seite zu AI Inference „Powered by vLLM and llm-d“ steht. vLLM veröffentlicht Sicherheitshinweise auf seiner Security-Seite bei GitHub, den jüngsten davon am 27. Juli 2026. Für kritische Probleme und solche mit hohem Schweregrad besagt seine Richtlinie, dass Fixes vor der öffentlichen Bekanntgabe in einem privaten Security-Fork entwickelt werden. Der Betreiber der Plattform muss diese Hinweise verfolgen, beurteilen, ob ein Fix die eingesetzte Version betrifft, und das Upgrade einplanen; das SLA sollte festlegen, wer das tut.

GPU-Server sind durch die Herstellergarantie abgedeckt. Das SLA sollte benennen, wer den Garantiefall eröffnet, wer die vom Hersteller verlangte Diagnose durchführt und wer das Teil vor Ort tauscht.

Zugriff, Datenschutz und Ausstieg in einem Managed-Vertrag

Ein Supportanbieter mit Administratorrechten auf den GPU-Servern kann Prompts, Antworten, den Index und das Query-Log lesen, die personenbezogene Daten enthalten. Artikel 28 Absatz 3 DSGVO verlangt, dass die Verarbeitung durch einen Auftragsverarbeiter „auf der Grundlage eines Vertrags oder eines anderen Rechtsinstruments“ erfolgt, in dem Gegenstand und Dauer, Art und Zweck der Verarbeitung, die Art der personenbezogenen Daten, die Kategorien betroffener Personen und die Pflichten und Rechte des Verantwortlichen festgelegt sind. Ob der Anbieter für Ihre Daten als Auftragsverarbeiter handelt, ist eine rechtliche Bewertung für Ihre Rechtsabteilung. Geben Sie dem Anbieter namentliche Konten im Verzeichnisdienst, beschränken Sie sie auf die Plattform und protokollieren Sie jede Sitzung.

Planen Sie den Ausstieg bei der Unterzeichnung. Konfigurations- und Deployment-Dateien gehören in ein Repository, das dem Unternehmen gehört, Runbooks in die Dokumentation des Unternehmens, und die Zugangsdaten des Anbieters werden am letzten Tag widerrufen. GOVERN 6.2 des NIST verlangt „Notfallprozesse“ für den Umgang mit Ausfällen oder Vorfällen in Daten oder KI-Systemen Dritter, die als hochriskant eingestuft werden; wo ein Anbieter die Plattform betreibt, gehört ein schriftlicher Übergabeplan für das Vertragsende dazu.

Was wir tun

Unsere Leistung Private AI/ML baut und betreut die Plattform und schult Ihr Team, sie zu betreiben und weiterzuentwickeln; danach ist es Ihre Wahl: Ihr eigenes Personal oder unser Support unter einem vereinbarten SLA. Die Modelle laufen on-premise auf Ihren Servern oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen, mit Protokollierung von Anfragen und Antworten sowie Daten- und Berechtigungsverwaltung, und öffentliche APIs kommen nur dort zum Einsatz, wo Sie sie freigeben. Unser Engineering-Partner Vixen.UNO arbeitet in Ihrer Umgebung unter Ihren Zugriffsregeln und nimmt keine Kopien von Produktivdaten mit, mit NDA vor technischen Details und Auftragsverarbeitungsvertrag auf Anfrage, wie unsere Seite Sicherheit & Compliance beschreibt. Eurokommerz hält den Vertrag und liefert die GPU-Server, und ein fester Projektleiter von Eurokommerz bleibt Ihr zentraler Ansprechpartner. Das erste Gespräch ist kostenlos, und der Preis des technischen Assessments steht vor Beginn fest.

FAQ

Was ist ein Managed Service für private KI?
Ein Managed Service für private KI ist eine private LLM-Plattform auf Hardware, die dem Unternehmen dediziert zur Verfügung steht, bei der ein Anbieter vereinbarte Betriebsaufgaben unter einer Supportvereinbarung ausführt. Das Unternehmen behält die Entscheidungen über Modelle, Daten, Zugriff und die Aufbewahrung des Query-Logs, während der Anbieter technische Arbeiten wie Upgrades und Störungen der Plattform übernimmt.
Wer betreibt eine private KI-Plattform nach Projektende?
Entweder das eigene Personal des Unternehmens, ein Anbieter unter einem vereinbarten SLA oder eine Mischung aus beiden. Bei 500 bis 2.000 Nutzern kann eine Mischung so aussehen: Das Unternehmen behält den Modell-Owner, die Daten-Owner, die IT-Sicherheit und den First Level im Service Desk, und der Anbieter ist der Second Level für Störungen der Plattform und Upgrades.
Was umfasst der Betrieb einer Managed-LLM-Plattform?
Er umfasst die GPU-Server, Treiber und Firmware, die Serving-Engine, das Gateway mit seinem Query-Log, das Frontend und den Vektorindex, mit Updates, der Bearbeitung von Störungen und Kapazitätswerten. Welche dieser Aufgaben der Anbieter ausführt, steht im Leistungsumfang der Supportvereinbarung.
Was sollte ein SLA für den Betrieb einer KI-Plattform festlegen?
Umfang, Servicezeiten, Prioritätsstufen mit Reaktionszeiten, Wartungsfenster und Änderungsfreigabe, den Zugriff des Anbieters und dessen Protokollierung, Berichte, die Meldung von Vorfällen und den Ausstieg. Die Werte hängen davon ab, zu welchen Stunden das Unternehmen den Assistenten braucht, und werden für jeden Fall vereinbart.
Kann ein Managed KI-Server in einem EU-Rechenzentrum laufen?
Ja, auf dedizierter Hardware, wobei der Betreiber des Rechenzentrums Strom, Kühlung, physische Sicherheit und Anbindung stellt und die Plattform über ein VPN oder eine Standleitung erreicht wird. Entscheidungen über Modelle, Daten und Zugriff bleiben wie bei on-premise beim Unternehmen.
Ist bei NVIDIA AI Enterprise Support enthalten?
NVIDIAs Supportseite beschreibt ein Abonnement für Support, Upgrades und Wartung, das in jeder Lizenz von NVIDIA AI Enterprise enthalten ist, mit Experten während der lokalen Geschäftszeiten. NVIDIA führt NVIDIA-Certified Systems unter den unterstützten Infrastrukturoptionen auf und verkauft Business Critical Support mit einer Reaktion innerhalb einer Stunde für Fälle mit Severity Level 1 separat für ausgewählte Produkte.

Schicken Sie uns die Modelle und GPU-Server, die Sie betreiben oder planen, die Zahl der Nutzer, wo die Plattform laufen soll und welche Aufgaben Ihr eigenes Personal behalten wird. Wir antworten innerhalb eines Werktages, und im ersten Gespräch gehen wir Prozess und Daten mit Ihnen durch, sodass Sie mit 2 bis 3 möglichen Lösungsszenarien herausgehen. Das erste Gespräch ist kostenlos.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien