BLOG · GUIDE ·

GPU-Server für die öffentliche Verwaltung: On-Premise-LLMs für Behörden und Gemeinden

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Öffentliche Stellen nutzen LLMs für Entwürfe und Zusammenfassungen, die Vorsortierung von Bürgeranfragen, Übersetzungen zwischen EU-Sprachen, die Transkription von Sitzungen und die Aktensuche; On-Premise-Betrieb oder dediziertes Hosting hält Bürgerdaten auf Hardware, die die Behörde kontrolliert
  • Mistral Small 3.2 (24B, Apache 2.0) ist ein kleines Update von 3.1, dessen Model Card Deutsch, Polnisch und Rumänisch unter 25 Sprachen nennt, Tschechisch und Ungarisch aber nicht; EuroLLM-22B deckt alle 24 Amtssprachen der EU ab, und Parakeet TDT 0.6B v3 transkribiert 25 europäische Sprachen
  • Nach dem AI Act in der Fassung der Verordnung (EU) 2026/1744 führt eine öffentliche Stelle, die ein Hochrisiko-System nach Anhang III betreibt, etwa eines, das den Anspruch auf öffentliche Unterstützungsleistungen beurteilt (Nummer 5 Buchstabe a), ab dem 2. Dezember 2027 eine Grundrechte-Folgenabschätzung nach Artikel 27 durch
  • Mit Mistral Small 3.2 in BF16 und einem FP8-Cache hält eine RTX PRO 6000 Server Edition nach unserer Schätzung rund 15 Gespräche bei 32K und eine H200 NVL rund 31
  • Mit Beispielwerten für die Nutzung erreichen 1.000 Beschäftigte eine Spitze von rund 40 Anfragen in Bearbeitung, bedient von zwei Servern mit je vier RTX PRO 6000; 2.000 Beschäftigte erreichen rund 80, bedient von zwei Servern mit je vier H200 NVL oder acht RTX PRO 6000

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

On-Premise-LLMs für Behörden und Gemeinden

In der öffentlichen Verwaltung nutzen Behörden und Gemeinden KI und LLMs für fünf Arten von Arbeit: Entwürfe und Zusammenfassungen von Schreiben, Berichten und Protokollen; die Zuordnung eingehender Bürgeranfragen an die zuständige Abteilung; Übersetzungen zwischen EU-Sprachen; die Transkription von Sitzungen und Anhörungen; und die Suche in den eigenen Akten. Alle fünf berühren Bürgerdaten oder interne Unterlagen, weshalb viele öffentliche Stellen die Modelle lieber auf eigenen Servern oder auf dedizierter Hardware in einem EU-Rechenzentrum betreiben als über einen öffentlich zugänglichen KI-Dienst. Ein GPU-Server dafür betreibt Open-Weight-Modelle mit einer Engine wie vLLM, und die Karten werden nach der Zahl der Beschäftigten ausgelegt, die ihn gleichzeitig nutzen, nach der Kontextlänge und nach den Sprachen, die die Modelle beherrschen müssen.

Für eine Stelle mit 200 bis 2.000 Beschäftigten ergibt das ein bis zwei Server mit je zwei bis acht Karten. Fällt eine Nutzung unter Anhang III des AI Act, hat die Behörde als Betreiber außerdem rechtliche Pflichten, die weiter unten beschrieben sind.

Workloads, Modellklassen und Karten

Das Entwurfsmodell ist der größte Einzelposten. Ein mehrsprachiges Modell mit 20B bis 30B Parametern übernimmt Schreiben, Zusammenfassungen und die Weiterleitung von Anfragen in einem Deployment, sodass die Vorsortierung kein eigenes Modell braucht. Die Aktensuche ergänzt ein Embedding-Modell und einen Reranker; Qwen3-Embedding-0.6B zum Beispiel hat 0,6B Parameter und unterstützt „100+ Sprachen“ und einen Kontext von 32K unter Apache 2.0. Auch die Spracherkennung ist klein: OpenAI nennt etwa 10 GB VRAM für Whisper large.

WORKLOADMODELLKLASSEBEISPIELEKARTE
Entwürfe, Zusammen­fassungenmehrsprachiges LLM, 20B bis 30BMistral Small 3.2, EuroLLM-22BRTX PRO 6000 Server Edition, H200 NVL
Vorsortierung von Anfragendas Entwurfs-LLM mit festem Prompt und festen Kategorienwie obengemeinsam mit den Entwürfen
ÜbersetzungLLM oder Übersetzungs­modell, 9B bis 24BEuroLLM-9B, EuroLLM-22B, Mistral Small 3.2L40S, RTX PRO 6000
Transkription von SitzungenSprach­erkennung, unter 2BWhisper large-v3, Parakeet TDT 0.6B v3L4 oder eine MIG-Instanz
AktensucheEmbedding und Reranker, unter 1BQwen3-Embedding-0.6B und sein RerankerL4 oder eine MIG-Instanz

Model Cards auf Hugging Face und OpenAIs Whisper-Repository, abgerufen am 10. Oktober 2026; die Kartenwahl ist unsere Lesart des Speichers, den jedes Modell braucht.

Kleine Modelle brauchen keine ganze Karte. NVIDIAs MIG-Leitfaden, aktualisiert am 11. September 2026, nennt bis zu vier MIG-Instanzen auf der RTX PRO 6000 Server Edition und sieben auf der H200 NVL, jede mit eigenem Speicher. Die L4 hat 24 GB bei 72 W als Single-Slot-Karte mit halber Bauhöhe und die L40S 48 GB, und keine der beiden steht in der Liste der MIG-fähigen GPUs dieses Leitfadens. Eine Karte im MIG-Modus kann das Embedding-Modell, den Reranker und das Spracherkennungsmodell nebeneinander tragen, während das Entwurfsmodell ganze Karten behält.

Modelle für EU-Sprachen und ihre Lizenzen

Die Sprachliste auf der Model Card entscheidet in der öffentlichen Verwaltung mehr als in den meisten Unternehmen, da eine Behörde in Mittel- und Osteuropa in ihrer Landessprache schreibt und Bürgern in anderen Sprachen antwortet. Die Model Card von Mistral Small 3.1 nennt 25 Sprachen, darunter Deutsch, Polnisch und Rumänisch, aber nicht Tschechisch, Ungarisch, Kroatisch, Slowakisch oder Bulgarisch, und die Model Card von 3.2 bezeichnet ihr Modell als „ein kleines Update“ von 3.1. EuroLLM-22B führt alle 24 Amtssprachen der EU unter 35 Sprachen auf, unter Apache 2.0, mit einer Sequenzlänge von 32.768 Token; seine Model Card hält fest, dass das Modell „nicht auf menschliche Präferenzen ausgerichtet wurde“. Bei der Spracherkennung transkribiert Parakeet TDT 0.6B v3 unter CC BY 4.0 25 europäische Sprachen, darunter jede Amtssprache der EU außer Irisch, während Whisper unter der MIT-Lizenz mehr Sprachen abdeckt.

Unser Vergleich offener LLMs für europäische Sprachen zeigt, welches Modell welche Sprache nennt und wie viel GPU-Speicher jedes belegt. Testen Sie zwei oder drei Kandidaten mit Ihren eigenen Schreiben und Anfragen in jeder Sprache, die Ihre Beschäftigten verwenden, bewertet von Muttersprachlern, bevor Sie die Servergröße festlegen.

Prüfen Sie die Lizenz so genau wie die Sprachliste. Apache 2.0, MIT und CC BY 4.0 erlauben die Nutzung durch eine öffentliche Stelle, während andere Open-Weight-Modelle mit Nutzungsrichtlinien, Umsatzschwellen oder nichtkommerziellen Bedingungen kommen; unser Vergleich der Lizenzen offener LLMs für die Nutzung im Unternehmen zitiert die Klauseln. Welche Bedingungen eine Behörde akzeptieren darf, ist eine rechtliche Bewertung für ihre Rechtsabteilung.

GPU-Server nach Behördengröße auslegen

Ein Server wird nach der Spitzenzahl der Anfragen in Bearbeitung ausgelegt, nicht nach der Kopfzahl. Unser Leitfaden zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße erklärt die Methode. Seine Beispielwerte sind 40 Prozent der Beschäftigten aktiv in der Spitzenstunde, je sechs Anfragen, 30 Sekunden je Anfrage und ein Spitzenfaktor von 2, womit die Spitze bei etwa 4 Prozent der Beschäftigten liegt.

Mistral Small 3.2 dient als Beispielmodell, da öffentliche Dokumente lang sind und seine config.json 131.072 Token zulässt, das 128K-Fenster, das die Model Card von 3.1 nennt. Seine BF16-Gewichte belegen 44,7 GiB, und nach unserer Auslegungsregel bleiben auf einer RTX PRO 6000 mit 96 GB 38,3 GiB für den KV-Cache und auf einer H200 NVL mit 141 GB 78,6 GiB. Nach seiner config.json (40 Schichten, 8 KV-Köpfe der Dimension 128) belegt ein Token 160 KiB 16-Bit-Cache, ein Gespräch bei deklarierten 32K Kontext belegt in einem FP8-Cache also 2,5 GiB. Eine RTX PRO 6000 hält dann rund 15 solche Gespräche und eine H200 NVL rund 31.

STELLE, BESCHÄFTIGTESPITZE (ANFRAGEN)KONFIGURATION32K-GESPRÄCHE
Gemeinde, 30012ein Server, 2 × RTX PRO 6000 Server Edition: eine betreibt das LLM, eine läuft im MIG-Modus für Suche und Sprach­erkennung15
Regional­behörde, 1.00040zwei Server, je 4 × RTX PRO 6000 Server Edition: drei LLM-Kopien, eine Karte im MIG-Modus45 je Server, 90 zusammen
Stadt, Ministerium, 2.00080zwei Server, je 4 × H200 NVL: drei Kopien, eine Karte im MIG-Modus; oder je 8 × RTX PRO 6000: sechs Kopien, zwei für Dienste93 oder 90 je Server

Unsere Schätzungen: Mistral Small 3.2 in BF16 mit FP8-KV-Cache bei deklarierten 32K Kontext, eine Kopie je Karte, 0,9 × vom Treiber gemeldeter Speicher, abzüglich 3 GiB und der Gewichte; Spitzen aus den Beispielwerten oben. Schichten und KV-Köpfe aus der config.json des Modells auf Hugging Face, abgerufen am 10. Oktober 2026.

Bei 1.000 und 2.000 Beschäftigten hält jeder der beiden Server die ganze Beispielspitze, sodass der Dienst weiterläuft, wenn einer ausfällt oder in einem Wartungsfenster ist. Der eine Server der Gemeinde hat keine solche Reserve, und ein zweiter Server derselben Bauart schafft sie. Mit EuroLLM-22B statt Mistral Small 3.2 hält eine RTX PRO 6000 rund 12 Gespräche bei seinem vollen Kontext von 32K mit FP8-Cache, und die Zahl der Kopien steigt entsprechend. Der vLLM-Befehl auf der Model Card selbst verteilt Mistral Small 3.2 mit --tensor-parallel-size 2 auf zwei GPUs, während unsere Rechnung eine Kopie je Karte mit 96 GB vorsieht; prüfen Sie die Größe des KV-Cache, die vLLM beim Start auf der Karte meldet, die Sie einsetzen werden. Acht Karten mit je bis zu 600 W ziehen bis zu 4,8 kW vor Prozessoren und Lüftern; prüfen Sie deshalb bei den Builds mit acht Karten Stromzuleitung und Kühlung des Racks vor der Bestellung.

Inferenzserver bauen wir mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern, und wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Ihre Beschäftigtenzahlen, Workloads und Sprachen über das Formular unten.

Eigener Serverraum oder EU-Rechenzentrum

Für eine Behörde hängt die Datensouveränität davon ab, wo die Hardware steht, wer den administrativen Zugriff hat und welcher Vertrag das Hosting regelt. Ein Server im eigenen Serverraum der Behörde klärt diese Fragen intern, braucht aber Strom, Kühlung und Personal für den Betrieb. Dedizierte Hardware in einem EU-Rechenzentrum hält die Daten in der EU auf Servern, die kein anderer Kunde nutzt, und die Behörde entscheidet unter Einbeziehung ihres Datenschutzbeauftragten, welche Akten dorthin dürfen.

Unsere Leistung Private AI/ML betreibt Modelle auf Ihren Servern oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen und protokolliert Anfragen und Antworten. Nennen Sie uns, welche Akten der Assistent erreichen darf und wo sie bleiben müssen.

Pflichten nach dem AI Act für Behörden: Artikel 27 und Anhang III

Eine öffentliche Stelle, die ein KI-System in eigener Verantwortung verwendet, ist nach Artikel 3 Nummer 4 des AI Act Betreiber. Entwürfe, Übersetzung, Transkription und Aktensuche gehören nach unserer Lesart nicht zu den in Anhang III aufgeführten Zwecken. Anhang III Nummer 5 Buchstabe a führt aber Systeme auf, die „von Behörden oder im Namen von Behörden“ verwendet werden sollen, um zu beurteilen, ob natürliche Personen Anspruch auf grundlegende öffentliche Unterstützungsleistungen und -dienste einschließlich Gesundheitsdiensten haben, oder um solche Leistungen zu gewähren, einzuschränken, zu widerrufen oder zurückzufordern. Nummer 5 Buchstabe d führt Systeme auf, die Notrufe natürlicher Personen bewerten und klassifizieren oder Not- und Rettungsdienste entsenden. Ein Routing für Anfragen, das beginnt, den Anspruch auf Leistungen zu beurteilen, oder ein Triage-Werkzeug, das Notrufe klassifiziert, kann deshalb unter Anhang III fallen.

Für eine solche Hochrisiko-Nutzung verlangt Artikel 27 Absatz 1 von Betreibern, die Einrichtungen des öffentlichen Rechts oder private Einrichtungen sind, die öffentliche Dienste erbringen, vor dem Einsatz eine Grundrechte-Folgenabschätzung; ausgenommen sind Systeme für kritische Infrastruktur nach Anhang III Nummer 2. Absatz 2 bezieht die Pflicht auf die erste Verwendung und verlangt eine Aktualisierung, wenn sich eines der Elemente ändert. Die Abschätzung umfasst die Verfahren, in denen das System verwendet wird, Zeitraum und Häufigkeit der Verwendung, die Kategorien betroffener Personen, die spezifischen Schadensrisiken, die Maßnahmen der menschlichen Aufsicht und die Schritte, falls sich Risiken verwirklichen, einschließlich der Beschwerdemechanismen. Nach Absatz 3 teilt der Betreiber der Marktüberwachungsbehörde die Ergebnisse mit und übermittelt mit der Mitteilung die ausgefüllte Vorlage nach Absatz 5. Die Verordnung (EU) 2026/1744 hat die Absätze 4 und 5 ersetzt; der Betreiber kann nun auf die Datenschutz-Folgenabschätzung nach der DSGVO verweisen oder Teile davon aufnehmen, und das Büro für Künstliche Intelligenz erarbeitet die Vorlage. Artikel 26 Absatz 8 ergänzt, dass Betreiber von Hochrisiko-Systemen, die Behörden sind, die Registrierungspflichten nach Artikel 49 erfüllen und ein System, das sie nicht in der EU-Datenbank nach Artikel 71 registriert finden, nicht verwenden und stattdessen dessen Anbieter oder Händler informieren.

Artikel 27 steht in Kapitel III Abschnitt 3, der nach Artikel 113 in der Fassung der Verordnung (EU) 2026/1744 für Systeme nach Anhang III ab dem 2. Dezember 2027 gilt. Artikel 50 Absatz 4 gilt seit dem 2. August 2026. Ein Betreiber legt offen, dass ein Text, den er veröffentlicht, um die Öffentlichkeit über Angelegenheiten von öffentlichem Interesse zu informieren, künstlich erzeugt oder manipuliert wurde, es sei denn, der Text wurde einer menschlichen Überprüfung oder redaktionellen Kontrolle unterzogen und jemand trägt die redaktionelle Verantwortung für seine Veröffentlichung. Unser Leitfaden zu den Betreiberpflichten nach dem EU AI Act behandelt den Zeitplan und Artikel 26. Ob eine bestimmte Nutzung unter Anhang III fällt, ist eine rechtliche Bewertung für die Rechtsabteilung der Behörde; der Server kann Prompts, Antworten und Nutzer protokollieren, damit der Nachweis vorliegt, wenn er gebraucht wird.

Allgemeine Information zum EU-Recht mit Stand Oktober 2026: Verordnung (EU) 2024/1689, Artikel 3 Nummer 4, Artikel 26 Absatz 8, Artikel 27, Artikel 50 Absatz 4 und Artikel 113 sowie Anhang III, in der konsolidierten Fassung mit Stand 27. Juli 2026 auf eur-lex.europa.eu, und der Verordnung (EU) 2026/1744, Artikel 1 Nummer 13.

Vom Piloten zur Ausschreibung und zum Betrieb

Die meisten Behörden kaufen Server über eine öffentliche Ausschreibung, der Pilot liefert also auch die technische Spezifikation. Unser Leitfaden zur technischen Spezifikation für die Ausschreibung von GPU-Servern zeigt, wie Sie messbare Anforderungen statt Markennamen formulieren.

  1. Wählen Sie einen Prozess mit klaren Metriken, etwa die Zusammenfassung von Fallakten oder die Weiterleitung von Anfragen, und die Sprachen, die er braucht.
  2. Testen Sie zwei oder drei Modelle mit Ihren eigenen Dokumenten und erfassen Sie die Anfragen der Spitzenstunde und ihre Dauer aus den Gateway-Logs.
  3. Legen Sie die Karten nach der gemessenen Spitze, dem deklarierten Kontext und den Modellen aus, die geladen bleiben, Suche und Spracherkennung eingeschlossen.
  4. Schreiben Sie die Ausschreibung aus diesen Zahlen: Speicher je Karte und insgesamt, MIG-Unterstützung, Leistung je Rackposition, Garantie und Abnahmetests.
  5. Planen Sie den Betrieb: wer den Server patcht, wo die Logs liegen und wie lange, und wie ein zweiter Server übernimmt.

Was wir liefern

Wir bauen KI-Server für diese Art von Plattform auf Bestellung, mit der RTX PRO 6000 Server Edition, der H200 NVL mit NVLink-Brücken, der L40S und der L4, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU unter einem EU-Vertrag und auf einer Rechnung. Die kleineren professionellen NVIDIA-GPUs, die wir liefern, etwa die RTX PRO 2000 und 4000, eignen sich für Transkriptions- oder Suchknoten in Außenstellen. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung, und Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch. Die Modelle, die Aktensuche und die Protokollierung darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO und Support unter einem vereinbarten SLA.

FAQ

Wie kann der öffentliche Sektor KI on-premise betreiben?
Eine öffentliche Stelle betreibt Open-Weight-Modelle wie Mistral Small 3.2 oder EuroLLM auf einem eigenen GPU-Server oder auf dedizierter Hardware in einem EU-Rechenzentrum, mit einer Serving-Engine wie vLLM. Das Entwurfsmodell belegt ganze Karten wie die RTX PRO 6000 Server Edition oder die H200 NVL, während sich Modelle für Spracherkennung und Suche per MIG eine Karte teilen. Prompts, Antworten und Dokumente bleiben dann auf Hardware, die die Behörde kontrolliert.
Welches LLM eignet sich für Behörden und die öffentliche Verwaltung?
Geeignet ist ein mehrsprachiges Open-Weight-Modell unter einer freizügigen Lizenz, getestet mit den eigenen Dokumenten der Behörde in jeder Sprache, die sie verwendet. Mistral Small 3.2 (24B, Apache 2.0) ist ein kleines Update von 3.1, dessen Model Card 25 Sprachen nennt, darunter Deutsch, Polnisch und Rumänisch, während EuroLLM-22B (Apache 2.0) alle 24 Amtssprachen der EU mit einem Kontext von 32.768 Token abdeckt. Muttersprachler sollten die Antworten von zwei oder drei Kandidaten bewerten, bevor der Server ausgelegt wird.
Was bedeutet souveräne KI in der Verwaltung auf eigenen Servern?
Souveräne KI bedeutet, dass Modelle, Dokumente und Logs auf Hardware laufen, deren Standort, administrativen Zugriff und Hosting-Vertrag die Behörde kontrolliert, entweder im eigenen Serverraum oder auf dedizierten Servern in einem EU-Rechenzentrum. Die Modellgewichte bleiben auf dem Server, und kein Prompt verlässt ihn, solange niemand einen externen Dienst freischaltet. Die Behörde entscheidet unter Einbeziehung ihres Datenschutzbeauftragten, welche Akten an welchen Standort dürfen.
Wie groß muss ein KI-Server für eine Gemeinde sein?
Eine Gemeinde mit rund 300 Beschäftigten erreicht mit Beispielwerten für die Nutzung eine Spitze von rund 12 Anfragen in Bearbeitung, die nach unserer Schätzung eine RTX PRO 6000 Server Edition mit Mistral Small 3.2 bei 32K Kontext bedient. Eine zweite Karte im MIG-Modus trägt die Modelle für Suche und Spracherkennung. Ein zweiter Server derselben Bauart schafft eine Reserve, falls einer ausfällt.
Kann eine Behörde ein privates LLM statt eines Cloud-Dienstes nutzen?
Ja, Open-Weight-Modelle unter den Lizenzen Apache 2.0, MIT oder CC BY 4.0 lassen sich auf eigenen Servern der Behörde betreiben, und die Bedingungen anderer Lizenzen sind eine rechtliche Bewertung für ihre Rechtsabteilung. Die Behörde legt die GPUs dann selbst aus, nach den Anfragen in Bearbeitung in der Spitze, der Kontextlänge und den Modellen, die geladen bleiben. Für 1.000 Beschäftigte halten zwei Server mit je vier RTX PRO 6000 die Beispielspitze von 40 Anfragen auch dann, wenn ein Server ausfällt.
Was verlangt der AI Act von Behörden?
Jede öffentliche Stelle, die ein KI-System in eigener Verantwortung verwendet, ist Betreiber (Artikel 3 Nummer 4) und legt seit dem 2. August 2026 offen, wenn sie KI-erzeugten Text veröffentlicht, um die Öffentlichkeit über Angelegenheiten von öffentlichem Interesse zu informieren, es sei denn, der Text wurde einer menschlichen Überprüfung oder redaktionellen Kontrolle unterzogen und jemand trägt die redaktionelle Verantwortung dafür (Artikel 50 Absatz 4). Für Hochrisiko-Nutzungen nach Anhang III, etwa die Beurteilung des Anspruchs auf öffentliche Unterstützungsleistungen nach Nummer 5 Buchstabe a, verlangt Artikel 27 vor der ersten Verwendung eine Grundrechte-Folgenabschätzung und Artikel 26 Absatz 8 die Erfüllung der Registrierungspflichten nach Artikel 49. Nach Artikel 113 in der Fassung der Verordnung (EU) 2026/1744 gelten diese Hochrisiko-Pflichten ab dem 2. Dezember 2027.

Schicken Sie uns die Zahl der Beschäftigten, die geplanten Workloads (Entwürfe, Anfragen, Übersetzung, Transkription, Aktensuche), die Sprachen und den Standort des Servers. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien