GPU-Server für die öffentliche Verwaltung: On-Premise-LLMs für Behörden und Gemeinden
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Öffentliche Stellen nutzen LLMs für Entwürfe und Zusammenfassungen, die Vorsortierung von Bürgeranfragen, Übersetzungen zwischen EU-Sprachen, die Transkription von Sitzungen und die Aktensuche; On-Premise-Betrieb oder dediziertes Hosting hält Bürgerdaten auf Hardware, die die Behörde kontrolliert
- Mistral Small 3.2 (24B, Apache 2.0) ist ein kleines Update von 3.1, dessen Model Card Deutsch, Polnisch und Rumänisch unter 25 Sprachen nennt, Tschechisch und Ungarisch aber nicht; EuroLLM-22B deckt alle 24 Amtssprachen der EU ab, und Parakeet TDT 0.6B v3 transkribiert 25 europäische Sprachen
- Nach dem AI Act in der Fassung der Verordnung (EU) 2026/1744 führt eine öffentliche Stelle, die ein Hochrisiko-System nach Anhang III betreibt, etwa eines, das den Anspruch auf öffentliche Unterstützungsleistungen beurteilt (Nummer 5 Buchstabe a), ab dem 2. Dezember 2027 eine Grundrechte-Folgenabschätzung nach Artikel 27 durch
- Mit Mistral Small 3.2 in BF16 und einem FP8-Cache hält eine RTX PRO 6000 Server Edition nach unserer Schätzung rund 15 Gespräche bei 32K und eine H200 NVL rund 31
- Mit Beispielwerten für die Nutzung erreichen 1.000 Beschäftigte eine Spitze von rund 40 Anfragen in Bearbeitung, bedient von zwei Servern mit je vier RTX PRO 6000; 2.000 Beschäftigte erreichen rund 80, bedient von zwei Servern mit je vier H200 NVL oder acht RTX PRO 6000
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
On-Premise-LLMs für Behörden und Gemeinden
In der öffentlichen Verwaltung nutzen Behörden und Gemeinden KI und LLMs für fünf Arten von Arbeit: Entwürfe und Zusammenfassungen von Schreiben, Berichten und Protokollen; die Zuordnung eingehender Bürgeranfragen an die zuständige Abteilung; Übersetzungen zwischen EU-Sprachen; die Transkription von Sitzungen und Anhörungen; und die Suche in den eigenen Akten. Alle fünf berühren Bürgerdaten oder interne Unterlagen, weshalb viele öffentliche Stellen die Modelle lieber auf eigenen Servern oder auf dedizierter Hardware in einem EU-Rechenzentrum betreiben als über einen öffentlich zugänglichen KI-Dienst. Ein GPU-Server dafür betreibt Open-Weight-Modelle mit einer Engine wie vLLM, und die Karten werden nach der Zahl der Beschäftigten ausgelegt, die ihn gleichzeitig nutzen, nach der Kontextlänge und nach den Sprachen, die die Modelle beherrschen müssen.
Für eine Stelle mit 200 bis 2.000 Beschäftigten ergibt das ein bis zwei Server mit je zwei bis acht Karten. Fällt eine Nutzung unter Anhang III des AI Act, hat die Behörde als Betreiber außerdem rechtliche Pflichten, die weiter unten beschrieben sind.
Workloads, Modellklassen und Karten
Das Entwurfsmodell ist der größte Einzelposten. Ein mehrsprachiges Modell mit 20B bis 30B Parametern übernimmt Schreiben, Zusammenfassungen und die Weiterleitung von Anfragen in einem Deployment, sodass die Vorsortierung kein eigenes Modell braucht. Die Aktensuche ergänzt ein Embedding-Modell und einen Reranker; Qwen3-Embedding-0.6B zum Beispiel hat 0,6B Parameter und unterstützt „100+ Sprachen“ und einen Kontext von 32K unter Apache 2.0. Auch die Spracherkennung ist klein: OpenAI nennt etwa 10 GB VRAM für Whisper large.
| WORKLOAD | MODELLKLASSE | BEISPIELE | KARTE |
|---|---|---|---|
| Entwürfe, Zusammenfassungen | mehrsprachiges LLM, 20B bis 30B | Mistral Small 3.2, EuroLLM-22B | RTX PRO 6000 Server Edition, H200 NVL |
| Vorsortierung von Anfragen | das Entwurfs-LLM mit festem Prompt und festen Kategorien | wie oben | gemeinsam mit den Entwürfen |
| Übersetzung | LLM oder Übersetzungsmodell, 9B bis 24B | EuroLLM-9B, EuroLLM-22B, Mistral Small 3.2 | L40S, RTX PRO 6000 |
| Transkription von Sitzungen | Spracherkennung, unter 2B | Whisper large-v3, Parakeet TDT 0.6B v3 | L4 oder eine MIG-Instanz |
| Aktensuche | Embedding und Reranker, unter 1B | Qwen3-Embedding-0. | L4 oder eine MIG-Instanz |
Model Cards auf Hugging Face und OpenAIs Whisper-Repository, abgerufen am 10. Oktober 2026; die Kartenwahl ist unsere Lesart des Speichers, den jedes Modell braucht.
Kleine Modelle brauchen keine ganze Karte. NVIDIAs MIG-Leitfaden, aktualisiert am 11. September 2026, nennt bis zu vier MIG-Instanzen auf der RTX PRO 6000 Server Edition und sieben auf der H200 NVL, jede mit eigenem Speicher. Die L4 hat 24 GB bei 72 W als Single-Slot-Karte mit halber Bauhöhe und die L40S 48 GB, und keine der beiden steht in der Liste der MIG-fähigen GPUs dieses Leitfadens. Eine Karte im MIG-Modus kann das Embedding-Modell, den Reranker und das Spracherkennungsmodell nebeneinander tragen, während das Entwurfsmodell ganze Karten behält.
Modelle für EU-Sprachen und ihre Lizenzen
Die Sprachliste auf der Model Card entscheidet in der öffentlichen Verwaltung mehr als in den meisten Unternehmen, da eine Behörde in Mittel- und Osteuropa in ihrer Landessprache schreibt und Bürgern in anderen Sprachen antwortet. Die Model Card von Mistral Small 3.1 nennt 25 Sprachen, darunter Deutsch, Polnisch und Rumänisch, aber nicht Tschechisch, Ungarisch, Kroatisch, Slowakisch oder Bulgarisch, und die Model Card von 3.2 bezeichnet ihr Modell als „ein kleines Update“ von 3.1. EuroLLM-22B führt alle 24 Amtssprachen der EU unter 35 Sprachen auf, unter Apache 2.0, mit einer Sequenzlänge von 32.768 Token; seine Model Card hält fest, dass das Modell „nicht auf menschliche Präferenzen ausgerichtet wurde“. Bei der Spracherkennung transkribiert Parakeet TDT 0.6B v3 unter CC BY 4.0 25 europäische Sprachen, darunter jede Amtssprache der EU außer Irisch, während Whisper unter der MIT-Lizenz mehr Sprachen abdeckt.
Unser Vergleich offener LLMs für europäische Sprachen zeigt, welches Modell welche Sprache nennt und wie viel GPU-Speicher jedes belegt. Testen Sie zwei oder drei Kandidaten mit Ihren eigenen Schreiben und Anfragen in jeder Sprache, die Ihre Beschäftigten verwenden, bewertet von Muttersprachlern, bevor Sie die Servergröße festlegen.
Prüfen Sie die Lizenz so genau wie die Sprachliste. Apache 2.0, MIT und CC BY 4.0 erlauben die Nutzung durch eine öffentliche Stelle, während andere Open-Weight-Modelle mit Nutzungsrichtlinien, Umsatzschwellen oder nichtkommerziellen Bedingungen kommen; unser Vergleich der Lizenzen offener LLMs für die Nutzung im Unternehmen zitiert die Klauseln. Welche Bedingungen eine Behörde akzeptieren darf, ist eine rechtliche Bewertung für ihre Rechtsabteilung.
GPU-Server nach Behördengröße auslegen
Ein Server wird nach der Spitzenzahl der Anfragen in Bearbeitung ausgelegt, nicht nach der Kopfzahl. Unser Leitfaden zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße erklärt die Methode. Seine Beispielwerte sind 40 Prozent der Beschäftigten aktiv in der Spitzenstunde, je sechs Anfragen, 30 Sekunden je Anfrage und ein Spitzenfaktor von 2, womit die Spitze bei etwa 4 Prozent der Beschäftigten liegt.
Mistral Small 3.2 dient als Beispielmodell, da öffentliche Dokumente lang sind und seine config.json 131.072 Token zulässt, das 128K-Fenster, das die Model Card von 3.1 nennt. Seine BF16-Gewichte belegen 44,7 GiB, und nach unserer Auslegungsregel bleiben auf einer RTX PRO 6000 mit 96 GB 38,3 GiB für den KV-Cache und auf einer H200 NVL mit 141 GB 78,6 GiB. Nach seiner config.json (40 Schichten, 8 KV-Köpfe der Dimension 128) belegt ein Token 160 KiB 16-Bit-Cache, ein Gespräch bei deklarierten 32K Kontext belegt in einem FP8-Cache also 2,5 GiB. Eine RTX PRO 6000 hält dann rund 15 solche Gespräche und eine H200 NVL rund 31.
| STELLE, BESCHÄFTIGTE | SPITZE (ANFRAGEN) | KONFIGURATION | 32K-GESPRÄCHE |
|---|---|---|---|
| Gemeinde, 300 | 12 | ein Server, 2 × RTX PRO 6000 Server Edition: eine betreibt das LLM, eine läuft im MIG-Modus für Suche und Spracherkennung | 15 |
| Regionalbehörde, 1.000 | 40 | zwei Server, je 4 × RTX PRO 6000 Server Edition: drei LLM-Kopien, eine Karte im MIG-Modus | 45 je Server, 90 zusammen |
| Stadt, Ministerium, 2.000 | 80 | zwei Server, je 4 × H200 NVL: drei Kopien, eine Karte im MIG-Modus; oder je 8 × RTX PRO 6000: sechs Kopien, zwei für Dienste | 93 oder 90 je Server |
Unsere Schätzungen: Mistral Small 3.2 in BF16 mit FP8-KV-Cache bei deklarierten 32K Kontext, eine Kopie je Karte, 0,9 × vom Treiber gemeldeter Speicher, abzüglich 3 GiB und der Gewichte; Spitzen aus den Beispielwerten oben. Schichten und KV-Köpfe aus der config.json des Modells auf Hugging Face, abgerufen am 10. Oktober 2026.
Bei 1.000 und 2.000 Beschäftigten hält jeder der beiden Server die ganze Beispielspitze, sodass der Dienst weiterläuft, wenn einer ausfällt oder in einem Wartungsfenster ist. Der eine Server der Gemeinde hat keine solche Reserve, und ein zweiter Server derselben Bauart schafft sie. Mit EuroLLM-22B statt Mistral Small 3.2 hält eine RTX PRO 6000 rund 12 Gespräche bei seinem vollen Kontext von 32K mit FP8-Cache, und die Zahl der Kopien steigt entsprechend. Der vLLM-Befehl auf der Model Card selbst verteilt Mistral Small 3.2 mit --tensor-parallel-size 2 auf zwei GPUs, während unsere Rechnung eine Kopie je Karte mit 96 GB vorsieht; prüfen Sie die Größe des KV-Cache, die vLLM beim Start auf der Karte meldet, die Sie einsetzen werden. Acht Karten mit je bis zu 600 W ziehen bis zu 4,8 kW vor Prozessoren und Lüftern; prüfen Sie deshalb bei den Builds mit acht Karten Stromzuleitung und Kühlung des Racks vor der Bestellung.
Inferenzserver bauen wir mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern, und wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Ihre Beschäftigtenzahlen, Workloads und Sprachen über das Formular unten.
Eigener Serverraum oder EU-Rechenzentrum
Für eine Behörde hängt die Datensouveränität davon ab, wo die Hardware steht, wer den administrativen Zugriff hat und welcher Vertrag das Hosting regelt. Ein Server im eigenen Serverraum der Behörde klärt diese Fragen intern, braucht aber Strom, Kühlung und Personal für den Betrieb. Dedizierte Hardware in einem EU-Rechenzentrum hält die Daten in der EU auf Servern, die kein anderer Kunde nutzt, und die Behörde entscheidet unter Einbeziehung ihres Datenschutzbeauftragten, welche Akten dorthin dürfen.
Unsere Leistung Private AI/ML betreibt Modelle auf Ihren Servern oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen und protokolliert Anfragen und Antworten. Nennen Sie uns, welche Akten der Assistent erreichen darf und wo sie bleiben müssen.
Pflichten nach dem AI Act für Behörden: Artikel 27 und Anhang III
Eine öffentliche Stelle, die ein KI-System in eigener Verantwortung verwendet, ist nach Artikel 3 Nummer 4 des AI Act Betreiber. Entwürfe, Übersetzung, Transkription und Aktensuche gehören nach unserer Lesart nicht zu den in Anhang III aufgeführten Zwecken. Anhang III Nummer 5 Buchstabe a führt aber Systeme auf, die „von Behörden oder im Namen von Behörden“ verwendet werden sollen, um zu beurteilen, ob natürliche Personen Anspruch auf grundlegende öffentliche Unterstützungsleistungen und -dienste einschließlich Gesundheitsdiensten haben, oder um solche Leistungen zu gewähren, einzuschränken, zu widerrufen oder zurückzufordern. Nummer 5 Buchstabe d führt Systeme auf, die Notrufe natürlicher Personen bewerten und klassifizieren oder Not- und Rettungsdienste entsenden. Ein Routing für Anfragen, das beginnt, den Anspruch auf Leistungen zu beurteilen, oder ein Triage-Werkzeug, das Notrufe klassifiziert, kann deshalb unter Anhang III fallen.
Für eine solche Hochrisiko-Nutzung verlangt Artikel 27 Absatz 1 von Betreibern, die Einrichtungen des öffentlichen Rechts oder private Einrichtungen sind, die öffentliche Dienste erbringen, vor dem Einsatz eine Grundrechte-Folgenabschätzung; ausgenommen sind Systeme für kritische Infrastruktur nach Anhang III Nummer 2. Absatz 2 bezieht die Pflicht auf die erste Verwendung und verlangt eine Aktualisierung, wenn sich eines der Elemente ändert. Die Abschätzung umfasst die Verfahren, in denen das System verwendet wird, Zeitraum und Häufigkeit der Verwendung, die Kategorien betroffener Personen, die spezifischen Schadensrisiken, die Maßnahmen der menschlichen Aufsicht und die Schritte, falls sich Risiken verwirklichen, einschließlich der Beschwerdemechanismen. Nach Absatz 3 teilt der Betreiber der Marktüberwachungsbehörde die Ergebnisse mit und übermittelt mit der Mitteilung die ausgefüllte Vorlage nach Absatz 5. Die Verordnung (EU) 2026/1744 hat die Absätze 4 und 5 ersetzt; der Betreiber kann nun auf die Datenschutz-Folgenabschätzung nach der DSGVO verweisen oder Teile davon aufnehmen, und das Büro für Künstliche Intelligenz erarbeitet die Vorlage. Artikel 26 Absatz 8 ergänzt, dass Betreiber von Hochrisiko-Systemen, die Behörden sind, die Registrierungspflichten nach Artikel 49 erfüllen und ein System, das sie nicht in der EU-Datenbank nach Artikel 71 registriert finden, nicht verwenden und stattdessen dessen Anbieter oder Händler informieren.
Artikel 27 steht in Kapitel III Abschnitt 3, der nach Artikel 113 in der Fassung der Verordnung (EU) 2026/1744 für Systeme nach Anhang III ab dem 2. Dezember 2027 gilt. Artikel 50 Absatz 4 gilt seit dem 2. August 2026. Ein Betreiber legt offen, dass ein Text, den er veröffentlicht, um die Öffentlichkeit über Angelegenheiten von öffentlichem Interesse zu informieren, künstlich erzeugt oder manipuliert wurde, es sei denn, der Text wurde einer menschlichen Überprüfung oder redaktionellen Kontrolle unterzogen und jemand trägt die redaktionelle Verantwortung für seine Veröffentlichung. Unser Leitfaden zu den Betreiberpflichten nach dem EU AI Act behandelt den Zeitplan und Artikel 26. Ob eine bestimmte Nutzung unter Anhang III fällt, ist eine rechtliche Bewertung für die Rechtsabteilung der Behörde; der Server kann Prompts, Antworten und Nutzer protokollieren, damit der Nachweis vorliegt, wenn er gebraucht wird.
Allgemeine Information zum EU-Recht mit Stand Oktober 2026: Verordnung (EU) 2024/1689, Artikel 3 Nummer 4, Artikel 26 Absatz 8, Artikel 27, Artikel 50 Absatz 4 und Artikel 113 sowie Anhang III, in der konsolidierten Fassung mit Stand 27. Juli 2026 auf eur-lex.europa.eu, und der Verordnung (EU) 2026/1744, Artikel 1 Nummer 13.
Vom Piloten zur Ausschreibung und zum Betrieb
Die meisten Behörden kaufen Server über eine öffentliche Ausschreibung, der Pilot liefert also auch die technische Spezifikation. Unser Leitfaden zur technischen Spezifikation für die Ausschreibung von GPU-Servern zeigt, wie Sie messbare Anforderungen statt Markennamen formulieren.
- Wählen Sie einen Prozess mit klaren Metriken, etwa die Zusammenfassung von Fallakten oder die Weiterleitung von Anfragen, und die Sprachen, die er braucht.
- Testen Sie zwei oder drei Modelle mit Ihren eigenen Dokumenten und erfassen Sie die Anfragen der Spitzenstunde und ihre Dauer aus den Gateway-Logs.
- Legen Sie die Karten nach der gemessenen Spitze, dem deklarierten Kontext und den Modellen aus, die geladen bleiben, Suche und Spracherkennung eingeschlossen.
- Schreiben Sie die Ausschreibung aus diesen Zahlen: Speicher je Karte und insgesamt, MIG-Unterstützung, Leistung je Rackposition, Garantie und Abnahmetests.
- Planen Sie den Betrieb: wer den Server patcht, wo die Logs liegen und wie lange, und wie ein zweiter Server übernimmt.
Was wir liefern
Wir bauen KI-Server für diese Art von Plattform auf Bestellung, mit der RTX PRO 6000 Server Edition, der H200 NVL mit NVLink-Brücken, der L40S und der L4, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU unter einem EU-Vertrag und auf einer Rechnung. Die kleineren professionellen NVIDIA-GPUs, die wir liefern, etwa die RTX PRO 2000 und 4000, eignen sich für Transkriptions- oder Suchknoten in Außenstellen. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung, und Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch. Die Modelle, die Aktensuche und die Protokollierung darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO und Support unter einem vereinbarten SLA.
FAQ
Wie kann der öffentliche Sektor KI on-premise betreiben?
Welches LLM eignet sich für Behörden und die öffentliche Verwaltung?
Was bedeutet souveräne KI in der Verwaltung auf eigenen Servern?
Wie groß muss ein KI-Server für eine Gemeinde sein?
Kann eine Behörde ein privates LLM statt eines Cloud-Dienstes nutzen?
Was verlangt der AI Act von Behörden?
Schicken Sie uns die Zahl der Beschäftigten, die geplanten Workloads (Entwürfe, Anfragen, Übersetzung, Transkription, Aktensuche), die Sprachen und den Standort des Servers. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages