BLOG · GUIDE ·

LLM-Gateway für ein Unternehmen: eine API, Schlüssel je Team, Token-Budgets und ein Query-Log

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Ein LLM-Gateway gibt jeder Anwendung einen OpenAI-kompatiblen Endpunkt, prüft einen Schlüssel je Anwendung oder Team, setzt Rate Limits und Token-Budgets durch, leitet an private Modelle oder, wo freigegeben, an eine externe API weiter und protokolliert jede Anfrage
  • vLLM ignoriert den Parameter user seiner Chat Completions API und kennt keine Benutzerkonten; nur ein Gateway, das der einzige Weg zum Modellserver ist, weiß deshalb, welches Team was gefragt hat
  • Der Proxy von LiteLLM steht außerhalb seines Enterprise-Verzeichnisses unter der MIT-Lizenz; JWT-Anmeldung über den Identity Provider, Schlüsselrotation und Budgets je Modell auf einem Schlüssel brauchen seine Enterprise-Lizenz
  • Envoy AI Gateway heißt seit dem 9. September 2026 Agent Router und bleibt unter Apache 2.0, mit Token-Rate-Limits, die Redis brauchen; Kongs AI Proxy steckt in seinem Gateway-Code unter Apache 2.0, während Token-Rate-Limiting und der PII-Sanitizer AI Gateway Enterprise brauchen
  • Fallback-Listen sollten nur private Modelle nennen, das Opt-out vom Logging je Anfrage sollte deaktiviert sein, und Inhalt und Aufbewahrungsfrist des Logs werden vor der ersten Anfrage festgelegt

Eurokommerz × Vixen.UNO: Private AI/ML  Experten kontaktieren →

Was ein LLM-Gateway in einer Unternehmensplattform tut

Ein LLM-Gateway, auch KI-Gateway genannt, ist ein Proxy, über den jede Anwendung die Sprachmodelle erreicht. Es bietet einen OpenAI-kompatiblen Endpunkt, prüft den Schlüssel des Aufrufers und leitet jede Anfrage an ein privates Modell weiter oder, nur wo das Unternehmen es freigegeben hat, an eine externe API. Es setzt Rate Limits und Token-Budgets je Anwendung und Team durch und schreibt jede Anfrage in ein Query-Log, das nach einer Aufbewahrungsrichtlinie geführt wird. Auf einer Plattform mit 500 bis 2.000 Nutzern und mehreren Anwendungen ist es außerdem die eine Komponente, die weiß, welches Team wie viele Token verbraucht hat.

FUNKTIONNUTZENDOKUMENTIERT IN
Ein Endpunkt im OpenAI-StilAnwendungen wechseln Modelle ohne CodeänderungLiteLLM-Proxy, Kong AI Proxy, Agent Router
Schlüssel je Anwendung, Teamein Schlüssel wird widerrufen, ohne andere Nutzer zu treffenVirtual Keys von LiteLLM
Login über Identity Providerder Zugang folgt dem Konto im Verzeichnis­dienstJWT Auth von LiteLLM, SecurityPolicy von Envoy Gateway
Rate Limitsein Batch-Job kann den interaktiven Chat nicht verdrängentpm- und rpm-Limits von LiteLLM, Token-Limits von Agent Router
Token-BudgetsVerbrauch je Abteilung und Zeitraummax_budget und budget_duration von LiteLLM
Fallback-RoutingAnfragen gehen weiter, wenn ein Modell ausfälltFallbacks von LiteLLM
PII-MaskierungNamen und Kennungen maskiert oder die Anfrage blockiertLiteLLM mit Presidio, Kong AI Sanitizer
Query-Log, Aufbewahrungwer was gefragt hat, für eine festgelegte Dauer aufbewahrtSpend Logs und Retention Cleanup von LiteLLM

Dokumentation von LiteLLM, Agent Router, Envoy Gateway und Kong, abgerufen am 10. Oktober 2026.

Warum der Modellserver ein Gateway vor sich braucht

vLLM prüft statische API-Schlüssel, hat aber keine Benutzerkonten, und seine Dokumentation vermerkt, dass der Parameter user der Chat Completions API ignoriert wird. Mehrere Anwendungen, die sich einen vLLM-Schlüssel teilen, sehen in seinen Logs identisch aus, und wird der Schlüssel widerrufen, stoppt das alle zugleich. Das Gateway gibt eigene Schlüssel aus, weiß, zu welcher Anwendung und welchem Team jeder gehört, und reicht die Anfrage mit einem Schlüssel weiter, den nur das Gateway besitzt. Das funktioniert nur, wenn das Gateway der einzige Zugang ist. Auf Kubernetes lassen Network Policies nur das Gateway, den Endpoint Picker und Prometheus an den Serving-Port, wie unser Leitfaden zu einer privaten LLM-Plattform auf Kubernetes darlegt.

Ein Rechenbeispiel zeigt die Größenordnung; die Zahlen sind eine Illustration, keine Sizing-Regel. Ein Unternehmen mit 1.500 Mitarbeitern betreibt ein Chat-Frontend für alle Beschäftigten, einen RAG-Assistenten für Rechtsabteilung und Vertrieb, einen Coding-Assistenten für 60 Entwickler, Workflows in n8n und einen nächtlichen Batch, der Felder aus eingehenden Dokumenten extrahiert. Mit einem Schlüssel je Anwendung in Test und Produktion hält das Gateway zehn Dienstschlüssel, dazu persönliche Schlüssel für Entwickler, deren IDE-Plugins die API direkt aufrufen. Das Chat-Frontend, dessen Anmeldung unser Leitfaden zur privaten ChatGPT-Alternative behandelt, muss mit jeder Anfrage die Identität des angemeldeten Nutzers mitgeben, sonst hält das Log nur die Anwendung fest.

LLM-Gateway-Optionen: LiteLLM, Agent Router (Envoy AI Gateway) und Kong

GATEWAYLIZENZGENANNTE GRENZEN
LiteLLM-ProxyMIT, außer seinem Enterprise-VerzeichnisJWT Auth, Schlüssel­rotation und Budgets je Modell auf einem Schlüssel brauchen eine Enterprise-Lizenz
Agent RouterApache 2.0früher Envoy AI Gateway; Token-Rate-Limits brauchen Redis
Kong AI GatewayAI Proxy: Code unter Apache 2.0AI Rate Limiting Advanced und AI Sanitizer nur in AI Gateway Enterprise
Inference ExtensionApache 2.0sein Endpoint Picker wählt ein Replikat; Schlüssel und Budgets kommen vom Gateway

LICENSE-Dateien von LiteLLM, Kong Gateway und Inference Extension, Dokumentation von LiteLLM und Agent Router, der Beitrag der Agentic AI Foundation vom 9. September 2026, Plugin-Seiten von Kong und die Website der Gateway API Inference Extension, abgerufen am 10. Oktober 2026.

Der Proxy von LiteLLM hält Schlüssel, Teams und Ausgaben in einer Postgres-Datenbank, die seine Dokumentation für Virtual Keys voraussetzt. Seine Lizenzdatei sagt, dass Inhalte außerhalb des Enterprise-Verzeichnisses „unter der MIT-Lizenz verfügbar“ sind, während dieses Verzeichnis eine eigene Lizenzdatei hat. Die Dokumentation kennzeichnet mehrere Funktionen als solche, die „eine LiteLLM-Enterprise-Lizenz“ erfordern, darunter die JWT-basierte Anmeldung, die Schlüsselrotation, Budgets je Modell auf einem Schlüssel und das Logging an manche Ziele, etwa Cloud-Storage-Buckets und eigene Callback-APIs. Single Sign-on für seine Admin-Oberfläche funktioniert ab v1.76.0 ohne diese Lizenz für bis zu 5 Nutzer.

Die Agentic AI Foundation kündigte am 9. September 2026 an: „Envoy AI Gateway ist jetzt Agent Router“, und fügte hinzu: „Die Lizenz bleibt Apache 2.0“. Agent Router läuft auf Envoy Gateway, dessen SecurityPolicy jede Anfrage gegen ein entferntes JWKS auf ein gültiges JWT prüft. Kongs Plugin AI Proxy „nimmt Anfragen in einem von einigen definierten und standardisierten OpenAI-Formaten an“ und übersetzt sie für Anbieter, zu denen vLLM und Ollama gehören. Kongs tokenbasiertes Rate Limiting und sein PII-Sanitizer sind jeweils „nur als Teil unseres Angebots AI Gateway Enterprise verfügbar“.

Die Gateway API Inference Extension bezeichnet sich als „ein offizielles Kubernetes-Projekt, das das Selbst-Hosting generativer Modelle auf Kubernetes optimiert“. Ihr Endpoint Picker teilt dem Gateway mit, welches Replikat eines Modells jede Anfrage bedienen soll. Schlüssel, Budgets und das Log kommen von dem Gateway, das sie implementiert; die beiden Schichten lassen sich also kombinieren: ein Zugangs-Gateway für Schlüssel und Budgets und dahinter das Routing auf Replikate.

API-Schlüssel je Team und Anmeldung über den Identity Provider

LiteLLM erzeugt Virtual Keys über seinen Endpunkt /key/generate. Jeder Schlüssel trägt eine team_id oder user_id, eine Liste erlaubter Modelle und eigene Limits, und die Ausgaben werden für das zugeordnete Team oder den zugeordneten Nutzer erfasst. Die Modellliste legt fest, welches Team welches Modell nutzt, etwa das Coding-Modell nur auf Entwicklerschlüsseln. Dienstschlüssel gehören in den Secret Store der jeweiligen Anwendung, mit einem Rotationsdatum; persönliche Schlüssel enden mit dem Zugang der Person zur Plattform.

Mit JWT Auth validiert LiteLLM Tokens des Identity Providers gegen dessen öffentliche Schlüssel und liest Team, Nutzer und Rolle aus Claims, die in seiner Konfiguration benannt sind; der Zugang endet also, sobald das Konto im Verzeichnisdienst deaktiviert und sein letztes Token abgelaufen ist. Agent Router kann für dieselbe Prüfung die SecurityPolicy von Envoy Gateway nutzen, und sein Beispiel für Rate Limits identifiziert den Nutzer über einen Request-Header, den das Gateway aus dem validierten Token setzen sollte, statt ihn vom Client zu übernehmen.

Rate Limits und Token-Budgets je Nutzer, Team und Abteilung

Rate Limits schützen interaktive Nutzer vor Massenjobs. LiteLLM setzt tpm_limit und rpm_limit, Token und Anfragen pro Minute, auf Schlüssel und Teams, und Limits auf einem Team gelten über alle seine Schlüssel hinweg. Im Rechenbeispiel erhält der Schlüssel der nächtlichen Extraktion ein Token-Limit, das dem Chat-Modell Raum für seine Spitze lässt, falls der Job bis in die Arbeitszeit läuft.

Budgets werden in LiteLLM als Ausgaben gezählt. Ein Schlüssel oder Team hat ein max_budget und eine budget_duration wie 30d, und die Dokumentation sagt, das Budget „wird am Ende des festgelegten Zeitraums zurückgesetzt“. Überschreitet ein Schlüssel sein Budget, schlagen Anfragen fehl, und max_budget_in_team begrenzt ein Mitglied innerhalb eines Teams. Die Ausgaben ergeben sich aus Kosten je Token; ein privates Modell braucht deshalb einen internen Verrechnungssatz in input_cost_per_token und output_cost_per_token, den LiteLLM nur zur Kostenerfassung nutzt. Sind beide Kosten ausdrücklich auf 0 gesetzt, überspringt LiteLLM für dieses Modell alle Budgetprüfungen; es bleibt dann verfügbar, nachdem ein Team sein Budget aufgebraucht hat, aber seine Anfragen erhöhen die Ausgaben nicht, und seine Nutzung je Abteilung muss in Token gezählt werden. Entscheiden Sie je Modell, welches Verhalten Sie wollen. Die Summen je Abteilung fließen dann in das Showback oder Chargeback, das unser Leitfaden zu einer gemeinsamen GPU-Plattform für Abteilungen beschreibt.

Agent Router zählt Token je Route in llmRequestCosts, mit den Typen InputToken, CachedInputToken, OutputToken, TotalToken und einem CEL-Ausdruck, und setzt Limits über eine BackendTrafficPolicy auf dem globalen Rate Limit von Envoy Gateway durch, gestützt auf Redis. Seine Dokumentation hält fest, dass die Nutzung nach Abschluss einer Antwort verbucht und ein zugelassener Stream nicht unterbrochen wird; die letzte Antwort kann ein Limit also überschreiten. Kongs AI Rate Limiting Advanced zählt Token insgesamt, Prompt- oder Completion-Token oder Kosten.

Routing zu privaten Modellen, Fallbacks und externe APIs

LiteLLM probiert die Fallbacks in der aufgeführten Reihenfolge durch, wenn ein Modell ausfällt, mit eigenen Listen für Anfragen, die das Kontextfenster eines Modells überschreiten, und für Fehler durch Content Policies. Retries und Timeouts werden je Modell gesetzt, und ein Deployment, das pro Minute öfter scheitert als allowed_fails, wird für seine cooldown_time aus der Rotation genommen. Eine Fallback-Liste, die ein externes Modell nennt, schickt Prompts aus dem Unternehmen hinaus, sobald das private Modell nicht verfügbar ist, ohne dass jemand das für diese Daten entschieden hat. Halten Sie Fallbacks unter privaten Modellen, etwa einem zweiten Replikat oder einem Modell mit längerem Kontext. Fügen Sie eine externe API als eigenen Modellnamen hinzu, den nur die Schlüssel freigegebener Aufgaben aufrufen dürfen, sodass jede Anfrage dorthin einen Schlüssel, ein Team und einen Log-Eintrag trägt.

In unserer Leistung Private AI/ML werden öffentliche APIs nur genutzt, wenn Sie den Hybridmodus für eine konkrete Aufgabe freigeben, und was dorthin geht, ist im Query-Log sichtbar. Nennen Sie uns die Anwendungen, die das Gateway aufrufen würden, und die Aufgaben, die ein externes Modell brauchen könnten.

Query-Log, PII-Maskierung und Aufbewahrung

LiteLLM schreibt für jede Anfrage eine Zeile in sein Spend Log in der Datenbank, und disable_spend_logs schaltet das ab. Ob eine Zeile auch den Inhalt von Anfrage und Antwort enthält, legt store_prompts_in_spend_logs oder der entsprechende Schalter in der Admin-Oberfläche fest, und die Dokumentation sagt, dass in der Oberfläche geänderte Einstellungen die Konfigurationsdatei überschreiben; prüfen Sie deshalb vor dem Go-live beides. Die Aufbewahrung wird mit maximum_spend_logs_retention_period gesetzt, und die Dokumentation sagt: „Aufbewahrung und Bereinigung sind Open Source.“ Die Einstellung turn_off_message_logging hält Nachrichten und Antworten von seinen Logging-Callbacks fern, während „Metadaten der Anfrage weiterhin protokolliert werden“. Ein Client kann das Logging je Anfrage mit no-log=True umgehen, sofern der Administrator nicht global_disable_no_log_param setzt, was ein verpflichtendes Query-Log erfordert.

LiteLLM maskiert personenbezogene Daten über Presidio, dessen Analyse- und Anonymisierungsdienste neben dem Gateway laufen müssen. Im Modus pre_call prüft es die Eingabe vor dem Modellaufruf, im Modus post_call prüft es Eingabe und Ausgabe danach. Je Entitätstyp ersetzt MASK einen Wert durch einen Platzhalter wie <PERSON>, und BLOCK weist die Anfrage ab. Kongs AI Sanitizer nutzt einen Anonymisierungsdienst, der als Container laufen kann. Maskierung ist vor allem auf Routen zu externen APIs wichtig; auf einer privaten Route kann sie Namen entfernen, die eine Vertragsprüfung braucht. Eingeschleuste Anweisungen erkennt sie nicht; diese behandelt unser Leitfaden zu Prompt Injection und LLM-Sicherheit.

Artikel 5 Absatz 1 Buchstabe e DSGVO verlangt, dass personenbezogene Daten „in einer Form gespeichert werden, die die Identifizierung der betroffenen Personen nur so lange ermöglicht, wie es für die Zwecke, für die sie verarbeitet werden, erforderlich ist“, und das Log kann Prompts mit Namen und Kundendaten enthalten. Was das Log speichert, wer es lesen darf und wie lange, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Richtlinienentscheidungen vor dem Go-live des Gateways

ENTSCHEIDUNGBEISPIEL, 1.500 MAWER ENTSCHEIDET
Modelle je TeamChat-Modell für alle; Coding-Modell für EntwicklerCIO, Abteilungs­leiter
Externe APIsaus; je Aufgabe freigegeben, eigener ModellnameCIO, DSB, Rechts­abteilung
Fallbacksnur private ModellePlattform­team
Limits je SchlüsselBatch unter der Chat-Spitze; Budgets je AbteilungPlattform­team, Finanzen
Log-InhalteMetadaten für alle; Text, wo die Richtlinie es verlangtDSB, Security
Aufbewahrungvor dem ersten Eintrag festgelegtRechts­abteilung
Leser des Logsbenannte Rollen, ihr Zugriff protokolliertSecurity, DSB
Opt-out vom Loggingfür alle Clients deaktiviertIT-Sicherheit

Eine Beispielrichtlinie; die Entscheidungen treffen Sie. Einstellungen wie in der Dokumentation von LiteLLM benannt, abgerufen am 10. Oktober 2026.

Derselbe Bericht, der die Token je Abteilung zeigt, zeigt auch, ob die Beschäftigten die freigegebene Plattform nutzen oder weiter öffentliche Werkzeuge verwenden; damit befasst sich unser Leitfaden zu Richtlinien und Kontrollen gegen Schatten-KI. Nehmen Sie das Gateway in dieser Reihenfolge in Betrieb.

  1. Stellen Sie das Gateway vor jeden Modellserver und schließen Sie alle anderen Wege dorthin.
  2. Legen Sie Teams und Schlüssel je Anwendung und Umgebung an, mit erlaubten Modellen und Limits.
  3. Binden Sie die Token-Validierung an den Identity Provider an und entfernen Sie gemeinsam genutzte persönliche Schlüssel.
  4. Legen Sie Log-Inhalte, Leser und Aufbewahrungsfrist fest und deaktivieren Sie das Opt-out vom Logging.
  5. Fügen Sie externe APIs nur als eigene Modellnamen auf den Schlüsseln freigegebener Aufgaben hinzu.

Die Protokollierung von Anfragen und Antworten, mit Daten- und Berechtigungsverwaltung, ist Teil der Plattform, die wir bauen. Beschreiben Sie Ihre Abteilungen, Anwendungen und das Log, das Ihre Rechtsabteilung erwartet, im Formular unten.

Was wir tun

Unsere Leistung Private AI/ML baut eine KI-Plattform unter Ihrer Kontrolle, auf Ihren Servern oder in einem Tier-3-Rechenzentrum in Litauen, bei der nichts an öffentliche Dienste geht, solange Sie es nicht ausdrücklich freigeben. Ein Query-Log, Daten- und Berechtigungsverwaltung und die Protokollierung von Anfragen und Antworten lassen Security und Legal sehen, wer worauf zugreift und wie. Eurokommerz hält den Vertrag und liefert die Hardware, mit Engineering von unserem Engineering-Partner Vixen.UNO und Support unter einem vereinbarten SLA. Das erste Gespräch ist kostenlos, und der Preis des technischen Assessments steht vor Beginn der Arbeiten fest. Den Umgang mit Daten während eines Projekts beschreibt unsere Seite Sicherheit und Compliance.

FAQ

Was ist ein LLM-Gateway?
Ein LLM-Gateway ist ein Proxy zwischen Anwendungen und Sprachmodellen, der einen OpenAI-kompatiblen Endpunkt bietet. Es prüft einen Schlüssel je Anwendung oder Team, setzt Rate Limits und Token-Budgets durch, leitet Anfragen an private Modelle oder, wo freigegeben, an externe APIs weiter und schreibt jede Anfrage in ein Query-Log. Es funktioniert nur, wenn es der einzige Weg zu den Modellservern ist.
Gibt es ein Open-Source-KI-Gateway für Unternehmen?
Der Proxy von LiteLLM steht außerhalb seines Enterprise-Verzeichnisses unter der MIT-Lizenz, wobei JWT-Anmeldung, Schlüsselrotation und Budgets je Modell auf einem Schlüssel seine Enterprise-Lizenz brauchen. Agent Router, bis September 2026 Envoy AI Gateway genannt, steht unter Apache 2.0 und läuft auf Envoy Gateway. Kongs Plugin AI Proxy ist Teil des Kong-Gateway-Codes unter Apache 2.0, während sein tokenbasiertes Rate Limiting und sein PII-Sanitizer zum Angebot AI Gateway Enterprise gehören.
Wofür wird der LiteLLM Proxy verwendet?
Der LiteLLM-Proxy gibt Anwendungen einen OpenAI-kompatiblen Endpunkt vor privaten Modellen und externen APIs. Er gibt Virtual Keys aus, die an Teams und Nutzer gebunden sind, setzt Token- und Anfragelimits sowie Ausgabenbudgets durch und übernimmt Fallbacks zwischen Modellen. Schlüssel, Teams und sein Spend Log speichert er in einer Postgres-Datenbank.
Wie funktioniert LLM Rate Limiting pro Nutzer oder Team?
Die Limits gehören in das Gateway, denn der Modellserver kennt den Nutzer nicht. LiteLLM setzt Token und Anfragen pro Minute auf Schlüssel und Teams, und Agent Router zählt Eingabe-, Ausgabe- oder Gesamt-Token je Route und setzt Limits über Envoy Gateway mit Redis durch. Agent Router verbucht die Nutzung nach Abschluss einer Antwort, ein zugelassener Stream kann ein Limit also überschreiten.
Wie erfasst man LLM-Kosten und Nutzung pro Abteilung bei privaten Modellen?
Geben Sie jedem Team eigene Schlüssel und lassen Sie das Gateway die Token je Schlüssel und Team zählen. LiteLLM berechnet Ausgaben aus Kosten je Token; ein privates Modell braucht deshalb einen internen Verrechnungssatz, und ein Modell, bei dem beide Kosten ausdrücklich auf 0 gesetzt sind, umgeht seine Budgetprüfungen und erhöht die Ausgaben nicht. Die Summen je Abteilung können dann in Showback oder Chargeback einfließen.
Sollte ein LLM-Gateway Prompts und Antworten protokollieren?
Ein Gateway ist der eine Ort, der weiß, welcher Nutzer und welches Team eine Anfrage geschickt hat; das Query-Log gehört deshalb dorthin, wobei Inhalt, Leser und Aufbewahrungsfrist vor dem Go-live festgelegt werden. Deaktivieren Sie in LiteLLM die No-Log-Option je Anfrage, wo das Log verpflichtend ist, und setzen Sie die Aufbewahrungsfrist für Spend Logs. Wie lange Prompts mit personenbezogenen Daten aufbewahrt werden dürfen, ist eine rechtliche Bewertung für Ihre Rechtsabteilung.

Schicken Sie uns die Anwendungen, die Ihre Modelle aufrufen werden, die Abteilungen und Nutzer dahinter und die externen APIs, die Sie in Betracht ziehen. Wir antworten innerhalb eines Werktages mit den nächsten Schritten zu einer Plattform mit Query-Log sowie Daten- und Berechtigungsverwaltung. Das erste Gespräch ist kostenlos.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien