BLOG · GUIDE ·

Eine private ChatGPT-Alternative für Ihr Unternehmen: Komponenten, Dimensionierung und Zugriffskontrolle

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Eine selbst gehostete Alternative zu ChatGPT kombiniert einen Modellserver mit OpenAI-kompatibler API wie vLLM, ein Chat-Frontend wie Open WebUI oder LibreChat, die Anmeldung über Ihren Identity Provider, eine Dokumentenschicht, die die Berechtigungen jedes Nutzers durchsetzt, ein Query-Log und GPU-Server, die für die Spitze der Anfragen in Bearbeitung ausgelegt sind
  • LibreChat steht unter der MIT-Lizenz; die eigene Lizenz von Open WebUI erlaubt seit v0.6.6 die interne Nutzung ohne Begrenzung je Nutzer, schützt aber das Branding oberhalb von 50 Endnutzern in einem beliebigen rollierenden Zeitraum von 30 Tagen; bei den Modellen stehen gpt-oss, Qwen3-32B und Gemma 4 unter Apache 2.0, während die Nutzungsrichtlinie von Llama 4 Unternehmen mit Hauptgeschäftssitz in der EU die Rechte an den multimodalen Modellen vorenthält
  • Die Anmeldung läuft in beiden Frontends per OpenID Connect über Ihren Identity Provider, nativ per SAML nur in LibreChat; Open WebUI gleicht die Gruppen bei jeder Anmeldung mit den Claims des Tokens ab und gibt Wissensdatenbanken gruppenweise frei, sodass Rechte je Dokument einen Filter beim Abruf brauchen
  • Das Audit-Log von Open WebUI ist standardmäßig aus, kürzt Bodies auf 2.048 Byte und schließt die Chat-Pfade aus, und selbst mit den Chat-Pfaden enthalten seine Response-Bodies keine Antworten, denn diese erreichen den Browser über einen WebSocket; ein vollständiges Protokoll der Prompts und Antworten liefern die gespeicherten Chats oder ein Gateway, mit einer vorab festgelegten Aufbewahrungsfrist
  • Dimensionieren Sie nach den Anfragen in Bearbeitung: 0,9 × der vom Treiber gemeldete Speicher, minus 3 GiB, minus die Gewichte lässt für gpt-oss-120b auf einer RTX PRO 6000 rund 22,2 GiB KV-Cache, also rund 19 Gespräche bei deklarierten 32K Kontext

Eurokommerz × Vixen.UNO: Private AI/ML  Experten kontaktieren →

Woraus eine private ChatGPT-Alternative besteht

Eine private Alternative zu ChatGPT betreibt einen Assistenten wie ChatGPT vollständig auf Servern unter Ihrer Kontrolle, on-premise oder auf dedizierter Hardware in einem EU-Rechenzentrum. Dazu gehören ein Modellserver mit OpenAI-kompatibler API wie vLLM, ein Chat-Frontend mit Konten wie Open WebUI oder LibreChat, die Anmeldung über Ihren Identity Provider, eine Dokumentenschicht, die die Zugriffsrechte jedes Nutzers anwendet, ein Protokoll der Prompts und Antworten, Guardrails, ein Modell, dessen Lizenz zu Ihrer Nutzung passt, und GPU-Server, die für die Spitze der Anfragen in Bearbeitung ausgelegt sind.

KOMPONENTEOPTIONENWAS FESTZULEGEN IST
ModellservervLLM, SGLang, NVIDIA NIMModell, Präzision, deklarierter Kontext
Chat-FrontendOpen WebUI, LibreChatLizenz­bedingungen, Funktionen je Rolle
Anmeldung und RollenOIDC, SAML, LDAP, SCIMlokale Anmeldung, Token-Laufzeit, Modell­zugriff
Dokumente und RAGUploads, Wissens­datenbanken, Retrieval-Dienstwo Rechte je Dokument durchgesetzt werden
Query-LogChatverlauf, Audit-Log, Gatewaywas gespeichert wird, wer es liest, wie lange
GuardrailsFilter­funktionen, Guard-Modellewelche Ein- und Ausgaben geprüft werden
ModellApache 2.0 oder Community-LizenzenLizenz­bedingungen, Sprachen, Speicher
GPU-Serverausgelegt nach Anfragen in BearbeitungZahl der Karten, ein zweiter Host

Dokumentation von vLLM, Open WebUI, LibreChat und NeMo Guardrails, abgerufen am 6. Oktober 2026.

Modellserver: vLLM mit OpenAI-kompatibler API

vLLM steht unter der Apache-2.0-Lizenz und wird in seiner Dokumentation als „ein HTTP-Server, der OpenAIs Completions API, Chat API und mehr implementiert“ beschrieben; gestartet wird es mit vllm serve und dem Modellnamen. Seine Option --api-key prüft statische Schlüssel, von denen das Frontend einen vorlegt, auf Routen wie /v1. vLLM hat keine Nutzerkonten, und seine Dokumentation vermerkt, dass der Parameter user der Chat API ignoriert wird; wer was gefragt hat, weiß also nur das Frontend oder ein Gateway vor vLLM. Setzen Sie --max-model-len auf den Kontext, den die Gespräche brauchen, und nicht auf das Maximum des Modells, denn der Wert legt fest, wie viele Gespräche voller Länge gleichzeitig Platz haben. Außerdem sammelt vLLM „standardmäßig anonyme Nutzungsdaten“ zu Hardware und Modellkonfiguration, bis VLLM_NO_USAGE_STATS=1 gesetzt ist. Unser Vergleich der Serving-Engines für LLMs behandelt SGLang, TensorRT-LLM und Ollama.

Chat-Frontend für private LLMs: Open WebUI oder LibreChat und ihre Lizenzen

Beide Frontends verbinden sich mit jedem OpenAI-kompatiblen Endpunkt, Open WebUI unter Settings, Admin, Connections mit der /v1-URL von vLLM und LibreChat über einen Custom Endpoint mit einer baseURL in librechat.yaml. Open WebUI durchsucht Wissensdatenbanken, optional mit BM25 und Reranking; LibreChat nutzt seine RAG API auf PostgreSQL mit pgvector.

LibreChat steht unter der MIT-Lizenz, sein separates Admin-Panel unter der AGPL-3.0. Open WebUI hat seit v0.6.6 vom 19. April 2025 eine eigene Lizenz: BSD-3-Bedingungen plus eine Klausel, die verbietet, das Open-WebUI-Branding zu verändern, zu entfernen, zu verdecken oder zu ersetzen, es sei denn, eine Installation hat nicht mehr als 50 Endnutzer „innerhalb eines beliebigen rollierenden Zeitraums von dreißig (30) Tagen“, der Rechteinhaber hat schriftlich zugestimmt oder eine Enterprise-Lizenz erlaubt es. Die Lizenzseite nennt „Keine Begrenzung je Nutzer für interne, Mitarbeiter- oder unternehmensweite Nutzung, solange das Open-WebUI-Branding stets vorhanden und deutlich sichtbar ist“ und hält fest, dass die Lizenz „keine von der OSI anerkannte ‚Open Source‘-Lizenz ist“, was dort zählt, wo eine Unternehmensrichtlinie nur von der OSI anerkannte Lizenzen zulässt.

Single Sign-on mit OIDC oder SAML, Rollen und Gruppen

Sowohl Open WebUI als auch LibreChat melden Nutzer über OpenID Connect an. Open WebUI dokumentiert außerdem LDAP und einen Trusted-Header-Modus für einen authentifizierenden Reverse Proxy und warnt, dass eine falsche Konfiguration „Nutzern erlauben kann, sich als beliebiger Nutzer zu authentifizieren“. Natives SAML haben wir in seiner Dokumentation nicht gefunden; ein Identity Provider, der nur SAML spricht, lässt sich über einen Broker wie Keycloak erreichen, der über externe „OpenID-Connect- oder SAML-Identity-Provider“ authentifiziert. LibreChat unterstützt SAML direkt, aber ohne Single Logout und nicht zusammen mit OpenID Connect.

Rollen und Gruppen kommen aus dem Token. Bei eingeschalteter Rollenverwaltung nennt OAUTH_ADMIN_ROLES in Open WebUI die Rollen, die sich als Administratoren anmelden, und OAUTH_ALLOWED_ROLES die Rollen, die überhaupt Zugang erhalten. ENABLE_OAUTH_GROUP_MANAGEMENT hält die Mitgliedschaften bei jeder Anmeldung „strikt synchronisiert“ mit den Claims des Tokens, was Nutzer aus Gruppen entfernt, denen sie von Hand zugeordnet wurden. Berechtigungen sind additiv, und Gruppen können nicht entziehen, was die Standardberechtigungen gewähren; deshalb empfiehlt die Dokumentation minimale Standardberechtigungen. LibreChat beschränkt die Anmeldung mit OPENID_REQUIRED_ROLE auf die dort aufgeführten Rollen und verwaltet Funktionsberechtigungen für Rollen, Gruppen und Nutzer in seinem separaten Admin-Panel, das seine Dokumentation als „jetzt zum Testen verfügbar“ beschreibt.

Neue Konten in Open WebUI erhalten zunächst die Rolle pending, und wer ENABLE_LOGIN_FORM auf false setzt, entfernt das lokale Passwortformular. Session-Token haben standardmäßig eine Laufzeit von 4w und bleiben ohne Redis nach der Abmeldung gültig; der Härtungsleitfaden ergänzt, dass das Deaktivieren eines Kontos „das bereits dafür ausgestellte Token nicht widerruft“, obwohl die Rolle bei jeder Anfrage erneut geprüft wird. Mit eingeschaltetem SCIM 2.0 deaktiviert der Identity Provider Nutzer direkt, was ihre Rolle auf pending setzt.

Dokument-Upload, RAG und Berechtigungen je Dokument

Dokumente kommen als Uploads im Chat an oder als gemeinsame Sammlungen, die der Assistent durchsucht. In Open WebUI wird eine Wissensdatenbank über eine Zugriffsliste für Gruppen oder Nutzer freigegeben, und das Begleitwerkzeug oikb spiegelt Quellen wie Git-Repositories, Confluence-Bereiche und S3-Buckets hinein. Die Zugriffsliste gilt für die ganze Wissensdatenbank; in der Dokumentation haben wir nichts gefunden, was die Berechtigungen eines Quellsystems je Dokument in den Index überträgt.

Das genügt, wo eine Sammlung einen einzigen Leserkreis hat. Wo eine Ablage Dokumente mit unterschiedlichen Lesern mischt, müssen die Berechtigungen beim Abruf durchgesetzt werden, durch eine Suche, die vor der Bewertung auf die Identität und die Mitgliedschaften des Nutzers filtert, wie unser Artikel zu RAG auf Unternehmensdaten erklärt. Das Frontend muss die Identität des Nutzers dann an diesen Retrieval-Dienst weitergeben; in Open WebUI erhält eine Filterfunktion den vollständigen Nutzerdatensatz.

Assistenten, die wir im Rahmen unserer Leistung Private AI/ML bauen, nennen die Quelle und beachten die Zugriffsrechte jedes Nutzers, mit Daten- und Berechtigungsverwaltung und einem Query-Log. Schreiben Sie uns im Formular unten, welchen Identity Provider Sie nutzen und in welchen Systemen die Dokumente liegen.

Protokollierung von Prompts und Antworten und ihre Aufbewahrungsdauer

Open WebUI legt gespeicherte Gespräche in seiner Datenbank ab, wo Nutzer sie löschen können, wenn ihnen die Berechtigung Allow Chat Delete erteilt ist; temporäre Chats verringern, was gespeichert wird, und Administratoren können die Chats anderer Nutzer lesen, solange ENABLE_ADMIN_CHAT_ACCESS auf dem Standardwert true steht. Das separate Audit-Log ist standardmäßig ausgeschaltet; auf der Stufe METADATA erfasst es Nutzer, IP-Adresse, User-Agent, Methode, URL und Zeitpunkt, und REQUEST_RESPONSE fügt beide Bodies hinzu, gekürzt auf 2.048 Byte. Seine Standardausschlüsse, /chats, /chat und /folders, nehmen die Chat-Routen davon aus. LibreChat löscht temporäre Chats standardmäßig nach 720 Stunden.

Ein vollständiges Query-Log ist eine Designentscheidung. Auch wenn die Chat-Pfade auditiert werden, erfasst das Log jede Chat-Anfrage, die das bisherige Gespräch enthält, aber nicht die Antwort: Im Browser enthält die HTTP-Response nur Task-IDs, während die Antwort über einen WebSocket ankommt und mit dem Chat gespeichert wird. Ein vollständiges Protokoll liefern entweder die gespeicherten Chats, wenn Nutzer weder löschen noch temporäre Chats verwenden dürfen, oder ein Gateway zwischen Frontend und Modellserver, das Anfragen und Antworten protokolliert; Open WebUI schickt ihm Name, ID, E-Mail-Adresse und Rolle des Nutzers als Header, wenn ENABLE_FORWARD_USER_INFO_HEADERS auf true steht. Die Europäische Kommission hält in ihren Hinweisen fest, dass Daten „so kurz wie möglich gespeichert werden müssen“, mit „Fristen für die Löschung oder Überprüfung der gespeicherten Daten“. Die Frist selbst und die Frage, was DSGVO oder KI-Verordnung von einem internen Assistenten verlangen, sind eine rechtliche Bewertung für Ihre Rechtsabteilung.

Dasselbe Log dokumentiert die hybride Nutzung. Eine öffentliche API, die manche Aufgaben nutzen dürfen, wird als weitere Verbindung hinzugefügt, wobei ihre Modelle auf die dafür berechtigten Nutzer oder Gruppen beschränkt werden. Lassen Sie die Direct Connections von Open WebUI ausgeschaltet, denn mit ihnen „kommuniziert der Browser direkt mit dem API-Anbieter“, am Server und seinem Log vorbei. Wann sich eine hybride Aufteilung lohnt, behandelt unser Beitrag Privates LLM oder Cloud-API.

Guardrails und Lizenzen offener Modelle

Guardrails prüfen, was in das Modell hineingeht und was herauskommt. Die Filterfunktionen von Open WebUI führen vor dem Modell ein Inlet und vor dem Nutzer ein Outlet aus, und ein als global und aktiv gesetzter Filter ist „für alle Modelle zwangsweise aktiviert“. NVIDIAs NeMo Guardrails, ein Toolkit unter Apache 2.0, ergänzt Input-, Output- und Retrieval-Rails, und OpenAIs Modelle gpt-oss-safeguard, ebenfalls unter Apache 2.0, „klassifizieren Textinhalte auf Grundlage von Sicherheitsrichtlinien, die Sie vorgeben“.

Die Lizenzen unten stammen aus der jeweiligen Model Card und können sich innerhalb einer Modellfamilie unterscheiden.

MODELLLIZENZWAS ZU PRÜFEN IST
gpt-oss-20b, gpt-oss-120bApache 2.0eine Nutzungs­richtlinie: alles geltende Recht einhalten
Qwen3-32B, Qwen3.8-27BApache 2.0Qwen3.8-Flash-Next steht unter der „Qwen Community License 1.0“
Gemma 4, E2B bis 31BApache 2.0Gemma 3 bleibt unter den Gemma Terms of Use
Llama 3.3 70BLlama-3.3-Community-LizenzNutzungs­richtlinie; „Built with Llama“ auf Produkten, die es enthalten; eine Lizenz von Meta oberhalb von 700 Millionen monatlich aktiven Nutzern
Llama 4 ScoutLlama-4-Community-LizenzNutzungs­richtlinie: multimodale Rechte in der EU vorenthalten

Model Cards, Lizenzdateien und Metas Nutzungsrichtlinien, abgerufen am 6. Oktober 2026.

Nach Metas Nutzungsrichtlinie für Llama 4 (Acceptable Use Policy), abgerufen am 6. Oktober 2026, werden die Lizenzrechte für „alle in Llama 4 enthaltenen multimodalen Modelle“ natürlichen Personen mit Wohnsitz in der EU und Unternehmen mit Hauptgeschäftssitz in der EU nicht gewährt, ausgenommen „Endnutzer eines Produkts oder Dienstes, das solche multimodalen Modelle integriert“. Meta beschreibt die Llama-4-Modelle als „nativ multimodal“. Ob eine solche Klausel Ihre Nutzung betrifft, ist eine Frage für Ihre Rechtsabteilung.

GPU-Dimensionierung für gleichzeitige Nutzer

Dimensionieren Sie die GPU nach den Anfragen in Bearbeitung in der Hauptgeschäftsstunde, nicht nach der Kopfzahl, wie unser Artikel zu gleichzeitigen Nutzern je RTX PRO 6000 erklärt. Seine Regel gibt dem KV-Cache 0,9 × den vom Treiber gemeldeten Speicher, minus 3 GiB, minus die Gewichte; gpu_memory_utilization von vLLM legt diesen Anteil fest und steht inzwischen standardmäßig auf 0,92. Eine RTX PRO 6000 mit 96 GB meldet 95,6 GiB, der Anteil von 0,9 beträgt also 86,0 GiB. Der Checkpoint von gpt-oss-120b mit seinen Expertengewichten in MXFP4 belegt 65,3 GB oder 60,8 GiB, sodass rund 22,2 GiB bleiben. Nur 18 seiner 36 Schichten halten einen Cache für den ganzen Kontext, während die übrigen ihre Attention über ein Fenster von 128 Token berechnen. Ein Token kostet deshalb 36 KiB Cache in BF16. Bei deklarierten 32K braucht ein Gespräch 1,125 GiB, und rund 19 haben gleichzeitig Platz; vLLM gibt beim Start seinen eigenen Wert aus.

Jede Anfrage des Frontends ist zustandslos, sodass mit jeder Runde das ganze Gespräch gesendet wird, und ein langer Chat mit einem hochgeladenen Dokument kann den deklarierten Kontext füllen; das Prefix Caching von vLLM verwendet den bereits verarbeiteten Verlauf wieder. Open WebUI ruft außerdem im Hintergrund ein Modell für Titel, Tags, Vorschläge für Folgefragen, Autovervollständigung und Suchanfragen auf, und „Standardmäßig läuft all das auf dem Modell, mit dem der Nutzer chattet“. Seine Dokumentation empfiehlt ein kleines, schnelles Task-Modell ohne Reasoning und nennt die Autovervollständigung „das Erste, was man abschalten sollte“. Ein Task- oder Embedding-Modell läuft als zweite vLLM-Instanz mit einem eigenen Anteil am Speicher der Karte.

Inferenzserver für private LLMs bauen wir mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Schicken Sie uns über das Formular unten das Modell, den Kontext, den Sie deklarieren wollen, und die Spitze Ihrer Anfragen in Bearbeitung.

Einführung in Schritten: Pilotgruppe, Richtlinie und Schulung

  1. Wählen Sie einen Prozess und eine Pilotgruppe und vereinbaren Sie die Metriken, die der Pilot erfüllen muss, bevor er wächst.
  2. Schreiben Sie die Nutzungsrichtlinie: zugelassene Datenklassen, Modelle und Verbindungen je Nutzergruppe, was protokolliert wird, wer es liest und wie lange. Was in die Richtlinie gehört, behandelt unser Leitfaden zu Schatten-KI, Richtlinie und Kontrollen.
  3. Richten Sie Single Sign-on mit Rollen und Gruppen ein, schalten Sie das lokale Anmeldeformular und die Nutzungsstatistik von vLLM ab, lassen Sie die Direct Connections ausgeschaltet und verkürzen Sie die Laufzeit der Token.
  4. Schulen Sie die Pilotgruppe vor dem Zugang: was eingegeben werden darf, wie man eine zitierte Quelle prüft und wie man eine falsche Antwort meldet.
  5. Messen Sie Anfragen in Bearbeitung, Zeit bis zum ersten Token und Antwortqualität an den Fragen der Pilotgruppe und dimensionieren Sie die Produktivserver danach.
  6. Öffnen Sie den Assistenten für die nächste Abteilung, sobald die Metriken erfüllt sind, und ergänzen Sie einen zweiten Server, bevor das ganze Unternehmen davon abhängt.

Was wir tun

Unsere Leistung Private AI/ML baut diese Plattform unter Ihrer Kontrolle, auf Ihren Servern oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen; nichts geht an öffentliche APIs, bis Sie selbst den Hybridmodus für eine konkrete Aufgabe freigeben, und was dorthin geht, zeigt das Query-Log. Die Assistenten antworten auf Basis Ihrer Dokumente, mit Quellenangabe und unter Beachtung der Zugriffsrechte jedes Nutzers. Wir starten mit einem Pilotprojekt auf einem Prozess mit klaren Metriken, skalieren nur, was seinen Wert bewiesen hat, und schulen Ihr Team für den Betrieb der Plattform. Eurokommerz hält den Vertrag und liefert die Hardware, das Engineering kommt von unserem Engineering-Partner Vixen.UNO; das erste Gespräch ist kostenlos, und der Preis des technischen Assessments steht vor Beginn fest. Wie wir während des Projekts mit Daten umgehen, beschreibt unsere Seite Sicherheit & Compliance.

FAQ

Woraus besteht eine selbst gehostete ChatGPT-Alternative?
Den Kern bilden ein Modellserver mit OpenAI-kompatibler API wie vLLM und ein Chat-Frontend mit Konten wie Open WebUI oder LibreChat. Dazu kommen die Anmeldung über Ihren Identity Provider per OpenID Connect oder SAML, eine Dokumentenschicht, die die Berechtigungen jedes Nutzers beim Abruf durchsetzt, ein Protokoll der Prompts und Antworten mit einer Aufbewahrungsfrist, Guardrails, ein Modell, dessen Lizenz zu Ihrer Nutzung passt, und GPU-Server, die für die Spitze der Anfragen in Bearbeitung ausgelegt sind.
Kann ein Assistent wie ChatGPT intern und on-premise laufen, ohne Daten nach außen zu senden?
Ja, mit dem Modell auf Ihren eigenen GPU-Servern und dem Frontend in Ihrem Netz gelangen Prompts und Dokumente nur über Verbindungen nach außen, die Sie hinzufügen: eine Verbindung zu einer öffentlichen API, die Websuche oder die Direct Connections von Open WebUI, über die der Browser direkt mit einem API-Anbieter spricht. Lassen Sie die Direct Connections ausgeschaltet und geben Sie eine öffentliche Verbindung nur den Nutzern, die sie verwenden dürfen, damit ihre Nutzung im Query-Log erscheint. vLLM sendet standardmäßig anonyme Nutzungsstatistiken, die laut seiner Dokumentation keine sensiblen Informationen enthalten, bis VLLM_NO_USAGE_STATS=1 gesetzt ist, und Open WebUI lädt seine Embedding- und Reranking-Modelle herunter und sucht nach Updates, sofern OFFLINE_MODE nicht auf true steht.
Darf ein Unternehmen Open WebUI ohne kommerzielle Lizenz nutzen?
Für die interne Nutzung ja: Die Lizenzseite nennt „Keine Begrenzung je Nutzer für interne, Mitarbeiter- oder unternehmensweite Nutzung, solange das Open-WebUI-Branding stets vorhanden und deutlich sichtbar ist“. Seit v0.6.6 vom April 2025 braucht das Verändern, Entfernen oder Verdecken des Open-WebUI-Brandings in einer Installation mit mehr als 50 Endnutzern in einem beliebigen rollierenden Zeitraum von 30 Tagen die schriftliche Erlaubnis des Rechteinhabers oder eine Enterprise-Lizenz, und laut Lizenzseite ist die Lizenz nicht von der OSI anerkannt. LibreChat selbst steht ohne eine solche Klausel unter der MIT-Lizenz, sein separates Admin-Panel unter der AGPL-3.0.
Wie binden wir einen internen LLM-Chat an Single Sign-on an?
Open WebUI und LibreChat melden Nutzer beide über OpenID Connect an; LibreChat unterstützt auch SAML, allerdings nicht gleichzeitig mit OpenID Connect, während Open WebUI einen Identity Provider, der nur SAML spricht, über einen Broker oder einen authentifizierenden Proxy erreicht. Übernehmen Sie Rollen und Gruppen aus dem Identity Provider ins Frontend, wobei Open WebUI die Gruppenmitgliedschaften bei jeder Anmeldung mit den Claims des Tokens abgleicht, und schalten Sie das lokale Anmeldeformular ab. Verkürzen Sie auch die Laufzeit der Session-Token, denn der Standardwert von Open WebUI ist 4w, und ohne Redis bleibt ein Token nach der Abmeldung bis zu seinem Ablauf gültig.
Wie viele GPUs braucht eine private ChatGPT-Alternative?
Das hängt von der Spitze der Anfragen in Bearbeitung und vom Kontext ab, den Sie deklarieren, nicht von der Kopfzahl. Nehmen Sie 0,9 des Speichers, den der Treiber meldet, ziehen Sie 3 GiB und die Gewichte ab und teilen Sie durch den KV-Cache, den ein Gespräch braucht: Auf einer RTX PRO 6000 mit 96 GB lässt gpt-oss-120b rund 22,2 GiB übrig, genug für rund 19 Gespräche bei deklarierten 32K Kontext. Planen Sie für die Verfügbarkeit eine zweite Karte in einem zweiten Host ein, was auch immer die Rechnung ergibt.
Welche offenen Modelle darf ein Unternehmen für einen internen Chat-Assistenten nutzen?
Stand 6. Oktober 2026 sind gpt-oss-20b und gpt-oss-120b, Qwen3-32B, Qwen3.8-27B und die Gemma-4-Modelle unter Apache 2.0 veröffentlicht, während für Llama 3.3 und Llama 4 Metas Community-Lizenzen und Nutzungsrichtlinien gelten. Die Nutzungsrichtlinie von Llama 4 enthält Unternehmen mit Hauptgeschäftssitz in der EU die Rechte an den multimodalen Modellen vor, und Lizenzen können sich innerhalb einer Modellfamilie unterscheiden, wie Qwen3.8-Flash-Next zeigt. Prüfen Sie die Lizenz auf jeder Model Card und überlassen Sie die rechtliche Bewertung Ihrer Rechtsabteilung.

Schicken Sie uns die Zahl der Personen, die den Assistenten nutzen würden, Ihren Identity Provider, den Speicherort der Dokumente, aus denen er antworten soll, und gegebenenfalls das Modell, an das Sie denken. Wir antworten innerhalb eines Werktages mit den nächsten Schritten, beginnend mit einem ersten Gespräch, nach dem Sie zwei oder drei mögliche Lösungsszenarien haben. Das erste Gespräch ist kostenlos.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien