Offene LLMs für Deutsch, Polnisch und Rumänisch: europäische Modelle, Lizenzen und GPU-Speicher im Vergleich
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- EuroLLM (1,7B, 9B und 22B, Apache 2.0) und Teuken-7B nennen Deutsch, Polnisch und Rumänisch unter allen 24 Amtssprachen der EU; die kommerzielle v0.4 von Teuken steht unter Apache 2.0, die neuere v0.6 unter CC BY-NC 4.0 für die nichtkommerzielle Nutzung
- Für Polnisch sind Bielik v3 (1,5B bis 11B, Apache 2.0) und PLLuM (4B und 12B unter Apache 2.0, 8B und 70B unter Metas Llama-3.1-Lizenz) mit Schwerpunkt auf dieser Sprache trainiert; die rumänischen Instruct-Modelle von OpenLLM-Ro stehen unter CC BY-NC 4.0
- Mistral Small 3.1, 3.2 und 4 nennen alle drei Sprachen und stehen unter Apache 2.0, während die modifizierte MIT-Lizenz von Mistral Medium 3.5 Unternehmen oberhalb einer monatlichen Umsatzschwelle keine Rechte gewährt
- Der Ankündigungsbeitrag zu Qwen3 führt alle drei Sprachen unter 119 auf, die Model Card von Gemma 4 nennt 35+ Sprachen von Haus aus und 140+ im Vortraining, ohne sie aufzuzählen, und Llama 3.1, 3.3 und 4 führen Deutsch auf, aber weder Polnisch noch Rumänisch; Stand 6. Oktober 2026 hatte OpenEuroLLM Forschungs-Checkpoints veröffentlicht
- In BF16 belegt EuroLLM-22B 42,2 GiB; nach unserer Dimensionierungsregel bleiben damit auf einer RTX PRO 6000 mit 96 GB 40,9 GiB für den KV-Cache, genug für etwa 24 Gespräche mit 8.192 Token
Eurokommerz × Vixen.UNO: Private AI/ML Experten kontaktieren →
Offene LLMs für Deutsch, Polnisch und Rumänisch: was die Model Cards nennen
Zu den offenen Modellen, deren Model Cards Deutsch, Polnisch und Rumänisch nennen, gehören EuroLLM (1,7B, 9B und 22B), Teuken-7B, die Bielik-v3-Modelle mit 7B und 11B sowie Mistral Small 3.1, 3.2 und 4, und der Ankündigungsbeitrag zu Qwen3 führt alle drei unter 119 Sprachen auf. Bielik und PLLuM sind mit Schwerpunkt auf Polnisch trainiert, und das Projekt OpenLLM-Ro veröffentlicht für Rumänisch feinabgestimmte Modelle für die Forschung. EuroLLM, Bielik v3 und diese Versionen von Mistral Small stehen unter Apache 2.0, während die aktuelle Version von Teuken und die Instruct-Modelle von OpenLLM-Ro die kommerzielle Nutzung ausschließen und zwei Größen von PLLuM unter Metas Llama-3.1-Lizenz fallen. „Offen“ bedeutet hier herunterladbare Gewichte unter der Lizenz auf der Model Card, die nicht immer eine Open-Source-Lizenz ist: Die Open Source Definition erlaubt keiner Lizenz, die Nutzung „in einem Unternehmen“ einzuschränken.
| MODELL, HERKUNFT | GRÖSSEN | DE, PL, RO | LIZENZ (MODEL CARD) |
|---|---|---|---|
| EuroLLM (EU-gefördert) | 1,7B, 9B, 22B; EuroMoE 2,6B | alle drei, unter 35 Sprachen | Apache 2.0 |
| Teuken-7B (OpenGPT-X) | 7B | alle drei, unter den 24 EU-Sprachen | kommerzielle v0.4: Apache 2.0; v0.6: CC BY-NC 4.0 |
| Salamandra, ALIA (BSC) | 2B, 7B; ALIA 40B | alle drei im Vortraining; Instruction Tuning vor allem auf iberischen Sprachen und Englisch | Apache 2.0 |
| Bielik v3 (SpeakLeash) | 1,5B, 4,5B, 7B, 11B | 7B, 11B: alle drei, unter 32 europäischen Sprachen; 1,5B, 4,5B: Polnisch | Apache 2.0; Kontaktdaten für den Download |
| PLLuM (HIVE AI) | 4B, 8B, 12B, 70B | Polnisch, mit englischen Daten | 4B, 12B: Apache 2.0; 8B, 70B: Llama-3. |
| Mistral Small 3.1, 3.2, 4 | 24B; 119B | alle drei genannt | Apache 2.0 |
| Mistral Medium 3.5 | 128B | alle drei genannt | modifizierte MIT-Lizenz mit Umsatzschwelle |
| Ministral 3, Mistral Large 3 | 3B bis 14B; 675B | Deutsch genannt; Polnisch, Rumänisch nicht | Apache 2.0 |
| Apertus (Swiss AI) | 0,5B bis 70B | „über 1.000 Sprachen“, keine genannt | Apache 2.0 und eine Nutzungsrichtlinie |
| OpenLLM-Ro, Instruct-Modelle | 2B bis 9B | Rumänisch | CC BY-NC 4.0 |
Model Cards und Sprachmetadaten auf Hugging Face, abgerufen am 6. Oktober 2026. DE, PL, RO: ob die Model Card oder ihre Metadaten Deutsch, Polnisch und Rumänisch nennen.
EuroLLM, Teuken und OpenEuroLLM: Modelle für alle 24 EU-Sprachen
EuroLLM wird von zehn Universitäten, Forschungszentren und Unternehmen mit EU-Förderung entwickelt, und seine Model Cards führen die 24 Amtssprachen der EU und 11 weitere auf. EuroLLM-22B hat 22,6 Milliarden Parameter und einen Kontext von 32.768 Token. Laut seiner Model Card liegt es beim Übersetzen gleichauf mit Gemma-3-27B, Qwen-3-32B und Apertus-70B oder übertrifft sie. Die Model Cards der Instruct-Versionen mit 9B und 22B halten fest, dass das Modell „nicht auf menschliche Präferenzen ausgerichtet wurde“ und Halluzinationen oder falsche Aussagen erzeugen kann.
Teuken-7B wurde im Forschungsprojekt OpenGPT-X von Fraunhofer, dem Forschungszentrum Jülich, der TU Dresden und dem DFKI entwickelt. Es deckt die 24 Amtssprachen der EU mit einem Kontext von 4.096 Token ab, der in einem RAG-Prompt wenig Platz für abgerufene Passagen lässt. Teuken-7B-instruct-commercial-v0.
OpenEuroLLM startete am 1. Februar 2025 mit 20 Organisationen und Mitteln aus dem Programm „Digitales Europa“, um offene Modelle für die „Amtssprachen der EU und darüber hinaus“ zu entwickeln. Stand 6. Oktober 2026 enthält seine Organisation auf Hugging Face Forschungs-Checkpoints, und auf der Model Card seines per Instruction Tuning angepassten 9B-Modells heißt es: „Experimenteller Forschungs-Checkpoint aus der SFT-Phase; kein fertiger Assistent für den Produktivbetrieb“. Im März 2026 schrieb das Projekt, es wolle „bis zum nächsten Sommer ein 8B-Modell veröffentlichen“.
Salamandra, ALIA und Apertus: was Vortraining und Tuning abdecken
Salamandra vom BSC, dem Supercomputing-Zentrum in Barcelona, gibt es in den Größen 2B und 7B, vortrainiert auf 35 europäischen Sprachen und Code, darunter Deutsch, Polnisch und Rumänisch. ALIA-40b wurde auf 9,83 Billionen Token in 35 europäischen Sprachen vortrainiert, und alle diese Modelle stehen unter Apache 2.0. Die Model Card von ALIA-40b-instruct-2606 hält fest: „Der Post-Training-Prozess konzentrierte sich vor allem auf Spanisch, Katalanisch, Baskisch, Galicisch und Englisch“, und die Metadaten des Modells führen wie die von salamandra-7b-instruct-2606 nur diese fünf Sprachen auf. Testen Sie diese Instruct-Modelle auf Deutsch, Polnisch oder Rumänisch, bevor Sie sich auf sie verlassen.
Die Swiss AI Initiative beschreibt Apertus als „vollständig offenes Modell“ mit offenen Gewichten und offenen Trainingsdaten, und laut seiner Model Card der Version 2509 unterstützt es „über 1.000 Sprachen“. Version 1.5 in den Größen 8B und 70B steht unter Apache 2.0, doch wer sie herunterlädt, muss eine Nutzungsrichtlinie akzeptieren und Kontaktdaten angeben; Version 1.1 ergänzt Modelle mit 0,5B, 1,5B und 4B. Die Model Card rät, alle sechs Monate neue Gewichte herunterzuladen, da das Projekt datenschutzrechtliche Löschanfragen über neue Releases umsetzt.
Polnische LLMs: Bielik und PLLuM
Bielik wird von SpeakLeash und ACK Cyfronet AGH entwickelt. In der Generation v3 sind die Modelle mit 1,5B und 4,5B nur für Polnisch gekennzeichnet, während die Modelle mit 7B und 11B als „mehrsprachig (32 europäische Sprachen, für Polnisch optimiert)“ ausgewiesen sind, mit Deutsch und Rumänisch in ihren Metadaten. Alle stehen unter Apache 2.0, und die Downloadseite verlangt Ihre Zustimmung, Kontaktdaten zu teilen. Die Model Card des 11B-Instruct-Modells vermerkt, dass das Modell „über keinerlei Moderationsmechanismen verfügt“. Bielik-PL-11B-v3.
PLLuM ist nach den Worten seiner Model Card „eine Familie großer Sprachmodelle (LLMs), spezialisiert auf Polnisch, mit zusätzlich einbezogenen englischen Daten für eine breitere Generalisierung“. Entwickelt wurde PLLuM 2024 vom PLLuM-Konsortium und seit 2025 unter HIVE AI, einer Initiative für den polnischen öffentlichen Sektor, die der polnische Minister für Digitalisierung finanziert. Die Generation vom Dezember 2025 mit der Kennung 2512 gibt es als Base-, Instruct- und Chat-Varianten. PLLuM-4B basiert auf Googles gemma-3-4b-pt und PLLuM-12B auf Mistral-Nemo-Base-2407, beide laut ihren Model Cards unter Apache 2.0. Llama-PLLuM-8B und Llama-PLLuM-70B basieren auf Llama 3.1 und fallen unter Metas Llama-3.1-Lizenz und deren Nutzungsrichtlinie; die Lizenz verlangt von allen, die sie oder ein Produkt oder einen Dienst mit ihnen weitergeben, den Hinweis „Built with Llama“ anzuzeigen. Googles Gemma Terms of Use zählen „auf Gemma basierende Werke“ zu den Modellderivaten und reichen ihre Nutzungsbeschränkungen weiter; wie sie mit der Angabe Apache 2.0 auf der Model Card von PLLuM-4B zusammenwirken, ist deshalb eine Frage für Ihre Rechtsabteilung.
Rumänische LLMs und Rumänisch in mehrsprachigen Modellen
Von den Modellen oben nennen EuroLLM, Teuken, die Basismodelle von Salamandra, die Bielik-Modelle mit 7B und 11B, Mistral Small 3.1, 3.2 und 4, Mistral Medium 3.5 und Qwen3 Rumänisch, Llama 3.1, 3.3 und 4 dagegen nicht. Das Projekt OpenLLM-Ro passt Llama-, Mistral-, Gemma- und Qwen-Modelle per Fine-Tuning an Rumänisch an und veröffentlicht seine Instruct-Modelle unter CC BY-NC 4.0, was die kommerzielle Nutzung ausschließt. Die Model Card von RoLlama3.1-8b-Instruct in der Version vom 23. April 2025 beschreibt das Modell als für die Forschung auf Rumänisch bestimmt. Sie gibt für RoMT-Bench 6,43 an, gegenüber 5,69 für das Llama 3.1 8B Instruct, auf dem es aufbaut.
Open-Weight-Modelle von Mistral: eine Lizenz je Modell
Mistral AI veröffentlicht die meisten seiner Modelle mit offenen Gewichten unter Apache 2.0, darunter Mistral NeMo, Mistral Small 3.1 und 3.2 (24B), Mistral Small 4 (119B), die Ministral-3-Modelle (3B, 8B und 14B) und Mistral Large 3 (675B). Die Model Card von Mistral Small 3.1 nennt 25 Sprachen, darunter Deutsch, Polnisch und Rumänisch, und die Model Card von 3.2 bezeichnet das Modell als „ein kleines Update“ von 3.1. Die neueren Model Cards nennen Deutsch unter „Dutzenden Sprachen“; Polnisch und Rumänisch erscheinen nur in den Metadaten von Mistral Small 4 und Mistral Medium 3.5, nicht in denen von Ministral 3 oder Mistral Large 3.
Mistral Medium 3.5, ein dichtes 128B-Modell, steht unter einer „Modified MIT License“, die überhaupt keine Rechte gewährt, wenn der „weltweite konsolidierte Monatsumsatz“ Ihres Unternehmens eine in der Lizenz festgelegte Schwelle überschreitet, und die Bedingung erstreckt sich auch auf Derivate. Ältere Modelle wie Mistral Large 2411 und Ministral 8B 2410 nutzen die „Mistral Research License“, die die nichtkommerzielle Nutzung erlaubt; eine kommerzielle Lizenz bietet Mistral auf Anfrage an.
Qwen3, Gemma 4, Llama und gpt-oss: Sprachen auf den Model Cards
| MODELL | LAUT MODEL CARD | DE, PL, RO | LIZENZ |
|---|---|---|---|
| Qwen3 | „100+ Sprachen und Dialekte“; 119 im Ankündigungsbeitrag | alle drei im Ankündigungsbeitrag | Apache 2.0 (Qwen3-32B) |
| Gemma 4 | 35+ von Haus aus, 140+ im Vortraining | keine genannt | Apache 2.0 |
| Llama 3.1, 3.3 | acht unterstützte Sprachen | nur Deutsch | Metas Community-Lizenz und Nutzungsrichtlinie |
| Llama 4 | 12 unterstützte, 200 im Vortraining | nur Deutsch | Llama-4-Lizenz; multimodale Rechte in der EU vorenthalten |
| gpt-oss | keine Sprachliste | Deutsch in MMMLU getestet | Apache 2.0 und eine Nutzungsrichtlinie |
Model Cards; Ankündigungsbeitrag zu Qwen3 (29. April 2025); Metas Nutzungsrichtlinie für Llama 4; OpenAIs Model Card zu gpt-oss (5. August 2025); alle abgerufen am 6. Oktober 2026.
OpenAIs Model Card zu gpt-oss vom 5. August 2025 berichtet Werte für MMMLU, eine professionell übersetzte Fassung von MMLU in 14 Sprachen ohne Polnisch oder Rumänisch, in der gpt-oss-120b auf Deutsch mit hohem Reasoning-Aufwand 83,0 erreicht. Unser Leitfaden zu einer privaten ChatGPT-Alternative vergleicht ihre Lizenzbedingungen, einschließlich der Klausel von Llama 4 zu Unternehmen mit Hauptgeschäftssitz in der EU.
GPU-Speicher je Modellgröße
Unsere Dimensionierungsregel setzt 0,9 des Speichers an, den der Treiber meldet, und zieht davon etwa 3 GiB Overhead und die Gewichte ab, in BF16 zwei Byte je Parameter; der Rest nimmt den KV-Cache auf, wie unser Leitfaden dazu erklärt, wie viel VRAM ein LLM braucht.
| MODELL | BF16-GEWICHTE | RTX PRO 5000, 48 GB | RTX PRO 6000, 96 GB | H200 NVL, 141 GB |
|---|---|---|---|---|
| EuroLLM-9B-Instruct-2512 | 17,0 GiB | 23,2 GiB | 66,0 GiB | 106,3 GiB |
| Bielik-11B-v3. | 20,8 GiB | 19,4 GiB | 62,2 GiB | 102,6 GiB |
| PLLuM-12B-instruct-2512 | 22,8 GiB | 17,4 GiB | 60,2 GiB | 100,5 GiB |
| EuroLLM-22B-Instruct-2512 | 42,2 GiB | passt nicht | 40,9 GiB | 81,2 GiB |
| Mistral-Small-3. | 44,7 GiB | passt nicht | 38,3 GiB | 78,6 GiB |
| ALIA-40b-instruct-2606 | 75,3 GiB | passt nicht | 7,7 GiB | 48,0 GiB |
| Llama-PLLuM-70B-instruct | 131,4 GiB | passt nicht | passt nicht | passt nicht |
Platz für den Cache je Karte nach dieser Regel, mit 95,6 GiB (RTX PRO 6000) und 140,4 GiB (H200 NVL), wie der Treiber sie meldet, und nominellen 48 GB; Parameterzahlen von Hugging Face, 6. Oktober 2026. „Passt nicht“ heißt: kein Platz mehr für den Cache.
EuroLLM-22B speichert in BF16 216 KiB Cache je Token, berechnet aus den 54 Schichten und den 8 KV-Heads mit je 128 Dimensionen in seiner config.json; die Tabelle der Model Card nennt 56 Schichten, was nicht zur Parameterzahl passt. Die 40,9 GiB, die auf einer RTX PRO 6000 übrig bleiben, fassen deshalb etwa 24 Gespräche mit 8.192 Token oder 6 mit den vollen 32.768, und ein FP8-Cache verdoppelt beide Werte. Llama-PLLuM-70B braucht in BF16 zwei RTX PRO 6000, die je Karte etwa 17 GiB für den Cache übrig lassen, oder eine quantisierte Version; unser Leitfaden zu FP8, NVFP4, INT4 und GGUF zeigt, was jedes Format spart und was es an Genauigkeit kostet.
KI-Server bauen wir auf Bestellung mit der RTX PRO 5000, der RTX PRO 6000 oder der H200 NVL und schicken Konfiguration und Angebot innerhalb eines Werktages. Schicken Sie uns über das Formular unten die Modelle auf Ihrer Auswahlliste und die Zahl der Personen, die sie gleichzeitig nutzen werden.
Ein Modell in Ihrer Sprache mit Ihren Dokumenten evaluieren
Öffentliche Benchmarks enthalten keinen Ihrer Verträge und keines Ihrer Support-Tickets, deshalb entscheidet ein eigener Test zwischen zwei oder drei Kandidaten.
- Nehmen Sie Modelle in die engere Wahl, deren Lizenz Ihre geplante Nutzung abdeckt und deren Gewichte in der geplanten Präzision auf Ihre GPUs passen.
- Bauen Sie den Testsatz, den unser Artikel zu RAG auf Unternehmensdaten beschreibt, für jede Sprache auf, in der Ihre Nutzer schreiben, mit Fragen in einer Sprache zu Dokumenten in einer anderen.
- Stellen Sie jeden Kandidaten mit derselben Engine, demselben Prompt, denselben abgerufenen Passagen und derselben maximalen Kontextlänge bereit, zum Beispiel über die OpenAI-kompatible API von vLLM; unser Vergleich der Serving-Engines behandelt die Optionen.
- Lassen Sie Muttersprachler die Antworten verblindet bewerten: Richtigkeit gegenüber der Quelle, Sprache der Antwort, Grammatik, Terminologie und Quellenangabe.
- Zählen Sie die Token, die jeder Tokenizer für eine Stichprobe Ihrer Dokumente erzeugt, denn die Zahlen unterscheiden sich zwischen den Modellen, und messen Sie die Zeit bis zum ersten Token auf Ihrer Hardware.
- Lassen Sie den Testsatz mit jeder neuen Version erneut laufen; EuroLLM, Bielik und PLLuM haben jeweils mehrere Generationen veröffentlicht.
Das technische Assessment unserer Leistung Private AI/ML umfasst die Modell- und GPU-Auswahl und einen Pilotplan mit Metriken; der Preis steht vor Beginn fest. Nennen Sie uns im Formular unten die Sprachen und Dokumenttypen, die Ihr Assistent bewältigen muss.
Was wir tun
Unsere Leistung Private AI/ML stellt offene und kommerzielle Modelle mit vLLM, Ollama oder NVIDIA AI Enterprise bereit: on-premise, sodass die Daten Ihr Netz nicht verlassen und der Zugriff kontrolliert ist, oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen, wo die Daten in der EU bleiben. Das erste Gespräch ist kostenlos, und danach haben Sie zwei oder drei mögliche Lösungsszenarien. Wir starten mit einem Pilotprojekt auf einem Prozess mit klaren Metriken und skalieren nur, was seinen Wert bewiesen hat. Eurokommerz hält den Vertrag und liefert die KI-Server, mit Engineering von unserem Engineering-Partner Vixen.UNO und Support unter SLA.
FAQ
Was ist PLLuM?
Welche offenen Sprachmodelle unterstützen Deutsch?
Welche offenen LLMs gibt es für Polnisch?
Gibt es ein offenes LLM für Rumänisch?
Was ist EuroLLM?
Welche europäischen offenen LLMs sind kommerziell nutzbar?
Schicken Sie uns die Sprachen, in denen Ihre Nutzer schreiben, die Dokumenttypen, aus denen der Assistent antworten soll, die Modelle, die Sie in Betracht ziehen, und die Zahl der Personen, die ihn nutzen werden. Wir antworten innerhalb eines Werktages mit den nächsten Schritten, beginnend mit einem ersten Gespräch, nach dem Sie zwei oder drei mögliche Lösungsszenarien haben. Das erste Gespräch ist kostenlos.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages