KI-Server kaufen für LLMs: Was Sie festlegen, bevor Sie ein Angebot anfragen
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Legen Sie zuerst den Workload und die Spitze der Anfragen in Bearbeitung fest, dann das Modell, seine Präzision und die Kontextlänge; diese bestimmen den GPU-Speicher, und CPU, RAM, NVMe, Netzwerk, Strom und Lizenzen werden um die Karten herum ausgelegt
- Planen Sie den Speicher für den KV-Cache als 0,9 × den vom Treiber gemeldeten Speicher, minus 3 GiB, minus die Gewichte; mit einem FP8-Cache hält eine RTX PRO 6000 mit 96 GB 12 gleichzeitige 8K-Sitzungen von Llama 3.3 70B in FP8 und eine H200 NVL 44
- NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems (30. September 2026) nennt zwei CPU-Sockel, sechs physische Kerne je GPU und doppelt so viel Systemspeicher wie GPU-Speicher als Ausgangspunkt; für zwei Inferenzkarten mit 96 GB plant unser 70B-Rechenbeispiel einen Prozessor und 192 bis 256 GB
- Strom wird je Rackposition in Ampere und Phasen angegeben: Zwei 600-W-Karten und ein Prozessor ziehen rund 2 kW an der Steckdose und passen an eine einphasige 16-A-Zuleitung, während acht 600-W-Karten allein 4,8 kW ziehen
- vLLM auf Bare Metal braucht keine NVIDIA-Lizenz; NIM in der Produktion und Compute-vGPU-Profile brauchen NVIDIA AI Enterprise, lizenziert pro GPU, und jede H200 NVL enthält ein Fünf-Jahres-Abonnement
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Was Sie beim Kauf eines KI-Servers festlegen
Um einen On-Premise-KI-Server zu kaufen, der zur Aufgabe passt, legen Sie zuerst den Workload und die Spitze gleichzeitiger Anfragen fest, dann das Modell, seine Präzision und die Kontextlänge. Zusammen bestimmen sie den GPU-Speicher, und GPU-Klasse und Kartenzahl ergeben sich daraus. CPU, Systemspeicher, NVMe-Storage, Netzwerk, Strom, Kühlung und Lizenzen werden um die Karten herum ausgelegt, und Garantie- und Supportbedingungen vervollständigen die Anfrage.
| ENTSCHEIDUNG | WAS FESTZULEGEN IST | MEHR DAZU |
|---|---|---|
| Workload und Nutzer | Inferenz, RAG oder Fine-Tuning; Spitze der Anfragen in Bearbeitung | Nutzer pro RTX PRO 6000 |
| Modell, Präzision, Kontext | Parameter, Präzision der Gewichte, Typ des KV-Cache, Kontextlänge | wie viel VRAM ein LLM braucht |
| GPU-Klasse und Anzahl | Speicher und Bandbreite je Karte, MIG, vGPU, NVLink, Kopien oder ein aufgeteiltes Modell | welche GPU für ein erstes KI-Projekt |
| CPU, RAM und NVMe | Kerne je GPU, x16-Verbindungen, RAM im Verhältnis zum GPU-Speicher, Storage-Ebenen | Rechenbeispiel für einen 70B-Server |
| Netzwerk, Strom, Kühlung | Ports, Zuleitung in Ampere und Phasen, PDU-Ausgänge, Zulufttemperatur | Strom und Kühlung für ein GPU-Rack |
| Software und Lizenzen | Bare Metal oder VMs, Serving-Engine, AI Enterprise, vGPU | AI-Enterprise- und vGPU-Lizenzen |
| Garantie und Support | Garantie, Burn-in-Bericht, Inbetriebnahme, Support | auf Bestellung gebaute KI-Server |
Die Entscheidungen in der Reihenfolge dieses Artikels; die verlinkten Seiten gehen auf jeden Schritt ausführlich ein.
Workload und gleichzeitige Nutzer
Inferenz für einen Assistenten hält die Gewichte und dazu einen KV-Cache je aktivem Gespräch. RAG fügt ein Embedding-Modell, einen Vektorindex und oft einen Reranker hinzu, und die Prompts enthalten die abgerufenen Passagen, sodass RAG-Anfragen länger sind als im reinen Chat. Fine-Tuning hält zusätzlich zu den Gewichten Gradienten und Optimiererzustände im Speicher; Trainings- und Fine-Tuning-Knoten bauen wir mit H200-NVL-Karten und NVLink-Bridges oder mit der RTX PRO 6000 Server Edition. Führen Sie jedes Modell auf, das der Server geladen hält, denn jedes belegt eigenen Speicher.
Die Nutzerzahl, nach der ein Server ausgelegt wird, ist die Spitze der Anfragen in Bearbeitung. Hundert Beschäftigte mit einem im Browser geöffneten Assistenten erzeugen weit weniger gleichzeitige Generierungen, und wir haben kein veröffentlichtes Verhältnis zwischen beiden gefunden. Nehmen Sie die Spitze der Hauptgeschäftsstunde aus den Gateway-Logs eines Pilotprojekts, oder schätzen Sie sie und sagen Sie dazu, dass es eine Schätzung ist. Nennen Sie auch die Kontextlänge, die Sie konfigurieren werden. Ist keine gesetzt, übernimmt vLLM sie aus der Modellkonfiguration, 40.960 Token bei Qwen3-32B, und wer stattdessen 8K deklariert, bringt fünfmal so viele Sitzungen voller Länge unter.
Modellgröße, Präzision und GPU-Speicher
Gewichte belegen zwei Byte je Parameter in BF16, eines in FP8 und etwa 0,6 in NVIDIAs NVFP4-Checkpoints. Unsere Leitfäden zur Dimensionierung setzen für den KV-Cache 0,9 × den vom Treiber gemeldeten Speicher an, minus 3 GiB für CUDA-Graphen und Aktivierungen, minus die Gewichte. Der Faktor 0,9 ist der Anteil des Speichers, den die Serving-Engine nutzen darf; in vLLM wird er mit gpu_memory_utilization eingestellt, und vLLM verwendet derzeit standardmäßig 0,92. Der Treiber meldet 95,6 GiB bei einer RTX PRO 6000 mit 96 GB und 140,4 GiB bei einer H200 NVL. In einem FP8-Cache belegt ein Gespräch mit vollem 8K-Kontext 0,625 GiB bei Qwen3-14B, 1 GiB bei Qwen3-32B und 1,25 GiB bei Llama 3.3 70B. Jeder Wert ist 2 × Schichten × KV-Heads × Head-Dimension × 8.192 Token zu je einem Byte, aus der Konfigurationsdatei des Modells.
| MODELL, FP8-GEWICHTE | GEWICHTE | KV JE 8K-SITZUNG | RTX PRO 6000, 96 GB | H200 NVL, 141 GB |
|---|---|---|---|---|
| Qwen3-14B | 15,2 GiB | 0,625 GiB | 108 | 173 |
| Qwen3-32B | 32,0 GiB | 1 GiB | 51 | 91 |
| Llama 3.3 70B | 67,7 GiB | 1,25 GiB | 12 | 44 |
Gleichzeitige Sitzungen mit vollem 8K-Kontext, FP8-KV-Cache. Gewichte: Qwens FP8-Checkpoints (16,3 und 34,3 GB) und NVIDIAs FP8-Checkpoint von Llama 3.3 70B (72,7 GB) auf Hugging Face; Schichten und KV-Heads aus der jeweiligen config.json.
Das sind Sitzungen voller Länge zum selben Zeitpunkt; kürzere Gespräche lassen Platz für mehr, und die Antwortzeit kann eine niedrigere Grenze setzen. vLLM hält den Cache im 16-Bit-Datentyp des Modells, sofern nicht --kv-cache-dtype fp8 gesetzt ist, und ein 16-Bit-Cache halbiert jede Zahl. Auf einer Testkarte gibt vLLM beim Start die Größe des KV-Cache aus, die es reserviert. Dreißig Nutzer des 70B-Modells mit 8K übersteigen, was eine RTX PRO 6000 in FP8 aufnimmt, und das 70B-Rechenbeispiel vergleicht für diesen Fall eine H200 NVL, zwei Karten und 4-Bit-Gewichte.
Inferenzserver legen wir nach dem Modell und der Zahl gleichzeitiger Nutzer aus. Nennen Sie uns das Modell, seine Präzision, Ihre Kontextlänge und die Spitze der Anfragen im Formular unten, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.
Welche GPU-Klasse und wie viele Karten
Die GPU-Klasse ergibt sich aus dem Speicher je Karte, der Bandbreite und den Funktionen. Die Bandbreite bestimmt die Geschwindigkeit, die jeder Nutzer sieht. Für ein 70B-Modell in FP8 liegt die rechnerische Obergrenze für einen Nutzer bei etwa 23 Token pro Sekunde auf der RTX PRO 6000 Server Edition und bei 68 auf der H200 NVL.
| GPU | SPEICHER, BANDBREITE | KARTENLEISTUNG | TYPISCHER EINSATZ |
|---|---|---|---|
| NVIDIA L4 | 24 GB, 300 GB/s | 72 W, Low Profile | Embedding- und Reranking-Modelle für RAG; LLMs bis etwa 14B in FP8, bei dieser Größe wenige Sitzungen |
| NVIDIA L40S | 48 GB, 864 GB/s | 350 W | 14B in FP8 für Dutzende Sitzungen, 32B für eine Handvoll; vGPU, kein MIG, kein NVLink |
| RTX PRO 6000 Server Edition | 96 GB, 1.597 GB/s | bis 600 W | 32B für Dutzende Sitzungen, 70B in FP8 für ein Dutzend; MIG, vGPU |
| NVIDIA H200 NVL | 141 GB, 4,8 TB/s | bis 600 W | 70B in FP8 für Dutzende Sitzungen, lange Kontexte, NVLink über 2 oder 4 Karten |
NVIDIA-Produktseiten, abgerufen am 6. Oktober 2026; der typische Einsatz ist unsere Lesart der Dimensionierungsregel oben, mit Gewichten und Cache in FP8.
Server-Edition- und Rechenzentrumskarten sind passiv gekühlt und brauchen ein Servergehäuse. Eine Workstation am Arbeitsplatz nimmt aktiv gekühlte Karten auf, die RTX PRO 6000 Workstation oder Max-Q, die RTX PRO 5000 oder die RTX PRO 4500. Solange die Wahl des Modells noch offen ist, kann zuerst ein Spark auf dem Schreibtisch eines Entwicklers stehen. Seine 128 GB gemeinsamer Speicher fassen große Modelle, aber seine Speicherbandbreite von 273 GB/s, niedriger als bei jeder Karte in der Tabelle, lässt ihn langsamer generieren.
Passt das Modell auf eine Karte, ergänzen Sie Karten als Kopien, eine Instanz je Karte hinter einem Load Balancer; das bringt mehr Durchsatz und beseitigt in einem zweiten Host den Single Point of Failure. Teilen Sie ein Modell nur dann auf mehrere Karten auf, wenn es selbst oder sein Cache für lange Gespräche nicht auf eine Karte passt. Die RTX PRO 6000 und die L40S haben kein NVLink, ein aufgeteiltes Modell tauscht seine Daten also über PCIe aus, während die H200 NVL 2 oder 4 Karten per Bridge mit 900 GB/s je GPU verbindet. NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems bezeichnet 2, 4 oder 8 GPUs pro Server als ausgewogen.
CPU-Kerne, Systemspeicher und NVMe-Storage
NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems, aktualisiert am 30. September 2026, geht bei einem Inferenzserver von zwei CPU-Sockeln und mindestens sechs physischen Kernen je GPU aus. Jede RTX PRO 6000 oder H200 NVL sollte an einer Gen5-x16-Verbindung sitzen, eine L40S an Gen4 x16 oder besser. Das Minimum des Leitfadens für den Systemspeicher ist das Doppelte des gesamten GPU-Speichers, gleichmäßig verteilt auf alle Sockel und Speicherkanäle. NVIDIA bezeichnet diese Empfehlungen als „einen Ausgangspunkt, um auf die spezifischen Anforderungen des jeweiligen Workloads einzugehen“. Für zwei Inferenzkarten plant das 70B-Rechenbeispiel einen Prozessor und mindestens den gesamten GPU-Speicher, weil die GPUs die Inferenz übernehmen und die Checkpoints über den Host-Speicher geladen werden. Die Starter-Konfiguration mit zwei Karten auf unserer Seite zu KI-Servern hat einen Prozessor und 256 GB. Eine RAG-Pipeline, die Dokumente parst und ihren Vektorindex auf demselben Server hält, braucht mehr Kerne und mehr Speicher.
Der Leitfaden empfiehlt ein NVMe-Laufwerk je CPU-Sockel, mit 1 TB als Minimum. Planen Sie darüber hinaus Ebenen: das Betriebssystem auf einem gespiegelten Laufwerkspaar, eine Modellablage für jeden Checkpoint, den Sie aufbewahren, den RAG-Index, bemessen nach dem Korpus, und für Fine-Tuning eine Scratch-Ebene für Datensätze und Checkpoints. Allein Llama 3.3 70B in FP8 hat 72,7 GB, und dasselbe Beispiel sieht 2 bis 4 TB für Modellablage, Logs und Evaluationssatz vor.
Netzwerk, Strom und Kühlung
Die Nutzer eines Inferenzservers brauchen wenig Bandbreite, weil gestreamter Text klein ist; die größeren Übertragungen sind Kopien von Checkpoints, und das 70B-Rechenbeispiel nutzt zwei 25-GbE-Ports. Für mehrere Server, die an einem Modell arbeiten, verlangt NVIDIAs Leitfaden mindestens 200 Gbit/s für Multi-Node-Inferenz und bis zu 400 Gbit/s je GPU. Außerdem führt er einen Redfish-kompatiblen Management-Controller und ein TPM-2.0-Modul auf.
Geben Sie den Strom je Rackposition an, in Ampere und Phasen. Ein 2U-Server mit zwei 600-W-Karten und einem Prozessor zieht rund 2 kW an der Steckdose. Das passt an eine einphasige 16-A-Zuleitung, die bei 230 V rund 3,7 kW trägt. Acht 600-W-Karten ziehen 4,8 kW, noch vor Prozessoren und Lüftern, und damit mehr, als eine 16-A-Zuleitung liefert; planen Sie für einen Server mit acht Karten deshalb vor der Bestellung Drehstromzuleitungen ein. Prüfen Sie auch die PDU-Ausgänge, denn ein C13-Ausgang trägt 10 A, rund 2,3 kW bei 230 V, und größere Netzteile von GPU-Servern brauchen C19-Ausgänge. An einem GPU-Stromkabel, das auf 450 W konfiguriert ist, läuft eine RTX PRO 6000 Server Edition gedrosselt, und eine H200 NVL startet nicht; das 600-W-Kabel gehört deshalb in die Bestellung.
Passive Karten sind auf die Gehäuselüfter und den Raum angewiesen, und ein Server braucht rund 160 CFM Luftstrom je kW Leistungsaufnahme bei 11 °C Temperaturanstieg. Raumluft ohne Einhausung stößt bei etwa 20 bis 25 kW pro Rack an ihre Grenze. Die Grenzwerte für die Zulufttemperatur werden je Servermodell und GPU festgelegt, und ein 2U-Modell erlaubt 30 °C mit der H200 NVL, aber 25 °C mit der RTX PRO 6000 Server Edition.
Software-Stack, Lizenzen und Support
Entscheiden Sie, ob die Modelle auf Bare Metal oder in virtuellen Maschinen laufen, denn daraus ergeben sich die Lizenzen. Eine Open-Source-Engine wie vLLM, die unter Apache 2.0 steht, braucht auf Bare Metal keine NVIDIA-Lizenz. NVIDIA AI Enterprise wird pro GPU lizenziert, für jede GPU in einem Server, auf dem die Software läuft. In NVIDIAs NIM-FAQ heißt es: „Die Nutzung von NIM in der Produktion erfordert eine NVIDIA-AI-Enterprise-Lizenz“, und Compute-vGPU-Profile in virtuellen Maschinen erzwingen die Lizenz per Software. Von den Editionen der RTX PRO 6000 unterstützt nur die Server Edition vGPU. Stand Oktober 2026 enthält jede H200 NVL ein Fünf-Jahres-Abonnement, das mit ihrer Seriennummer aktiviert wird; für die L40S, die L4 und die RTX-PRO-Karten wird die Lizenz pro GPU gekauft. NVIDIA unterstützt AI Enterprise auf NVIDIA-Certified Systems; wenn Sie diesen Support oder das Abonnement der H200 NVL brauchen, geben Sie deshalb ein Servermodell an, das NVIDIA mit Ihren Karten als zertifiziert führt.
Fragen Sie bei der Hardware nach den Garantiebedingungen je Komponente, danach, wer einen Austausch abwickelt, und nach einem Burn-in-Bericht, der zeigt, dass der Server vor dem Versand unter Last lief. Entscheiden Sie, wer ihn danach betreibt und ob die Inbetriebnahme vor Ort Teil der Bestellung ist.
Was Sie mit einer Angebotsanfrage schicken
Diese zehn Angaben genügen, um einen Server auszulegen und anzubieten, und wo eine Zahl noch offen ist, reicht eine als solche gekennzeichnete Schätzung.
- Workload: Inferenz für einen Assistenten, RAG, Fine-Tuning, oder welche davon sich den Server teilen.
- Modell: das Modell oder die engere Auswahl, seine Größe und die Präzision, in der es laufen soll.
- Kontext: die Kontextlänge, die Sie je Anfrage deklarieren werden.
- Gleichzeitigkeit: die Spitze der Anfragen in Bearbeitung, heute und mit dem Wachstum, das Sie erwarten.
- Antwortziele, falls vorhanden: Zeit bis zum ersten Token und Token pro Sekunde je Nutzer.
- Daten: Größe des RAG-Korpus, Datensätze für das Fine-Tuning und wie viele Modellversionen Sie aufbewahren.
- Standort: Rackposition und Einbautiefe, Zuleitung in Ampere und Phasen, PDU-Ausgänge und Zulufttemperatur, oder stattdessen ein EU-Rechenzentrum.
- Netzwerk: Uplink-Ports und ihre Geschwindigkeit, und ob mehrere Server an einem Modell arbeiten.
- Software: Bare Metal oder virtuelle Maschinen, die Serving-Engine und ob NIM, vGPU oder NVIDIA-Support gebraucht werden.
- Support: Garantie, Inbetriebnahme vor Ort und wer den Server nach der Lieferung betreibt.
Vor dem Angebot prüfen wir Rack, Strom und Luftstrom. Schicken Sie uns die zehn Angaben über das Formular unten, Schätzungen eingeschlossen, und Konfiguration und Angebot folgen innerhalb eines Werktages.
Was wir liefern
Wir bauen KI-Server auf Bestellung rund um den Workload, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Zu den Karten gehören die Server Edition und die Workstation Edition der RTX PRO 6000, die H200 NVL mit NVLink-Bridges, die L40S und die L4, dazu NVIDIA-AI-Enterprise- und vGPU-Lizenzen auf derselben Rechnung. Wir bauen auch auf Ihrem eigenen Gehäuse oder mit Teilen, die Sie bereits besitzen, nach einer Kompatibilitätsprüfung von Plattform, Strom und Kühlung. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch; Modelle, RAG und MLOps darauf sind unsere Leistung Private AI/ML, umgesetzt von unserem Engineering-Partner Vixen.UNO.
FAQ
Was muss ich festlegen, wenn ich einen KI-Server kaufe?
Was braucht ein KI-Server für Unternehmen außer GPUs?
Wie dimensioniere ich einen GPU-Server für ein LLM?
Welche GPU gehört in einen privaten KI-Server?
Kann ein On-Premise-KI-Server im vorhandenen Serverraum laufen?
Brauche ich für einen KI-Server eine NVIDIA-AI-Enterprise-Lizenz?
Schicken Sie uns den Workload, das Modell und seine Präzision, die Kontextlänge, die Spitze gleichzeitiger Anfragen sowie Zuleitung, PDU-Ausgänge und Zulufttemperatur an der Rackposition. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem schriftlichen Angebot; Rack, Strom und Luftstrom prüfen wir vor dem Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages