BLOG · VERGLEICH ·

Cloud-GPU oder eigener Server für gleichmäßige Inferenz: GPU mieten oder kaufen und wie Sie vergleichen

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Für Inferenz, die die meisten Stunden des Monats läuft, vergleichen Sie die Kosten je produktiver GPU-Stunde: die gemieteten Instanzstunden, die Ihnen im benötigten Preismodell berechnet werden, gegen die Lebenszykluskosten des eigenen Servers, geteilt durch die GPU-Stunden, in denen er Anfragen bedient
  • Leerlaufstunden kosten auf beiden Seiten Geld, solange gemietete Kapazität nicht freigegeben wird; Stand Oktober 2026 berechnet AWS eine On-Demand Capacity Reservation zum On-Demand-Tarif, ob Instanzen darin laufen oder nicht, und seine Savings Plans reservieren keine Kapazität
  • Stand Oktober 2026 führt die P5-Seite von AWS die H200 nur in Instanzen mit 8 GPUs, p5e.48xlarge und p5en.48xlarge mit je 1.128 GB HBM3e, und AWS schreibt, dass der Neustart einer gestoppten Instanz scheitern kann, wenn On-Demand-Kapazität fehlt
  • Ein Monat von vLLMs Gauge für laufende Anfragen und von DCGMs SM-Aktivität je GPU, gemessen vor der Entscheidung, ergibt den produktiven Anteil und die Stunden, in die er fällt
  • Ein Hybrid hält die Grundlast auf eigenen Servern und mietet geplante Spitzen; Stand Oktober 2026 reservieren AWS Capacity Blocks GPU-Instanzen mit Start bis zu acht Wochen im Voraus für 1 bis 182 Tage, im Voraus bezahlt, und Googles Flex-start bedient bis zu sieben Tage

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Cloud-GPUs mieten oder eigene Server: Vergleich für gleichmäßige Inferenz

Ob eine Cloud-GPU oder ein eigener GPU-Server bei Inferenz, die die meisten Stunden des Monats läuft, günstiger ist, hängt von den Kosten einer produktiven GPU-Stunde auf beiden Seiten ab. Auf der Mietseite ist das der Betrag, der Ihnen für Instanzstunden in dem Preismodell berechnet wird, das Ihr Workload braucht, geteilt durch die GPU-Stunden, in denen Anfragen bedient wurden. Auf der eigenen Seite sind es die Lebenszykluskosten des Servers, geteilt durch seine produktiven GPU-Stunden über die Jahre im Betrieb.

Dieser Artikel vergleicht GPU-Kapazität, also die Instanzen oder Server, auf denen Sie ein Modell betreiben. Die Bezahlung pro Token für eine Modell-API ist eine andere Rechnung, die unser Vergleich von privatem LLM und Cloud-API darlegt, und die Verlagerung anderer Workloads aus der Public Cloud behandelt unser Leitfaden zur Cloud-Repatriierung. Die Methode nimmt die Tarife aus Ihren eigenen Rechnungen und Angeboten.

Kosten je produktiver GPU-Stunde auf beiden Seiten

Eine produktive GPU-Stunde ist eine Stunde, in der eine GPU mindestens eine Anfrage bedient oder einen Batch-Job ausführt. Eine eigene GPU kostet in jeder Stunde ihrer Nutzungsdauer gleich viel. Bei fünf Jahren im Betrieb sind das zum Beispiel 43.800 Stunden je GPU (5 × 8.760), und die eigenen Kosten je produktiver GPU-Stunde sind die Lebenszykluskosten des Servers, geteilt durch die Zahl der GPUs, durch diese Stunden und durch den produktiven Anteil. Die Lebenszykluskosten umfassen Kauf, Lizenzen, Strom in kWh, Rack-Fläche oder Colocation, Support und Betriebszeit.

Auf der Mietseite berechnet eine Instanz mit 8 GPUs acht GPU-Stunden für jede Stunde, in der sie zugewiesen ist, dazu Storage, Datenübertragung und einen etwaigen Supportplan, geteilt durch die produktiven GPU-Stunden im selben Zeitraum. Eine gemietete GPU, die gestoppt oder beendet ist, kostet nichts für Rechenleistung; ein niedriger produktiver Anteil spricht also nur dann für die Miete, wenn die Kapazität in Leerlaufstunden freigegeben wird und wieder verfügbar ist, wenn die Nutzer zurückkommen.

Muss gemietete Kapazität in jeder Stunde des Monats zugewiesen bleiben, steht der produktive Anteil auf beiden Seiten und kürzt sich heraus. Der Vergleich reduziert sich dann auf die eigenen Kosten je GPU-Stunde der Nutzungsdauer gegen den Miettarif je GPU-Stunde unter der Verpflichtung oder Reservierung, die Sie halten würden.

Cloud-GPU-Preismodelle: On-Demand, Verpflichtungen, Reservierungen und Spot

Das Preismodell entscheidet, welche Stunden berechnet werden und ob Kapazität für Sie vorgehalten wird.

PREISMODELLKAPAZITÄT GESICHERTABRECHNUNGLAUFZEIT
AWS On-Demandnein; der Start hängt von verfügbarer Kapazität abSekunden­genau während der Laufzeitkeine
AWS Savings Planskeine Kapazitäts­reservierungdie stündliche Verpflichtung, jede Stundeein oder drei Jahre
AWS Capacity Reservationja, in einer Availability ZoneOn-Demand-Tarif, genutzt oder nichtkeine bei sofortiger Nutzung; jederzeit stornierbar
AWS Capacity Blocks for MLja, GPU-Instanzen zu künftigen Terminenim Voraus beim Kauf1 bis 182 Tage
AWS Spotnein; mit 2 Minuten Vorwarnung Zurück­gefordertSekunden­genau während der Laufzeitkeine
Google Flex-startBest Effort, wird nicht vorzeitig beendetniedrigere Tarife für A3 und andere Serienbis zu 7 Tage
Google-Kalender­modusja, bis zu 80 VMsniedrigere Tarifebis zu 90 Tage
Google Spot VMsnein; jederzeit vorzeitig beendetniedrigere Tarifekeine

AWS-Preisseite für EC2, Benutzerhandbuch und FAQ zu Savings Plans, EC2-Benutzerhandbuch (Capacity Reservations, Capacity Blocks, Spot-Unterbrechungen, Fehlerbehebung); Google Cloud „Consumption options for AI Hypercomputer“, aktualisiert am 8. Oktober 2026. Alle gelesen am 10. Oktober 2026.

Ein Savings Plan senkt den Tarif im Gegenzug für eine Verpflichtung „für einen Zeitraum von einem oder drei Jahren“. AWS schreibt, „die Verpflichtung jeder Stunde kann nur innerhalb dieser Stunde genutzt und nicht übertragen werden“, dass Nutzung darüber hinaus „zu regulären On-Demand-Tarifen berechnet“ wird und dass Savings Plans keine Kapazitätsreservierung bieten. Capacity Reservations „werden zum entsprechenden On-Demand-Tarif berechnet, unabhängig davon, ob Sie Instanzen in der reservierten Kapazität ausführen oder nicht“, und die Rabatte aus Savings Plans gelten auch für sie. Google bietet ressourcenbasierte Rabatte für zugesicherte Nutzung unter anderem für GPUs an, für ein oder drei Jahre.

Stand 10. Oktober 2026 führt die P5-Seite von AWS zwei Instanzgrößen für die H200, p5e.48xlarge und p5en.48xlarge, jeweils mit acht GPUs und 1.128 GB HBM3e; die einzige Größe mit einer GPU auf der P5-Seite ist die H100 in p5.4xlarge. Der Neustart einer gestoppten Instanz kann mit InsufficientInstanceCapacity fehlschlagen, und AWS begründet diesen Fehler damit, dass nicht „enough available On-Demand capacity to fulfill your request“ vorhanden ist.

GPU-Auslastung und belegte Stunden vor dem Vergleich messen

Die GPU-Auslastung, wie nvidia-smi sie meldet, zählt die Zeit, in der irgendein Kernel läuft, und zeigt eine GPU im Serving deshalb beschäftigter, als sie ist. DCGMs SM-Aktivität ist „der Anteil der Zeit, in der mindestens ein Warp auf einem Multiprozessor aktiv war, gemittelt über alle Multiprozessoren“, und NVIDIA schreibt: „Ein Wert von 0,8 oder mehr ist notwendig, aber nicht hinreichend für eine effektive Nutzung der GPU.“ Unser Leitfaden zu DCGM-Metriken und XID-Fehlern listet die Felder und die Einstellungen des Exporters auf. Auf der Serving-Seite liefert vLLMs Gauge vllm:num_requests_running die „Number of requests currently running“, am Endpunkt /metrics des Servers.

  1. Exportieren Sie einen Monat vllm:num_requests_running und DCGMs SM-Aktivität je GPU, aus den Cloud-Instanzen, die Sie heute betreiben, oder von einem Pilotserver.
  2. Zählen Sie je Modellserver und den GPUs, auf denen er läuft, die Stunden mit mindestens einer laufenden Anfrage oder einem Batch-Job; ihr Anteil am Monat ist der produktive Anteil.
  3. Halten Sie fest, wann diese Stunden liegen (Werktage, Abende, Nächte, Monatsende und saisonale Spitzen), und die SM-Aktivität in diesen Stunden.
  4. Legen Sie fest, in welchen Stunden das Modell ohne Verzögerung antworten muss, denn das bestimmt das Preismodell auf der Mietseite.
  5. Tragen Sie die abgerechneten Stunden der Mietseite und die Lebenszykluskosten der eigenen Seite in die Formel oben ein.

Kostenposten bei gemieteten und eigenen GPU-Servern

KOSTENPOSTENGEMIETETE GPUSEIGENE GPU-SERVER
GPU-KapazitätInstanz­stunden oder eine Verpflichtung, die jede Stunde berechnet wirdKauf, verteilt auf die Jahre im Betrieb
Kapazität bei Bedarfhängt vom Preismodell ab, siehe obender Server ist da; ein zweiter für Failover
Modell­gewichte und Datenpersistenter Speicher; der Instance Store wird beim Stoppen gelöschtNVMe im Server
Daten­übertragungausgehende Daten­übertragung als eigener Posten berechnetIhre eigene Anbindung
Strom, Kühlung, FlächeTeil des AnbietertarifskWh, Kühlung, Rack oder Colocation
BetriebSie betreiben Betriebs­system, Treiber und Modellserverdasselbe, plus Hardware und Firmware
Defekte HardwareSache des Anbieters; ein Start landet meist auf einem neuen HostHersteller­garantie, Ersatzteile

AWS-EC2-Benutzerhandbuch (Stoppen und Starten, Capacity Reservations) und EC2-Preisseite für On-Demand, gelesen am 10. Oktober 2026; die übrigen Zeilen sind unsere Einschätzung.

Wenn Sie Angebote für die H200 vergleichen, beachten Sie, dass NVIDIA die H200 als SXM-Modul für HGX-Boards „mit 4 oder 8 GPUs“ führt und als H200 NVL, eine PCIe-Karte mit bis zu 600 W, die eine „2- or 4-way NVIDIA NVLink bridge“ mit 900 GB/s je GPU verbindet. Beide haben 141 GB mit 4,8 TB/s. Die P5-Seite von AWS nennt das Modul nicht, führt aber „900 GB/s NVSwitch“ zwischen den GPUs jeder H200-Instanz. H200-NVL-Karten werden in NVLink-Domänen zu zwei oder vier verbunden; ein Modell, das acht GPUs in einer NVLink-Domäne braucht, braucht also ein SXM-System, während acht NVL-Karten zwei solche Domänen bilden. Eine gemietete Instanz mit 8 GPUs berechnet alle acht, während ein eigener Server mit vier Karten starten und wachsen kann. Für die eigene Seite listet unser Leitfaden zum Vergleich von GPU-Server-Angeboten die Positionen und die Kostenkategorien über fünf Jahre auf.

Rechenbeispiel: ein Unternehmen mit 1.000 Mitarbeitenden auf acht GPUs

Nehmen Sie als Beispiel ein Unternehmen mit 1.000 Mitarbeitenden, dessen Chat- und RAG-Assistent an 21 Werktagen von 07:00 bis 19:00 Uhr auf acht GPUs läuft, 252 Stunden. Ein nächtlicher Batch indexiert neue Dokumente und fasst Tickets zusammen, an denselben 21 Tagen jeweils vier Stunden lang, weitere 84 Stunden. Bei den 730 Stunden eines durchschnittlichen Monats (8.760 / 12) sind die GPUs 336 Stunden produktiv, ein Anteil von 46 Prozent. Ihr eigener Export ersetzt diese Beispielzahlen.

Auf einer Instanz mit 8 GPUs, die den ganzen Monat zugewiesen bleibt, unter On-Demand oder einer Capacity Reservation, zählt die Rechnung 730 Instanzstunden oder 5.840 GPU-Stunden für 2.688 produktive GPU-Stunden. Wird die Instanz außerhalb der 336 Stunden gestoppt, zählt die Rechnung diese Stunden plus jeden Start und jedes Laden des Modells, in diesem Beispiel zwei am Tag; jeder Start hängt aber von verfügbarer On-Demand-Kapazität ab, und die Gewichte werden aus persistentem Speicher geladen, weil der Instance Store beim Stoppen gelöscht wird.

Über die fünf Jahre des Beispiels bedienen acht eigene GPUs 350.400 GPU-Stunden, davon 161.280 produktiv beim selben Anteil. Muss das Modell an jedem Werktag ab 07:00 Uhr antworten, wird die gemietete Kapazität alle 730 Stunden des Monats gehalten, und der Vergleich lautet: eigene Kosten je GPU-Stunde gegen den Miettarif unter einer Reservierung. Ist ein späterer Start an manchen Morgen akzeptabel, ist die Miete nur für die belegten Stunden, unter Inkaufnahme des Kapazitätsrisikos, der Fall, in dem die Mietseite günstiger ausfallen kann, je nach den Tarifen in Ihren Angeboten.

Unsere Leistung Private AI/ML umfasst eine TCO-Rechnung gegen Cloud-GPUs vor dem Kauf. Schicken Sie uns einen Monat Ihrer GPU- und Anfragemetriken über das Formular unten, mit den Instanztypen, die Sie heute mieten.

Welche Lasten zu gemieteten GPUs passen und welche zu eigenen Servern

LASTMUSTERBESSER GEEIGNETWARUM
Chat und RAG an Werktageneigene Server, oder gemietet mit ReservierungKapazität wird jeden Morgen gebraucht, Leerlauf­stunden werden also so oder so bezahlt
Inferenz die meisten Stundeneigene Serverhoher produktiver Anteil über die Nutzungs­dauer
Geplante Spitzen, feste Tagegemieteter Block auf eigener Grundlastfür feste Termine reserviert, danach freigegeben
Überlauf an SpitzentagenOn-Demand oder Flex-start, wenn die Daten dorthin dürfenkurz und gelegentlich, Kapazität nicht zugesichert
Neustart­fähige Batch-JobsSpot, oder eigene GPUs nachtsUnterbrechungen werden toleriert
Gelegentliches Fine-Tuninggemieteter Blockgroß und kurz
Pilot, Volumen unbekanntOn-Demand oder eine APIkeine Verpflichtung, bis das Volumen gemessen ist

Unsere Einschätzung der Preismodelle aus der Tabelle oben und des Rechenbeispiels; Google Cloud empfiehlt Spot VMs für „Batchverarbeitung und Datenanalysen“.

Das Hybridmuster hält die Grundlast auf eigenen Servern und mietet die Spitzen. Es braucht auf beiden Seiten dasselbe Modell und dieselbe Version der Serving-Engine, ein Gateway, das Überlauf an die gemieteten Instanzen schickt, wenn die Warteschlange auf den eigenen Servern wächst, die vLLM als vllm:num_requests_waiting meldet, und eine Datenklasse, die beim Anbieter verarbeitet werden darf. Geplante Spitzen passen zu reservierten Blöcken. AWS bietet beide H200-Größen in ausgewählten Regionen als Capacity Blocks an; ein Block lässt sich mit Start bis zu acht Wochen im Voraus buchen und läuft in Schritten von 1 Tag bis 14 Tage und in Schritten von 7 Tagen bis 182 Tage, zu einem Preis, der beim Kauf „von verfügbarem Angebot und Nachfrage abhängt“.

Wir bauen KI-Server auf Bestellung, ausgelegt nach Modell und gleichzeitigen Nutzern. Nennen Sie uns die Grundlast, die Sie ins eigene Haus holen würden, und die Spitzen, die Sie weiter mieten würden; Konfiguration und Angebot folgen innerhalb eines Werktages.

Datenübertragung und der Ausstieg bei einem Cloud-GPU-Anbieter

AWS führt die ausgehende Datenübertragung ins Internet als eigenen Posten auf der EC2-Preisseite, mit Tarifstufen über mehrere Dienste hinweg. Gestreamte Antworten sind klein; Dokumentenbestände, Vektorindizes, Logs, Backups und Modellkopien sind die größeren Übertragungen, für das Hybridmuster und für den Umzug selbst.

Die Datenverordnung (Data Act), Verordnung (EU) 2023/2854, bezieht in der 2023 veröffentlichten Fassung den Umzug auf eine IKT-Infrastruktur in eigenen Räumlichkeiten in ihre Definition des Wechsels ein (Artikel 2 Nummer 34) und zählt Datenextraktionsentgelte zu den Wechselentgelten (Artikel 2 Nummer 36). Bis zum 12. Januar 2027 dürfen Anbieter ermäßigte Wechselentgelte erheben, begrenzt auf die Kosten, die ihnen im unmittelbaren Zusammenhang mit dem Wechsel entstehen, und ab diesem Datum keine mehr (Artikel 29). Standarddienstentgelte und Sanktionen bei vorzeitiger Kündigung sind keine Wechselentgelte (Artikel 2 Nummer 36); prüfen Sie deshalb die Restlaufzeit jedes Savings Plans und jedes Rabatts für zugesicherte Nutzung, bevor Sie einen Termin festlegen. Diese Regeln betreffen den Wechsel selbst; für das Hybridmuster, das den Anbieter parallel weiter nutzt, fragen Sie den Anbieter schriftlich, welche Entgelte anfallen. Wie diese Regeln auf einen Vertrag anzuwenden sind, ist eine rechtliche Bewertung für die Rechtsabteilung des Unternehmens, und unser Leitfaden zum Cloud-Wechsel nach dem Data Act erläutert die Fristen, die Ausnahmen und den Stand des Digital-Omnibus-Vorschlags.

Was wir liefern

Wir bauen KI-Server auf Bestellung für Inferenz und RAG, mit 2 bis 8 GPUs pro Knoten, montiert und im Burn-in getestet, mit Herstellergarantie und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Zu den NVIDIA-GPUs, die wir liefern, gehören für gleichmäßige Inferenz die RTX PRO 6000 Server Edition, die H200 NVL mit NVLink-Brücken und die L40S, mit Lizenzen für NVIDIA AI Enterprise und vGPU auf derselben Rechnung. Wir prüfen Rack, Strom und Luftstrom vor dem Angebot. Unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO, betreibt Modelle on-premise oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen.

FAQ

Ist eine Cloud-GPU günstiger als ein eigener GPU-Server?
Das hängt von den produktiven GPU-Stunden ab und von den Stunden, die Sie bezahlen. Ein eigener Server kostet gleich viel, ob beschäftigt oder im Leerlauf, und gemietete Kapazität kostet nur dann nichts, wenn sie freigegeben ist; für Inferenz, die an jedem Werktag morgens antworten muss, wird die gemietete Kapazität also den ganzen Monat gehalten. Vergleichen Sie die eigenen Lebenszykluskosten je produktiver GPU-Stunde mit der Mietrechnung je produktiver GPU-Stunde in dem Preismodell, das Sie bräuchten.
Sollte ich einen GPU-Server für LLM-Inferenz mieten oder kaufen?
Mieten Sie für Piloten mit unbekanntem Volumen, kurze Fine-Tuning-Läufe, geplante Spitzen und neustartfähige Batch-Jobs. Eigene Server passen zu Inferenz, die die meisten Stunden des Tages oder an jedem Werktag läuft, wo gemietete Kapazität ohnehin für jede Stunde reserviert würde. Beides lässt sich kombinieren, mit eigener Grundlast und gemieteten Spitzen.
Wie berechne ich die GPU-Auslastung für den Break-even?
Exportieren Sie einen Monat von vLLMs Gauge für laufende Anfragen und von DCGMs SM-Aktivität je GPU und zählen Sie die Stunden mit mindestens einer laufenden Anfrage oder einem Batch-Job. Ihr Anteil am Monat ist der produktive Anteil, und die eigenen Kosten je produktiver GPU-Stunde sind die Lebenszykluskosten, geteilt durch die GPUs, die Stunden im Betrieb und diesen Anteil. NVIDIA bezeichnet eine SM-Aktivität von 0,8 oder mehr als notwendig, aber nicht hinreichend für eine effektive Nutzung der GPU.
Gibt es bei AWS eine Instanz mit nur einer H200-GPU?
Laut der P5-Seite von AWS, gelesen am 10. Oktober 2026, gibt es die H200 in zwei Instanzgrößen, p5e.48xlarge und p5en.48xlarge, jeweils mit acht GPUs und 1.128 GB HBM3e. Die einzige Größe mit einer GPU auf dieser Seite ist p5.4xlarge mit einer H100. Ein eigener Server kann mit weniger Karten H200 NVL starten und später weitere aufnehmen.
Reservieren Savings Plans oder Rabatte für zugesicherte Nutzung GPU-Kapazität?
AWS schreibt, dass Savings Plans keine Kapazitätsreservierung bieten; Kapazität hält eine On-Demand Capacity Reservation, die zum On-Demand-Tarif berechnet wird, ob Instanzen darin laufen oder nicht, oder ein Capacity Block for ML zu festen Terminen. Die Savings-Plan-Verpflichtung jeder Stunde kann nur innerhalb dieser Stunde genutzt werden. Google bietet ressourcenbasierte Verpflichtungen für GPUs über ein oder drei Jahre an und hält Kapazität über Reservierungen vor.
Entfallen mit dem EU Data Act die Egress-Gebühren, wenn wir GPU-Workloads zurückholen?
Die Datenverordnung zählt in der 2023 veröffentlichten Fassung den Umzug auf eine Infrastruktur in eigenen Räumlichkeiten als Wechsel und Datenextraktionsentgelte als Wechselentgelte, die Anbieter bis zum 12. Januar 2027 in ermäßigter Form, begrenzt auf ihre unmittelbar damit verbundenen Kosten, und ab diesem Datum gar nicht mehr erheben dürfen. Standarddienstentgelte und Sanktionen bei vorzeitiger Kündigung sind keine Wechselentgelte; prüfen Sie deshalb die Restlaufzeit jeder Verpflichtung, bevor Sie den Umzug planen. Wie das auf einen bestimmten Vertrag anzuwenden ist, ist eine rechtliche Bewertung für die Rechtsabteilung des Unternehmens.

Schicken Sie uns einen Monat GPU- und Anfragemetriken aus Ihren Cloud-Instanzen oder Ihrem Pilot, die Instanztypen und Preismodelle, die Sie heute nutzen, und die Stunden, in denen Ihre Nutzer das Modell brauchen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für diese Last, die Sie vor dem Kauf mit Ihren Cloud-GPUs vergleichen können.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien