Cloud-GPU oder eigener Server für gleichmäßige Inferenz: GPU mieten oder kaufen und wie Sie vergleichen
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Für Inferenz, die die meisten Stunden des Monats läuft, vergleichen Sie die Kosten je produktiver GPU-Stunde: die gemieteten Instanzstunden, die Ihnen im benötigten Preismodell berechnet werden, gegen die Lebenszykluskosten des eigenen Servers, geteilt durch die GPU-Stunden, in denen er Anfragen bedient
- Leerlaufstunden kosten auf beiden Seiten Geld, solange gemietete Kapazität nicht freigegeben wird; Stand Oktober 2026 berechnet AWS eine On-Demand Capacity Reservation zum On-Demand-Tarif, ob Instanzen darin laufen oder nicht, und seine Savings Plans reservieren keine Kapazität
- Stand Oktober 2026 führt die P5-Seite von AWS die H200 nur in Instanzen mit 8 GPUs, p5e.48xlarge und p5en.48xlarge mit je 1.128 GB HBM3e, und AWS schreibt, dass der Neustart einer gestoppten Instanz scheitern kann, wenn On-Demand-Kapazität fehlt
- Ein Monat von vLLMs Gauge für laufende Anfragen und von DCGMs SM-Aktivität je GPU, gemessen vor der Entscheidung, ergibt den produktiven Anteil und die Stunden, in die er fällt
- Ein Hybrid hält die Grundlast auf eigenen Servern und mietet geplante Spitzen; Stand Oktober 2026 reservieren AWS Capacity Blocks GPU-Instanzen mit Start bis zu acht Wochen im Voraus für 1 bis 182 Tage, im Voraus bezahlt, und Googles Flex-start bedient bis zu sieben Tage
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Cloud-GPUs mieten oder eigene Server: Vergleich für gleichmäßige Inferenz
Ob eine Cloud-GPU oder ein eigener GPU-Server bei Inferenz, die die meisten Stunden des Monats läuft, günstiger ist, hängt von den Kosten einer produktiven GPU-Stunde auf beiden Seiten ab. Auf der Mietseite ist das der Betrag, der Ihnen für Instanzstunden in dem Preismodell berechnet wird, das Ihr Workload braucht, geteilt durch die GPU-Stunden, in denen Anfragen bedient wurden. Auf der eigenen Seite sind es die Lebenszykluskosten des Servers, geteilt durch seine produktiven GPU-Stunden über die Jahre im Betrieb.
Dieser Artikel vergleicht GPU-Kapazität, also die Instanzen oder Server, auf denen Sie ein Modell betreiben. Die Bezahlung pro Token für eine Modell-API ist eine andere Rechnung, die unser Vergleich von privatem LLM und Cloud-API darlegt, und die Verlagerung anderer Workloads aus der Public Cloud behandelt unser Leitfaden zur Cloud-Repatriierung. Die Methode nimmt die Tarife aus Ihren eigenen Rechnungen und Angeboten.
Kosten je produktiver GPU-Stunde auf beiden Seiten
Eine produktive GPU-Stunde ist eine Stunde, in der eine GPU mindestens eine Anfrage bedient oder einen Batch-Job ausführt. Eine eigene GPU kostet in jeder Stunde ihrer Nutzungsdauer gleich viel. Bei fünf Jahren im Betrieb sind das zum Beispiel 43.800 Stunden je GPU (5 × 8.760), und die eigenen Kosten je produktiver GPU-Stunde sind die Lebenszykluskosten des Servers, geteilt durch die Zahl der GPUs, durch diese Stunden und durch den produktiven Anteil. Die Lebenszykluskosten umfassen Kauf, Lizenzen, Strom in kWh, Rack-Fläche oder Colocation, Support und Betriebszeit.
Auf der Mietseite berechnet eine Instanz mit 8 GPUs acht GPU-Stunden für jede Stunde, in der sie zugewiesen ist, dazu Storage, Datenübertragung und einen etwaigen Supportplan, geteilt durch die produktiven GPU-Stunden im selben Zeitraum. Eine gemietete GPU, die gestoppt oder beendet ist, kostet nichts für Rechenleistung; ein niedriger produktiver Anteil spricht also nur dann für die Miete, wenn die Kapazität in Leerlaufstunden freigegeben wird und wieder verfügbar ist, wenn die Nutzer zurückkommen.
Muss gemietete Kapazität in jeder Stunde des Monats zugewiesen bleiben, steht der produktive Anteil auf beiden Seiten und kürzt sich heraus. Der Vergleich reduziert sich dann auf die eigenen Kosten je GPU-Stunde der Nutzungsdauer gegen den Miettarif je GPU-Stunde unter der Verpflichtung oder Reservierung, die Sie halten würden.
Cloud-GPU-Preismodelle: On-Demand, Verpflichtungen, Reservierungen und Spot
Das Preismodell entscheidet, welche Stunden berechnet werden und ob Kapazität für Sie vorgehalten wird.
| PREISMODELL | KAPAZITÄT GESICHERT | ABRECHNUNG | LAUFZEIT |
|---|---|---|---|
| AWS On-Demand | nein; der Start hängt von verfügbarer Kapazität ab | Sekundengenau während der Laufzeit | keine |
| AWS Savings Plans | keine Kapazitätsreservierung | die stündliche Verpflichtung, jede Stunde | ein oder drei Jahre |
| AWS Capacity Reservation | ja, in einer Availability Zone | On-Demand-Tarif, genutzt oder nicht | keine bei sofortiger Nutzung; jederzeit stornierbar |
| AWS Capacity Blocks for ML | ja, GPU-Instanzen zu künftigen Terminen | im Voraus beim Kauf | 1 bis 182 Tage |
| AWS Spot | nein; mit 2 Minuten Vorwarnung Zurückgefordert | Sekundengenau während der Laufzeit | keine |
| Google Flex-start | Best Effort, wird nicht vorzeitig beendet | niedrigere Tarife für A3 und andere Serien | bis zu 7 Tage |
| Google-Kalendermodus | ja, bis zu 80 VMs | niedrigere Tarife | bis zu 90 Tage |
| Google Spot VMs | nein; jederzeit vorzeitig beendet | niedrigere Tarife | keine |
AWS-Preisseite für EC2, Benutzerhandbuch und FAQ zu Savings Plans, EC2-Benutzerhandbuch (Capacity Reservations, Capacity Blocks, Spot-Unterbrechungen, Fehlerbehebung); Google Cloud „Consumption options for AI Hypercomputer“, aktualisiert am 8. Oktober 2026. Alle gelesen am 10. Oktober 2026.
Ein Savings Plan senkt den Tarif im Gegenzug für eine Verpflichtung „für einen Zeitraum von einem oder drei Jahren“. AWS schreibt, „die Verpflichtung jeder Stunde kann nur innerhalb dieser Stunde genutzt und nicht übertragen werden“, dass Nutzung darüber hinaus „zu regulären On-Demand-Tarifen berechnet“ wird und dass Savings Plans keine Kapazitätsreservierung bieten. Capacity Reservations „werden zum entsprechenden On-Demand-Tarif berechnet, unabhängig davon, ob Sie Instanzen in der reservierten Kapazität ausführen oder nicht“, und die Rabatte aus Savings Plans gelten auch für sie. Google bietet ressourcenbasierte Rabatte für zugesicherte Nutzung unter anderem für GPUs an, für ein oder drei Jahre.
Stand 10. Oktober 2026 führt die P5-Seite von AWS zwei Instanzgrößen für die H200, p5e.48xlarge und p5en.48xlarge, jeweils mit acht GPUs und 1.128 GB HBM3e; die einzige Größe mit einer GPU auf der P5-Seite ist die H100 in p5.4xlarge. Der Neustart einer gestoppten Instanz kann mit InsufficientInstanceCapacity fehlschlagen, und AWS begründet diesen Fehler damit, dass nicht „enough available On-Demand capacity to fulfill your request“ vorhanden ist.
GPU-Auslastung und belegte Stunden vor dem Vergleich messen
Die GPU-Auslastung, wie nvidia-smi sie meldet, zählt die Zeit, in der irgendein Kernel läuft, und zeigt eine GPU im Serving deshalb beschäftigter, als sie ist. DCGMs SM-Aktivität ist „der Anteil der Zeit, in der mindestens ein Warp auf einem Multiprozessor aktiv war, gemittelt über alle Multiprozessoren“, und NVIDIA schreibt: „Ein Wert von 0,8 oder mehr ist notwendig, aber nicht hinreichend für eine effektive Nutzung der GPU.“ Unser Leitfaden zu DCGM-Metriken und XID-Fehlern listet die Felder und die Einstellungen des Exporters auf. Auf der Serving-Seite liefert vLLMs Gauge vllm:num_requests_running die „Number of requests currently running“, am Endpunkt /metrics des Servers.
- Exportieren Sie einen Monat
vllm:num_requests_runningund DCGMs SM-Aktivität je GPU, aus den Cloud-Instanzen, die Sie heute betreiben, oder von einem Pilotserver. - Zählen Sie je Modellserver und den GPUs, auf denen er läuft, die Stunden mit mindestens einer laufenden Anfrage oder einem Batch-Job; ihr Anteil am Monat ist der produktive Anteil.
- Halten Sie fest, wann diese Stunden liegen (Werktage, Abende, Nächte, Monatsende und saisonale Spitzen), und die SM-Aktivität in diesen Stunden.
- Legen Sie fest, in welchen Stunden das Modell ohne Verzögerung antworten muss, denn das bestimmt das Preismodell auf der Mietseite.
- Tragen Sie die abgerechneten Stunden der Mietseite und die Lebenszykluskosten der eigenen Seite in die Formel oben ein.
Kostenposten bei gemieteten und eigenen GPU-Servern
| KOSTENPOSTEN | GEMIETETE GPUS | EIGENE GPU-SERVER |
|---|---|---|
| GPU-Kapazität | Instanzstunden oder eine Verpflichtung, die jede Stunde berechnet wird | Kauf, verteilt auf die Jahre im Betrieb |
| Kapazität bei Bedarf | hängt vom Preismodell ab, siehe oben | der Server ist da; ein zweiter für Failover |
| Modellgewichte und Daten | persistenter Speicher; der Instance Store wird beim Stoppen gelöscht | NVMe im Server |
| Datenübertragung | ausgehende Datenübertragung als eigener Posten berechnet | Ihre eigene Anbindung |
| Strom, Kühlung, Fläche | Teil des Anbietertarifs | kWh, Kühlung, Rack oder Colocation |
| Betrieb | Sie betreiben Betriebssystem, Treiber und Modellserver | dasselbe, plus Hardware und Firmware |
| Defekte Hardware | Sache des Anbieters; ein Start landet meist auf einem neuen Host | Herstellergarantie, Ersatzteile |
AWS-EC2-Benutzerhandbuch (Stoppen und Starten, Capacity Reservations) und EC2-Preisseite für On-Demand, gelesen am 10. Oktober 2026; die übrigen Zeilen sind unsere Einschätzung.
Wenn Sie Angebote für die H200 vergleichen, beachten Sie, dass NVIDIA die H200 als SXM-Modul für HGX-Boards „mit 4 oder 8 GPUs“ führt und als H200 NVL, eine PCIe-Karte mit bis zu 600 W, die eine „2- or 4-way NVIDIA NVLink bridge“ mit 900 GB/s je GPU verbindet. Beide haben 141 GB mit 4,8 TB/s. Die P5-Seite von AWS nennt das Modul nicht, führt aber „900 GB/s NVSwitch“ zwischen den GPUs jeder H200-Instanz. H200-NVL-Karten werden in NVLink-Domänen zu zwei oder vier verbunden; ein Modell, das acht GPUs in einer NVLink-Domäne braucht, braucht also ein SXM-System, während acht NVL-Karten zwei solche Domänen bilden. Eine gemietete Instanz mit 8 GPUs berechnet alle acht, während ein eigener Server mit vier Karten starten und wachsen kann. Für die eigene Seite listet unser Leitfaden zum Vergleich von GPU-Server-Angeboten die Positionen und die Kostenkategorien über fünf Jahre auf.
Rechenbeispiel: ein Unternehmen mit 1.000 Mitarbeitenden auf acht GPUs
Nehmen Sie als Beispiel ein Unternehmen mit 1.000 Mitarbeitenden, dessen Chat- und RAG-Assistent an 21 Werktagen von 07:00 bis 19:00 Uhr auf acht GPUs läuft, 252 Stunden. Ein nächtlicher Batch indexiert neue Dokumente und fasst Tickets zusammen, an denselben 21 Tagen jeweils vier Stunden lang, weitere 84 Stunden. Bei den 730 Stunden eines durchschnittlichen Monats (8.760 / 12) sind die GPUs 336 Stunden produktiv, ein Anteil von 46 Prozent. Ihr eigener Export ersetzt diese Beispielzahlen.
Auf einer Instanz mit 8 GPUs, die den ganzen Monat zugewiesen bleibt, unter On-Demand oder einer Capacity Reservation, zählt die Rechnung 730 Instanzstunden oder 5.840 GPU-Stunden für 2.688 produktive GPU-Stunden. Wird die Instanz außerhalb der 336 Stunden gestoppt, zählt die Rechnung diese Stunden plus jeden Start und jedes Laden des Modells, in diesem Beispiel zwei am Tag; jeder Start hängt aber von verfügbarer On-Demand-Kapazität ab, und die Gewichte werden aus persistentem Speicher geladen, weil der Instance Store beim Stoppen gelöscht wird.
Über die fünf Jahre des Beispiels bedienen acht eigene GPUs 350.400 GPU-Stunden, davon 161.280 produktiv beim selben Anteil. Muss das Modell an jedem Werktag ab 07:00 Uhr antworten, wird die gemietete Kapazität alle 730 Stunden des Monats gehalten, und der Vergleich lautet: eigene Kosten je GPU-Stunde gegen den Miettarif unter einer Reservierung. Ist ein späterer Start an manchen Morgen akzeptabel, ist die Miete nur für die belegten Stunden, unter Inkaufnahme des Kapazitätsrisikos, der Fall, in dem die Mietseite günstiger ausfallen kann, je nach den Tarifen in Ihren Angeboten.
Unsere Leistung Private AI/ML umfasst eine TCO-Rechnung gegen Cloud-GPUs vor dem Kauf. Schicken Sie uns einen Monat Ihrer GPU- und Anfragemetriken über das Formular unten, mit den Instanztypen, die Sie heute mieten.
Welche Lasten zu gemieteten GPUs passen und welche zu eigenen Servern
| LASTMUSTER | BESSER GEEIGNET | WARUM |
|---|---|---|
| Chat und RAG an Werktagen | eigene Server, oder gemietet mit Reservierung | Kapazität wird jeden Morgen gebraucht, Leerlaufstunden werden also so oder so bezahlt |
| Inferenz die meisten Stunden | eigene Server | hoher produktiver Anteil über die Nutzungsdauer |
| Geplante Spitzen, feste Tage | gemieteter Block auf eigener Grundlast | für feste Termine reserviert, danach freigegeben |
| Überlauf an Spitzentagen | On-Demand oder Flex-start, wenn die Daten dorthin dürfen | kurz und gelegentlich, Kapazität nicht zugesichert |
| Neustartfähige Batch-Jobs | Spot, oder eigene GPUs nachts | Unterbrechungen werden toleriert |
| Gelegentliches Fine-Tuning | gemieteter Block | groß und kurz |
| Pilot, Volumen unbekannt | On-Demand oder eine API | keine Verpflichtung, bis das Volumen gemessen ist |
Unsere Einschätzung der Preismodelle aus der Tabelle oben und des Rechenbeispiels; Google Cloud empfiehlt Spot VMs für „Batchverarbeitung und Datenanalysen“.
Das Hybridmuster hält die Grundlast auf eigenen Servern und mietet die Spitzen. Es braucht auf beiden Seiten dasselbe Modell und dieselbe Version der Serving-Engine, ein Gateway, das Überlauf an die gemieteten Instanzen schickt, wenn die Warteschlange auf den eigenen Servern wächst, die vLLM als vllm:num_requests_waiting meldet, und eine Datenklasse, die beim Anbieter verarbeitet werden darf. Geplante Spitzen passen zu reservierten Blöcken. AWS bietet beide H200-Größen in ausgewählten Regionen als Capacity Blocks an; ein Block lässt sich mit Start bis zu acht Wochen im Voraus buchen und läuft in Schritten von 1 Tag bis 14 Tage und in Schritten von 7 Tagen bis 182 Tage, zu einem Preis, der beim Kauf „von verfügbarem Angebot und Nachfrage abhängt“.
Wir bauen KI-Server auf Bestellung, ausgelegt nach Modell und gleichzeitigen Nutzern. Nennen Sie uns die Grundlast, die Sie ins eigene Haus holen würden, und die Spitzen, die Sie weiter mieten würden; Konfiguration und Angebot folgen innerhalb eines Werktages.
Datenübertragung und der Ausstieg bei einem Cloud-GPU-Anbieter
AWS führt die ausgehende Datenübertragung ins Internet als eigenen Posten auf der EC2-Preisseite, mit Tarifstufen über mehrere Dienste hinweg. Gestreamte Antworten sind klein; Dokumentenbestände, Vektorindizes, Logs, Backups und Modellkopien sind die größeren Übertragungen, für das Hybridmuster und für den Umzug selbst.
Die Datenverordnung (Data Act), Verordnung (EU) 2023/2854, bezieht in der 2023 veröffentlichten Fassung den Umzug auf eine IKT-Infrastruktur in eigenen Räumlichkeiten in ihre Definition des Wechsels ein (Artikel 2 Nummer 34) und zählt Datenextraktionsentgelte zu den Wechselentgelten (Artikel 2 Nummer 36). Bis zum 12. Januar 2027 dürfen Anbieter ermäßigte Wechselentgelte erheben, begrenzt auf die Kosten, die ihnen im unmittelbaren Zusammenhang mit dem Wechsel entstehen, und ab diesem Datum keine mehr (Artikel 29). Standarddienstentgelte und Sanktionen bei vorzeitiger Kündigung sind keine Wechselentgelte (Artikel 2 Nummer 36); prüfen Sie deshalb die Restlaufzeit jedes Savings Plans und jedes Rabatts für zugesicherte Nutzung, bevor Sie einen Termin festlegen. Diese Regeln betreffen den Wechsel selbst; für das Hybridmuster, das den Anbieter parallel weiter nutzt, fragen Sie den Anbieter schriftlich, welche Entgelte anfallen. Wie diese Regeln auf einen Vertrag anzuwenden sind, ist eine rechtliche Bewertung für die Rechtsabteilung des Unternehmens, und unser Leitfaden zum Cloud-Wechsel nach dem Data Act erläutert die Fristen, die Ausnahmen und den Stand des Digital-Omnibus-Vorschlags.
Was wir liefern
Wir bauen KI-Server auf Bestellung für Inferenz und RAG, mit 2 bis 8 GPUs pro Knoten, montiert und im Burn-in getestet, mit Herstellergarantie und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Zu den NVIDIA-GPUs, die wir liefern, gehören für gleichmäßige Inferenz die RTX PRO 6000 Server Edition, die H200 NVL mit NVLink-Brücken und die L40S, mit Lizenzen für NVIDIA AI Enterprise und vGPU auf derselben Rechnung. Wir prüfen Rack, Strom und Luftstrom vor dem Angebot. Unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO, betreibt Modelle on-premise oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen.
FAQ
Ist eine Cloud-GPU günstiger als ein eigener GPU-Server?
Sollte ich einen GPU-Server für LLM-Inferenz mieten oder kaufen?
Wie berechne ich die GPU-Auslastung für den Break-even?
Gibt es bei AWS eine Instanz mit nur einer H200-GPU?
Reservieren Savings Plans oder Rabatte für zugesicherte Nutzung GPU-Kapazität?
Entfallen mit dem EU Data Act die Egress-Gebühren, wenn wir GPU-Workloads zurückholen?
Schicken Sie uns einen Monat GPU- und Anfragemetriken aus Ihren Cloud-Instanzen oder Ihrem Pilot, die Instanztypen und Preismodelle, die Sie heute nutzen, und die Stunden, in denen Ihre Nutzer das Modell brauchen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für diese Last, die Sie vor dem Kauf mit Ihren Cloud-GPUs vergleichen können.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages