GPU-Server-Ausschreibung: messbare Anforderungen für das Leistungsverzeichnis eines KI-Servers
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Eine GPU-Server-Ausschreibung sollte messbare Mindestwerte und Ergebnisse statt Produktnamen festlegen: GPU-Speicher je Karte und je Server, Speicherbandbreite, Präzisionen, Hardware-Partitionierung, Host-Anbindung, Strom je Rackposition, Management, Garantie, Abnahmetests und Lizenzzeilen
- Jede Schwelle entscheidet, welche Karten anbieten können: Die Unterstützung von FP4 in den Tensor Cores schließt die H200 NVL aus, deren Spezifikationstabelle bei NVIDIA FP8, aber kein FP4 führt, während 96 GB je GPU und 1.500 GB/s sowohl die RTX PRO 6000 Server Edition als auch die H200 NVL zulassen
- Artikel 42 Absatz 4 der Richtlinie 2014/24/EU untersagt Verweise auf eine bestimmte Herstellung, auf Marken oder Typen, es sei denn, der Auftragsgegenstand rechtfertigt sie; „ausnahmsweise“ sind sie zulässig, wenn eine hinreichend genaue und allgemein verständliche Beschreibung nicht möglich ist, und „Solche Verweise sind mit dem Zusatz ‚oder gleichwertig‘ zu versehen“
- Artikel 67 Absatz 2 stellt den Zuschlag auf den Preis oder die Kosten ab und lässt ein Preis-Leistungs-Verhältnis mit Kriterien wie Kundendienst und technischer Hilfe zu; Artikel 67 Absatz 4 verlangt, dass sich die Informationen der Bieter überprüfen lassen
- Eine veröffentlichte Ergebnis-ID von MLPerf® Inference (geschlossene Division, Kategorie Available) kann als Referenz für das angebotene GPU-Modell und die Kartenzahl dienen; was der Vertrag prüfen kann, ist der Abnahmetest auf den gelieferten Servern mit Ihrem Modell und Ihrer Last
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Was eine Leistungsbeschreibung für GPU-Server enthalten sollte
Eine Leistungsbeschreibung für eine GPU-Server-Ausschreibung nennt messbare Mindestwerte und Ergebnisse, keine Marken. Sie gibt den GPU-Speicher je Karte und insgesamt an, die Speicherbandbreite, die Präzisionen, die die Modelle brauchen, Hardware-Partitionierung und Virtualisierung, die PCIe-Generation, den verfügbaren Strom an jeder Rackposition, die Management-Schnittstelle, Garantiedauer und Reaktionszeit, Burn-in- und Abnahmetests sowie die Lizenzzeilen.
Die Dimensionierung gehört vor die Ausschreibung: Modelle, Präzision, Kontextlänge und die Spitze gleichzeitiger Anfragen bestimmen Speicher und Kartenzahl, wie unser Leitfaden dazu erklärt, was Sie beim Kauf eines KI-Servers festlegen. Dieser Artikel macht aus dieser Dimensionierung Formulierungen, die Bieter Zeile für Zeile beantworten können, für eine öffentliche Ausschreibung ebenso wie für die Angebotsanfrage eines privaten Unternehmens.
Technische Anforderungen als messbare Zeilen
Formulieren Sie jede Anforderung als Schwelle mit Einheit und Nachweisquelle, meist dem Datenblatt des Herstellers. Eine Schwelle, die nur ein Produkt erfüllt, verengt das Feld ebenso wie ein Markenname; prüfen Sie deshalb vor der Veröffentlichung, welche Karten jede Zeile bestehen.
| ANFORDERUNG | MESSBARER WORTLAUT | BEGRÜNDUNG |
|---|---|---|
| GPU-Speicher je Karte | mindestens 96 GB je GPU, ECC aktiviert | das größte Modell und sein KV-Cache müssen auf eine Karte oder einen Kartensatz passen |
| GPU-Speicher je Server | mindestens 768 GB in höchstens 8 GPUs | Zahl der Modellkopien oder ein großes Modell je Server |
| Speicherbandbreite | mindestens 1.500 GB/s je GPU, laut Datenblatt | bestimmt die Generierungsgeschwindigkeit je Nutzer; lässt RTX PRO 6000 SE und H200 NVL zu |
| Präzisionen | Tensor-Core-Unterstützung für FP8; FP4 nur, wenn geplant | eine FP4-Zeile schließt die H200 NVL aus |
| Partitionierung | Hardware-Partitionierung in mindestens 4 isolierte Instanzen je GPU | RTX PRO 6000 SE bis zu vier, H200 NVL bis zu sieben |
| GPU-zu-GPU-Verbindung | nur wenn ein Modell mehrere Karten überspannt: GB/s je GPU | H200 NVL mit Bridge 900 GB/s je GPU; RTX PRO 6000 SE nutzt PCIe |
| Host-Anbindung | PCIe 5.0 x16 je GPU | NVIDIAs Konfigurationsleitfaden, für beide Karten |
| CPU und Systemspeicher | mindestens 6 physische Kerne je GPU; RAM nach Dimensionierung | NVIDIAs Leitfaden nennt 2 × den gesamten GPU-Speicher als „Ausgangspunkt“ |
| Management und Sicherheit | Out-of-Band-Controller, Redfish 1.0 oder neuer, TPM 2.0 | Fernbetrieb und Secure Boot, wie NVIDIAs Leitfaden sie aufführt |
| Stromversorgung | maximale Leistungsaufnahme in kW bei voller GPU-Last, redundante Netzteile, Anschlusstyp | muss zur Zuleitung an der Rackposition passen |
Formulierungen und Schwellen sind unser Beispiel für einen Server mit acht Karten zu 96 GB. Kartenwerte von NVIDIAs Produktseiten zur RTX PRO 6000 Blackwell Server Edition und zur H200 NVL; Zeilen zu CPU, Speicher, PCIe, Redfish und TPM aus NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems, aktualisiert am 30. September 2026; alle abgerufen am 10. Oktober 2026.
NVIDIA führt für die RTX PRO 6000 Blackwell Server Edition 96 GB GDDR7 mit ECC und 1.597 GB/s. Für die H200 NVL nennt NVIDIA 141 GB bei 4,8 TB/s, eine Untergrenze von 96 GB und 1.500 GB/s lässt also beide zu. Die Seite zur Server Edition nennt 4 PFLOPS FP4-Tensor-Core-Leistung, während die Tabelle der H200 NVL FP8 und kein FP4 führt. Bei der Partitionierung gibt NVIDIA für die Server Edition „bis zu vier vollständig isolierte Instanzen“ an und für die H200 NVL „Up to 7 MIGs @16.5GB each“, vier Instanzen je GPU sind also eine Untergrenze, die beide erreichen.
Eine Zeile zur GPU-zu-GPU-Verbindung gehört nur dann in die Leistungsbeschreibung, wenn ein Modell mehrere Karten überspannen muss und die Dimensionierung zeigt, dass PCIe es begrenzt. Die H200 NVL verbindet 2 oder 4 Karten über eine NVLink-Bridge mit 900 GB/s je GPU, und die RTX PRO 6000 Server Edition hat kein NVLink; auf einem Server, der eine Modellkopie je Karte betreibt, entfernt die Zeile also nur Bieter.
Wir bauen KI-Server auf Bestellung und prüfen Rack, Strom und Luftstrom vor dem Angebot. Schicken Sie uns den Workload hinter Ihrer Leistungsbeschreibung, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.
Marke oder gleichwertig nach Artikel 42 der Richtlinie 2014/24/EU
Die Richtlinie 2014/24/EU regelt in der EU die Aufträge öffentlicher Auftraggeber, deren Wert ihre Schwellenwerte erreicht oder überschreitet. Nach Artikel 42 Absatz 2 müssen technische Spezifikationen „allen Wirtschaftsteilnehmern den gleichen Zugang zum Vergabeverfahren gewähren“. Artikel 42 Absatz 3 Buchstabe a, die Form der Tabelle oben, lässt sie „in Form von Leistungs- oder Funktionsanforderungen, einschließlich Umweltmerkmalen“ zu, sofern die Parameter hinreichend genau sind, um den Bietern ein klares Bild vom Auftragsgegenstand zu vermitteln.
Nach Artikel 42 Absatz 4 darf eine Spezifikation, soweit es nicht durch den Auftragsgegenstand gerechtfertigt ist, nicht auf eine „bestimmte Herstellung oder Herkunft“, auf Marken oder auf Typen verweisen, wenn dadurch bestimmte Unternehmen oder Waren begünstigt oder ausgeschlossen werden. Solche Verweise sind „ausnahmsweise zulässig“, wenn der Auftragsgegenstand nach Absatz 3 nicht hinreichend genau und allgemein verständlich beschrieben werden kann, und „Solche Verweise sind mit dem Zusatz ‚oder gleichwertig‘ zu versehen.“ Verwendet eine Ausschreibung eine Zeile wie „RTX PRO 6000 Blackwell Server Edition oder gleichwertig“, geben die messbaren Zeilen der Tabelle den Bietern einen Weg, die Gleichwertigkeit zu zeigen, und dem Auftraggeber einen Weg, sie zu prüfen.
Der Gerichtshof der EU hat am 16. Januar 2025 in der Rechtssache DYKA Plastics (C-424/23) entschieden, dass die Aufzählung der Methoden zur Formulierung technischer Spezifikationen in Artikel 42 Absatz 3 abschließend ist. Er fügte hinzu, dass der gleiche Zugang „zwangsläufig verletzt“ ist, wenn eine Spezifikation, die gegen Artikel 42 Absätze 3 und 4 verstößt, bestimmte Unternehmen oder Waren ausschließt.
| BESTIMMUNG | WAS SIE SAGT | FÜR EINEN GPU-SERVER |
|---|---|---|
| Art. 42 Abs. 2 | gleicher Zugang, keine ungerechtfertigten Hindernisse für den Wettbewerb | Schwellen nicht höher als der dimensionierte Workload |
| Art. 42 Abs. 3 Buchst. a | Leistungs- oder Funktionsanforderungen, einschließlich Umweltmerkmalen | Speicher, Bandbreite, Partitionen, Leistungsaufnahme |
| Art. 42 Abs. 4 | Herstellung oder Marke nur ausnahmsweise, mit „oder gleichwertig“ | Kriterien, die das Gleichwertige festlegen |
| Art. 67 Abs. 2 | Preis oder Kosten, LebenszyklusKostenrechnung, Preis-Leistungs-Verhältnis | Garantie, Kundendienst, Energie |
| Art. 67 Abs. 4 | Kriterien, anhand der Informationen der Bieter überprüfbar | jedes Kriterium anhand der Angebote prüfbar |
| VO (EU) 2025/2152 | Schwellenwerte nach Art. 4 für 2026 und 2027 | ob die EU-Vorschriften für den Auftrag gelten |
Richtlinie 2014/24/EU, Artikel 42 und 67, wie in den Urteilen C-424/23 (16. Januar 2025) und C-546/16 (20. September 2018) auf eur-lex.europa.eu wiedergegeben; Delegierte Verordnung (EU) 2025/2152 der Kommission vom 22. Oktober 2025, anwendbar ab 1. Januar 2026.
Allgemeine Information zum EU-Recht mit Stand Oktober 2026: Richtlinie 2014/24/EU, Artikel 42 und 67, und Delegierte Verordnung (EU) 2025/2152 der Kommission, amtliche Texte auf eur-lex.europa.eu.
Welches Verfahren gilt und ob der Auftragswert die Schwellenwerte nach Artikel 4 in der durch die Verordnung (EU) 2025/2152 geänderten Fassung erreicht, entscheidet die Vergabestelle, und die rechtliche Bewertung jeder Klausel ist Sache der Rechtsabteilung der Organisation.
Zuschlagskriterien und MLPerf®-Benchmarkergebnisse
Nach Artikel 67 Absatz 2 wird das wirtschaftlich günstigste Angebot „auf der Grundlage des Preises oder der Kosten, mittels eines Kosten-Wirksamkeits-Ansatzes, wie der Lebenszykluskostenrechnung“ bestimmt, und es kann „das beste Preis-Leistungs-Verhältnis“ beinhalten. Zu den Beispielen gehören „Kundendienst und technische Hilfe“, worunter eine Ausschreibung die Reaktionszeit der Garantie und die Abwicklung von GPU-Ersatz bewerten kann. Artikel 67 Absatz 4 verlangt Kriterien, die „mit Spezifikationen einhergehen, die eine wirksame Überprüfung der von den Bietern übermittelten Informationen gestatten“. „GPU-Speicher je Server über der Untergrenze von 768 GB, bewertet je 96 GB“ lässt sich überprüfen; ein Kriterium wie „höhere KI-Leistung“ lässt sich nicht überprüfen.
MLCommons hat die Ergebnisse von MLPerf® Inference v6.0 am 1. April 2026 veröffentlicht. Die geschlossene Division „soll Hardwareplattformen oder Software-Frameworks vergleichen“, und Systeme der Kategorie Available enthalten „nur Komponenten, die zum Kauf oder zur Miete in der Cloud verfügbar sind“. Eine Ausschreibung kann die Bieter auffordern, die Ergebnis-ID eines veröffentlichten Ergebnisses von MLPerf® Inference für ein System mit dem angebotenen GPU-Modell und der angebotenen Kartenzahl zu nennen, geschlossene Division, Kategorie Available, aus einer beliebigen Runde, in der es eines gibt. Die Messaging Guidelines von MLCommons verlangen, dass jede Verwendung eines Ergebnisses dessen Ergebnis-ID nennt, und legen fest, dass Ergebnisse „nur mit kompatiblen MLPerf-Ergebnissen verglichen werden dürfen“, also mit demselben Benchmark und Szenario aus kompatiblen Versionen.
Ein Ergebnis zeigt, was Modell und Software des Benchmarks auf diesem System erreicht haben, nicht, was Ihr Modell leisten wird. Die vertragliche Leistungsprüfung ist ein Lasttest auf den gelieferten Servern mit Ihrem Modell, Ihrer Kontextlänge und Ihrer Gleichzeitigkeit, in der Ausschreibung mit Werkzeug und Einstellungen festgelegt.
Zeilen zu Strom, Energie und Rücknahme
Geben Sie den Strom an jeder Rackposition in Ampere und Phasen an, dazu den Typ der PDU-Ausgänge und die Zulufttemperatur, und verlangen Sie von den Bietern die maximale Leistungsaufnahme ihres Servers bei voller GPU-Last. NVIDIA gibt sowohl die H200 NVL als auch die RTX PRO 6000 Server Edition mit „Up to 600W (configurable)“ an, acht Karten kommen also auf 4,8 kW, noch vor Prozessoren und Lüftern.
Energie kann als Umweltmerkmal nach Artikel 42 Absatz 3 Buchstabe a oder über die Lebenszykluskostenrechnung nach Artikel 67 Absatz 2 einfließen. Verlangen Sie die Leistungsaufnahme im Leerlauf und bei Volllast, abgelesen am Management-Controller während des Abnahmelaufs. Unser Artikel zum GPU-Energieverbrauch pro Token zeigt, wie Sie sie im Verhältnis zur geleisteten Arbeit messen. Wenn die Umweltpolitik des Auftraggebers es verlangt, nehmen Sie die Rücknahme von Verpackung und ausgetauschten Teilen als Lieferzeile auf.
Zeilen zu Garantie, Burn-in, Abnahme und Lizenzen
Legen Sie die Garantiedauer je Komponente fest, Service vor Ort oder nur Teile, die Reaktionszeit und eine zentrale Ansprechstelle für GPU-Reklamationen. Verlangen Sie je Server einen Burn-in-Bericht, der zeigt, dass er vor dem Versand unter Last lief, und nennen Sie die Abnahmetests vor Ort in der Ausschreibung, zum Beispiel dcgmi diag -r 3 mit aktuellem DCGM auf jeder GPU und einen Lauf unter anhaltender Leistungsaufnahme ohne thermische Drosselung. Unser Leitfaden zu Abnahmetest und Burn-in von GPU-Servern nennt die Prüfungen und Abnahmekriterien, die Sie in die Ausschreibung übernehmen können. Wie sich Angebote bei diesen Punkten unterscheiden, behandelt unser Artikel zum Vergleich von GPU-Server-Angeboten Zeile für Zeile.
Lizenzen brauchen eigene Zeilen. NVIDIA AI Enterprise wird pro GPU lizenziert, und NVIDIA schreibt, dass die „H200 NVL mit einem Fünf-Jahres-Abonnement für NVIDIA AI Enterprise geliefert wird“; verlangen Sie von den Bietern deshalb, enthaltene Abonnements und ihre Laufzeit getrennt von gekauften aufzuführen, mit der Supportstufe. Unser Artikel zur Lizenzierung von NVIDIA AI Enterprise erklärt, wann die Lizenz gebraucht wird. Sollen sich virtuelle Maschinen die Karten teilen, ergänzen Sie vGPU-Lizenzzeilen, lizenziert pro gleichzeitigem Nutzer für Grafikprofile und pro GPU für Compute-Profile, wie unser Artikel zu MIG und vGPU je GPU erklärt. Eine weitere Zeile kann fragen, ob das angebotene Servermodell in NVIDIAs Qualified System Catalog für das angebotene GPU-Modell und die Kartenzahl steht, da NVIDIA Serveroptionen für die H200 NVL als „NVIDIA-Certified Systems mit bis zu 8 GPUs“ führt.
Unsere Server werden montiert und im Burn-in getestet, mit Testbericht auf Wunsch. Nennen Sie uns die Abnahmetests, die Ihre Ausschreibung verlangt, und wie viele Server sie umfasst.
Rechenbeispiel: zwei Inferenzserver für 1.500 Beschäftigte
Nehmen Sie ein Unternehmen mit 1.500 Beschäftigten, dessen Dimensionierung zwei Inferenzserver mit je acht Karten zu 96 GB ergibt, an zwei Rackpositionen, damit einer läuft, während der andere gewartet wird. Die Leistungsbeschreibung verlangt je Server mindestens 768 GB GPU-Speicher in höchstens acht GPUs, mindestens 1.500 GB/s je GPU, FP8-Unterstützung, vier Instanzen je GPU für Embedding-Modelle und Modelle für gesprochene Sprache sowie PCIe 5.0 x16 je GPU. Hinzu kommen mindestens 48 physische Kerne, der dimensionierte Systemspeicher, zwei 25-GbE-Ports, ein Management-Port und redundante Netzteile an zwei Zuleitungen.
Der Zuschlagsteil bewertet Preis oder Kosten zusammen mit der Reaktionszeit der Garantie, der Leistungsaufnahme bei Volllast und dem GPU-Speicher über der Untergrenze, jeweils mit Gewichtung und Prüfmethode. Der Abnahmeteil nennt den Burn-in-Bericht, den DCGM-Lauf, einen Lauf unter anhaltender Leistungsaufnahme und einen Lasttest mit dem Modell des Unternehmens bei seinem deklarierten Kontext und seiner Spitze gleichzeitiger Anfragen.
Vom Workload zur veröffentlichten Ausschreibung
- Halten Sie den Workload fest: Modelle, Präzision, Kontextlänge, Spitze gleichzeitiger Anfragen und das erwartete Wachstum über die Vertragslaufzeit.
- Dimensionieren Sie daraus eine Referenzkonfiguration und prüfen Sie, welche GPU-Modelle jede Schwelle erfüllen.
- Machen Sie aus jeder Komponente einen messbaren Mindestwert mit Einheit und Nachweisquelle, und verwenden Sie eine Hersteller- oder Typbezeichnung nur mit „oder gleichwertig“ und den Kriterien für das Gleichwertige.
- Ergänzen Sie die Standortdaten, also Rackpositionen, Zuleitungen in Ampere und Phasen, Ausgänge, Zulufttemperatur und Netzwerkports.
- Legen Sie die Zuschlagskriterien und ihre Gewichtung fest, jedes anhand der Informationen in den Angeboten überprüfbar.
- Schreiben Sie die Burn-in-, Abnahme- und Lasttests sowie die Abhilfe, wenn ein Server einen davon nicht besteht.
- Ergänzen Sie die Lizenz- und Garantiezeilen, geben Sie die Unterlagen an die Vergabestelle oder die Rechtsabteilung und veröffentlichen Sie.
Was wir liefern
Wir bauen KI-Server auf Bestellung mit der RTX PRO 6000 Server Edition, der H200 NVL mit NVLink-Bridges, der L40S und der L4, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU. Die Karten liefern wir auch ohne Server aus unserem Sortiment professioneller NVIDIA-GPUs für vorhandene Server. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung wie die Hardware, unter einem EU-Vertrag. Wir prüfen Rack, Strom und Luftstrom vor dem Angebot, und Konfiguration und Angebot folgen innerhalb eines Werktages.
FAQ
Was gehört in das Leistungsverzeichnis für einen GPU-Server?
Wie schreibe ich eine Ausschreibung für einen KI-Server?
Darf eine öffentliche Ausschreibung eine bestimmte GPU wie die RTX PRO 6000 nennen?
Was bedeutet „Marke oder gleichwertig“ in einer Leistungsbeschreibung?
Kann man MLPerf-Ergebnisse als Kriterium in einer GPU-Server-Ausschreibung verwenden?
Welche Zuschlagskriterien passen zur Beschaffung von GPU-Servern?
Schicken Sie uns den Workload hinter Ihrer Leistungsbeschreibung: die Modelle, die Spitze gleichzeitiger Anfragen, die Zahl der Server und den Strom an jeder Rackposition. Wir prüfen Rack, Strom und Luftstrom und antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages