Guides zu KI-Infrastruktur
& Enterprise-IT
Praxisguides unseres Engineering-Teams – Benchmarks, Sizing-Formeln und ehrliche Vergleiche.
Vier Fragen entscheiden: Modellgröße, gleichzeitige Nutzer, Standort der Maschine und was nach dem Pilot kommt. 273 GB/s gegen 1.597 und 4.800.
Artikel lesen →Keine VRAM-Zahl, ein gemeinsamer Pool: was der Speicher bei BF16, FP8 und FP4 wirklich fasst und was ein Gerät feinabstimmen kann.
Artikel lesen →Der Hersteller nennt keine Token pro Sekunde für diese Karte. Die KV-Cache-Rechnung, die 1.597 GB/s der Server Edition und wie Sie selbst messen.
Artikel lesen →Steckplatz, Sense-Pin, Kühlung, Supportliste, NVLink und Lizenz: die Prüfungen vor der Bestellung.
Artikel lesen →Ein gelaufener Backup-Job belegt den RPO, nicht den RTO. Was beim Restore fehlt und was bewiesene Wiederherstellung zeigen muss.
Artikel lesen →RAG ändert die Eingabe, Fine-Tuning die Gewichte. Was jedes löst und was volles Tuning, LoRA und QLoRA an VRAM kosten.
Artikel lesen →Wie Hardened Repository und Object Lock arbeiten, welche Angriffe Immutability stoppt und welche nicht, und wie lang die Frist sein sollte.
Artikel lesen →Standard und Enterprise Plus enden bei vSphere 8 U3: was jede Stufe freischaltet, die Regeln pro Kern, die vSAN-Kontingente und die Fallen.
Artikel lesen →2,1 TB HBM3e mit NVLink oder 768 GB GDDR7 über PCIe: Speicherrechnung, MLPerf v6.0 und wofür jede Maschine wirklich gebaut ist.
Artikel lesen →96, 72, 48, 32 oder 24 GB: Speicher, Bandbreite, MIG und vGPU je Karte, welches Modell wohin passt und warum CAD die große nicht braucht.
Artikel lesen →Pro GPU statt pro VM: wie gezählt wird, was bei H100 NVL und H200 NVL dabei ist, wann vGPU sie braucht und was ohne sie läuft.
Artikel lesen →Llama 3.3 70B, dreißig Nutzer, 8k Kontext: die Speicherrechnung, warum eine 96-GB-Karte nur in FP4 gerade so reicht, und der Server um die Karte herum.
Artikel lesen →Wo Luft endet, was Rear-Door-Wärmetauscher, Kaltplatten und Immersion jeweils tragen, ASHRAE-Wasserklassen, Durchfluss und was ein Umbau wirklich bedeutet.
Artikel lesen →Warum ein 2U vier 350-W-Karten nimmt, aber nur zwei mit 600 W, wo PCIe-Switches ins Spiel kommen, und die eine Zahl, die die meisten Bestellungen stoppt.
Artikel lesen →Wie zwei Geräte verbunden werden, gemessene Token-Raten im Verbund, Bild- und Videogenerierung, Fine-Tuning und die ehrliche Antwort zum Gaming.
Artikel lesen →96 GB GDDR7 mit FP4 oder 141 GB HBM3e mit NVLink: Modellgrößen, die Bandbreitenrechnung hinter Token pro Sekunde und die MLPerf-Zahlen.
Artikel lesen →48 GB bei 350 W gegen 96 GB bei bis zu 600 W: Speicher, MIG, vGPU-Plätze, Server-Passung und die Fälle, in denen die ältere Karte die richtige Bestellung ist.
Artikel lesen →Fast jeder Fehler ist ein Such-Fehler. Berechtigungen beim Abruf, sinnerhaltende Zerlegung und der Testsatz, den niemand baut.
Artikel lesen →Der Break-even ist eine Mengenfrage. Die vier Kostenpositionen, die niemand rechnet – und wann die Datenlage vorher entscheidet.
Artikel lesen →Warum die Kosten nahe null steil steigen, wie man Systeme in Stufen einteilt – und die Abhängigkeitsreihenfolge, die Pläne ruiniert.
Artikel lesen →Überdimensionierte VMs, vergessene Maschinen, alte Snapshots – und warum mehr vCPU eine VM oft langsamer macht.
Artikel lesen →Wie Kerne gezählt werden, was die 16-Kern-Regel mit kleinen Clustern macht, was hinter der 72-Kern-Meldung steckte.
Artikel lesen →Dichtewerte pro Rack, die Luftmengen-Rechnung, wo Luftkühlung endet – und die vier Prüfungen vor der Lieferung.
Artikel lesen →Gemessene Token-Raten, das 273-GB/s-Limit, Batch-Serving-Ergebnisse und Zwei-Knoten-Betrieb.
Artikel lesen →Welche NX-Knoten GPUs aufnehmen, wie MIG und vGPU teilen, was auf AHV funktioniert.
Artikel lesen →Ein Chip, drei Karten: die komplette Vergleichstabelle, die NVIDIA nie an einem Ort veröffentlicht hat.
Artikel lesen →Hardware-Slices vs. Time-Slicing, Sitzplätze pro Karte für RTX PRO und L40S, Lizenzen.
Artikel lesen →96 vs. 48 GB, FP4 und MIG, die Ada nie hatte – und wann die Vorgängergeneration reicht.
Artikel lesen →Identische Rechenleistung, der ganze Unterschied im Speicher: wo der Gewinn 3,4× erreicht – und wo null.
Artikel lesen →Gewichte, KV-Cache, Overhead und parallele Nutzer – die Formeln für die GPU-Wahl.
Artikel lesen →Sizing, Konfiguration, Angebot – wir antworten innerhalb eines Werktages