BLOG · VERGLEICH ·

DGX Spark vs Mac Studio vs Ryzen AI Max: welches Desktop-System für lokale LLMs

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Der DGX Spark hat 128 GB Unified Memory mit 273 GB/s und NVIDIAs CUDA-Stack; Systeme mit dem Ryzen AI Max+ 395 haben bis zu 128 GB mit 256 GB/s und AMDs ROCm unter Linux; der Mac Studio bietet bis zu 128 GB mit bis zu 614 GB/s (M5 Max) oder bis zu 512 GB mit 1,2 TB/s (M5 Ultra) unter macOS
  • Die Token-Generierung für einen Nutzer folgt auf allen drei Systemen der Speicherbandbreite; für ein dichtes 70B-Modell mit 8-Bit-Gewichten liegt die rechnerische Obergrenze bei etwa 3,9 Token pro Sekunde auf dem DGX Spark, 3,6 auf dem Ryzen AI Max+ 395 und 17 auf dem M5 Ultra
  • In einem llama.cpp-Vergleich mit demselben Build auf beiden Maschinen (22. Oktober 2025) erzeugte gpt-oss 120B 45,9 Token pro Sekunde auf dem DGX Spark und 47,5 auf einem System mit Ryzen AI Max+ 395, während die Prompt-Verarbeitung mit 1.737 und etwa 1.000 Token pro Sekunde lief
  • AMDs ROCm-Dokumentation setzt die standardmäßige Grenze für GPU-mappbaren Speicher unter Linux auf etwa 50 Prozent des RAM und hebt sie über die TTM-Grenze an; AMDs eigener Test mit einer Billion Parametern hob sie auf 120 GB je System mit 128 GB an
  • Der DGX Spark koppelt bis zu vier Systeme über ConnectX-7 mit 200 Gb/s und hält Code auf dem CUDA-Stack der NVIDIA-GPU-Server; der Mac Studio bildet Cluster über Thunderbolt 5 mit RDMA, und AMDs Cluster-Test nutzte 5-Gb/s-Ethernet

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

DGX Spark vs Mac Studio vs Ryzen AI Max: was entscheidet

Für die Arbeit mit lokalen LLMs unterscheiden sich die drei Systeme in vier Punkten: wie viel Speicher ein Modell nutzen kann, wie schnell dieser Speicher gelesen wird, welcher Software-Stack auf der GPU läuft und wie sich die Maschine in die IT des Unternehmens einfügt. Der DGX Spark hat 128 GB Unified Memory mit 273 GB/s und führt NVIDIAs CUDA-Stack unter DGX OS aus. Der Mac Studio mit M5 Ultra bietet bis zu 512 GB mit 1,2 TB/s unter macOS mit Apples Metal und MLX, die Version mit M5 Max bis zu 128 GB mit bis zu 614 GB/s. Systeme mit dem AMD Ryzen AI Max+ 395, bekannt unter dem Codenamen Strix Halo, haben bis zu 128 GB mit 256 GB/s und führen AMDs ROCm unter Linux aus.

Spezifikationen im Vergleich

MERKMALDGX SPARKMAC STUDIO M5 MAXMAC STUDIO M5 ULTRARYZEN AI MAX+ 395
Unified Memory128 GB LPDDR5x (Founders Edition)36 GB; 48, 64 oder 128 GB mit der 40-Kern-GPU96 GB; 256 oder 512 GB mit der 80-Kern-GPUbis zu 128 GB, 256 Bit LPDDR5x-8000
Speicher­bandbreite273 GB/s460 GB/s; 614 GB/s mit der 40-Kern-GPU1,2 TB/s256 GB/s
GPUBlackwell, 6.144 CUDA-Kerne32 oder 40 GPU-Kerne64 oder 80 GPU-KerneRadeon 8060S, 40 Compute Units
GPU-SoftwareCUDAMetal, MLXMetal, MLXROCm
NetzwerkConnectX-7 mit 200 Gb/s, 10 GbE10 Gb Ethernet, vier Thunderbolt-5-Ports10 Gb Ethernet, sechs Thunderbolt-5-Portsvom System­hersteller festgelegt
Strom240-W-Netzteil, GB10 mit 140 W TDP480 W Dauer­leistung maximal480 W Dauer­leistung maximal55 W Standard-TDP, 45 bis 120 W konfigurierbar
Betriebs­systemNVIDIA DGX OSmacOSmacOSunter anderem Ubuntu und RHEL in AMDs Liste

NVIDIA-Produktseite zum DGX Spark, die Zahl der CUDA-Kerne aus NVIDIAs Hardware-Übersicht; technische Daten des Mac Studio von Apple; AMD-Produktseite zum Ryzen AI Max+ 395; AMDs User Guide zum Ryzen AI Halo für den Wert von 256 GB/s; alle abgerufen am 9. Oktober 2026.

Der Ryzen AI Max+ 395 ist ein Prozessor, den mehrere Hersteller in eigene Systeme einbauen; Storage, Anschlüsse und Gehäuse hängen daher vom System ab. AMD verkauft auch eine eigene Box, den Ryzen AI Halo, den sein User Guide mit 150 × 150 × 45,4 mm, 128 GB LPDDR5x mit 256 GB/s, einer selbstverschlüsselnden SSD mit 2 TB, einem 10-Gb-Ethernet-Port und einer TDP von 120 W angibt. AMD sagte am 20. Mai 2026, dass er Modelle mit bis zu 200 Milliarden Parametern ausführt. Am 28. September 2026 sagte AMD, dass Systeme mit seinen Ryzen AI Max und Max PRO 400 Series bei seinen Partnern erhältlich sind und dass die 400 Series, in unserer Übersetzung, „bis zu 192 GB, davon bis zu 160 GB dediziert für die GPU“ bietet. Die AMD-Seiten, die wir gelesen haben, nennen für die 400 Series keine Bandbreite.

Wie viel des Speichers die GPU nutzen kann

Auf dem DGX Spark teilen sich CPU, DGX OS und GPU einen Pool, ohne festen GPU-Anteil außer einer Reserve für die Anzeige. Das System meldet etwa 119 bis 122 GiB der 128 GB, und NVIDIAs Playbook-Einstellungen ergeben ein Arbeitsbudget für Gewichte und KV-Cache von rund 102 bis 115 GB, wie unser Artikel dazu, was in 128 GB auf einem DGX Spark passt, durchrechnet.

Apples Spezifikationsseite nennt den Unified Memory als eine Zahl je Konfiguration und gibt keinen separaten GPU-Anteil an. Metal meldet je GPU einen Wert, recommendedMaxWorkingSetSize, den Apples Entwicklerdokumentation, in unserer Übersetzung, als „eine Näherung dafür, wie viel Speicher in Byte diese GPU belegen kann, ohne ihre Laufzeitleistung zu beeinträchtigen“ beschreibt. Eine Apple-Angabe dazu je Mac-Studio-Konfiguration haben wir nicht gefunden; lesen Sie den Wert daher auf der Maschine aus, bevor Sie ein Modell nahe am eingebauten Speicher dimensionieren.

Beim Ryzen AI Max+ 395 ist die Aufteilung zwischen CPU und GPU eine Einstellung. AMDs User Guide zum Ryzen AI Halo beschreibt Variable Graphics Memory, bei dem sich der gemeinsam genutzte Anteil von 10 bis 90 Prozent in Schritten von 5 Prozent einstellen lässt, standardmäßig 75 Prozent, und warnt, dass höhere Werte weniger Speicher für andere Anwendungen lassen. Unter Linux setzt AMDs ROCm-Dokumentation die standardmäßige Grenze für GPU-mappbaren Speicher (GTT) auf etwa 50 Prozent des System-RAM und empfiehlt eine kleine dedizierte Reservierung in der Firmware, zum Beispiel 0,5 GB, und stattdessen eine höhere gemeinsame TTM-Grenze. In AMDs eigenem Cluster-Test vom Februar 2026 lag das Firmware-Maximum bei 96 GB je System, und Kernel-Parameter hoben den Anteil der GPU auf 120 GB jedes Systems mit 128 GB an.

Speicherbandbreite und Token pro Sekunde

Apples Team für Machine-Learning-Forschung nennt in einem Beitrag zum M5-Chip die Regel für die Token-Generierung, in unserer Übersetzung: „Die Erzeugung der folgenden Token ist durch die Speicherbandbreite begrenzt und nicht durch die Rechenleistung.“ Dasselbe gilt auf dem DGX Spark und dem Ryzen AI Max+ 395. Bei einem dichten Modell liest jedes neue Token jedes Gewicht einmal; die Bandbreite geteilt durch die Größe der Gewichte ergibt daher eine Obergrenze für einen Nutzer.

SYSTEMBANDBREITEDICHTES 70B, 8 BIT
DGX Spark273 GB/setwa 3,9 Token/s
Ryzen AI Max+ 395256 GB/setwa 3,6 Token/s
Mac Studio M5 Max, 40 Kerne614 GB/setwa 8,7 Token/s
Mac Studio M5 Ultra1,2 TB/setwa 17 Token/s
RTX PRO 6000 Workstation1.792 GB/setwa 25 Token/s

Bandbreiten von Seiten von NVIDIA, Apple und AMD, abgerufen am 9. Oktober 2026; die Obergrenzen sind unsere Rechnung, Bandbreite geteilt durch etwa 70,6 GB Gewichte, wie in unseren anderen DGX-Spark-Artikeln. Gemessene Werte bleiben darunter: LMSYS hat im Oktober 2025 auf dem DGX Spark mit SGLang 2,7 Token/s für Llama 3.1 70B in FP8 gemessen.

Ein Mixture-of-Experts-Modell liest je Token nur seine aktiven Experten und läuft weit schneller, als seine Gesamtgröße vermuten lässt. Am 22. Oktober 2025 hat ein Teilnehmer der DGX-Spark-Diskussion im llama.cpp-Projekt gpt-oss 120B in MXFP4 mit llama-bench gemessen, mit demselben llama.cpp-Build auf beiden Maschinen, einem Prompt von 2.048 Token, 32 erzeugten Token und aktivierter Flash Attention. Der DGX Spark erzeugte 45,87 Token pro Sekunde und ein System mit Ryzen AI Max+ 395 und ROCm 47,49, also nah beieinander, wie es die ähnlichen Bandbreiten erwarten lassen. Am 2. November 2025 meldete derselbe Teilnehmer 60,57 Token pro Sekunde auf dem DGX Spark mit einem neueren llama.cpp-Build und NVIDIAs Kernel 6.17.1, ohne neuen Lauf auf dem AMD-System; NVIDIAs eigener llama.cpp-Wert aus seinem Performance-Blog vom 24. Oktober 2025 liegt bei 55,37. Unser Benchmark-Artikel zum DGX Spark sammelt die übrigen veröffentlichten Läufe.

Die Prompt-Verarbeitung hängt von der Rechenleistung ab. Im Lauf vom 22. Oktober verarbeitete der DGX Spark 1.737 Prompt-Token pro Sekunde gegenüber etwa 1.000 auf dem Ryzen AI Max+ 395. Apple gibt an, dass der M5 Ultra LLM-Prompts in LM Studio bis zu viermal schneller verarbeitet als der M3 Ultra, nach eigenen Tests vom Juli 2026; Apple nennt das Modell nicht, und eine zitierfähige Messung Dritter am Mac Studio mit M5, mit Modell, Engine und Datum, haben wir nicht gefunden.

Brauchen mehrere Personen ein 70B-Modell in Lesegeschwindigkeit, ist der nächste Schritt eine RTX-PRO-6000-Workstation mit 96 GB je Karte. Nennen Sie uns das Modell und die Zahl der Nutzer, und wir vergleichen sie anhand Ihrer Zahlen mit dem DGX Spark.

Software-Stack: CUDA, MLX oder ROCm

Der DGX Spark läuft mit DGX OS, einem Ubuntu-basierten Linux für Arm, und demselben CUDA-Stack wie NVIDIAs Rechenzentrums-GPUs. NVIDIA veröffentlicht dafür Playbooks für vLLM, TensorRT-LLM und NIM, und dieselben Engines laufen auf Servern mit RTX PRO 6000 und H200 NVL. FP4-Arithmetik braucht eine Blackwell-GPU wie die RTX PRO 6000; auf der H200 NVL lassen sich FP4-Gewichte laden, gerechnet wird aber in 16 Bit. Unser Vergleich von vLLM, SGLang, TensorRT-LLM, llama.cpp und Ollama zeigt, welche Formate jede Engine auf dem DGX Spark ausführt. Wegen des Arm-Prozessors braucht jede reine x86-Binärabhängigkeit einen Arm-Build.

Der Mac Studio läuft mit macOS und Metal für die GPU. Apple beschreibt MLX als sein Open-Source-Framework für maschinelles Lernen auf Apple silicon, das, in unserer Übersetzung, „Entwicklern ermöglicht, Modelle auszuführen, zu trainieren und feinabzustimmen“. Auch llama.cpp und LM Studio laufen auf dem Mac. Ein Team, das mit MLX arbeitet und seine Modelle später mit vLLM oder TensorRT-LLM auf Linux-GPU-Servern bereitstellt, wechselt an diesem Punkt die Engine und oft das Quantisierungsformat; GGUF-Dateien für llama.cpp laufen auf beiden.

Systeme mit Ryzen AI Max+ 395 führen ROCm, AMDs GPU-Software-Stack, unter Linux aus. Der Ryzen AI Halo wird mit vorinstallierten ROCm-Komponenten, PyTorch, Lemonade und ComfyUI ausgeliefert. AMDs ROCm-Dokumentation verlangt für die Ryzen-AI-Max-Serie den Linux-Kernel 6.18.4 oder neuer oder eine Distribution, die die Korrekturen enthält, etwa Fedora 43 oder Ubuntu 26.04; prüfen Sie die Kombination also, bevor Sie mehrere Maschinen ausrollen.

Zwei bis vier Systeme koppeln

Der DGX Spark koppelt über seine ConnectX-7-Ports mit 200 Gb/s je Port, und NVIDIAs Clustering-Leitfaden unterstützt bis zu drei Systeme per Direktkabel und vier über einen Switch. NVIDIAs Produktseite nennt bis zu 400 Milliarden Parameter auf zwei Systemen mit 128 GB und bis zu 700 Milliarden auf vier; unser Artikel zu zwei gekoppelten DGX-Spark-Systemen behandelt die Verkabelung.

Apple gibt an, dass sich mehrere Mac Studio über Thunderbolt 5 mit RDMA zu einem Cluster verbinden lassen und dass ein Cluster aus vier Systemen KI-Inferenz bis zu dreimal schneller ausführt als ein System, nach eigenen Tests vom Juli 2026; Apple nennt das Modell nicht. MLX dokumentiert JACCL als sein Backend für „RDMA over thunderbolt“, das es, in unserer Übersetzung, „für Dinge wie Tensor-Parallelismus“ als notwendig bezeichnet.

AMD veröffentlichte am 25. Februar 2026 einen Test mit vier Systemen: vier Framework Desktop mit dem Ryzen AI Max+ 395, verbunden über 5-Gb/s-Ethernet, mit llama.cpp über RPC. Kimi K2.5 in einer 2-Bit-Quantisierung (UD_Q2_K_XL), eine Datei mit 375 GB, erzeugte 9,45 Token pro Sekunde für 128 Token, und ein Prompt mit 4.096 Token brauchte 39,7 Sekunden bis zum ersten Token, beides mit Flash Attention.

Betrieb im Unternehmen

NVIDIA nennt für den DGX Spark keinen BMC; verwaltet wird er über sein Betriebssystem und NVIDIA Sync. Hängt er, setzt ihn jemand vor Ort zurück, oder eine schaltbare Steckdose trennt ihn kurz vom Strom. Auf dem Ryzen AI Halo ist SSH unter Linux standardmäßig aktiv, und AMDs Developer Center bietet Updates, das Zurücksetzen auf Werkseinstellungen, ein Rollback auf Snapshots und BIOS-Updates. Ein Mac Studio wird wie jeder andere Mac im Unternehmen verwaltet.

Alle drei laufen an einer Bürosteckdose: der DGX Spark mit einem 240-W-Netzteil, der Mac Studio mit bis zu 480 W Dauerleistung laut Apples Spezifikation und der Ryzen AI Halo mit einer TDP von 120 W. Apple verkauft den Mac Studio über eigene Stores und Apple Authorized Resellers. Systeme mit Ryzen AI Max kommen von AMDs Partnern, jeweils mit eigenen Garantiebedingungen, und AMD hat Micro Center, einen US-Händler, als exklusiven Händler für den Ryzen AI Halo genannt. Wir liefern die DGX Spark Founders Edition unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie.

Welches System für welchen Bedarf

BEDARFPASSENDWARUM
Entwicklung für CUDA-ServerDGX Sparkderselbe CUDA-Stack, Playbooks für vLLM, TensorRT-LLM und NIM
Mehr Tempo, bis 128 GBMac Studio M5 Max oder Ultra460 GB/s bis 1,2 TB/s gegenüber 256 bis 273 GB/s
Über 128 GB in einem SystemMac Studio M5 Ultra256 oder 512 GB in einem System
Modell über 128 GB, CUDAzwei DGX Spark256 GB über ein QSFP-Kabel, bis zu 400B Parameter laut NVIDIA
Linux mit AMD-SoftwareSystem mit Ryzen AI Max+ 395ROCm unter Linux, 128 GB mit 256 GB/s
Team in Lese­geschwindigkeitRTX-PRO-6000-Workstation96 GB mit 1.792 GB/s je Karte, bis zu vier Karten

Unsere Auswertung der oben genannten Seiten von NVIDIA, Apple und AMD, Stand 9. Oktober 2026, und unserer Artikel zum DGX Spark und zur RTX PRO 6000.

Für ein Team, das täglich ein Modell in Lesegeschwindigkeit nutzt, passen eine bis vier RTX-PRO-6000-Karten besser; unser Artikel zur Max-Q-Workstation mit vier Karten behandelt sie.

Wir liefern den DGX Spark und auf Bestellung gebaute RTX-PRO-6000-Workstations, aber keine Mac Studio und keine Systeme mit Ryzen AI Max. Beschreiben Sie Ihre Modelle und Nutzer im Formular unten, und wir sagen Ihnen, welches der beiden passt.

Was wir liefern

Wir liefern den NVIDIA DGX Spark in der Founders Edition (128 GB, 4 TB) EU-weit unter einem Vertrag und auf einer Rechnung, mit Herstellergarantie, zum Beispiel zwei DGX Spark für ein Modell über 128 GB oder vier für Modelle mit bis zu 700 Milliarden Parametern nach NVIDIAs Angabe. Außerdem liefern wir die RTX PRO 6000 Blackwell in den Editionen Workstation, Max-Q und Server, als Karten oder in auf Bestellung gebauten Workstations und KI-Servern, montiert und im Burn-in getestet. Mit dem Modell, seiner Präzision, der Kontextlänge und der Zahl gleichzeitiger Nutzer schlagen wir innerhalb eines Werktages eine Konfiguration vor und erstellen ein Angebot.

FAQ

DGX Spark vs Mac Studio: was ist besser für lokale LLMs?
Das hängt davon ab, ob Kapazität, Geschwindigkeit oder der Software-Stack entscheidet. Der Mac Studio mit M5 Ultra bietet bis zu 512 GB mit 1,2 TB/s; damit lädt er größere Modelle und hat für einen Nutzer eine höhere Obergrenze bei der Token-Generierung als der DGX Spark mit 128 GB und 273 GB/s. Der DGX Spark führt NVIDIAs CUDA-Stack mit vLLM, TensorRT-LLM und NIM aus, die Entwicklung lässt sich also ohne Wechsel der Engine auf NVIDIA-GPU-Server übertragen.
DGX Spark vs Ryzen AI Max+ 395 (Strix Halo): wie unterscheiden sie sich?
Beide haben bis zu 128 GB LPDDR5x als Unified Memory an einer 256-Bit-Schnittstelle, mit 273 GB/s auf dem DGX Spark und 256 GB/s auf dem Ryzen AI Max+ 395 nach AMDs Angabe. In einem llama.cpp-Vergleich mit demselben Build vom 22. Oktober 2025 erzeugte gpt-oss 120B 45,9 Token pro Sekunde auf dem DGX Spark und 47,5 auf dem AMD-System, und der DGX Spark verarbeitete Prompts mit 1.737 gegenüber etwa 1.000 Token pro Sekunde; ein späterer Lauf auf dem DGX Spark mit einem neueren Build erreichte 60,6. Der DGX Spark führt CUDA aus und koppelt bis zu vier Systeme über ConnectX-7 mit 200 Gb/s, während das AMD-System ROCm unter Linux ausführt.
Ist der Ryzen AI Max eine DGX-Spark-Alternative?
Für Modelle bis etwa 100 GB auf einem Schreibtisch bei ähnlicher Generierungsgeschwindigkeit ja: AMDs Ryzen AI Halo hat 128 GB mit 256 GB/s in einer Box von 150 mm, und AMD gibt an, dass er Modelle mit bis zu 200 Milliarden Parametern ausführt. Er nutzt AMDs ROCm statt CUDA; Code, der mit vLLM oder TensorRT-LLM in CUDA-Builds auf NVIDIA-Server zielt, wird also auf einem anderen Stack getestet. Der GPU-Anteil am Speicher ist eine Einstellung: standardmäßig 75 Prozent im Variable Graphics Memory des Ryzen AI Halo und laut AMDs ROCm-Dokumentation etwa 50 Prozent unter Linux, bis die TTM-Grenze angehoben wird.
Eignet sich ein Mac Studio für LLMs?
Apples Spezifikationen nennen für die Version mit M5 Ultra bis zu 512 GB Unified Memory mit 1,2 TB/s und für die Version mit M5 Max bis zu 128 GB mit bis zu 614 GB/s; er fasst also große Modelle und hat für einen Nutzer eine hohe Obergrenze bei der Token-Generierung. Er läuft mit macOS und Metal, MLX, llama.cpp und LM Studio, und Apple gibt an, dass sich mehrere Systeme über Thunderbolt 5 mit RDMA zu einem Cluster verbinden lassen. Wer dieselben Modelle später mit vLLM oder TensorRT-LLM auf Linux-GPU-Servern bereitstellt, wechselt weg von MLX und oft zu einem anderen Quantisierungsformat, während GGUF-Dateien für llama.cpp auf beiden laufen.
Wie viel Speicher kann die GPU auf einem Ryzen AI Max+ 395 nutzen?
AMDs User Guide zum Ryzen AI Halo setzt den gemeinsam genutzten Anteil zwischen 10 und 90 Prozent, standardmäßig 75 Prozent. Unter Linux nennt AMDs ROCm-Dokumentation eine standardmäßige Grenze für GPU-mappbaren Speicher von etwa 50 Prozent des RAM und empfiehlt, die gemeinsame TTM-Grenze anzuheben und die Reservierung in der Firmware klein zu halten. In AMDs eigenem Cluster-Test vom Februar 2026 wurde der Anteil auf 120 GB jedes Systems mit 128 GB angehoben.
Welcher Desktop für lokale LLMs erzeugt für einen Nutzer schneller Token?
Für einen Nutzer folgt die Token-Generierung der Speicherbandbreite; der Mac Studio M5 Ultra hat mit 1,2 TB/s daher eine höhere Obergrenze als die beiden anderen mit 273 GB/s auf dem DGX Spark und 256 GB/s auf dem Ryzen AI Max+ 395. Für ein dichtes 70B-Modell mit 8-Bit-Gewichten liegt diese Obergrenze nach unserer Rechnung bei etwa 17, 3,9 und 3,6 Token pro Sekunde. Eine RTX PRO 6000 als Workstation-Karte erreicht 1.792 GB/s, etwa 25 Token pro Sekunde für dasselbe Modell, mit 96 GB je Karte.

Schicken Sie uns die Modelle, die Sie betreiben wollen, ihre Präzision, die Kontextlänge, wie viele Personen sie gleichzeitig nutzen werden und wo die Modelle im Produktivbetrieb laufen sollen. Wir antworten innerhalb eines Werktages mit einer Konfiguration (DGX Spark oder eine RTX-PRO-6000-Workstation) und einem schriftlichen Angebot.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien