DGX Spark vs Mac Studio vs Ryzen AI Max: welches Desktop-System für lokale LLMs
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Der DGX Spark hat 128 GB Unified Memory mit 273 GB/s und NVIDIAs CUDA-Stack; Systeme mit dem Ryzen AI Max+ 395 haben bis zu 128 GB mit 256 GB/s und AMDs ROCm unter Linux; der Mac Studio bietet bis zu 128 GB mit bis zu 614 GB/s (M5 Max) oder bis zu 512 GB mit 1,2 TB/s (M5 Ultra) unter macOS
- Die Token-Generierung für einen Nutzer folgt auf allen drei Systemen der Speicherbandbreite; für ein dichtes 70B-Modell mit 8-Bit-Gewichten liegt die rechnerische Obergrenze bei etwa 3,9 Token pro Sekunde auf dem DGX Spark, 3,6 auf dem Ryzen AI Max+ 395 und 17 auf dem M5 Ultra
- In einem llama.cpp-Vergleich mit demselben Build auf beiden Maschinen (22. Oktober 2025) erzeugte gpt-oss 120B 45,9 Token pro Sekunde auf dem DGX Spark und 47,5 auf einem System mit Ryzen AI Max+ 395, während die Prompt-Verarbeitung mit 1.737 und etwa 1.000 Token pro Sekunde lief
- AMDs ROCm-Dokumentation setzt die standardmäßige Grenze für GPU-mappbaren Speicher unter Linux auf etwa 50 Prozent des RAM und hebt sie über die TTM-Grenze an; AMDs eigener Test mit einer Billion Parametern hob sie auf 120 GB je System mit 128 GB an
- Der DGX Spark koppelt bis zu vier Systeme über ConnectX-7 mit 200 Gb/s und hält Code auf dem CUDA-Stack der NVIDIA-GPU-Server; der Mac Studio bildet Cluster über Thunderbolt 5 mit RDMA, und AMDs Cluster-Test nutzte 5-Gb/s-Ethernet
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
DGX Spark vs Mac Studio vs Ryzen AI Max: was entscheidet
Für die Arbeit mit lokalen LLMs unterscheiden sich die drei Systeme in vier Punkten: wie viel Speicher ein Modell nutzen kann, wie schnell dieser Speicher gelesen wird, welcher Software-Stack auf der GPU läuft und wie sich die Maschine in die IT des Unternehmens einfügt. Der DGX Spark hat 128 GB Unified Memory mit 273 GB/s und führt NVIDIAs CUDA-Stack unter DGX OS aus. Der Mac Studio mit M5 Ultra bietet bis zu 512 GB mit 1,2 TB/s unter macOS mit Apples Metal und MLX, die Version mit M5 Max bis zu 128 GB mit bis zu 614 GB/s. Systeme mit dem AMD Ryzen AI Max+ 395, bekannt unter dem Codenamen Strix Halo, haben bis zu 128 GB mit 256 GB/s und führen AMDs ROCm unter Linux aus.
Spezifikationen im Vergleich
| MERKMAL | DGX SPARK | MAC STUDIO M5 MAX | MAC STUDIO M5 ULTRA | RYZEN AI MAX+ 395 |
|---|---|---|---|---|
| Unified Memory | 128 GB LPDDR5x (Founders Edition) | 36 GB; 48, 64 oder 128 GB mit der 40-Kern-GPU | 96 GB; 256 oder 512 GB mit der 80-Kern-GPU | bis zu 128 GB, 256 Bit LPDDR5x-8000 |
| Speicherbandbreite | 273 GB/s | 460 GB/s; 614 GB/s mit der 40-Kern-GPU | 1,2 TB/s | 256 GB/s |
| GPU | Blackwell, 6.144 CUDA-Kerne | 32 oder 40 GPU-Kerne | 64 oder 80 GPU-Kerne | Radeon 8060S, 40 Compute Units |
| GPU-Software | CUDA | Metal, MLX | Metal, MLX | ROCm |
| Netzwerk | ConnectX-7 mit 200 Gb/s, 10 GbE | 10 Gb Ethernet, vier Thunderbolt-5-Ports | 10 Gb Ethernet, sechs Thunderbolt-5-Ports | vom Systemhersteller festgelegt |
| Strom | 240-W-Netzteil, GB10 mit 140 W TDP | 480 W Dauerleistung maximal | 480 W Dauerleistung maximal | 55 W Standard-TDP, 45 bis 120 W konfigurierbar |
| Betriebssystem | NVIDIA DGX OS | macOS | macOS | unter anderem Ubuntu und RHEL in AMDs Liste |
NVIDIA-Produktseite zum DGX Spark, die Zahl der CUDA-Kerne aus NVIDIAs Hardware-Übersicht; technische Daten des Mac Studio von Apple; AMD-Produktseite zum Ryzen AI Max+ 395; AMDs User Guide zum Ryzen AI Halo für den Wert von 256 GB/s; alle abgerufen am 9. Oktober 2026.
Der Ryzen AI Max+ 395 ist ein Prozessor, den mehrere Hersteller in eigene Systeme einbauen; Storage, Anschlüsse und Gehäuse hängen daher vom System ab. AMD verkauft auch eine eigene Box, den Ryzen AI Halo, den sein User Guide mit 150 × 150 × 45,4 mm, 128 GB LPDDR5x mit 256 GB/s, einer selbstverschlüsselnden SSD mit 2 TB, einem 10-Gb-Ethernet-Port und einer TDP von 120 W angibt. AMD sagte am 20. Mai 2026, dass er Modelle mit bis zu 200 Milliarden Parametern ausführt. Am 28. September 2026 sagte AMD, dass Systeme mit seinen Ryzen AI Max und Max PRO 400 Series bei seinen Partnern erhältlich sind und dass die 400 Series, in unserer Übersetzung, „bis zu 192 GB, davon bis zu 160 GB dediziert für die GPU“ bietet. Die AMD-Seiten, die wir gelesen haben, nennen für die 400 Series keine Bandbreite.
Wie viel des Speichers die GPU nutzen kann
Auf dem DGX Spark teilen sich CPU, DGX OS und GPU einen Pool, ohne festen GPU-Anteil außer einer Reserve für die Anzeige. Das System meldet etwa 119 bis 122 GiB der 128 GB, und NVIDIAs Playbook-Einstellungen ergeben ein Arbeitsbudget für Gewichte und KV-Cache von rund 102 bis 115 GB, wie unser Artikel dazu, was in 128 GB auf einem DGX Spark passt, durchrechnet.
Apples Spezifikationsseite nennt den Unified Memory als eine Zahl je Konfiguration und gibt keinen separaten GPU-Anteil an. Metal meldet je GPU einen Wert, recommendedMaxWorkingSetSize, den Apples Entwicklerdokumentation, in unserer Übersetzung, als „eine Näherung dafür, wie viel Speicher in Byte diese GPU belegen kann, ohne ihre Laufzeitleistung zu beeinträchtigen“ beschreibt. Eine Apple-Angabe dazu je Mac-Studio-Konfiguration haben wir nicht gefunden; lesen Sie den Wert daher auf der Maschine aus, bevor Sie ein Modell nahe am eingebauten Speicher dimensionieren.
Beim Ryzen AI Max+ 395 ist die Aufteilung zwischen CPU und GPU eine Einstellung. AMDs User Guide zum Ryzen AI Halo beschreibt Variable Graphics Memory, bei dem sich der gemeinsam genutzte Anteil von 10 bis 90 Prozent in Schritten von 5 Prozent einstellen lässt, standardmäßig 75 Prozent, und warnt, dass höhere Werte weniger Speicher für andere Anwendungen lassen. Unter Linux setzt AMDs ROCm-Dokumentation die standardmäßige Grenze für GPU-mappbaren Speicher (GTT) auf etwa 50 Prozent des System-RAM und empfiehlt eine kleine dedizierte Reservierung in der Firmware, zum Beispiel 0,5 GB, und stattdessen eine höhere gemeinsame TTM-Grenze. In AMDs eigenem Cluster-Test vom Februar 2026 lag das Firmware-Maximum bei 96 GB je System, und Kernel-Parameter hoben den Anteil der GPU auf 120 GB jedes Systems mit 128 GB an.
Speicherbandbreite und Token pro Sekunde
Apples Team für Machine-Learning-Forschung nennt in einem Beitrag zum M5-Chip die Regel für die Token-Generierung, in unserer Übersetzung: „Die Erzeugung der folgenden Token ist durch die Speicherbandbreite begrenzt und nicht durch die Rechenleistung.“ Dasselbe gilt auf dem DGX Spark und dem Ryzen AI Max+ 395. Bei einem dichten Modell liest jedes neue Token jedes Gewicht einmal; die Bandbreite geteilt durch die Größe der Gewichte ergibt daher eine Obergrenze für einen Nutzer.
| SYSTEM | BANDBREITE | DICHTES 70B, 8 BIT |
|---|---|---|
| DGX Spark | 273 GB/s | etwa 3,9 Token/s |
| Ryzen AI Max+ 395 | 256 GB/s | etwa 3,6 Token/s |
| Mac Studio M5 Max, 40 Kerne | 614 GB/s | etwa 8,7 Token/s |
| Mac Studio M5 Ultra | 1,2 TB/s | etwa 17 Token/s |
| RTX PRO 6000 Workstation | 1.792 GB/s | etwa 25 Token/s |
Bandbreiten von Seiten von NVIDIA, Apple und AMD, abgerufen am 9. Oktober 2026; die Obergrenzen sind unsere Rechnung, Bandbreite geteilt durch etwa 70,6 GB Gewichte, wie in unseren anderen DGX-Spark-Artikeln. Gemessene Werte bleiben darunter: LMSYS hat im Oktober 2025 auf dem DGX Spark mit SGLang 2,7 Token/s für Llama 3.1 70B in FP8 gemessen.
Ein Mixture-of-Experts-Modell liest je Token nur seine aktiven Experten und läuft weit schneller, als seine Gesamtgröße vermuten lässt. Am 22. Oktober 2025 hat ein Teilnehmer der DGX-Spark-Diskussion im llama.cpp-Projekt gpt-oss 120B in MXFP4 mit llama-bench gemessen, mit demselben llama.cpp-Build auf beiden Maschinen, einem Prompt von 2.048 Token, 32 erzeugten Token und aktivierter Flash Attention. Der DGX Spark erzeugte 45,87 Token pro Sekunde und ein System mit Ryzen AI Max+ 395 und ROCm 47,49, also nah beieinander, wie es die ähnlichen Bandbreiten erwarten lassen. Am 2. November 2025 meldete derselbe Teilnehmer 60,57 Token pro Sekunde auf dem DGX Spark mit einem neueren llama.cpp-Build und NVIDIAs Kernel 6.17.1, ohne neuen Lauf auf dem AMD-System; NVIDIAs eigener llama.cpp-Wert aus seinem Performance-Blog vom 24. Oktober 2025 liegt bei 55,37. Unser Benchmark-Artikel zum DGX Spark sammelt die übrigen veröffentlichten Läufe.
Die Prompt-Verarbeitung hängt von der Rechenleistung ab. Im Lauf vom 22. Oktober verarbeitete der DGX Spark 1.737 Prompt-Token pro Sekunde gegenüber etwa 1.000 auf dem Ryzen AI Max+ 395. Apple gibt an, dass der M5 Ultra LLM-Prompts in LM Studio bis zu viermal schneller verarbeitet als der M3 Ultra, nach eigenen Tests vom Juli 2026; Apple nennt das Modell nicht, und eine zitierfähige Messung Dritter am Mac Studio mit M5, mit Modell, Engine und Datum, haben wir nicht gefunden.
Brauchen mehrere Personen ein 70B-Modell in Lesegeschwindigkeit, ist der nächste Schritt eine RTX-PRO-6000-Workstation mit 96 GB je Karte. Nennen Sie uns das Modell und die Zahl der Nutzer, und wir vergleichen sie anhand Ihrer Zahlen mit dem DGX Spark.
Software-Stack: CUDA, MLX oder ROCm
Der DGX Spark läuft mit DGX OS, einem Ubuntu-basierten Linux für Arm, und demselben CUDA-Stack wie NVIDIAs Rechenzentrums-GPUs. NVIDIA veröffentlicht dafür Playbooks für vLLM, TensorRT-LLM und NIM, und dieselben Engines laufen auf Servern mit RTX PRO 6000 und H200 NVL. FP4-Arithmetik braucht eine Blackwell-GPU wie die RTX PRO 6000; auf der H200 NVL lassen sich FP4-Gewichte laden, gerechnet wird aber in 16 Bit. Unser Vergleich von vLLM, SGLang, TensorRT-LLM, llama.cpp und Ollama zeigt, welche Formate jede Engine auf dem DGX Spark ausführt. Wegen des Arm-Prozessors braucht jede reine x86-Binärabhängigkeit einen Arm-Build.
Der Mac Studio läuft mit macOS und Metal für die GPU. Apple beschreibt MLX als sein Open-Source-Framework für maschinelles Lernen auf Apple silicon, das, in unserer Übersetzung, „Entwicklern ermöglicht, Modelle auszuführen, zu trainieren und feinabzustimmen“. Auch llama.cpp und LM Studio laufen auf dem Mac. Ein Team, das mit MLX arbeitet und seine Modelle später mit vLLM oder TensorRT-LLM auf Linux-GPU-Servern bereitstellt, wechselt an diesem Punkt die Engine und oft das Quantisierungsformat; GGUF-Dateien für llama.cpp laufen auf beiden.
Systeme mit Ryzen AI Max+ 395 führen ROCm, AMDs GPU-Software-Stack, unter Linux aus. Der Ryzen AI Halo wird mit vorinstallierten ROCm-Komponenten, PyTorch, Lemonade und ComfyUI ausgeliefert. AMDs ROCm-Dokumentation verlangt für die Ryzen-AI-Max-Serie den Linux-Kernel 6.18.4 oder neuer oder eine Distribution, die die Korrekturen enthält, etwa Fedora 43 oder Ubuntu 26.04; prüfen Sie die Kombination also, bevor Sie mehrere Maschinen ausrollen.
Zwei bis vier Systeme koppeln
Der DGX Spark koppelt über seine ConnectX-7-Ports mit 200 Gb/s je Port, und NVIDIAs Clustering-Leitfaden unterstützt bis zu drei Systeme per Direktkabel und vier über einen Switch. NVIDIAs Produktseite nennt bis zu 400 Milliarden Parameter auf zwei Systemen mit 128 GB und bis zu 700 Milliarden auf vier; unser Artikel zu zwei gekoppelten DGX-Spark-Systemen behandelt die Verkabelung.
Apple gibt an, dass sich mehrere Mac Studio über Thunderbolt 5 mit RDMA zu einem Cluster verbinden lassen und dass ein Cluster aus vier Systemen KI-Inferenz bis zu dreimal schneller ausführt als ein System, nach eigenen Tests vom Juli 2026; Apple nennt das Modell nicht. MLX dokumentiert JACCL als sein Backend für „RDMA over thunderbolt“, das es, in unserer Übersetzung, „für Dinge wie Tensor-Parallelismus“ als notwendig bezeichnet.
AMD veröffentlichte am 25. Februar 2026 einen Test mit vier Systemen: vier Framework Desktop mit dem Ryzen AI Max+ 395, verbunden über 5-Gb/s-Ethernet, mit llama.cpp über RPC. Kimi K2.5 in einer 2-Bit-Quantisierung (UD_Q2_K_XL), eine Datei mit 375 GB, erzeugte 9,45 Token pro Sekunde für 128 Token, und ein Prompt mit 4.096 Token brauchte 39,7 Sekunden bis zum ersten Token, beides mit Flash Attention.
Betrieb im Unternehmen
NVIDIA nennt für den DGX Spark keinen BMC; verwaltet wird er über sein Betriebssystem und NVIDIA Sync. Hängt er, setzt ihn jemand vor Ort zurück, oder eine schaltbare Steckdose trennt ihn kurz vom Strom. Auf dem Ryzen AI Halo ist SSH unter Linux standardmäßig aktiv, und AMDs Developer Center bietet Updates, das Zurücksetzen auf Werkseinstellungen, ein Rollback auf Snapshots und BIOS-Updates. Ein Mac Studio wird wie jeder andere Mac im Unternehmen verwaltet.
Alle drei laufen an einer Bürosteckdose: der DGX Spark mit einem 240-W-Netzteil, der Mac Studio mit bis zu 480 W Dauerleistung laut Apples Spezifikation und der Ryzen AI Halo mit einer TDP von 120 W. Apple verkauft den Mac Studio über eigene Stores und Apple Authorized Resellers. Systeme mit Ryzen AI Max kommen von AMDs Partnern, jeweils mit eigenen Garantiebedingungen, und AMD hat Micro Center, einen US-Händler, als exklusiven Händler für den Ryzen AI Halo genannt. Wir liefern die DGX Spark Founders Edition unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie.
Welches System für welchen Bedarf
| BEDARF | PASSEND | WARUM |
|---|---|---|
| Entwicklung für CUDA-Server | DGX Spark | derselbe CUDA-Stack, Playbooks für vLLM, TensorRT-LLM und NIM |
| Mehr Tempo, bis 128 GB | Mac Studio M5 Max oder Ultra | 460 GB/s bis 1,2 TB/s gegenüber 256 bis 273 GB/s |
| Über 128 GB in einem System | Mac Studio M5 Ultra | 256 oder 512 GB in einem System |
| Modell über 128 GB, CUDA | zwei DGX Spark | 256 GB über ein QSFP-Kabel, bis zu 400B Parameter laut NVIDIA |
| Linux mit AMD-Software | System mit Ryzen AI Max+ 395 | ROCm unter Linux, 128 GB mit 256 GB/s |
| Team in Lesegeschwindigkeit | RTX-PRO-6000-Workstation | 96 GB mit 1.792 GB/s je Karte, bis zu vier Karten |
Unsere Auswertung der oben genannten Seiten von NVIDIA, Apple und AMD, Stand 9. Oktober 2026, und unserer Artikel zum DGX Spark und zur RTX PRO 6000.
Für ein Team, das täglich ein Modell in Lesegeschwindigkeit nutzt, passen eine bis vier RTX-PRO-6000-Karten besser; unser Artikel zur Max-Q-Workstation mit vier Karten behandelt sie.
Wir liefern den DGX Spark und auf Bestellung gebaute RTX-PRO-6000-Workstations, aber keine Mac Studio und keine Systeme mit Ryzen AI Max. Beschreiben Sie Ihre Modelle und Nutzer im Formular unten, und wir sagen Ihnen, welches der beiden passt.
Was wir liefern
Wir liefern den NVIDIA DGX Spark in der Founders Edition (128 GB, 4 TB) EU-weit unter einem Vertrag und auf einer Rechnung, mit Herstellergarantie, zum Beispiel zwei DGX Spark für ein Modell über 128 GB oder vier für Modelle mit bis zu 700 Milliarden Parametern nach NVIDIAs Angabe. Außerdem liefern wir die RTX PRO 6000 Blackwell in den Editionen Workstation, Max-Q und Server, als Karten oder in auf Bestellung gebauten Workstations und KI-Servern, montiert und im Burn-in getestet. Mit dem Modell, seiner Präzision, der Kontextlänge und der Zahl gleichzeitiger Nutzer schlagen wir innerhalb eines Werktages eine Konfiguration vor und erstellen ein Angebot.
FAQ
DGX Spark vs Mac Studio: was ist besser für lokale LLMs?
DGX Spark vs Ryzen AI Max+ 395 (Strix Halo): wie unterscheiden sie sich?
Ist der Ryzen AI Max eine DGX-Spark-Alternative?
Eignet sich ein Mac Studio für LLMs?
Wie viel Speicher kann die GPU auf einem Ryzen AI Max+ 395 nutzen?
Welcher Desktop für lokale LLMs erzeugt für einen Nutzer schneller Token?
Schicken Sie uns die Modelle, die Sie betreiben wollen, ihre Präzision, die Kontextlänge, wie viele Personen sie gleichzeitig nutzen werden und wo die Modelle im Produktivbetrieb laufen sollen. Wir antworten innerhalb eines Werktages mit einer Konfiguration (DGX Spark oder eine RTX-PRO-6000-Workstation) und einem schriftlichen Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages