Ein DGX Spark für ein Team: wie viele Personen er bedient und wie Sie ihn teilen
- NVIDIA verkauft den Spark als Desktop-Rechner für Entwickler und veröffentlicht keine Teamgröße; die Garantie beschreibt das Gerät als kleinen Server für „multi-users purposes“
- Mit gpt-oss-120b und Prompts von 4.096 Token haben die Maintainer von llama.cpp 55 Token pro Sekunde für eine Anfrage gemessen; ihre Messwerte ergeben umgerechnet etwa 17 je Anfrage bei 8 gleichzeitigen, 12 bei 16 und 8 bei 32
- Das kleinere gpt-oss-20b hält sich besser: 29 Token pro Sekunde je Anfrage bei 8 gleichzeitigen und 21 bei 16, ausgehend von 79 im Einzelbetrieb
- Lange Prompts stauen sich: 32 Anfragen mit Prompts von 4.096 Token brauchen mit gpt-oss-120b 54 Sekunden zum Einlesen, bevor die letzte ihr erstes Token erzeugt, und lange Antworten kosten danach noch ihre eigene Zeit
- Was funktioniert, ist eine Serving-Engine mit OpenAI-kompatibler API, ein Chat-Frontend mit eigenen Konten und ein Linux-Konto pro Entwickler; Ollama beantwortet, sofern nicht anders eingestellt, jeweils eine Anfrage pro Modell
Was NVIDIA sagt und was nicht
NVIDIA positioniert den DGX Spark für „Workloads von KI-Entwicklern, Forschern und Data Scientists“ und veröffentlicht keine Zahl dazu, wie viele Personen sich ein Gerät teilen können. Am nächsten kommt dem eine Aussage zur Software: „Mit Unterstützung von Frameworks, die gut mit Parallelität umgehen (etwa NVIDIA TensorRT LLM, vLLM und SGLang), laufen Multi-Agenten-Workloads auf NVIDIA DGX Spark reibungslos.“ Deutlicher zum vorgesehenen Einsatz äußert sich die Garantie: ein „small-scale server for consumer and enterprise end user and multi-users purposes“. Ein Gerät zu teilen liegt im Rahmen dessen, was NVIDIA vorsieht. Die Frage ist, wie weit das reicht.
Maßgeblich für die Auslegung sind gleichzeitige Anfragen, nicht Personen. Zehn Entwickler mit einem Coding-Assistenten schicken selten zehn Anfragen in derselben Sekunde, und eine Dokumentenpipeline schickt alle ihre Anfragen auf einmal. Unser Artikel zu Nutzern pro RTX PRO 6000 erklärt, wie Sie die Zahl, auf die es ankommt, aus Ihren eigenen Logs ablesen; hier wenden wir die veröffentlichten Messungen auf den Spark an.
Tempo je Anfrage, von 1 bis 32 gleichzeitig
Die vollständigsten öffentlichen Daten stammen von den Maintainern von llama.cpp, die den DGX Spark mit mehreren parallel laufenden Anfragen messen. Die Tabelle zeigt die Generierungsgeschwindigkeit, die jede einzelne Anfrage erhält.
| PARALLELE ANFRAGEN | GPT-OSS-20B | GPT-OSS-120B | QWEN3-CODER-30B-A3B, 8 BIT |
|---|---|---|---|
| 1 | 78,5 | 55,2 | 53,5 |
| 2 | 51,2 | 34,3 | 31,4 |
| 4 | 36,0 | 22,7 | 20,9 |
| 8 | 29,1 | 17,4 | 15,0 |
| 16 | 21,3 | 12,3 | 10,3 |
| 32 | 14,8 | 8,2 | 6,8 |
Token pro Sekunde je Anfrage. DGX-Spark-Ergebnisse der Maintainer von llama.cpp (llama-batched-bench, Build vom Februar 2026, Promptlänge 4.096 Token und 32 erzeugte Token je Anfrage); das Tempo je Anfrage ist der veröffentlichte Gesamtwert geteilt durch die Zahl der Anfragen.
Der Gesamtdurchsatz steigt dabei weiter, bei gpt-oss-120b von 55 Token pro Sekunde für eine Anfrage auf 262 bei 32, während jede einzelne Anfrage langsamer wird. LMSYS hat zum Marktstart im Oktober 2025 denselben Verlauf gemessen, mit SGLang und Prompts und Antworten von je 2.048 Token: gpt-oss-120b fiel von 50,5 Token pro Sekunde im Einzelbetrieb auf 14,6 je Anfrage bei 8, 9,2 bei 16, 6,3 bei 32 und 4,6 bei 64, in Summe etwa 290 Token pro Sekunde. NVIDIAs eigener Test zur Parallelität, veröffentlicht im März 2026, ließ Qwen3 Coder Next in FP8 auf vLLM mit Prompts von 32K Token und Antworten von 1K Token laufen: Eine, zwei und vier gleichzeitige Aufgaben dauerten 35, 54 und 91 Sekunden, und das erste Token kam im Median nach 9, 12 und 15 Sekunden.
Unser 70B-Rechenbeispiel rechnet mit 10 Token pro Sekunde als bequemem Lesetempo. Daran gemessen bleibt gpt-oss-120b auf einem Spark mit Prompts von 4.096 Token bis zu etwa 16 gleichzeitigen Anfragen über dieser Marke und fällt bei 32 darunter, während gpt-oss-20b bei 32 darüber bleibt.
Warum sich lange Prompts stauen
Einen Prompt einzulesen ist Rechenarbeit, und auf dem Spark läuft sie mit einer ziemlich festen Rate: etwa 2.400 Token pro Sekunde für gpt-oss-120b in den Ergebnissen von llama.cpp, ob nun eine Anfrage wartet oder zweiunddreißig. Prompts reihen sich deshalb hintereinander ein. Acht Anfragen mit Prompts von 4.096 Token brauchen zusammen 13,6 Sekunden zum Einlesen und zweiunddreißig brauchen 54,4 Sekunden; mit Prompts von 8.192 Token brauchen zweiunddreißig 111 Sekunden. Längere Kontexte bremsen auch das Einlesen selbst: Bei einer Kontexttiefe von 32K Token verarbeitet dasselbe Modell Prompts mit etwa 1.570 Token pro Sekunde.
Das ist der Unterschied zwischen einem Chat-Team und einem Agenten-Team. Menschen, die Fragen tippen, schicken kurze Prompts, und ein Gerät verkraftet viele davon. Retrieval-Pipelines und Coding-Agenten schicken bei jedem Aufruf Dokumente und ganze Dateien mit, und NVIDIAs eigene Tabelle endet bei vier solchen Aufgaben gleichzeitig. Auch die Antworten zählen: In diesem Test dauerte das Erzeugen der Antworten mit 1K Token länger als das Einlesen der Prompts mit 32K Token. Sehen Sie sich vor der Auslegung die Prompt- und Antwortlängen in Ihren Logs an, nicht nur die Zahl der Nutzer.
Welches Modell Sie bereitstellen
Mixture-of-Experts-Modelle sind es, die den Spark für ein Team brauchbar machen, weil jedes Token nur die aktiven Parameter liest. gpt-oss-20b hat 21 Milliarden Parameter, davon 3,6 Milliarden aktiv, und 13,8 GB Gewichte; gpt-oss-120b hat 117 Milliarden, davon 5,1 Milliarden aktiv, und 65,3 GB; Qwen3-Coder-30B-A3B hat 30,5 Milliarden, davon 3,3 Milliarden aktiv. Dichte Modelle sind der Gegenfall. LMSYS hat ein dichtes Llama 3.1 70B in FP8 mit 2,7 Token pro Sekunde für eine Anfrage gemessen und mit 20,2 insgesamt für acht, 2,5 je Anfrage: ein Modell für einen nächtlichen Batch-Job, nicht für ein Team.
Der Speicher entscheidet, wie viele davon gleichzeitig passen. Unser Artikel zu den 128 GB leitet aus NVIDIAs eigenen Playbook-Voreinstellungen ein praktisches Arbeitsbudget von etwa 102 bis 115 GB für Gewichte und Cache ab. gpt-oss-120b und gpt-oss-20b belegen zusammen etwa 79 GB Gewichte, was für beide rund 23 bis 36 GB Cache übrig lässt: ein schnelles Modell für Alltagsfragen und ein größeres für die schweren, auf demselben Gerät.
Wie Sie ein Gerät teilen
Eine Serving-Engine. vLLM, SGLang, TensorRT-LLM, der llama.cpp-Server und NVIDIA NIM stellen alle eine OpenAI-kompatible API bereit, und NVIDIA veröffentlicht für jede davon DGX-Spark-Playbooks. Prüfen Sie die Voreinstellungen für gleichzeitige Anfragen, bevor Sie der Hardware die Schuld geben: Ollama verarbeitet jeweils eine Anfrage pro Modell, solange OLLAMA_NUM_PARALLEL nicht erhöht wird, und stellt den Rest in die Warteschlange; der llama.cpp-Server ist standardmäßig auf vier gleichzeitige Anfragen eingestellt; vLLM bezieht seine Grenzen aus --max-num-seqs und --gpu-memory-utilization. NVIDIAs vLLM-Playbook setzt den zweiten Wert auf 0,8, mit dem Hinweis, ihn auf einer dedizierten GPU Richtung 0,95 anzuheben.
Ein Frontend mit Konten. Open WebUI verbindet sich mit OpenAI-kompatiblen Endpunkten wie vLLM und dem llama.cpp-Server. Das erste angelegte Konto wird Administrator, neue Registrierungen bleiben im Wartezustand, bis jemand sie freigibt, Berechtigungen legen fest, wer welche Modelle und Wissensdatenbanken sieht, und die Anmeldung über OIDC oder LDAP ist dokumentiert. NVIDIAs Open-WebUI-Playbook richtet es mit einem lokalen Administratorkonto auf dem Gerät ein.
Entwicklerkonten. DGX OS ist Ubuntu, und jeder Entwickler sollte ein eigenes Linux-Konto haben. Das DGX Dashboard gibt jedem Konto ein eigenes JupyterLab mit eigenem Port und eigenem Arbeitsverzeichnis, NVIDIA Sync kann seit Version 0.117 denselben Spark mehrfach unter verschiedenen Benutzerkonten hinzufügen, und der Zugriff auf Docker wird pro Nutzer vergeben. Für den Zugriff von außerhalb des Büros hat NVIDIA Sync Tailscale eingebaut.
Training: jeweils eine Arbeitslast. Ein Fine-Tuning-Lauf und eine Serving-Engine teilen sich dieselben 128 GB und dieselbe GPU. Planen Sie das Training außerhalb der Arbeitszeit ein, oder geben Sie ihm ein zweites Gerät.
Wo ein Gerät an seine Grenze kommt
Für Chat mit gpt-oss-120b und Prompts von 4.096 Token trägt ein Gerät nach den Messungen etwa 16 gleichzeitige Anfragen, bevor jede unter das Lesetempo fällt, und etwa 8, wenn jede Antwort mit 17 Token pro Sekunde oder mehr streamen soll; gpt-oss-20b verdoppelt diesen Spielraum ungefähr. Für Coding-Agenten und Dokumentenpipelines mit langen Prompts kommt die Grenze viel früher, bei einer Handvoll paralleler Aufgaben.
Ein zweiter Spark bringt Kapazität statt Tempo je Anfrage. Zwei verbundene Geräte fassen 256 GB, und StorageReview hat für gpt-oss-120b bei 128 Anfragen mit Pipeline-Parallelismus insgesamt 555 Token pro Sekunde gemessen, wie unser Artikel zu zwei Knoten beschreibt, doch jede Anfrage läuft weiterhin mit der Bandbreite eines Spark. Braucht ein Team viele schnelle Ströme aus einem großen Modell, ist der nächste Schritt eine Karte mit mehr Bandbreite: Eine RTX PRO 6000 Server Edition bewegt 1.597 GB/s und die Workstation-Karte 1.792 GB/s, gegenüber 273 beim Spark. Unser Vergleich für ein erstes KI-Projekt geht diese Entscheidung durch.
Was wir liefern
Eurokommerz liefert den NVIDIA DGX Spark in der Founders Edition EU-weit mit Herstellergarantie, einzeln oder als verbundenes Paar. Wächst ein Team über ein Gerät hinaus, bemessen wir den nächsten Schritt anhand seiner eigenen Zahlen, ob das ein zweiter Spark ist oder ein Server mit RTX-PRO-6000-Karten.
FAQ
Wie viele Personen können sich einen DGX Spark teilen?
Warum beantwortet Ollama nur eine Person auf einmal?
Können mehrere Entwickler gleichzeitig an einem DGX Spark arbeiten?
Welches Modell eignet sich für ein Team auf dem DGX Spark?
Verdoppelt ein zweiter DGX Spark die Zahl der Nutzer?
Was begrenzt einen DGX Spark bei Coding-Agenten?
Nennen Sie uns, wie viele Personen das Gerät nutzen werden, was sie ihm schicken werden (Chat, Dokumente oder Code) und welches Modell Sie im Sinn haben. Wir schätzen ab, wie viele gleichzeitige Anfragen ein DGX Spark trägt und wann eine zweite Maschine sinnvoll ist. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages