BLOG · GUIDE ·

Fine-Tuning auf DGX Spark: LoRA, QLoRA und vollständiges Fine-Tuning in 128 GB, und wann ein Server der nächste Schritt ist

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • NVIDIA nennt Fine-Tuning von Modellen bis 70 Milliarden Parameter auf DGX Spark; sein PyTorch-Playbook erreicht diese Größe auf einem Spark nur mit QLoRA und zeigt ein vollständiges Fine-Tuning bei Llama 3.2 3B und LoRA bei Llama 3.1 8B
  • Für zwei DGX Spark führt dasselbe Playbook LoRA auf Llama 3.1 70B mit FSDP2 aus; auf einer BF16-Basis belegt dieser Lauf nach unserer Rechnung etwa 144 GB Modellzustände, mehr als ein Spark hat, oder etwa 72 GB pro Spark mit Sharding
  • NVIDIAs NeMo-Playbook, aktualisiert am 4. September 2026, deckt Modelle mit etwa 1 bis 70B Parametern ab, mit für Spark validierten Rezepten: LoRA auf Llama 3.1 8B und Qwen3 8B, QLoRA auf Llama 3.3 70B Instruct
  • Das PyTorch-Team von Meta brauchte etwa 8 Stunden je Epoche für ein vollständiges BF16-Fine-Tuning von Llama 3.1 8B bei 16K Token, und NVIDIA maß 759,79 Token pro Sekunde für QLoRA auf einem 70B-Modell, etwa 22 Minuten je Million Trainings-Token
  • Ein GPU-Server ist der nächste Schritt für wiederholte Läufe auf großen Datensätzen, LoRA auf einer BF16-Basis über 32B und vollständiges Fine-Tuning mit 32-Bit-Adam: Die H200 NVL fasst die 128 GB Zustände eines vollständigen 8B-Fine-Tunings auf einer Karte

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Was sich auf einem DGX Spark und auf zwei feinabstimmen lässt

Laut NVIDIAs Produktseite, abgerufen am 9. Oktober 2026, lassen sich auf DGX Spark Modelle mit bis zu 70 Milliarden Parametern feinabstimmen, und wie groß das Modell sein darf, entscheidet die Methode. NVIDIAs PyTorch-Playbook für Fine-Tuning, abgerufen am 9. Oktober 2026 in NVIDIAs GitHub-Repository, liefert je Stufe ein Skript: ein vollständiges Fine-Tuning von Llama 3.2 3B, LoRA auf Llama 3.1 8B und QLoRA auf Llama 3.1 70B auf einem Spark. Unter der Überschrift „Run on two Sparks“ führt es LoRA auf dem 70B-Modell mit FSDP2 aus, per Sharding auf zwei DGX Spark verteilt, und seine Konfigurationsdateien für zwei Systeme decken auch ein vollständiges Fine-Tuning des 3B-Modells und LoRA auf dem 8B-Modell ab.

NVIDIAs NeMo-Playbook, aktualisiert am 4. September 2026, nennt dieselbe Spanne, Modelle mit etwa 1 bis 70B Parametern, und führt drei Rezepte auf einem Spark aus. Das PyTorch-Team von Meta zeigte im Februar 2026 einen vierten Fall, ein vollständiges Fine-Tuning von Llama 3.1 8B in BF16. Unsloth geht in seinem eigenen DGX-Spark-Leitfaden weiter und schreibt, seine Software ermögliche lokales Fine-Tuning von LLMs mit bis zu 200B Parametern.

METHODEEIN SPARKZWEI DGX SPARKQUELLE
Vollständiges Fine-TuningLlama 3.2 3B; Llama 3.1 8B in BF16Llama 3.2 3B, Konfigurations­dateiNVIDIA-PyTorch-Playbook; PyTorch-Blog, Februar 2026
LoRALlama 3.1 8B, Qwen3 8BLlama 3.1 8B und 70B mit FSDP2NVIDIA-Playbooks für PyTorch und NeMo
QLoRA, 4-Bit-BasisLlama 3.1 70B, Llama 3.3 70B Instruct; gpt-oss-120b mit etwa 68 GBkein Beispiel veröffentlichtNVIDIA-Playbooks für PyTorch und NeMo; Unsloth-Leitfaden

NVIDIA-Playbooks unter build.nvidia.com/spark und ihre READMEs in NVIDIAs Repository dgx-spark-playbooks, abgerufen am 9. Oktober 2026; PyTorch-Blog vom 2. Februar 2026; DGX-Spark-Leitfaden von Unsloth (ohne Datum).

Auf einem Spark erreicht NVIDIA 70B nur mit QLoRA. Bevor Sie überhaupt ein Fine-Tuning planen, prüfen Sie, ob dem Modell Wissen oder ein Verhalten fehlt, denn Ersteres behebt Retrieval zuverlässiger; unser Vergleich von Fine-Tuning und RAG legt die Belege dar.

Die Fine-Tuning-Playbooks: PyTorch, NeMo, Unsloth und LLaMA Factory

NVIDIAs Katalog unter build.nvidia.com/spark führt Fine-Tuning-Playbooks für NeMo, Unsloth, LLaMA Factory, Vision-Language-Modelle und FLUX.1-Bildmodelle. Das PyTorch-Playbook stand am 9. Oktober 2026 nicht in dieser Liste, und seine README liegt weiterhin in NVIDIAs Repository dgx-spark-playbooks auf GitHub. Jedes Playbook installiert ein Framework und führt einen Beispieljob aus, den Sie anschließend auf Ihren eigenen Datensatz richten.

Das PyTorch-Playbook zeigt NVIDIAs eigene Stufenleiter. Seine Skripte sind nach der Methode benannt, von Llama3_3B_full_finetuning.py bis Llama3_70B_qLoRA_finetuning.py. Voreingestellt sind BF16-Präzision, LoRA-Rang 8 und eine maximale Sequenzlänge von 2.048 Token, und NVIDIA veranschlagt 30 bis 45 Minuten für Einrichtung und einen ersten Lauf. Die README trägt als letztes Aktualisierungsdatum den 15. Januar 2025, ein Datum vor der Markteinführung des Produkts; wir zitieren sie deshalb mit dem Abrufdatum 9. Oktober 2026.

Das NeMo-Playbook nutzt NeMo AutoModel 26.08 im Container nvcr.io/nvidia/nemo-automodel:26.08, mit Rezepten, die NVIDIA als Spark-spezifische LoRA- und QLoRA-Rezepte bezeichnet. Seine drei Beispiele führen LoRA auf Llama 3.1 8B und Qwen3 8B und QLoRA auf Llama 3.3 70B Instruct aus, je 20 Schritte. Zum 70B-Rezept schreibt NVIDIA, es lade das Modell im 4-Bit-Modus und verwende die validierten Speichereinstellungen für Spark. Das Playbook empfiehlt, Batchgröße, Größe der gepackten Sequenzen, Attention, Activation Checkpointing und die Einstellungen zum Laden von Checkpoints aus diesen Rezepten beizubehalten, solange Sie keine anderen validiert haben. NVIDIA veranschlagt 45 bis 90 Minuten für Einrichtung und einen ersten Lauf.

Das Unsloth-Playbook, zuletzt aktualisiert am 15. Dezember 2025, deckt LoRA und QLoRA ab. Sein Beispiel lädt unsloth/Meta-Llama-3.1-8B-bnb-4bit, ein 8B-Modell in 4 Bit, sein Beispiel für eigene Läufe setzt eine Batchgröße von 4, und der Testlauf trainiert 60 Schritte; NVIDIA nennt 30 bis 60 Minuten für Einrichtung und diesen Lauf. Unsloths eigener Leitfaden gibt an, dass ein QLoRA-Fine-Tuning von gpt-oss-120b in 4 Bit rund 68 GB Unified Memory belegt.

Das LLaMA Factory-Playbook, zuletzt aktualisiert am 31. Juli 2026, bietet LoRA, QLoRA und vollständiges Fine-Tuning und nutzt als Beispiel einen LoRA-Lauf auf Qwen3. NVIDIA rät, mehr als 50 GB Speicherplatz für Modelle und Checkpoints einzuplanen, und nennt je nach Modellgröße und Datensatz 1 bis 7 Stunden Training.

Speicher je Methode in 128 GB

Die Modellzustände folgen derselben Rechnung wie in unserem Leitfaden zum GPU-Speicher für vollständiges Fine-Tuning, LoRA und QLoRA: 16 Byte pro Parameter für Adam in gemischter Präzision, 2 Byte pro eingefrorenem BF16-Gewicht und etwa 0,516 Byte pro Gewicht in 4-Bit-NF4 mit doppelter Quantisierung. Aktivierungen kommen hinzu und wachsen mit Batchgröße und Sequenzlänge. Das System zeigt etwa 119 bis 122 GiB der 128 GB an, und das Betriebssystem und Ihre übrigen Prozesse teilen sich diesen Pool; was in 128 GB auf einem DGX Spark passt erklärt, warum auf dieser Maschine kein Werkzeug eine VRAM-Zahl meldet.

Gemessen an diesem Pool braucht ein vollständiges Fine-Tuning eines 3B-Modells etwa 48 GB Modellzustände. Llama 3.1 8B mit 32-Bit-Adam braucht 128 GB, etwa den gesamten Speicher, den das System anzeigt, noch vor der ersten Aktivierung. LoRA mit Rang 16 auf allen linearen Schichten braucht für das 8B-Modell 16,7 GB, sodass der größte Teil des Speichers für den Batch bleibt. LoRA auf einer BF16-Basis eines 70B-Llama-Modells braucht 144,4 GB, was dazu passt, dass NVIDIA dieses Beispiel auf zwei DGX Spark ausführt. Per FSDP verteilt, sind es etwa 72,2 GB pro Spark, zuzüglich der Aktivierungen und der gerade zusammengeführten Parameter. QLoRA senkt dasselbe 70B-Modell auf etwa 42,8 GB, wodurch vom sichtbaren Speicher etwa 85 bis 88 GB für Aktivierungen, Betriebssystem und alles Übrige bleiben. NVIDIAs PyTorch-Skripte verwenden standardmäßig Rang 8, was diese Werte um weniger als 2 GB senkt.

Zwei Hinweise in NVIDIAs Playbooks betreffen diese Plattform. NVIDIAs Unsloth-README merkt an, dass DGX Spark eine Unified-Memory-Architektur (UMA) nutzt, und nennt für Speicherfehler, die unterhalb der Kapazität auftreten, sync; echo 3 > /proc/sys/vm/drop_caches, ausgeführt als root. Das NeMo-Playbook startet seinen Container mit einem Speicherlimit von 64 GB, --memory=64g, nach NVIDIAs Angabe das 64-GB-Limit, das für die Spark-Validierung mit weniger Speicher verwendet wird.

Wir liefern die DGX Spark Founders Edition mit 128 GB EU-weit. Nennen Sie uns das Basismodell, die Größe Ihres Datensatzes und die Methode im Formular unten, und wir antworten innerhalb eines Werktages, ob ein Spark oder zwei DGX Spark für den Lauf passen.

Vollständiges Fine-Tuning eines 8B-Modells auf einem Spark

Das PyTorch-Team von Meta veröffentlichte am 2. Februar 2026 ein vollständiges Fine-Tuning von Llama 3.1 8B Instruct auf einem DGX Spark, mit dem Single-Device-Rezept von torchtune. Der Lauf nutzte 11.000 Gesprächspaare aus dem ToolACE-Datensatz mit synthetischen Reasoning-Traces, eine Sequenzlänge von 16.384 Token, eine Batchgröße von 16, 3 Epochen und BF16. Das Team berichtet eine Spitze von rund 80 Prozent Speicherauslastung und im Schnitt rund 8 Stunden je Epoche.

Der Blog nennt den Optimierer nicht und verwendet eine eigene Konfigurationsdatei, fft-8b.yaml. Die Single-Device-Konfiguration, die torchtune für Llama 3.1 8B mitliefert, nutzt den 8-Bit-Optimierer PagedAdamW8bit aus bitsandbytes, führt den Optimiererschritt im Rückwärtsdurchlauf aus und schaltet Activation Checkpointing ein; die Datei kennzeichnet alle drei als Maßnahmen zum Speichersparen. Mit FP32-Mastergewichten und Adam-Momenten, der 16-Byte-Zählung gemischter Präzision, braucht dasselbe Modell 128 GB vor den Aktivierungen. Wenn Ihr Trainingsrezept 32-Bit-Optimiererzustände erwartet, planen Sie das vollständige 8B-Fine-Tuning für einen GPU-Server.

Trainingszeiten aus veröffentlichten Läufen

NVIDIAs Performance-Blog vom 24. Oktober 2025 meldet den Spitzendurchsatz beim Training auf einem Spark bei Sequenzen von 2.048 Token, einer Epoche und 64 Schritten. Seine Tabelle nennt 13.519,54 Token pro Sekunde für das vollständige 3B-Fine-Tuning, 6.969,59 für das 8B-LoRA und 759,79 für QLoRA auf Llama 3.3 70B. Der Fließtext des Blogs nennt für dieselben drei Läufe höhere Spitzenwerte, zum Beispiel 5.079,4 Token pro Sekunde für das 70B-QLoRA. Wir verwenden die Tabelle, die die Konfiguration angibt. NVIDIA ergänzt, keiner dieser Tuning-Workloads könne auf einer Consumer-GPU mit 32 GB laufen.

Bei 759,79 Token pro Sekunde dauert eine Million Trainings-Token im 70B-QLoRA-Lauf nach unserer Rechnung etwa 22 Minuten. Andere namentlich genannte Quellen geben tatsächliche Laufzeiten an. Unsloth meldet 1.000 Schritte und 4 Stunden RL-Training für gpt-oss-20b auf DGX Spark, ein Beispiel für Reinforcement Learning, das dem Modell das Spiel 2048 beibringt. Das vollständige 8B-Fine-Tuning von Meta dauerte etwa 8 Stunden je Epoche bei 16K Token. NVIDIAs Schätzung für LLaMA Factory liegt bei 1 bis 7 Stunden. Der Artikel zu zwei Knoten führt veröffentlichte Fine-Tuning- und Multi-Node-Werte für DGX Spark auf, darunter Unsloths Speicherwerte für ein 70B-LoRA auf zwei DGX Spark.

Was DGX Spark beim Training begrenzt

Die großen Matrixmultiplikationen des Trainings sind rechenlimitiert, wie unser Vergleich von H200 NVL und RTX PRO 6000 für Fine-Tuning herleitet, deshalb bestimmt die Tensor-Rate den Großteil des Tempos. Für DGX Spark nennt NVIDIA bis zu 1 PFLOP bei FP4, einen Wert, der laut Fußnote im Datenblatt Sparsity nutzt, und eine dichte BF16-Angabe von NVIDIA haben wir nicht gefunden. Für die H200 NVL nennt NVIDIA 1.671 BF16-TFLOPS mit Sparsity, halbiert 835,5 dicht. NVIDIAs RTX-PRO-Whitepaper nennt 503,8 dichte BF16-TFLOPS für die RTX PRO 6000 Workstation Edition; für die Server Edition haben wir keine dichte Angabe von NVIDIA gefunden.

Bei der Speicherbandbreite ist der Unterschied größer: DGX Spark hat 273 GB/s gegenüber 1.597 GB/s bei der RTX PRO 6000 Server Edition und 4,8 TB/s bei der H200 NVL. Nach der Überlegung desselben Vergleichs sind der Optimiererschritt, die Adapter-Multiplikationen und bei QLoRA die Dequantisierung jedes 4-Bit-Gewichts durch die Bandbreite begrenzt. Die gemessenen Benchmarks des DGX Spark zeigen die Wirkung der 273 GB/s auf die Generierung. Ein Spark führt außerdem jeweils nur einen schweren Job aus, da sich ein Trainingslauf und eine Serving-Engine dieselben 128 GB und dieselbe GPU teilen.

Zwei DGX Spark werden über ConnectX-7 mit 200 Gb/s pro Port verbunden, und NVIDIAs eigener RDMA-Test misst 189,85 Gb/s. Nach unserer Rechnung sind das etwa 24 GB/s, gegenüber 450 GB/s in jeder Richtung über eine Zweifach-NVLink-Bridge zwischen H200-NVL-Karten, und Läufe mit Sharding tauschen ihre Parameter über diese Verbindung aus.

DGX Spark oder GPU-Server für Fine-Tuning

DGX Spark passt zu einem Entwickler, der Daten vorbereitet, Rezepte testet und QLoRA bis 70B ausführt, wenn ein Lauf von Stunden oder über Nacht akzeptabel ist. NVIDIAs Produktseite beschreibt das System für KI-Entwicklung und -Tests am Schreibtisch. Ein GPU-Server passt zu einem Team, das nach Zeitplan neu trainiert, mehrere Experimente gleichzeitig ausführt oder LoRA auf einer BF16-Basis braucht.

WORKLOADEIN SPARKZWEI DGX SPARKGPU-SERVER
LoRA, 8B, Testläufepasst, 16,7 GB Zuständenicht nötigRTX PRO 6000 mit 86 GB frei
QLoRA, 70Bpasst, 42,8 GB Zuständekein Beispiel veröffentlichtRTX PRO 6000 mit 60 GB frei
LoRA, 32B, BF16-Basis67,7 GB Zustände, kein NVIDIA-Beispielkein Beispiel veröffentlichtRTX PRO 6000 mit 35 GB frei
LoRA, 70B, BF16-Basispasst nicht, 144,4 GBetwa 72,2 GB pro Sparkzwei H200 NVL mit NVLink
Voll, 8B, 32-Bit-Adampasst nicht, 128 GBkein Beispiel veröffentlichteine H200 NVL, 22 GB frei
Nachtraining nach Zeitplanlangsam, jeweils ein Joblangsam, jeweils ein JobServer auf Bestellung gebaut

Modellzustände ohne Aktivierungen, LoRA mit Rang 16 auf allen linearen Schichten, nach der Rechnung unseres Leitfadens zum GPU-Speicher; RTX PRO 6000 mit 95,6 GiB und H200 NVL mit 140,4 GiB, wie der Treiber sie meldet. Methoden je Plattform aus NVIDIAs Playbooks.

PyTorch, NeMo, Unsloth und LLaMA Factory laufen auch auf GPU-Servern, ein auf einem Spark getestetes Rezept zieht also mit seinen Frameworks auf den Server um. DGX Spark ist ein Arm-System, daher müssen Container und jede reine Binärabhängigkeit für die x86-Prozessoren des Servers gebaut oder bezogen werden. Für zwei oder mehr Karten verbindet die H200 NVL 2 oder 4 Karten per NVLink mit 900 GB/s pro GPU, was zu Läufen mit Sharding passt.

Wir bauen Trainings- und Fine-Tuning-Knoten auf Bestellung mit der RTX PRO 6000 Server Edition oder der H200 NVL mit NVLink-Bridges und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Modell, Methode und Datensatzgröße über das Formular unten.

Was wir liefern

Wir liefern die DGX Spark Founders Edition mit 128 GB, für einen Entwickler oder als zwei DGX Spark für 70B-LoRA-Läufe, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Wenn das Fine-Tuning zu Läufen nach Zeitplan übergeht, bauen wir KI-Server auf Bestellung mit der RTX PRO 6000 Server Edition oder der H200 NVL, mit schnellem NVMe-Scratch-Storage, montiert und im Burn-in getestet, mit Konfiguration und Angebot innerhalb eines Werktages. Wenn Sie auch die Plattform rund um das Training wünschen: MLOps auf Kubernetes mit KServe und Kubeflow und private LLMs in Ihrer Infrastruktur gehören zu unserem Service Private AI/ML, umgesetzt von unserem Engineering-Partner Vixen.UNO.

FAQ

Ist LLM-Fine-Tuning auf DGX Spark möglich?
Ja. NVIDIA nennt Fine-Tuning von Modellen bis 70 Milliarden Parameter und veröffentlicht Playbooks für PyTorch, NeMo, Unsloth und LLaMA Factory. Auf einem Spark zeigt NVIDIAs PyTorch-Playbook ein vollständiges Fine-Tuning von Llama 3.2 3B, LoRA auf Llama 3.1 8B und QLoRA auf Llama 3.1 70B.
Welche Modellgröße lässt sich auf einem DGX Spark feinabstimmen?
Bis 70 Milliarden Parameter mit QLoRA, das die eingefrorene Basis in 4 Bit speichert, nach unserer Rechnung mit etwa 42,8 GB Modellzuständen für Llama 3.3 70B. LoRA auf einer BF16-Basis reicht in NVIDIAs Beispielen bis 8B, ein vollständiges Fine-Tuning in NVIDIAs Playbook bis 3B und in einem Lauf, den das PyTorch-Team von Meta im Februar 2026 veröffentlichte, bis 8B in BF16.
Funktioniert Unsloth auf DGX Spark?
Ja. NVIDIA veröffentlicht ein Unsloth-Playbook für DGX Spark, das LoRA und QLoRA abdeckt und einen Testjob auf einem Llama 3.1 8B in 4 Bit in 30 bis 60 Minuten einschließlich Einrichtung ausführt. Unsloths eigener Leitfaden gibt an, dass QLoRA auf gpt-oss-120b rund 68 GB Unified Memory belegt.
Kann DGX Spark QLoRA auf einem 70B-Modell ausführen?
Ja. Sowohl NVIDIAs PyTorch-Playbook als auch sein NeMo-Playbook führen QLoRA auf einem 70B-Llama-Modell auf einem Spark aus. NVIDIA maß 759,79 Token pro Sekunde für QLoRA auf Llama 3.3 70B bei Sequenzen von 2.048 Token, das sind etwa 22 Minuten je Million Trainings-Token.
Wie lange dauert Training oder Fine-Tuning auf DGX Spark?
Das hängt von Modell, Methode und Datensatz ab. NVIDIAs LLaMA-Factory-Playbook veranschlagt 1 bis 7 Stunden Training, Unsloth meldet 4 Stunden für 1.000 Schritte Reinforcement Learning auf gpt-oss-20b in einem Beispiel, in dem das Modell ein Spiel lernt, und das PyTorch-Team von Meta brauchte etwa 8 Stunden je Epoche für ein vollständiges Fine-Tuning von Llama 3.1 8B bei Sequenzen von 16K Token.
Schaffen zwei DGX Spark LoRA auf einem 70B-Modell?
Ja. NVIDIAs PyTorch-Playbook enthält ein Beispiel mit zwei DGX Spark, das LoRA auf Llama 3.1 70B mit FSDP2 ausführt. Auf einer BF16-Basis kommen die Modellzustände nach unserer Rechnung auf etwa 144 GB, mehr als ein Spark fasst, oder etwa 72 GB pro Spark bei Sharding über zwei.

Schicken Sie uns das Basismodell, die Methode (vollständiges Fine-Tuning, LoRA oder QLoRA), die Größe Ihrer Trainingsdaten, die Sequenzlänge und wie oft Sie neu trainieren wollen. Wir antworten innerhalb eines Werktages mit den Speicherwerten für Ihren Lauf, mit der Angabe, ob ein Spark, zwei DGX Spark oder ein auf Bestellung gebauter GPU-Server dazu passt, und mit einem schriftlichen Angebot.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien