Embedding- und Reranker-Server für RAG: welche GPU, und wie viele für Millionen von Dokumenten
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Embedding-Modelle und Reranker für RAG sind klein: Qwen3-Embedding-0.6B belegt in BF16 rund 1,2 GB und das 8B-Modell rund 16 GB, deshalb entscheidet über ihre GPU der Durchsatz, nicht der Speicher
- NVIDIAs NIM-Dokumentation nennt für ihr 1B-Embedding-Modell in FP8 49,2 Texte mit 512 Token pro Sekunde auf einer L4 und 144,3 auf einer L40S (Version 1.14.0, 30. September 2026) sowie für einen 1B-Reranker 52,1 und 171,1 bewertete Passagen pro Sekunde (17. August 2026)
- Nach unserer Rechnung aus diesen Werten dauert das Embedding von 3 Millionen Chunks mit 512 Token auf einer L4 rund 17 Stunden und auf einer L40S rund 5,8 Stunden; bei 40 Passagen je Anfrage bewältigt eine L4 im Reranking rund 1,3 Anfragen pro Sekunde und eine L40S rund 4,3, mit drei parallelen Anfragen 4,5
- Text Embeddings Inference 1.9 hat Images für Ada-Karten wie die L4 und L40S und ein als experimentell gekennzeichnetes Image für Blackwell 12.0, die Compute Capability jeder RTX-PRO-Blackwell-Karte; NIM im Produktivbetrieb setzt NVIDIA AI Enterprise voraus
- Retrieval-Modelle können auf einer eigenen kleinen Karte laufen oder sich eine RTX PRO 6000 als MIG-Instanzen mit 24 GB teilen; die L4, L40S, RTX PRO 4000 und RTX PRO 2000 stehen nicht auf NVIDIAs MIG-Liste
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
GPU-Anforderungen für Embedding-Modelle und Reranker bei RAG
Die GPU-Anforderungen eines Embedding-Modells und eines Rerankers sind gering im Vergleich zu denen des Sprachmodells in einem RAG-System. Qwen3-Embedding-0.6B braucht in BF16 rund 1,2 GB für seine Gewichte und das 8B-Modell rund 16 GB, deshalb fasst eine Karte mit 24 GB wie die NVIDIA L4 die kleinen Modelle mit reichlich Reserve. Die GPU wird nach dem Durchsatz ausgelegt: Token pro Sekunde, wenn das Korpus eingebettet wird, und Anfragen pro Sekunde mal Passagen je Anfrage, wenn der Reranker Suchergebnisse bewertet.
Nach unserer Rechnung aus NVIDIAs Werten dauert das Embedding von 3 Millionen Chunks mit 512 Token mit einem 1B-Embedding-Modell auf einer L4 rund 17 Stunden und auf einer L40S rund 5,8 Stunden. Bei 40 Passagen je Anfrage und drei parallelen Anfragen bewältigt eine L4 im Reranking rund 1,3 Anfragen pro Sekunde und eine L40S rund 4,5. Ein Korpus mit einigen Millionen Chunks und einigen Anfragen pro Sekunde kann beide Modelle deshalb auf einer kleinen Karte oder einer MIG-Instanz neben dem LLM betreiben. Ein eigener Retrieval-Server lohnt sich bei Dutzenden Millionen Chunks oder bei einer vollständigen Neuindexierung, die innerhalb eines Wartungsfensters abgeschlossen sein muss.
Unser Leitfaden zu RAG auf Unternehmensdaten behandelt Zerlegung in Chunks, Berechtigungen und Evaluierung; dieser Artikel behandelt die Hardware der RAG-Infrastruktur.
Embedding- und Reranker-Modelle: Parameter, Dimensionen, Sprachen
Die folgenden Modelle sind mit Stand Oktober 2026 für mehrsprachige Korpora dokumentiert. NVIDIAs Embedding-Modell nennt 26 evaluierte Sprachen, darunter Deutsch, Französisch, Polnisch, Tschechisch und Ungarisch.
| MODELL | PARAMETER | VEKTORDIMENSIONEN | MAX. EINGABE | SPRACHEN, LIZENZ |
|---|---|---|---|---|
| Qwen3-Embedding-0. | 0,6B | 1.024, MRL | 32K Token | 100+; Apache 2.0 |
| Qwen3-Embedding-4B | 4B | 2.560, MRL | 32K Token | 100+; Apache 2.0 |
| Qwen3-Embedding-8B | 8B | 4.096, MRL | 32K Token | 100+; Apache 2.0 |
| BAAI bge-m3 | 568M | 1.024 dense, dazu sparse und Multi-Vektor | 8.192 Token | 100+; MIT |
| Embedding | 300M | 768, oder 512, 256, 128 | 2.048 Token | 100+; Gemma Terms of Use |
| llama-nemotron-embed-1b-v2 | 1B | 384 bis 2.048 | 8.192 Token | 26 evaluiert; NVIDIA Open Model License |
| Qwen3-Reranker 0.6B, 4B, 8B | 0,6B, 4B und 8B | keine, bewertet Paare | 32K Token | 100+; Apache 2.0 |
| bge-reranker-v2-m3 | 0,6B | keine, bewertet Paare | 512 im Beispiel der Model Card | mehrsprachig; Apache 2.0 |
Model Cards von Qwen, BAAI, Google und NVIDIA auf Hugging Face, abgerufen am 10. Oktober 2026; die 568M Gesamtparameter von bge-m3 aus NVIDIAs Support-Matrix für den Embedding-NIM, aktualisiert am 3. Oktober 2026. MRL: Der Vektor lässt sich kürzen (Matryoshka Representation Learning).
In BF16 belegen die Gewichte zwei Byte je Parameter, rund 1,2 GB für ein 0,6B-Modell, 8 GB für ein 4B-Modell und 16 GB für ein 8B-Modell. Eine Serving-Engine reserviert zusätzlich Speicher für ihre Batches: NVIDIAs Support-Matrix nennt 3,6 GB GPU-Speicher für das nicht optimierte Profil von llama-nemotron-embed-1b-v2 und 33 GB für bge-m3, dessen Gewichte nach unserer Rechnung in FP16 rund 1,1 GB belegen.
Eine Million float32-Vektoren mit 1.024 Dimensionen belegen vor jedem Index 4,10 GB, wie unser Vergleich der Vektordatenbanken für RAG zeigt, und 4.096 Dimensionen das Vierfache. Qwen3 Embedding, EmbeddingGemma und NVIDIAs Modell liefern auf Anforderung kürzere Vektoren; testen Sie eine kürzere Länge mit Ihrem Testsatz, bevor Sie den Index auslegen.
Serving-Engines: Text Embeddings Inference, vLLM und NVIDIA NIM
Text Embeddings Inference (TEI) von Hugging Face stellt Embedding-Modelle mit Qwen3-, Gemma3-, XLM-RoBERTa-, BERT- und weiteren Architekturen bereit und als Re-Ranker Modelle zur Sequenzklassifikation auf Basis von CamemBERT und XLM-RoBERTa. Jede GPU-Architektur hat ihr eigenes Image, mit Stand Oktober 2026 in Version 1.9: das Image 89- für Ada-Karten wie die L4 und L40S, hopper- für Hopper und 120- für Blackwell 12.0, als experimentell gekennzeichnet und mit GeForce-Beispielen aufgeführt. NVIDIAs Liste der CUDA-GPUs nennt Compute Capability 12.0 für jede RTX-PRO-Blackwell-Karte, die wir liefern, deshalb läuft TEI auf diesen Karten aus diesem experimentellen Image.
Für die Auslegung zählt --max-batch-tokens mit dem Standardwert 16.384, und die Dokumentation nennt den Parameter „eine entscheidende Stellgröße, um die maximale Nutzung der verfügbaren Hardware zu ermöglichen“, die TEI nicht automatisch setzen kann. --auto-truncate steht standardmäßig auf true; ein Chunk, der länger als die maximale Eingabe des Modells ist, wird also gekürzt statt abgewiesen, was bei EmbeddingGemma mit 2.048 Token ins Gewicht fällt.
vLLM betreibt Embedding- und Scoring-Modelle in seinem Pooling-Runner, mit den Endpunkten /v1/embeddings, /score und /rerank. Die Model Cards von Qwen verlangen für beide Qwen3-Serien vLLM 0.8.5 oder neuer. Der Qwen3-Reranker ist ein Sprachmodell, das jedes Paar aus Anfrage und Passage über die Wahrscheinlichkeit der Token „yes“ und „no“ bewertet; er gehört nicht zu den aufgeführten Re-Ranker-Architekturen von TEI und läuft deshalb auf vLLM.
Die NIM-Container von NVIDIA NeMo Retriever bieten eine OpenAI-kompatible API. Für llama-nemotron-embed-1b-v2 und die Modelle rerank-1b-v2 und 500m-v2 nennen die Support-Matrizen optimierte FP16- und FP8-Profile nach Compute Capability 12.0, 10.0, 9.0 und 8.9, was die L4, die L40S und die RTX-PRO-Blackwell-Karten abdeckt. NVIDIAs NIM-FAQ hält fest: „Die Nutzung von NIM in der Produktion erfordert eine Lizenz für NVIDIA AI Enterprise.“
Veröffentlichter Durchsatz auf L4, L40S und RTX PRO 6000
Die Werte, die wir für Embedding und Reranking auf den Karten gefunden haben, die wir liefern, stammen von NVIDIAs NIM-Performance-Seiten. Die aktuelle Embedding-Seite, aktualisiert am 3. Oktober 2026, verwendet „eine separate synthetische AIPerf-Benchmark-Matrix“ und führt die L4 nicht mehr auf; die Zeilen für L4 und L40S zum 1B-Textmodell, das jene Seite Llama Nemotron Embed 1B nennt, stammen deshalb aus der Dokumentation der NIM-Version 1.14.0, aktualisiert am 30. September 2026. Vergleichbare veröffentlichte Werte für die Qwen3- oder BGE-Modelle auf diesen Karten haben wir nicht gefunden.
| MODELL, PRÄZISION | GPU | ANFRAGE | DURCHSATZ | MITTL. LATENZ |
|---|---|---|---|---|
| Embed 1B, FP8 | L4 | 64 Texte mit 512 Token | 49,2 Texte/s | 1.300 ms |
| Embed 1B, FP8 | L40S | 64 Texte mit 512 Token | 144,3 Texte/s | 443 ms |
| Embed VL 1B v2, FP8 | L40S | 64 Texte mit 512 Token | 159,3 Texte/s | 395 ms |
| Embed VL 1B v2, gemischt | RTX PRO 6000 Server | 64 Texte mit 512 Token | 156,6 Texte/s | 402 ms |
| Nemotron 3 Embed 1B, NVFP4 | RTX PRO 6000 Server | 64 Texte mit 512 Token | 511,4 Texte/s | 118 ms |
| Rerank 1B, FP8 | L4 | 40 Passagen mit 512 Token | 52,1 Passagen/s | 768 ms |
| Rerank 1B, FP8 | L40S | 40 Passagen mit 512 Token | 171,1 Passagen/s | 234 ms |
| Rerank 500m, FP8 | L40S | 40 Passagen mit 512 Token | 297,0 Passagen/s | 134 ms |
| Rerank VL 1B v2, FP8 | RTX PRO 6000 Server | 40 Passagen mit 514 Token | 246,1 Passagen/s | 161 ms |
Performance-Seiten des NVIDIA NeMo Retriever Embedding NIM für Version 1.14.0 (aktualisiert am 30. September 2026, Zeilen Embed 1B) und latest (aktualisiert am 3. Oktober 2026, übrige Embedding-Zeilen) sowie Performance-Seite des Reranking NIM (aktualisiert am 17. August 2026), abgerufen am 10. Oktober 2026; jeweils eine Anfrage zur Zeit.
Beim Embedding mit 512 Token verarbeitet die L40S 2,9-mal so viele Texte wie die L4 und beim Reranking 3,3-mal so viele Passagen. Die RTX PRO 6000 Server Edition liegt mit gemischter Präzision beim VL-Modell gleichauf mit der L40S. Mit Nemotron 3 Embed 1B in NVFP4 verarbeitet sie 511,4 Texte pro Sekunde, rund das 3,5-Fache der L40S-Zeile für Embed 1B, wobei die beiden Zeilen unterschiedliche Modelle verwenden. Das Embedding einer Suchanfrage ist eine leichte Last, und die L4-Tabelle nennt 13 ms für eine Anfrage mit 20 Token.
Wie lange die Indexierung dauert: Dokumente, Chunks und Token
Die Indexierung ist eine einmalige Spitze, die vollständig wiederholt wird, sobald sich das Embedding-Modell ändert, und sie wird in vier Schritten geschätzt.
- Lassen Sie Ihren Chunker über eine Stichprobe laufen und ermitteln Sie die durchschnittliche Zahl der Chunks je Dokument.
- Zählen Sie die durchschnittlichen Token je Chunk mit dem Tokenizer des Embedding-Modells.
- Teilen Sie die Gesamtzahl der Chunks durch den Durchsatz Ihres Modells auf der infrage kommenden Karte, aus einem veröffentlichten Wert oder einem Test mit Ihren eigenen Chunks.
- Rechnen Sie das Parsing der Dokumente und OCR hinzu, die separat laufen und oft länger dauern, sowie die Schreibvorgänge in die Vektordatenbank.
Wie in unserem Vergleich der Vektordatenbanken ergeben 300.000 Dokumente mit je zehn Chunks 3 Millionen Chunks. Bei je 512 Token sind das 1,54 Milliarden Token. Nach unserer Schätzung aus dem Durchsatz oben dauert der vollständige Lauf mit Embed 1B in FP8 auf einer L4 rund 17 Stunden und auf einer L40S 5,8 Stunden. Eine RTX PRO 6000 Server Edition braucht mit dem VL-Modell bei gemischter Präzision rund 5,3 Stunden und mit Nemotron 3 Embed 1B in NVFP4 rund 1,6 Stunden.
Ein 8B-Embedding-Modell leistet je Token ein Mehrfaches der Rechenarbeit dieser 1B-Modelle; planen Sie seinen vollständigen Lauf deshalb in Tagen statt in Stunden und testen Sie es vorher. Nach dem ersten Lauf werden nur neue und geänderte Dokumente eingebettet, eine kleine Last für jede dieser Karten.
Den Reranker auslegen: Anfragen pro Sekunde und Passagen
Ein Reranker bewertet jede abgerufene Passage gegen die Anfrage; seine Last ist deshalb Anfragen pro Sekunde mal Passagen je Anfrage, bei der Tokenlänge von Anfrage plus Passage. In NVIDIAs Werten für 40 Passagen mit 512 Token bewältigt der 1B-Reranker auf einer L4 bei drei parallelen Anfragen (Concurrency 3) 52,7 Passagen pro Sekunde, rund 1,3 Anfragen pro Sekunde. Auf einer L40S sind es 181,6, rund 4,5 Anfragen pro Sekunde, und mit dem 500m-Modell auf der L40S 389, rund 9,7.
Unser Artikel zum privaten ChatGPT-Server nach Unternehmensgröße verwendet Beispielwerte, die für 500 Mitarbeiter 1.200 Anfragen in der Spitzenstunde und einen Spitzenfaktor von 2 ergeben. Mit einem Abruf je Anfrage sind das in der Spitze rund 0,67 Anfragen pro Sekunde, die eine L4 abdeckt. Für 2.000 Mitarbeiter ergeben dieselben Werte rund 2,7 Anfragen pro Sekunde, mehr als die L4 bewältigt und im Rahmen der L40S. Ein Agent, der je Antwort mehrmals sucht, vervielfacht die Rate.
Jede Antwort wartet außerdem auf den Reranker, bevor das LLM beginnt: in NVIDIAs Tabellen mit einer Anfrage zur Zeit 768 ms für 40 Passagen auf der L4 und 234 ms auf der L40S. Mit drei parallelen Anfragen, der Einstellung hinter den Anfragen pro Sekunde oben, nennen die Tabellen 2.254 ms und 652 ms. Weniger Passagen je Anfrage verringern Last und Wartezeit.
Wir liefern die L4, die L40S und die RTX-PRO-Karten für Retrieval-Modelle, als Karten für Ihre Server oder in nach Auftrag gebauten KI-Servern. Nennen Sie uns Ihre Dokumentenzahl, die Chunk-Länge und die Spitzenzahl der Anfragen pro Sekunde, und wir legen die Karten danach aus.
Eine eigene Karte oder eine MIG-Instanz auf der LLM-GPU
Die erste von drei Platzierungen gibt den Retrieval-Modellen eine eigene kleine Karte im LLM-Server: die passive Low-Profile-L4 mit 72 W, die RTX PRO 4000 SFF mit 70 W, die RTX PRO 2000 mit 16 GB und 70 W oder die RTX PRO 4500 mit 32 GB. Die zweite ist MIG auf der LLM-Karte. NVIDIAs MIG-Leitfaden nennt bis zu vier Instanzen mit 24 GB auf jeder Edition der RTX PRO 6000 und bis zu sieben auf der H200 NVL, jede mit eigenem Speicher und eigener Fehlerisolierung, wie unser Leitfaden zum GPU-Sharing mit MIG, Time-Slicing und MPS erklärt.
Die dritte ist der Betrieb der Engines nebeneinander auf einer Karte ohne Partitionierung. Jede Engine reserviert dann ihren eigenen Anteil am Speicher, und sie konkurrieren um Rechenleistung; lassen Sie eine vollständige Neuindexierung deshalb nachts oder auf einer separaten Karte laufen. NVIDIA veröffentlicht für diese Modelle keinen Durchsatz für eine MIG-Instanz oder für die RTX PRO 2000, 4000 und 4500; testen Sie Ihr Modell deshalb auf der Konfiguration, die Sie planen.
Beispielkonfigurationen nach Korpusgröße und Anfragelast
| KORPUS UND LAST | VOLLINDEX, SCHÄTZUNG | RERANKING-KAPAZITÄT | KONFIGURATION |
|---|---|---|---|
| 3 Mio. Chunks, 1 Anfrage/s | 17 h auf L4, 5,8 h auf L40S | L4: 1,3 Anfragen/s | eine L4 im LLM-Server oder eine MIG-Instanz mit 24 GB auf einer RTX PRO 6000 (testen) |
| 3 Mio. Chunks, 4 Anfragen/s | 5,8 h auf L40S | L40S: 4,5 mit 1B, 9,7 mit 500m | eine L40S für beide Modelle, der 500m-Reranker für Reserve |
| 30 Mio. Chunks, 4 Anfragen/s | 58 h auf einer L40S, 16 h auf einer RTX PRO 6000 in NVFP4 | wie oben | zwei L40S in einem Retrieval-Server oder eine RTX PRO 6000 Server Edition |
| Qwen3-8B-Paar, jedes Korpus | ein Mehrfaches der 1B-Zeit; testen | kein veröffentlichter Wert | eine L40S mit 48 GB oder zwei MIG-Instanzen mit 24 GB |
Unsere Schätzungen: Chunks mit 512 Token geteilt durch die oben veröffentlichten Texte pro Sekunde; Reranking bei 40 Passagen je Anfrage und drei parallelen Anfragen. Parsing, OCR und Schreibvorgänge in die Datenbank nicht enthalten. Die 32 GB BF16-Gewichte des 8B-Paars wie in unserem Artikel zur Unternehmensgröße.
Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen, und liefern Konfiguration und Angebot innerhalb eines Werktages. Schicken Sie uns Korpusgröße und Anfragelast über das Formular unten; grobe Schätzwerte genügen.
Was wir liefern
Wir liefern die Karten für Retrieval-Modelle, die L4, L40S, RTX PRO 2000, 4000, 4000 SFF und 4500, sowie die RTX PRO 6000 und H200 NVL für MIG neben dem LLM, als professionelle NVIDIA-GPUs oder in nach Auftrag gebauten KI-Servern. Die Server sind im Burn-in getestet, mit Herstellergarantie auf jede Komponente, unter einem EU-Vertrag und auf einer Rechnung, und Lizenzen für NVIDIA AI Enterprise für NIM kommen auf dieselbe Rechnung. Die RAG-Plattform selbst, mit Assistenten, die die Quelle angeben und die Zugriffsrechte jedes Nutzers beachten, ist unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Wie viel GPU-Speicher braucht ein Embedding-Modell?
Wie lange dauert es, Embeddings für eine Million Dokumente zu berechnen?
Welche GPU braucht ein Reranker?
Kann das Embedding-Modell auf derselben GPU wie das LLM laufen?
Läuft Text Embeddings Inference auf RTX-PRO-Blackwell-GPUs?
Welches Embedding-Modell eignet sich für mehrsprachige Unternehmensdokumente?
Schicken Sie uns die Zahl der Dokumente, die durchschnittliche Zahl und Länge der Chunks, die Embedding- und Reranker-Modelle, die Sie in Betracht ziehen, die Spitzenzahl der Anfragen pro Sekunde und die Server, die Sie betreiben. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages