GPU-Server für Videoanalyse: wie viele Kameras pro GPU mit L4, L40S und den RTX-PRO-Karten
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Eine GPU für Videoanalyse wird zuerst durch ihre Hardware-Videodecoder (NVDEC) begrenzt und dann durch die Inferenz je analysiertem Bild; der GPU-Speicher ist bei CNN-Detektoren selten die erste Grenze
- Die L4 hat 4 NVDEC-Engines und 4 JPEG-Decoder bei 72 W in einer Single-Slot-Karte mit halber Bauhöhe, die L40S 3 Decoder bei 350 W, die RTX PRO 6000 Server Edition 4 Blackwell-Decoder bei bis zu 600 W
- In NVIDIAs Dokumentation zu DeepStream 7.1 verarbeitete eine L4 68 H.264- oder 81 H.265-Streams mit 1080p und 30 Bildern pro Sekunde, mit einem ResNet18-Detektor auf jedem Bild, einem Tracker und zwei Klassifikatoren
- NVIDIAs Dokumentation zu DeepStream 9.1 (aktualisiert am 28. Juli 2026) nennt 1.524 Bilder pro Sekunde für PeopleNet 2.6.3 mit Tracker auf der RTX PRO 6000 Server Edition und 1.114 auf der L40S; werden 10 von 30 Bildern analysiert, sind bis zu etwa dreimal so viele Kameras möglich
- Nach unserer Schätzung für Kameras mit 1080p30 braucht ein leichter Detektor auf jedem Bild eine L4 für 16 Kameras, zwei für 64 und sechs für 256; PeopleNet auf 10 von 30 Bildern braucht eine RTX PRO 6000 Server Edition für 64 und drei für 256
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
GPU für Videoanalyse: zuerst die Decoder, dann die Inferenz
Eine GPU für Videoanalyse wird zuerst durch ihre Hardware-Videodecoder begrenzt, die NVDEC-Engines, die jeden H.264- oder H.265-Stream wieder in Einzelbilder umwandeln, und danach durch die Inferenzarbeit je analysiertem Bild. Für die CNN-Detektoren, die in den meisten Kamera-Pipelines laufen, ist der GPU-Speicher selten die erste Grenze. NVIDIA veröffentlicht die Decodierrate je NVDEC-Engine und die Zahl der Engines je Karte, eine vollständige DeepStream-Messung für die L4 und Bilder pro Sekunde für größere Modelle auf der L40S und der RTX PRO 6000.
Nach diesen Werten brauchen 16 Kameras eine Karte, 64 Kameras eine oder zwei Karten und 256 Kameras drei bis sechs, je nach Modell und der Zahl der Bilder pro Sekunde, die es analysiert. Die Kamerazahlen sind unsere Schätzungen aus NVIDIAs Werten, mit Quellen und Methode unter jeder Tabelle.
NVDEC, NVENC und JPEG-Decoder auf L4, L40S und den RTX-PRO-Karten
Im Standardmodus von DeepStream decodiert das Decoder-Plug-in jedes Bild jedes Streams, ob das Modell es analysiert oder nicht. Die Decodierlast folgt daher der Bildrate der Kameras, nicht der Analyserate.
| GPU | NVDEC UND NVENC | LEISTUNG, KÜHLUNG | BAUFORM | 1080P30-DECODIERUNG |
|---|---|---|---|---|
| NVIDIA L4 | 4 und 2, dazu 4 JPEG-Decoder | 72 W, passiv | halbe Bauhöhe, Single Slot | 120 H.264, 218 H.265 |
| NVIDIA L40S | 3 und 3 | 350 W, passiv | volle Bauhöhe, Dual Slot | 90 H.264, 164 H.265 |
| RTX PRO 6000 Server Edition | 4 und 4 | bis zu 600 W, passiv | volle Bauhöhe, Dual Slot (Luft) | 289 H.264, 249 H.265 |
| RTX PRO 5000 | 3 und 3 | 300 W, aktiv | volle Bauhöhe, Dual Slot | 217 H.264, 187 H.265 |
| RTX PRO 4500 | 2 und 2 | 200 W, aktiv | volle Bauhöhe, Dual Slot | 144 H.264, 124 H.265 |
| RTX PRO 4000 | 2 und 2 | 145 W, aktiv | volle Bauhöhe, Single Slot | 144 H.264, 124 H.265 |
| RTX PRO 4000 SFF | 2 und 2 | 70 W, aktiv | halbe Bauhöhe, Dual Slot | 144 H.264, 124 H.265 |
| RTX PRO 2000 | 1 und 1 | 70 W, aktiv | 2,7 × 6,6 Zoll, Dual Slot | 72 H.264, 62 H.265 |
NVIDIA-Produktseiten, gelesen am 9. Oktober 2026; NVENC-Anzahl laut NVIDIAs Support-Matrix des Video Codec SDK, gelesen am selben Tag. Nur die Seite der L4 nennt JPEG-Decoder. NVIDIA führt außerdem eine flüssigkeitsgekühlte Server Edition im Single-Slot-Format. Decodiergrenze in der letzten Spalte: unsere Rechnung, Engines × NVIDIAs Richtwert je Engine bei 1920 × 1080 (NVDEC Application Note, Video Codec SDK 13.1) ÷ 30 Bilder pro Sekunde, eine Obergrenze, keine Streamzahl.
Die NVDEC Application Note zum Video Codec SDK 13.1 nennt Richtwerte je Engine bei 1920 × 1080 in 4:2:0: 903 Bilder pro Sekunde für H.264 und 1.641 für H.265 auf Ada sowie 2.172 und 1.872 auf Blackwell. NVIDIA hat sie beim höchsten Videotakt gemessen, 2.160 MHz auf Ada und 2.362 MHz auf Blackwell, und schreibt, die Leistung „sollte entsprechend den Videotakten skalieren, die nvidia-smi auf der Ziel-GPU meldet“, und variiere zwischen GPU-Klassen. Die letzte Spalte ist daher eine Obergrenze. Auf der L4 erreichte NVIDIAs eigener DeepStream-Lauf 68 H.264-Streams gegenüber den 120 der Rechnung.
Alle acht Karten kodieren laut Support-Matrix AV1, und die Seite der L40S gibt an, dass ihre Engines AV1-Encoding und -Decoding umfassen. Die vier JPEG-Decoder der L4 dienen Kameras, die MJPEG oder Standbilder senden, Formate, die das DeepStream-Decoder-Plug-in neben H.264, H.265 und AV1 unterstützt. Unser Vergleich der 70-W-Karten behandelt die L4 und die RTX PRO 4000 SFF im Detail.
Streamzahlen für Kameras, die NVIDIA für DeepStream veröffentlicht
Von den Karten in diesem Artikel haben wir nur für die L4 eine veröffentlichte Streamzahl gefunden. Die Performance-Seite der Dokumentation zu DeepStream 7.1, zuletzt aktualisiert am 15. September 2025, ließ 1080p-Dateien mit 30 Bildern pro Sekunde durch einen per Pruning verkleinerten ResNet18-Detektor TrafficCamNet auf jedem Bild laufen, einen IOU-Tracker mit 960 × 544 und zwei ResNet18-Fahrzeugklassifikatoren. Auf einem System mit AMD EPYC 7763 und NVIDIAs INT8-Beispielkonfiguration verarbeitete eine L4 68 H.264-Streams bei 75,74 Prozent GPU- und 8,06 Prozent CPU-Auslastung und 81 H.265-Streams bei 100 Prozent GPU- und 46,1 Prozent CPU-Auslastung. Mit H.264 hatte die GPU noch Reserven, was darauf hindeutet, dass die Decoder die Grenze waren; mit H.265 füllte die Inferenzarbeit zuerst die GPU. NVIDIA sagt nicht, welche Einheit die jeweilige Grenze setzte.
Die Dokumentation zu DeepStream 9.1, zuletzt aktualisiert am 28. Juli 2026, nennt stattdessen Bilder pro Sekunde je GPU, End-to-End gemessen, „unter Berücksichtigung von Videoerfassung und Decodierung, Vorverarbeitung, Batching, Inferenz und Nachverarbeitung“, mit der 1080p-H.265-Beispieldatei und abgeschaltetem Rendering. Sie gibt nicht an, wie viele Streams diese Werte erzeugt haben.
| MODELL, TRACKER | EINGABE INS MODELL | PRO 6000 SE | PRO 6000 WS | L40S |
|---|---|---|---|---|
| PeopleNet 2.6.3, MV3DT | 640 × 640, FP16 | 1.524 | 1.899 | 1.114 |
| RT-DETR, kein Tracker | 640 × 640, FP16 | 1.037 | 1.063 | 643 |
| Traffic | 544 × 960, FP16 | 920 | 994 | 643 |
| Grounding-DINO, kein Tracker | 544 × 960, FP16 | 159 | 178 | 107 |
NVIDIA-Dokumentation zu DeepStream 9.1, Performance, dGPU pretrained models, Bilder pro Sekunde je GPU mit TensorRT, zuletzt aktualisiert am 28. Juli 2026. TL steht für TrafficCamNet Transformer Lite. NVIDIA nennt in dieser Tabelle keine Werte für die L4 oder die RTX PRO 4000.
Durch 30 geteilt entspricht der PeopleNet-Wert etwa 50 Kameras, die mit voller Bildrate analysiert werden, auf einer RTX PRO 6000 Server Edition und 37 auf einer L40S. Bei 10 analysierten Bildern pro Sekunde steigen die Zahlen um bis zu etwa das Dreifache, da Decodierung und Tracker weiterhin jedes Bild verarbeiten. Open-Vocabulary-Detektoren wie Grounding-DINO laufen mit etwa einem Zehntel dieser Rate. Die Fußnote zu den „1.040 gleichzeitigen AV1-Videostreams mit 720p30“ auf NVIDIAs L4-Seite beschreibt einen AV1-Encoding-Lauf auf einem Server mit acht L4-Karten; für die Analyse gilt der Wert daher nicht.
So dimensionieren Sie einen Server für Videoanalyse
Dimensionieren Sie Decodierung und Inferenz getrennt und richten Sie sich nach dem größeren Bedarf.
- Decodierlast: Kameras × die Bildrate, die sie senden, je Codec und Auflösung. Vergleichen Sie sie mit der Decodiergrenze in der ersten Tabelle und mit NVIDIAs gemessenem L4-Wert, und bleiben Sie deutlich unter der Obergrenze.
- Inferenzlast: Kameras × die Bilder pro Sekunde, die das Modell analysiert. In DeepStream legt die Eigenschaft
intervaldes Inferenz-Plug-ins die „Anzahl aufeinanderfolgender Batches, die bei der Inferenz übersprungen werden“ fest,interval=2analysiert also eines von drei Bildern, 10 von 30. Der Tracker erhält die übersprungenen Bilder trotzdem und verfolgt die Objekte darauf ohne neue Detektionen. - Teilen Sie die Inferenzlast durch die Bilder pro Sekunde, die NVIDIA für dasselbe oder ein ähnliches Modell auf der Karte veröffentlicht, und planen Sie bis etwa 70 Prozent davon, mit Reserve für Spitzen und Wachstum.
- Prüfen Sie CPU, Arbeitsspeicher, Netzwerk und Stromversorgung des Servers, wie unten beschrieben.
Zwei Decoder-Einstellungen verringern die Arbeit weiter. Die Einstellung drop-frame-interval des Decoders gibt nur jedes n-te Bild weiter, „ein Wert von 5 bedeutet, dass der Decoder jedes fünfte Bild ausgibt“; das spart die Arbeit nach dem Decoder, aber nicht das Decodieren, dimensionieren Sie die Decoder also für die volle Bildrate. skip-frames mit dem Wert decode_key decodiert nur Keyframes, die analysierte Rate folgt dann dem Keyframe-Intervall der Kameras; das passt zu Szenen, die sich langsam ändern. Nach Pixelzahl braucht ein 4K-Stream etwa viermal so viel Decodierkapazität wie ein 1080p-Stream; das ist unsere Annahme, da die Application Note nur Werte für 1080p nennt.
Kameras pro GPU: Konfigurationen für 16, 64 und 256 Kameras
Die Tabelle wendet diese Methode auf 1080p-Kameras mit 30 Bildern pro Sekunde an, mit zwei Pipelines: einem leichten CNN-Detektor mit Tracker und Klassifikatoren auf jedem Bild, wie in NVIDIAs L4-Messung, und PeopleNet 2.6.3 mit MV3DT, NVIDIAs Multi-View-3D-Tracker, auf 10 von 30 Bildern.
| KAMERAS, 1080P30 | BILDER PRO SEKUNDE | CNN, ALLE BILDER | PEOPLENET, 10 FPS |
|---|---|---|---|
| 16 Kameras | 480 decodiert, 480 oder 160 analysiert | 1 L4 | 1 L40S oder eine L4 nach einem Test mit Ihrem Modell |
| 64 Kameras | 1.920 decodiert, 1.920 oder 640 analysiert | 2 L4 | 1 RTX PRO 6000 Server Edition oder 1 L40S bei H. |
| 256 Kameras | 7.680 decodiert, 7.680 oder 2.560 analysiert | 6 L4 | 3 RTX PRO 6000 Server Edition oder 4 L40S bei H. |
Unsere Schätzungen, keine Messungen: L4-Anzahl aus NVIDIAs 68 H.264-Streams je Karte (DeepStream 7.1), die übrigen Karten aus den Bildern pro Sekunde von DeepStream 9.1 und den Decodiergrenzen in der ersten Tabelle, jeweils auf etwa 70 Prozent geplant, unter der Annahme, dass die Inferenzarbeit mit den analysierten Bildern skaliert. NVIDIA veröffentlicht keinen PeopleNet-Wert für die L4.
Die PeopleNet-Spalte nennt größere Karten, weil NVIDIA die Rate dieses Modells nur für sie veröffentlicht. Bei H.264-Kameras würden 64 Streams etwa 71 Prozent der Decodier-Obergrenze einer L40S belegen, daher nennt die Tabelle die L40S nur für H.265-Kameras; die RTX PRO 6000 Server Edition mit vier Blackwell-Decodern bewältigt beide Codecs. Für einen kleinen Standort ohne Server-Luftstrom hat die RTX PRO 4000 SFF zwei Blackwell-Decoder bei 70 W in einer Karte mit eigenem Lüfter, doch NVIDIA veröffentlicht keinen DeepStream-Wert für sie; testen Sie Ihr Modell also zuerst darauf.
Wir bauen GPU-Server für diese Kamerazahlen nach Auftrag und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Kamerazahl, Codecs und Modelle über das Formular unten, und Sie erhalten innerhalb eines Werktages eine Konfiguration.
CPU, Arbeitsspeicher, Netzwerk und Strom rund um die Karten
Die CPU empfängt und parst die RTSP-Streams. In NVIDIAs L4-Lauf auf einem AMD EPYC 7763 hielten 81 H.265-Streams die CPU bei 46,1 Prozent und 68 H.264-Streams bei 8,06 Prozent; der Codec verändert die CPU-Last also erheblich. Einen NVIDIA-Wert für Kerne je Stream haben wir nicht gefunden, planen Sie den Prozessor daher nach einem Testlauf. Jedes decodierte 1080p-Bild in NV12 belegt etwa 3,1 MB (1920 × 1080 × 1,5 Byte), und die Pipeline hält mehrere davon je Stream vor, der GPU-Speicher wächst also mit der Kamerazahl; NVIDIAs L4-Läufe mit 68 und 81 Streams passten in die 24 GB der Karte.
Planen Sie das Netzwerk aus der Bitrate der Kameras mal der Kamerazahl, dazu den Uplink zum Videomanagementsystem. Bei der Leistung ziehen sechs L4 432 W, vier L40S 1.400 W und drei Karten der RTX PRO 6000 Server Edition bis zu 1.800 W, jeweils ohne Prozessoren und Lüfter. Die L4, die L40S und die luftgekühlte Server Edition sind passiv gekühlt und brauchen den Luftstrom des Servers. Unser Artikel dazu, wie viele GPUs in einen Server passen, behandelt PCIe-Lanes, Netzteile und Luftstrom, und unser Vergleich von L4 und L40S nennt die Zahl der L4 je Servermodell.
Videosuche und Zusammenfassung mit Vision-Language-Modellen
Suche und Zusammenfassungen über aufgezeichnetes Video nutzen Vision-Language-Modelle und ein LLM, die die Grenze von den Decodern zum Speicher verschieben. NVIDIAs Blueprint Video Search and Summarization (VSS) gibt auf seiner Seite zu den Voraussetzungen, aktualisiert am 16. Juli 2026, an, es sei auf der H100, der RTX PRO 6000 Blackwell, der L40S, DGX Spark, IGX Thor und AGX Thor „validiert und getestet“ worden, und führt die RTX PRO 4500 Blackwell mit dem Vermerk „eingeschränkte Unterstützung für das Alerts-Profil“. Sein Basisprofil für die Entwicklung läuft auf einer RTX PRO 6000 Blackwell, auf der sich die Modelle die GPU teilen, oder auf zwei mit dedizierten GPUs; die L40S braucht zwei. Das Suchprofil braucht drei bis vier RTX PRO 6000 oder vier L40S, wenn alle Modelle lokal laufen. NVIDIA nennt außerdem als Minimum eine x86-CPU mit 18 Kernen, 128 GB RAM, eine SSD mit 1 TB und eine Netzwerkschnittstelle mit 1 Gbps. Für DGX Spark und die Thor-Plattformen nennt die Seite nur Konfigurationen, bei denen das LLM entfernt läuft. Das Deployment offener und kommerzieller Modelle on-premise ist Teil unserer Leistung Private AI/ML.
Wir bauen KI-Server mit Karten der RTX PRO 6000 Server Edition oder L40S für diese Profile nach Auftrag. Schreiben Sie uns die Stunden Video und die Fragen, die Ihre Teams daran stellen würden.
Datenschutz und Sicherheit eines Videoanalyse-Servers
Videos, auf denen Personen identifizierbar sind, sind personenbezogene Daten im Sinne der DSGVO, und ob und wie sie analysiert werden dürfen, ist eine Bewertung für die Rechtsabteilung des Unternehmens. Technisch sollten Sie die Kameras in einem eigenen Netzwerksegment betreiben, dem Analyse-Server nur die Zugriffe geben, die er braucht, und seinen Management-Controller, die Treiber und die Container-Runtime härten, wie in unserem Leitfaden zum Absichern eines GPU-Servers beschrieben.
Was wir liefern
Wir liefern die NVIDIA L4 und L40S, die RTX PRO 6000 Server Edition sowie die RTX PRO 2000, 4000, 4000 SFF, 4500 und 5000 als GPUs für Server, die Sie bereits betreiben, oder in auf Bestellung gebauten KI-Servern, montiert und im Burn-in getestet, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Vor Ihrer Bestellung bestätigen wir, dass die Karte in Gehäuse und Steckplatz passt und dass das Rack sie mit Strom versorgen und kühlen kann. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch; die Modelle darauf sind unsere Leistung Private AI/ML, und das Engineering übernimmt unser Engineering-Partner Vixen.UNO.
FAQ
Wie viele Kameras pro GPU sind bei der Videoanalyse möglich?
Eignet sich die NVIDIA L4 für Videoanalyse?
Welche Hardware braucht NVIDIA DeepStream für viele Kameras?
L4 oder L40S für Videoanalyse?
Wie viel GPU-Speicher braucht Videoanalyse?
Welche GPU für einen NVR mit KI-Videoanalyse?
Schicken Sie uns die Zahl der Kameras, ihre Auflösung, Bildrate und ihren Codec, die Modelle, die Sie einsetzen, wie viele Bilder pro Sekunde diese analysieren und wo der Server stehen wird. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem schriftlichen Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages