BLOG · GUIDE ·

GPU-Server für Videoanalyse: wie viele Kameras pro GPU mit L4, L40S und den RTX-PRO-Karten

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Eine GPU für Videoanalyse wird zuerst durch ihre Hardware-Videodecoder (NVDEC) begrenzt und dann durch die Inferenz je analysiertem Bild; der GPU-Speicher ist bei CNN-Detektoren selten die erste Grenze
  • Die L4 hat 4 NVDEC-Engines und 4 JPEG-Decoder bei 72 W in einer Single-Slot-Karte mit halber Bauhöhe, die L40S 3 Decoder bei 350 W, die RTX PRO 6000 Server Edition 4 Blackwell-Decoder bei bis zu 600 W
  • In NVIDIAs Dokumentation zu DeepStream 7.1 verarbeitete eine L4 68 H.264- oder 81 H.265-Streams mit 1080p und 30 Bildern pro Sekunde, mit einem ResNet18-Detektor auf jedem Bild, einem Tracker und zwei Klassifikatoren
  • NVIDIAs Dokumentation zu DeepStream 9.1 (aktualisiert am 28. Juli 2026) nennt 1.524 Bilder pro Sekunde für PeopleNet 2.6.3 mit Tracker auf der RTX PRO 6000 Server Edition und 1.114 auf der L40S; werden 10 von 30 Bildern analysiert, sind bis zu etwa dreimal so viele Kameras möglich
  • Nach unserer Schätzung für Kameras mit 1080p30 braucht ein leichter Detektor auf jedem Bild eine L4 für 16 Kameras, zwei für 64 und sechs für 256; PeopleNet auf 10 von 30 Bildern braucht eine RTX PRO 6000 Server Edition für 64 und drei für 256

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

GPU für Videoanalyse: zuerst die Decoder, dann die Inferenz

Eine GPU für Videoanalyse wird zuerst durch ihre Hardware-Videodecoder begrenzt, die NVDEC-Engines, die jeden H.264- oder H.265-Stream wieder in Einzelbilder umwandeln, und danach durch die Inferenzarbeit je analysiertem Bild. Für die CNN-Detektoren, die in den meisten Kamera-Pipelines laufen, ist der GPU-Speicher selten die erste Grenze. NVIDIA veröffentlicht die Decodierrate je NVDEC-Engine und die Zahl der Engines je Karte, eine vollständige DeepStream-Messung für die L4 und Bilder pro Sekunde für größere Modelle auf der L40S und der RTX PRO 6000.

Nach diesen Werten brauchen 16 Kameras eine Karte, 64 Kameras eine oder zwei Karten und 256 Kameras drei bis sechs, je nach Modell und der Zahl der Bilder pro Sekunde, die es analysiert. Die Kamerazahlen sind unsere Schätzungen aus NVIDIAs Werten, mit Quellen und Methode unter jeder Tabelle.

NVDEC, NVENC und JPEG-Decoder auf L4, L40S und den RTX-PRO-Karten

Im Standardmodus von DeepStream decodiert das Decoder-Plug-in jedes Bild jedes Streams, ob das Modell es analysiert oder nicht. Die Decodierlast folgt daher der Bildrate der Kameras, nicht der Analyserate.

GPUNVDEC UND NVENCLEISTUNG, KÜHLUNGBAUFORM1080P30-DECODIERUNG
NVIDIA L44 und 2, dazu 4 JPEG-Decoder72 W, passivhalbe Bauhöhe, Single Slot120 H.264, 218 H.265
NVIDIA L40S3 und 3350 W, passivvolle Bauhöhe, Dual Slot90 H.264, 164 H.265
RTX PRO 6000 Server Edition4 und 4bis zu 600 W, passivvolle Bauhöhe, Dual Slot (Luft)289 H.264, 249 H.265
RTX PRO 50003 und 3300 W, aktivvolle Bauhöhe, Dual Slot217 H.264, 187 H.265
RTX PRO 45002 und 2200 W, aktivvolle Bauhöhe, Dual Slot144 H.264, 124 H.265
RTX PRO 40002 und 2145 W, aktivvolle Bauhöhe, Single Slot144 H.264, 124 H.265
RTX PRO 4000 SFF2 und 270 W, aktivhalbe Bauhöhe, Dual Slot144 H.264, 124 H.265
RTX PRO 20001 und 170 W, aktiv2,7 × 6,6 Zoll, Dual Slot72 H.264, 62 H.265

NVIDIA-Produktseiten, gelesen am 9. Oktober 2026; NVENC-Anzahl laut NVIDIAs Support-Matrix des Video Codec SDK, gelesen am selben Tag. Nur die Seite der L4 nennt JPEG-Decoder. NVIDIA führt außerdem eine flüssigkeitsgekühlte Server Edition im Single-Slot-Format. Decodiergrenze in der letzten Spalte: unsere Rechnung, Engines × NVIDIAs Richtwert je Engine bei 1920 × 1080 (NVDEC Application Note, Video Codec SDK 13.1) ÷ 30 Bilder pro Sekunde, eine Obergrenze, keine Streamzahl.

Die NVDEC Application Note zum Video Codec SDK 13.1 nennt Richtwerte je Engine bei 1920 × 1080 in 4:2:0: 903 Bilder pro Sekunde für H.264 und 1.641 für H.265 auf Ada sowie 2.172 und 1.872 auf Blackwell. NVIDIA hat sie beim höchsten Videotakt gemessen, 2.160 MHz auf Ada und 2.362 MHz auf Blackwell, und schreibt, die Leistung „sollte entsprechend den Videotakten skalieren, die nvidia-smi auf der Ziel-GPU meldet“, und variiere zwischen GPU-Klassen. Die letzte Spalte ist daher eine Obergrenze. Auf der L4 erreichte NVIDIAs eigener DeepStream-Lauf 68 H.264-Streams gegenüber den 120 der Rechnung.

Alle acht Karten kodieren laut Support-Matrix AV1, und die Seite der L40S gibt an, dass ihre Engines AV1-Encoding und -Decoding umfassen. Die vier JPEG-Decoder der L4 dienen Kameras, die MJPEG oder Standbilder senden, Formate, die das DeepStream-Decoder-Plug-in neben H.264, H.265 und AV1 unterstützt. Unser Vergleich der 70-W-Karten behandelt die L4 und die RTX PRO 4000 SFF im Detail.

Streamzahlen für Kameras, die NVIDIA für DeepStream veröffentlicht

Von den Karten in diesem Artikel haben wir nur für die L4 eine veröffentlichte Streamzahl gefunden. Die Performance-Seite der Dokumentation zu DeepStream 7.1, zuletzt aktualisiert am 15. September 2025, ließ 1080p-Dateien mit 30 Bildern pro Sekunde durch einen per Pruning verkleinerten ResNet18-Detektor TrafficCamNet auf jedem Bild laufen, einen IOU-Tracker mit 960 × 544 und zwei ResNet18-Fahrzeugklassifikatoren. Auf einem System mit AMD EPYC 7763 und NVIDIAs INT8-Beispielkonfiguration verarbeitete eine L4 68 H.264-Streams bei 75,74 Prozent GPU- und 8,06 Prozent CPU-Auslastung und 81 H.265-Streams bei 100 Prozent GPU- und 46,1 Prozent CPU-Auslastung. Mit H.264 hatte die GPU noch Reserven, was darauf hindeutet, dass die Decoder die Grenze waren; mit H.265 füllte die Inferenzarbeit zuerst die GPU. NVIDIA sagt nicht, welche Einheit die jeweilige Grenze setzte.

Die Dokumentation zu DeepStream 9.1, zuletzt aktualisiert am 28. Juli 2026, nennt stattdessen Bilder pro Sekunde je GPU, End-to-End gemessen, „unter Berücksichtigung von Videoerfassung und Decodierung, Vorverarbeitung, Batching, Inferenz und Nachverarbeitung“, mit der 1080p-H.265-Beispieldatei und abgeschaltetem Rendering. Sie gibt nicht an, wie viele Streams diese Werte erzeugt haben.

MODELL, TRACKEREINGABE INS MODELLPRO 6000 SEPRO 6000 WSL40S
PeopleNet 2.6.3, MV3DT640 × 640, FP161.5241.8991.114
RT-DETR, kein Tracker640 × 640, FP161.0371.063643
TrafficCamNet TL, NvDCF544 × 960, FP16920994643
Grounding-DINO, kein Tracker544 × 960, FP16159178107

NVIDIA-Dokumentation zu DeepStream 9.1, Performance, dGPU pretrained models, Bilder pro Sekunde je GPU mit TensorRT, zuletzt aktualisiert am 28. Juli 2026. TL steht für TrafficCamNet Transformer Lite. NVIDIA nennt in dieser Tabelle keine Werte für die L4 oder die RTX PRO 4000.

Durch 30 geteilt entspricht der PeopleNet-Wert etwa 50 Kameras, die mit voller Bildrate analysiert werden, auf einer RTX PRO 6000 Server Edition und 37 auf einer L40S. Bei 10 analysierten Bildern pro Sekunde steigen die Zahlen um bis zu etwa das Dreifache, da Decodierung und Tracker weiterhin jedes Bild verarbeiten. Open-Vocabulary-Detektoren wie Grounding-DINO laufen mit etwa einem Zehntel dieser Rate. Die Fußnote zu den „1.040 gleichzeitigen AV1-Videostreams mit 720p30“ auf NVIDIAs L4-Seite beschreibt einen AV1-Encoding-Lauf auf einem Server mit acht L4-Karten; für die Analyse gilt der Wert daher nicht.

So dimensionieren Sie einen Server für Videoanalyse

Dimensionieren Sie Decodierung und Inferenz getrennt und richten Sie sich nach dem größeren Bedarf.

  1. Decodierlast: Kameras × die Bildrate, die sie senden, je Codec und Auflösung. Vergleichen Sie sie mit der Decodiergrenze in der ersten Tabelle und mit NVIDIAs gemessenem L4-Wert, und bleiben Sie deutlich unter der Obergrenze.
  2. Inferenzlast: Kameras × die Bilder pro Sekunde, die das Modell analysiert. In DeepStream legt die Eigenschaft interval des Inferenz-Plug-ins die „Anzahl aufeinanderfolgender Batches, die bei der Inferenz übersprungen werden“ fest, interval=2 analysiert also eines von drei Bildern, 10 von 30. Der Tracker erhält die übersprungenen Bilder trotzdem und verfolgt die Objekte darauf ohne neue Detektionen.
  3. Teilen Sie die Inferenzlast durch die Bilder pro Sekunde, die NVIDIA für dasselbe oder ein ähnliches Modell auf der Karte veröffentlicht, und planen Sie bis etwa 70 Prozent davon, mit Reserve für Spitzen und Wachstum.
  4. Prüfen Sie CPU, Arbeitsspeicher, Netzwerk und Stromversorgung des Servers, wie unten beschrieben.

Zwei Decoder-Einstellungen verringern die Arbeit weiter. Die Einstellung drop-frame-interval des Decoders gibt nur jedes n-te Bild weiter, „ein Wert von 5 bedeutet, dass der Decoder jedes fünfte Bild ausgibt“; das spart die Arbeit nach dem Decoder, aber nicht das Decodieren, dimensionieren Sie die Decoder also für die volle Bildrate. skip-frames mit dem Wert decode_key decodiert nur Keyframes, die analysierte Rate folgt dann dem Keyframe-Intervall der Kameras; das passt zu Szenen, die sich langsam ändern. Nach Pixelzahl braucht ein 4K-Stream etwa viermal so viel Decodierkapazität wie ein 1080p-Stream; das ist unsere Annahme, da die Application Note nur Werte für 1080p nennt.

Kameras pro GPU: Konfigurationen für 16, 64 und 256 Kameras

Die Tabelle wendet diese Methode auf 1080p-Kameras mit 30 Bildern pro Sekunde an, mit zwei Pipelines: einem leichten CNN-Detektor mit Tracker und Klassifikatoren auf jedem Bild, wie in NVIDIAs L4-Messung, und PeopleNet 2.6.3 mit MV3DT, NVIDIAs Multi-View-3D-Tracker, auf 10 von 30 Bildern.

KAMERAS, 1080P30BILDER PRO SEKUNDECNN, ALLE BILDERPEOPLENET, 10 FPS
16 Kameras480 decodiert, 480 oder 160 analysiert1 L41 L40S oder eine L4 nach einem Test mit Ihrem Modell
64 Kameras1.920 decodiert, 1.920 oder 640 analysiert2 L41 RTX PRO 6000 Server Edition oder 1 L40S bei H.265-Kameras
256 Kameras7.680 decodiert, 7.680 oder 2.560 analysiert6 L43 RTX PRO 6000 Server Edition oder 4 L40S bei H.265-Kameras

Unsere Schätzungen, keine Messungen: L4-Anzahl aus NVIDIAs 68 H.264-Streams je Karte (DeepStream 7.1), die übrigen Karten aus den Bildern pro Sekunde von DeepStream 9.1 und den Decodiergrenzen in der ersten Tabelle, jeweils auf etwa 70 Prozent geplant, unter der Annahme, dass die Inferenzarbeit mit den analysierten Bildern skaliert. NVIDIA veröffentlicht keinen PeopleNet-Wert für die L4.

Die PeopleNet-Spalte nennt größere Karten, weil NVIDIA die Rate dieses Modells nur für sie veröffentlicht. Bei H.264-Kameras würden 64 Streams etwa 71 Prozent der Decodier-Obergrenze einer L40S belegen, daher nennt die Tabelle die L40S nur für H.265-Kameras; die RTX PRO 6000 Server Edition mit vier Blackwell-Decodern bewältigt beide Codecs. Für einen kleinen Standort ohne Server-Luftstrom hat die RTX PRO 4000 SFF zwei Blackwell-Decoder bei 70 W in einer Karte mit eigenem Lüfter, doch NVIDIA veröffentlicht keinen DeepStream-Wert für sie; testen Sie Ihr Modell also zuerst darauf.

Wir bauen GPU-Server für diese Kamerazahlen nach Auftrag und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Kamerazahl, Codecs und Modelle über das Formular unten, und Sie erhalten innerhalb eines Werktages eine Konfiguration.

CPU, Arbeitsspeicher, Netzwerk und Strom rund um die Karten

Die CPU empfängt und parst die RTSP-Streams. In NVIDIAs L4-Lauf auf einem AMD EPYC 7763 hielten 81 H.265-Streams die CPU bei 46,1 Prozent und 68 H.264-Streams bei 8,06 Prozent; der Codec verändert die CPU-Last also erheblich. Einen NVIDIA-Wert für Kerne je Stream haben wir nicht gefunden, planen Sie den Prozessor daher nach einem Testlauf. Jedes decodierte 1080p-Bild in NV12 belegt etwa 3,1 MB (1920 × 1080 × 1,5 Byte), und die Pipeline hält mehrere davon je Stream vor, der GPU-Speicher wächst also mit der Kamerazahl; NVIDIAs L4-Läufe mit 68 und 81 Streams passten in die 24 GB der Karte.

Planen Sie das Netzwerk aus der Bitrate der Kameras mal der Kamerazahl, dazu den Uplink zum Videomanagementsystem. Bei der Leistung ziehen sechs L4 432 W, vier L40S 1.400 W und drei Karten der RTX PRO 6000 Server Edition bis zu 1.800 W, jeweils ohne Prozessoren und Lüfter. Die L4, die L40S und die luftgekühlte Server Edition sind passiv gekühlt und brauchen den Luftstrom des Servers. Unser Artikel dazu, wie viele GPUs in einen Server passen, behandelt PCIe-Lanes, Netzteile und Luftstrom, und unser Vergleich von L4 und L40S nennt die Zahl der L4 je Servermodell.

Videosuche und Zusammenfassung mit Vision-Language-Modellen

Suche und Zusammenfassungen über aufgezeichnetes Video nutzen Vision-Language-Modelle und ein LLM, die die Grenze von den Decodern zum Speicher verschieben. NVIDIAs Blueprint Video Search and Summarization (VSS) gibt auf seiner Seite zu den Voraussetzungen, aktualisiert am 16. Juli 2026, an, es sei auf der H100, der RTX PRO 6000 Blackwell, der L40S, DGX Spark, IGX Thor und AGX Thor „validiert und getestet“ worden, und führt die RTX PRO 4500 Blackwell mit dem Vermerk „eingeschränkte Unterstützung für das Alerts-Profil“. Sein Basisprofil für die Entwicklung läuft auf einer RTX PRO 6000 Blackwell, auf der sich die Modelle die GPU teilen, oder auf zwei mit dedizierten GPUs; die L40S braucht zwei. Das Suchprofil braucht drei bis vier RTX PRO 6000 oder vier L40S, wenn alle Modelle lokal laufen. NVIDIA nennt außerdem als Minimum eine x86-CPU mit 18 Kernen, 128 GB RAM, eine SSD mit 1 TB und eine Netzwerkschnittstelle mit 1 Gbps. Für DGX Spark und die Thor-Plattformen nennt die Seite nur Konfigurationen, bei denen das LLM entfernt läuft. Das Deployment offener und kommerzieller Modelle on-premise ist Teil unserer Leistung Private AI/ML.

Wir bauen KI-Server mit Karten der RTX PRO 6000 Server Edition oder L40S für diese Profile nach Auftrag. Schreiben Sie uns die Stunden Video und die Fragen, die Ihre Teams daran stellen würden.

Datenschutz und Sicherheit eines Videoanalyse-Servers

Videos, auf denen Personen identifizierbar sind, sind personenbezogene Daten im Sinne der DSGVO, und ob und wie sie analysiert werden dürfen, ist eine Bewertung für die Rechtsabteilung des Unternehmens. Technisch sollten Sie die Kameras in einem eigenen Netzwerksegment betreiben, dem Analyse-Server nur die Zugriffe geben, die er braucht, und seinen Management-Controller, die Treiber und die Container-Runtime härten, wie in unserem Leitfaden zum Absichern eines GPU-Servers beschrieben.

Was wir liefern

Wir liefern die NVIDIA L4 und L40S, die RTX PRO 6000 Server Edition sowie die RTX PRO 2000, 4000, 4000 SFF, 4500 und 5000 als GPUs für Server, die Sie bereits betreiben, oder in auf Bestellung gebauten KI-Servern, montiert und im Burn-in getestet, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Vor Ihrer Bestellung bestätigen wir, dass die Karte in Gehäuse und Steckplatz passt und dass das Rack sie mit Strom versorgen und kühlen kann. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch; die Modelle darauf sind unsere Leistung Private AI/ML, und das Engineering übernimmt unser Engineering-Partner Vixen.UNO.

FAQ

Wie viele Kameras pro GPU sind bei der Videoanalyse möglich?
Das hängt von den Decodern, dem Modell und der Zahl der Bilder pro Sekunde ab, die es analysiert. In NVIDIAs Dokumentation zu DeepStream 7.1 verarbeitete eine L4 68 H.264- oder 81 H.265-Streams mit 1080p und 30 Bildern pro Sekunde mit einem leichten ResNet18-Detektor, einem Tracker und zwei Klassifikatoren. Mit PeopleNet 2.6.3 und einem Tracker ergeben NVIDIAs Werte aus DeepStream 9.1, 1.524 Bilder pro Sekunde auf der RTX PRO 6000 Server Edition und 1.114 auf der L40S, etwa 50 und 37 Kameras bei 30 analysierten Bildern pro Sekunde und bei 10 bis zu etwa dreimal so viele, da Decodierung und Tracking weiterhin auf jedem Bild laufen.
Eignet sich die NVIDIA L4 für Videoanalyse?
NVIDIA beschreibt sie als universellen Beschleuniger für „effizientes Video, KI und Grafik“, mit vier NVDEC-Decodern, zwei Encodern und vier JPEG-Decodern bei 72 W in einer Single-Slot-Karte mit halber Bauhöhe. NVIDIA hat in DeepStream 7.1 mit einem leichten Detektor 68 H.264- oder 81 H.265-Streams mit 1080p30 je L4 gemessen. Sie ist passiv gekühlt und braucht den Luftstrom eines Servers.
Welche Hardware braucht NVIDIA DeepStream für viele Kameras?
DeepStream decodiert auf den NVDEC-Engines der GPU und führt die Inferenz mit TensorRT aus, die Zahl der Decoder und die Inferenzrate der Karte bestimmen also die Kamerazahl. NVIDIAs Performance-Seite zu DeepStream 9.1 nennt die RTX PRO 6000 Workstation und Server Edition, die L40S, B200, GB200, DGX Spark sowie Jetson Thor und Orin. Die CPU empfängt und parst die Streams, und in NVIDIAs L4-Lauf beanspruchten 81 H.265-Streams 46,1 Prozent eines AMD EPYC 7763.
L4 oder L40S für Videoanalyse?
Die L4 hat vier Decoder bei 72 W, die L40S drei bei 350 W; für viele Streams mit leichten Modellen bietet die L4 also mehr Decodierkapazität je Watt. Die L40S führt schwerere Modelle schneller aus, 1.114 Bilder pro Sekunde für PeopleNet 2.6.3 mit Tracker nach NVIDIAs Werten für DeepStream 9.1, und für die L4 veröffentlicht NVIDIA keinen solchen Wert. Für Videosuche mit Vision-Language-Modellen führt NVIDIAs VSS-Blueprint die L40S auf, die L4 nicht.
Wie viel GPU-Speicher braucht Videoanalyse?
Bei CNN-Detektoren mit Tracker ist der Speicher selten die Grenze: Ein decodiertes 1080p-Bild belegt etwa 3,1 MB, und die Zahlen, die NVIDIA für die L4 mit 24 GB veröffentlicht, sind durch Decoder und Inferenz begrenzt. Zur Grenze wird der Speicher bei Vision-Language-Modellen für die Videosuche, für die NVIDIAs VSS-Blueprint mindestens eine RTX PRO 6000 Blackwell braucht, auf der sich die Modelle die GPU teilen, oder zwei L40S.
Welche GPU für einen NVR mit KI-Videoanalyse?
Für einen Rekorder oder Edge-Server mit Server-Luftstrom und bis zu einigen Dutzend 1080p-Kameras deckt eine L4 in einem Steckplatz mit halber Bauhöhe die Decodierung und einen leichten Detektor ab. Ohne Server-Luftstrom hat die RTX PRO 4000 SFF einen eigenen Lüfter, zwei Blackwell-Decoder und 24 GB bei 70 W, allerdings veröffentlicht NVIDIA keinen DeepStream-Wert für sie. Für Hunderte Kameras oder schwerere Modelle passt ein GPU-Server mit mehreren Karten vom Typ L4, L40S oder RTX PRO 6000 Server Edition.

Schicken Sie uns die Zahl der Kameras, ihre Auflösung, Bildrate und ihren Codec, die Modelle, die Sie einsetzen, wie viele Bilder pro Sekunde diese analysieren und wo der Server stehen wird. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem schriftlichen Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien