BLOG · GUIDE ·

Whisper GPU-Anforderungen: Dimensionierung eines On-Premise-Servers für Spracherkennung mit Whisper und Parakeet

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Spracherkennung braucht wenig GPU-Speicher: OpenAI nennt etwa 10 GB VRAM für Whisper large und etwa 6 GB für large-v3-turbo, Parakeet TDT 0.6B hat 600 Millionen Parameter, und NVIDIAs ASR NIM verlangt mindestens 16 GB
  • Die Zahl der GPUs folgt aus der Spitzenzahl gleichzeitiger Live-Streams und aus den Stunden aufgezeichneten Audios je Stunde Verarbeitungszeit, veröffentlicht als RTFx, Sekunden transkribierten Audios je Sekunde Rechenzeit
  • Auf einer A100 im Paper zum Open ASR Leaderboard (Dezember 2025) erreichte Whisper large-v3 eine RTFx von 145,5, Canary-1B v2 749 und Parakeet TDT 0.6B v3 3.333; Parakeet v3 und Canary decken 25 europäische Sprachen ab, Whisper 99
  • NVIDIAs Werte für ASR NIM, aktualisiert am 7. Oktober 2026, nennen für eine L40S maximal 190 englische Live-Streams mit Parakeet 0.6B CTC bei 160-ms-Chunks; NIM führt Whisper nur offline aus
  • Mit Sprecherdiarisierung fiel die Offline-Rate der L40S in NVIDIAs Werten von 3.638 auf 101,5; nach unserer Schätzung fasst eine L40S oder RTX PRO 5000 mit 48 GB Erkennung, Diarisierung und ein 20B-LLM für Zusammenfassungen

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Whisper GPU-Anforderungen in Kürze

Die GPU-Anforderungen von Whisper und anderen Modellen für Spracherkennung sind gering, denn Spracherkennung braucht weit weniger GPU-Speicher als ein Sprachmodell. OpenAI nennt etwa 10 GB VRAM für Whisper large und etwa 6 GB für large-v3-turbo, und NVIDIAs Parakeet TDT 0.6B v3 hat 600 Millionen Parameter; jede Karte, die wir liefern, ab der RTX PRO 2000 mit 16 GB, fasst also eines dieser Modelle. Für einen Server zur Spracherkennung on-premise entscheidet der Workload über die GPU: wie viele Live-Streams gleichzeitig laufen und wie viele Stunden aufgezeichnetes Audio je Stunde Verarbeitungszeit anfallen.

Modellkarten und Benchmarks veröffentlichen den Durchsatz als RTFx, den Kehrwert des Echtzeitfaktors: Sekunden transkribierten Audios je Sekunde Rechenzeit. Eine RTFx von 100 macht aus 100 Stunden Aufzeichnungen eine Stunde GPU-Zeit. Die Wahl des Modells verändert diesen Wert um mehr als eine Größenordnung; wählen Sie daher zuerst das Modell und dann die Karte.

Spracherkennungsmodelle, Stand Oktober 2026

Whisper large-v3 hat 1.550 Millionen Parameter, und seine Modellkarte führt 99 Sprachen auf. Large-v3-turbo reduziert die Decoder-Schichten von 32 auf 4, was laut OpenAI deutlich schneller ist, bei einer geringen Qualitätseinbuße, und es gibt auch dann die Originalsprache aus, wenn eine Übersetzung angefordert wird. OpenAIs Whisper-Repository veröffentlicht Code und Gewichte unter der MIT-Lizenz, während die Modellkarte von large-v3 auf Hugging Face mit Apache 2.0 gekennzeichnet ist.

NVIDIAs Parakeet TDT 0.6B v3, am 14. August 2025 auf Hugging Face veröffentlicht, transkribiert 25 europäische Sprachen, darunter Polnisch, Tschechisch, Slowakisch, Rumänisch, Ungarisch und Deutsch, mit Interpunktion und Zeitstempeln je Wort. Laut seiner Modellkarte verarbeitet es in einem Durchgang Audio von bis zu 24 Minuten mit Full Attention (auf einer A100 80GB) oder bis zu 3 Stunden mit Local Attention. Canary-1B v2 deckt dieselben 25 Sprachen ab und übersetzt außerdem zwischen Englisch und den übrigen 24. Beide stehen unter CC BY 4.0. Nemotron Speech Streaming 0.6B ist in seiner Veröffentlichung auf Hugging Face vom 13. März 2026 ein englisches Streaming-Modell mit Chunk-Größen von 80, 160, 560 und 1.120 ms. Canary-Qwen 2.5B wurde nur auf Englisch trainiert.

MODELLPARAMETERSPRACHENSPEICHERANGABERTFX AUF A100
Whisper large-v31.550 Mio.99etwa 10 GB (OpenAI); 12,5 GB NIM-Profil145,5
Whisper large-v3-turbo809 Mio.99, keine Übersetzungetwa 6 GB (OpenAI)nicht im Paper
Parakeet TDT 0.6B v3600 Mio.25 europäische14,02 GB NIM-Profil, Batch 1.0243.333
Canary-1B v2978 Mio.25 europäische, Übersetzungmindestens 6 GB RAM zum Laden (Modellkarte)749
Canary-Qwen 2.5B2,5 Mrd.Englischnicht angegeben418
Nemotron ASR Streaming600 Mio. (englisches Modell)Englisch; 40 Locales in NIM4 GB bei Batch 32, 23 GB bei Batch 512 (NIM)nicht im Paper

Modellkarten auf Hugging Face und OpenAIs Whisper-Repository, gelesen am 9. Oktober 2026; NIM-Profile aus NVIDIAs Support-Matrix für ASR NIM, zuletzt aktualisiert am 7. Oktober 2026; RTFx aus dem Paper zum Open ASR Leaderboard (arXiv 2510.06961v3, 10. Dezember 2025), eine A100-SXM4-80GB, Batchgröße 64, wo der Speicher es zuließ.

GPU-Speicher für Whisper large-v3 und turbo

OpenAIs Tabelle im Whisper-Repository nennt etwa 10 GB VRAM für die large-Modelle und etwa 6 GB für turbo, das beim Transkribieren von Englisch auf einer A100 etwa achtmal so schnell wie large gemessen wurde. Optimierte Runtimes können weniger brauchen. faster-whisper, eine Neuimplementierung auf CTranslate2, nennt in seiner README 13 Minuten Audio, transkribiert mit large-v2 und Beam-Größe 5 auf einer GeForce RTX 3070 Ti mit 8 GB. Die Originalimplementierung brauchte 2 Minuten 23 Sekunden bei 4.708 MB. faster-whisper in FP16 mit batch_size=8 brauchte 17 Sekunden bei 6.090 MB und in INT8 mit derselben Batchgröße 16 Sekunden bei 4.500 MB.

NVIDIAs Container ASR NIM, der Parakeet-, Canary-, Whisper- und Nemotron-Modelle bereitstellt, verlangt eine GPU mit Compute Capability 8.0 oder höher und mindestens 16 GB VRAM. Seine Profile reservieren Speicher für große Batches: 12,5 GB für Whisper large-v3, 13,75 bis 14,02 GB für Parakeet TDT und bis zu 50,07 GB für das größte mehrsprachige Profil von Parakeet RNNT, mehr, als eine L40S hat. Die Support-Matrix ergänzt: „Stellen Sie sicher, dass die Modelle, die Sie bereitstellen, den verfügbaren GPU-Speicher nicht überschreiten“ (unsere Übersetzung). Der Speicherbedarf hängt daher stärker von der Batchgröße und der Zahl der geladenen Modelle ab als von der Parameterzahl des Modells.

Durchsatz in RTFx: was die veröffentlichten Werte zeigen

Das Paper zum Open ASR Leaderboard, von Hugging Face, der University of Cambridge und Mistral AI, hat jedes Modell auf derselben A100 mit Batchgröße 64 gemessen, wo der Speicher es zuließ. Parakeet TDT 0.6B v3 transkribierte dort etwa 23-mal so schnell wie Whisper large-v3. Auf den englischen Testsets lag seine durchschnittliche Wortfehlerrate bei 6,32 Prozent, gegenüber 7,44 bei Whisper large-v3.

Für Deutsch nennt die mehrsprachige Tabelle des Papers 4,97 Prozent für Whisper large-v3, 4,90 für Parakeet TDT 0.6B v3 und 4,96 für Canary-1B v2. Diese Tabelle umfasst nur Deutsch, Französisch, Italienisch, Spanisch und Portugiesisch; testen Sie die Modelle für Polnisch, Tschechisch oder Rumänisch daher mit Ihren eigenen Aufzeichnungen, bevor Sie den Server dimensionieren.

Für die L4 berichtete E2E Networks am 27. März 2026 über einen Test mit 100 LibriSpeech-Äußerungen. Whisper large-v3-turbo in BF16 mit Batch 4 verarbeitete Audio 41,1-mal schneller als seine Dauer, in 2.299 MB. Parakeet TDT 0.6B v3 in BF16 mit Batch 8 kam auf das 238,9-Fache, in 5.151 MB. Das Testset ist klein und seine Äußerungen sind kurz; wir nutzen diese Werte daher als Anhaltspunkte.

Echtzeit-Transkription: gleichzeitige Streams je GPU

Whisper arbeitet mit 30-Sekunden-Fenstern, und laut seiner Modellkarte ist für large-v3 eine Chunk-Länge von 30 Sekunden optimal. NVIDIAs ASR NIM führt Whisper und Parakeet TDT nur offline aus. Für Live-Gespräche bietet es Streaming-Modelle: Parakeet CTC für Englisch und mehrere weitere Sprachen, Parakeet RNNT 1.1B multilingual und Nemotron ASR Streaming.

NVIDIAs Performance-Seite zu ASR NIM, zuletzt aktualisiert am 7. Oktober 2026, misst Streams mit dem riva_streaming_asr_client und dessen Flag --simulate_realtime an einer LibriSpeech-Datei. Auf der L40S bewältigte Parakeet 0.6B CTC auf Englisch mit 160-ms-Chunks 64 Streams bei 33,9 ms durchschnittlicher und 39,7 ms p90-Latenz, und NVIDIA gibt mit einem N-Gramm-Sprachmodell maximal 190 effektive Streams an. Mit 960-ms-Chunks liefen 512 Streams bei 198,8 ms durchschnittlicher Latenz, bei einem angegebenen Maximum von 900. Beim Streaming entspricht die RTFx etwa der Zahl der Streams, da jeder Stream im Sprechtempo eintrifft; maßgeblich ist daher die Latenz.

Auf dieser Seite haben wir kein Ergebnis für Whisper oder Canary auf der L40S gefunden und keine Werte für die L4 oder die RTX-PRO-Karten. Die Support-Matrix führt die L4, die L40 und einen Eintrag „Blackwell RTX 60xx“, nennt die L40S aber nicht namentlich, obwohl die Performance-Seite sie misst. Prüfen Sie die Matrix des NIM-Release, das Sie einsetzen, gegen die Karte, die Sie bestellen.

Einen Transkriptionsserver nach Workload dimensionieren

Dimensionieren Sie Live-Gespräche nach der Spitzenzahl gleichzeitiger Streams. Dimensionieren Sie Aufzeichnungen nach der RTFx, die sie brauchen: 2.000 Stunden Anrufe pro Monat, verarbeitet an 20 Arbeitstagen zu je 8 Stunden, brauchen eine dauerhafte RTFx von 12,5.

WORKLOADBEISPIELVOLUMENMODELL UND ENGINESETUP, SCHÄTZUNG
Live-Anrufe, Englisch100 gleichzeitige AnrufeParakeet 0.6B CTC in ASR NIM, 160-ms-Chunks1 L40S, etwa die Hälfte der von NVIDIA angegebenen 190 Streams
Live-Anrufe, Englisch300 gleichzeitige AnrufeParakeet 0.6B CTC in ASR NIM3 L40S bei 160-ms-Chunks oder 1 L40S bei 960-ms-Chunks
Besprechungs­aufzeichnungen50 Stunden am Tag, Sprecher­zuordnung, Zusammen­fassungenParakeet TDT v3 oder Whisper turbo, Diarisierung, 20B-LLM1 L40S oder 1 RTX PRO 5000 48 GB
Batch-Archiv, EU-Sprachen10.000 Stunden, einmaligParakeet TDT 0.6B v31 L4, etwa 42 Stunden Verarbeitung
Batch-Archiv, alle Sprachen10.000 Stunden, einmaligWhisper large-v3-turbo4 L4, etwa 61 Stunden Verarbeitung

Unsere Schätzungen, keine Messungen: Live-Anrufe aus NVIDIAs Werten für ASR NIM auf der L40S (7. Oktober 2026), geplant auf etwa 70 Prozent des angegebenen Maximums; Archive aus den L4-Werten von E2E Networks (27. März 2026), das 238,9- und 41,1-Fache der Audiodauer je Karte; Besprechungen aus NVIDIAs Offline-Rate der L40S mit Diarisierung, die NVIDIA mit Parakeet 0.6B CTC auf Englisch gemessen hat, nicht mit den Modellen in dieser Zeile.

Ihr Audio, Ihre Sprachen und Ihre Einstellungen verändern diese Zahlen; ein Testlauf mit einigen Stunden Ihrer eigenen Aufzeichnungen kommt daher vor der Bestellung. Telefonaudio, überlappende Sprecher und Hintergrundgeräusche senken die Genauigkeit, und längere Chunks erhöhen die Latenz.

Wir bauen Transkriptionsserver nach Auftrag mit L4-, L40S- oder RTX-PRO-Karten und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Nennen Sie uns Ihre Stunden Audio pro Tag und die Spitzenzahl gleichzeitiger Anrufe im Formular unten.

Diarisierung und LLM-Zusammenfassungen auf demselben Server

Die Sprecherzuordnung kann mehr Rechenaufwand verursachen als die Transkription. In NVIDIAs Werten für die L40S erreichte Parakeet 0.6B CTC offline mit 32 parallelen Anfragen ohne Diarisierung eine RTFx von 3.638 und mit Diarisierung 101,5. Dimensionieren Sie den Server für Besprechungsaufzeichnungen daher nach der Rate mit Diarisierung. Die Pipeline community-1 von pyannote, unter CC BY 4.0, ist eine offene Alternative. Ihre Modellkarte gibt an, dass pyannote-Pipelines standardmäßig auf der CPU laufen und sich mit wenigen Codezeilen auf die GPU verlagern lassen, und nennt keinen Geschwindigkeitswert. Ihre Dateien lassen sich erst herunterladen, nachdem Sie ihre Bedingungen auf Hugging Face akzeptiert haben.

Zusammenfassungen und Protokolle brauchen ein Sprachmodell neben der Spracherkennung. Canary-Qwen 2.5B hat einen LLM-Modus, der das Transkript zusammenfassen oder Fragen dazu beantworten kann, ausgehend vom Transkript und nur auf Englisch. Für andere Sprachen betreiben Sie ein separates LLM. Nach unserer Schätzung passt gpt-oss-20b mit 13,8 GB neben Whisper turbo und einem Diarisierungsmodell auf eine L40S oder RTX PRO 5000 mit 48 GB. gpt-oss-120b mit 65,3 GB braucht eine RTX PRO 6000 mit 96 GB, um neben der Spracherkennung zu laufen. Unser Artikel zu den LLM-Hardware-Anforderungen je Modell behandelt die größeren Modelle.

Wir liefern die Karten für Erkennung, Diarisierung und Zusammenfassungen in einem Server. Beschreiben Sie die Sprachen, die Aufzeichnungen und die gewünschten Zusammenfassungen im Formular unten.

Welche GPUs aus unserem Sortiment zu einem Spracherkennungs-Server passen

KARTESPEICHER, LEISTUNGKÜHLUNG, BAUFORMUNSERE EINSCHÄTZUNG
NVIDIA L424 GB, 72 Wpassiv, halbe Bauhöhe, Single SlotBatch-Transkription in Servern; in der Matrix von ASR NIM gelistet
RTX PRO 200016 GB, 70 Waktiv, 2,7 × 6,6 Zoll, Dual Slotein Modell, am NIM-Minimum von 16 GB, nicht in dessen Matrix genannt
RTX PRO 4000 SFF24 GB, 70 Waktiv, halbe Bauhöhe, Dual Slotkleine Standorte ohne Server-Luftstrom
RTX PRO 400024 GB, 145 Waktiv, Single SlotWorkstations und kompakte Server
RTX PRO 450032 GB, 200 Waktiv, Dual SlotErkennung plus ein kleines LLM
RTX PRO 500048 oder 72 GB, 300 Waktiv, Dual SlotErkennung, Diarisierung und ein 20B-LLM
NVIDIA L40S48 GB, 350 Wpassiv, Dual SlotLive-Anrufe, mit NVIDIAs veröffentlichten Streamwerten
RTX PRO 6000 Server Edition96 GB, bis zu 600 Wpassiv, Dual SlotErkennung plus ein LLM der 120B-Klasse

Speicher und Leistung von unserer GPU-Seite und NVIDIAs Produktseiten, gelesen am 9. Oktober 2026; die Eignung ist unsere Einschätzung der Werte in diesem Artikel.

Die passiven Karten brauchen den Luftstrom eines Servers, und die aktiv gekühlten RTX-PRO-Karten passen in Workstations und Edge-Systeme. Unser Vergleich von L4 und L40S und unser Vergleich der 70-W-Karten behandeln Bauformen und Kartenzahlen je Server.

faster-whisper steht unter der MIT-Lizenz und läuft ohne Lizenz für NVIDIA AI Enterprise. NVIDIAs NIM-FAQ, aktualisiert am 6. August 2026, gibt an, dass der Produktivbetrieb von NIM eine Lizenz für NVIDIA AI Enterprise erfordert, die je GPU lizenziert wird.

Datenschutz und Sicherheit eines Transkriptionsservers

Aufgezeichnete Anrufe und Besprechungen, in denen Personen identifizierbar sind, sind personenbezogene Daten im Sinne der DSGVO, und ob und wie sie transkribiert werden dürfen, ist eine Bewertung für die Rechtsabteilung des Unternehmens. Technisch sollten Sie prüfen, dass keine Komponente Audio an einen gehosteten Dienst sendet. Die Modellkarte von pyannote etwa bietet das Modell Precision-2 über eine API auf den Servern von pyannoteAI an. Halten Sie Aufzeichnungen und Transkripte auf dem Server unter Ihrer Kontrolle, beschränken Sie den Zugriff auf seine API und härten Sie seinen Management-Controller, die Treiber und die Container-Runtime, wie in unserem Leitfaden zum Absichern eines GPU-Servers beschrieben. Kameraanalyse, einen verwandten Workload, behandelt unser Artikel zum GPU-Server für Videoanalyse.

Was wir liefern

Wir liefern die NVIDIA L4 und L40S, die RTX PRO 2000, 4000, 4000 SFF, 4500 und 5000 sowie die RTX PRO 6000 Server Edition als GPUs für Server, die Sie bereits betreiben, oder in auf Bestellung gebauten KI-Servern, montiert und im Burn-in getestet, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Vor Ihrer Bestellung bestätigen wir, dass die Karte in Gehäuse und Steckplatz passt und dass das Rack sie mit Strom versorgen und kühlen kann. Lizenzen für NVIDIA AI Enterprise für NIM stehen auf derselben Rechnung. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch; Spracherkennungsmodelle und LLMs darauf sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Welche GPU-Anforderungen hat Whisper?
OpenAI nennt etwa 10 GB VRAM für Whisper large und etwa 6 GB für large-v3-turbo, und optimierte Runtimes wie faster-whisper brauchen weniger, laut dessen README etwa 4,5 GB für large-v2 in INT8 mit Batchgröße 8. NVIDIAs ASR NIM, das auch Whisper large-v3 bereitstellt, verlangt Compute Capability 8.0 und mindestens 16 GB VRAM. Über die Karte entscheidet meist der Durchsatz, nicht der Speicher.
Wie viel VRAM braucht Whisper large-v3?
OpenAIs Whisper-Repository nennt etwa 10 GB für die large-Modelle und etwa 6 GB für turbo. Das Profil von NVIDIAs ASR NIM für Whisper large-v3 reserviert 12,5 GB GPU-Speicher bei einer Batchgröße von 1.024. Eine Karte mit 16 GB fasst es, und eine Karte mit 48 GB lässt Platz für Diarisierung und ein LLM.
Welche GPU für Echtzeit-Transkription?
Live-Transkription braucht ein Streaming-Modell wie Parakeet CTC, Parakeet RNNT oder Nemotron ASR Streaming, da NVIDIAs ASR NIM Whisper nur offline ausführt. NVIDIAs Werte vom 7. Oktober 2026 nennen für eine L40S bis zu 190 englische Live-Streams mit Parakeet 0.6B CTC bei 160-ms-Chunks und 64 Streams bei 33,9 ms durchschnittlicher Latenz. Einen solchen NVIDIA-Wert für die L4 oder die RTX-PRO-Karten haben wir nicht gefunden.
Kann Spracherkennung on-premise laufen?
Ja. Whisper ist unter der MIT-Lizenz veröffentlicht, NVIDIAs Parakeet- und Canary-Modelle unter CC BY 4.0, und alle laufen auf einem GPU-Server unter Ihrer Kontrolle. Der Produktivbetrieb von NVIDIAs Containern für ASR NIM erfordert eine Lizenz für NVIDIA AI Enterprise, faster-whisper dagegen nicht.
Was ist NVIDIA Parakeet?
Parakeet ist NVIDIAs Familie von Spracherkennungsmodellen, und die Modelle in NVIDIAs ASR NIM haben 0,6 oder 1,1 Milliarden Parameter. Parakeet TDT 0.6B v3, veröffentlicht im August 2025, transkribiert 25 europäische Sprachen mit Interpunktion und Zeitstempeln je Wort, unter CC BY 4.0. Auf einer A100 erreichte es im Paper zum Open ASR Leaderboard eine RTFx von 3.333, gegenüber 145,5 für Whisper large-v3.
Wie viele GPUs braucht ein Transkriptionsserver?
Für Live-Gespräche zählen Sie die Spitzenzahl gleichzeitiger Streams, für Aufzeichnungen teilen Sie die Stunden Audio durch die verfügbaren Stunden und erhalten die nötige RTFx. Nach unserer Schätzung aus NVIDIAs Werten passen 100 gleichzeitige englische Anrufe auf eine L40S, und nach den L4-Werten von E2E Networks braucht ein einmaliges Archiv von 10.000 Stunden mit Parakeet TDT 0.6B v3 etwa 42 Stunden auf einer L4. Sprecherdiarisierung und Zusammenfassungen erhöhen die Last; testen Sie daher zuerst mit Ihren eigenen Aufzeichnungen.

Schicken Sie uns die Stunden Audio pro Tag, die Spitzenzahl gleichzeitiger Anrufe, die Sprachen und ob Sie Sprecherzuordnung und Zusammenfassungen brauchen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien