Callcenter-KI on-premise: GPUs, um Anrufe zu transkribieren und Gespräche zusammenzufassen, für 200 bis 1.000 Agenten
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Callcenter-KI on-premise läuft in zwei GPU-Stufen, Spracherkennung für jede Gesprächsminute und ein LLM-Durchgang je Gespräch, beide dimensioniert nach den gleichzeitigen Gesprächen in der Spitzenstunde und den Gesprächsminuten pro Tag
- Getrennte Kanäle für Agent und Kunde machen eine Sprecherdiarisierung überflüssig, verdoppeln aber die Audiostreams: 1.000 Agenten, die gleichzeitig telefonieren, ergeben 2.000 Streams
- NVIDIA gibt je L40S maximal 190 englische Live-Streams mit Parakeet 0.6B CTC bei 160-ms-Chunks an und 900 bei 960 ms; Live-Assistenz für 1.000 Agenten braucht nach unserer Schätzung allein für die Spracherkennung 4 bis 16 L40S
- Zusammenfassungen sind die kleine Stufe: In MLPerf Inference v6.0 erzeugten acht RTX PRO 6000 Server Edition offline 48.613,8 Token pro Sekunde mit Llama 3.1 8B, und nach unserer Schätzung deckt eine Karte die Zusammenfassungen von 1.000 Agenten ab
- Der AI Act verbietet seit dem 2. Februar 2025, Emotionen von Beschäftigten abzuleiten; die Stimmen der Agenten gehen daher an kein Emotionsmodell, und Aufzeichnungen und Transkripte brauchen Aufbewahrungsfristen nach der DSGVO
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Callcenter-KI on-premise: zwei GPU-Stufen
Callcenter-KI on-premise läuft in zwei GPU-Stufen. Die Spracherkennung macht aus jeder Gesprächsminute ein Transkript, und ein Sprachmodell liest jedes Transkript einmal, um die Zusammenfassung, den Anrufgrund und den nächsten Schritt zu schreiben. Beide Stufen werden aus denselben zwei Zahlen dimensioniert: den gleichzeitig laufenden Gesprächen in der Spitzenstunde und den Gesprächsminuten pro Tag.
In unserer Schätzung unten passen Zusammenfassungen nach dem Gespräch für 200 englischsprachige Agenten auf zwei Rechenzentrumskarten, während Live-Assistenz für 1.000 Agenten allein für die Spracherkennung 4 bis 16 L40S braucht, dazu zwei RTX PRO 6000 Server Edition. Sprachmodelle, ihren VRAM-Bedarf und ihre RTFx behandelt unser Leitfaden zur Dimensionierung von Whisper und Parakeet.
Spracherkennung und LLM: Modelle und GPUs je Stufe
Live-Transkription braucht ein Streaming-Modell wie Parakeet CTC oder Parakeet RNNT 1.1B multilingual, da NVIDIAs ASR NIM Whisper nur offline ausführt. Nach dem Gespräch lassen sich Offline-Modelle wie Parakeet TDT 0.6B v3 mit 25 europäischen Sprachen einsetzen.
Zeichnen Sie Agent und Kunde auf getrennten Kanälen auf, wo die Telefonieplattform es zulässt. Die Sprecherzuordnung ergibt sich dann aus dem Kanal, und es wird kein Diarisierungsmodell gebraucht, das bei einer gemischten Aufzeichnung mehr GPU-Zeit beanspruchen kann als die Transkription. Im Gegenzug wird jedes Gespräch zu zwei Audiostreams.
Der LLM-Durchgang liest ein langes Transkript und schreibt einen kurzen Text. Der MLPerf-Benchmark mit Llama 3.1 8B hat dieselbe Form: Er fasst Nachrichtenartikel aus CNN/DailyMail zusammen, „mit einer durchschnittlichen Eingabelänge von 778 Token und einer Ausgabelänge von 73 Token“, wie MLCommons ihn beschreibt. Wir nutzen seine Ergebnisse als Referenz für ein Zusammenfassungsmodell der 8B-Klasse; ein größeres Modell senkt die Rate, wie die 70B-Werte in unserem Leitfaden zur Batch-Inferenz mit LLMs zeigen.
| STUFE | MODELLKLASSE | VERÖFFENTLICHTE ZAHL | GELIEFERTE KARTE |
|---|---|---|---|
| Live-Spracherkennung | Streaming, Parakeet 0.6B CTC | bis zu 190 englische Streams bei 160 ms, 900 bei 960 ms, eine L40S | L40S |
| Nach dem Anruf, Englisch | offline, Parakeet 0.6B CTC | RTFx 3.638 bei 32 parallelen Anfragen, eine L40S | L40S |
| Nach dem Anruf, 25 Sprachen | offline, Parakeet TDT 0.6B v3 | 238,9-fache Audiodauer bei Batch 8 mit englischem Audio, eine L4 | L4 |
| GesprächsZusammenfassung | LLM, 8B-Klasse, Batch | 48.613,8 Token pro Sekunde, acht Karten, offline | RTX PRO 6000 Server Edition |
| Live-Agentenassistenz | LLM, 8B-Klasse, latenzgebunden | 47.581,0 Token pro Sekunde, acht Karten, Server-Szenario | RTX PRO 6000 Server Edition |
Performance-Seite von NVIDIA zu ASR NIM, zuletzt aktualisiert am 7. Oktober 2026 (L40S, Englisch, maximale effektive Streams, wie NVIDIA sie angibt); Blog von E2E Networks vom 27. März 2026 (100 englische LibriSpeech-Äußerungen auf einer L4); MLPerf® Inference v6.0, Datacenter-Suite, Closed Division, Kategorie Available, Llama 3.1 8B, Eintrag 6.0-0005, acht RTX PRO 6000 Blackwell Server Edition, FP4-Gewichte, Offline- und Server-Szenario, abgerufen aus dem v6.0-Ergebnis-Repository von MLCommons am 10. Oktober 2026, Ergebnisse von der MLCommons Association verifiziert. Das Server-Szenario hält laut der Benchmark-Beschreibung von MLCommons die Zeit bis zum ersten Token bei höchstens 2 s und die Zeit je Ausgabe-Token bei höchstens 100 ms. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.
Echtzeit-Agentenassistenz oder Verarbeitung nach dem Gespräch
Die Verarbeitung nach dem Gespräch transkribiert die Aufzeichnung und fasst sie zusammen, wenn das Gespräch endet, und die Jobs können sich in einer Warteschlange sammeln. Die Hardware hält mit der Spitzenstunde Schritt, wenn die Zusammenfassung zum nächsten Gespräch fertig sein muss, oder mit der Tagesmenge, wenn sie bis zum nächsten Morgen warten darf.
Echtzeit-Agentenassistenz transkribiert während des Gesprächs beide Kanäle und fragt das LLM jedes Mal nach einer vorgeschlagenen Antwort, wenn der Kunde zu Ende gesprochen hat; sie wird daher für die Spitze ausgelegt. In NVIDIAs Werten für die L40S liefen 512 englische Streams mit 960-ms-Chunks bei 198,8 ms durchschnittlicher Latenz, und der Text kommt in Schritten von etwa einem Chunk an. Mit 160-ms-Chunks liefen 64 Streams bei 33,9 ms, und NVIDIA gibt ein Maximum von 190 statt 900 Streams an; kurze Chunks brauchen also fast fünfmal so viele Karten.
Jede Vorschlagsanfrage sendet das bisherige Gespräch. Das automatische Prefix-Caching von vLLM „speichert den KV-Cache vorhandener Anfragen zwischen, sodass eine neue Anfrage den KV-Cache direkt wiederverwenden kann, wenn sie dasselbe Präfix hat“, und seine Dokumentation nennt Gespräche über mehrere Runden als Anwendungsfall. Ist es eingeschaltet, berechnet jede Anfrage vor allem den neuen Gesprächsbeitrag statt des ganzen Gesprächs. Legen Sie Ziele für die Zeit bis zum ersten Token und die Zeit je Ausgabe-Token fest, wie es unser Leitfaden zu Latenzzielen für LLMs beschreibt, und testen Sie sie bei der Parallelität der Spitzenstunde.
Die Streaming-Ergebnisse für die L40S, die wir auf NVIDIAs Seite lesen konnten, umfassen Englisch, Spanisch, Vietnamesisch und Mandarin, und für Deutsch, Polnisch, Tschechisch oder Rumänisch haben wir dort keinen Stream-Wert gefunden. Für diese Sprachen bestimmt ein Test mit Ihren eigenen Aufzeichnungen die Zahl, und der Speicher des Streaming-Profils muss auf die Karte passen.
Dimensionierung nach Gesprächen in der Spitzenstunde und Minuten pro Tag
- Nehmen Sie die gleichzeitig laufenden Gespräche in der Spitzenstunde oder, als Obergrenze, die Zahl der angemeldeten Agenten.
- Multiplizieren Sie mit zwei für getrennte Kanäle; das Ergebnis sind die Live-Streams und die Audiostunden je Stunde in der Spitze.
- Für Live-Assistenz teilen Sie die Streams durch die Streams je Karte, mit denen Sie planen; wir planen mit etwa 70 Prozent des von NVIDIA angegebenen Maximums.
- Für die Verarbeitung nach dem Gespräch braucht die Sprachstufe eine RTFx mindestens gleich der Zahl der in der Spitzenstunde aufgezeichneten Kanäle, wenn die Zusammenfassungen Schritt halten müssen, oder die Kanalstunden des Tages geteilt durch die Stunden des Verarbeitungsfensters, wenn sie warten dürfen.
- Für das LLM multiplizieren Sie die pro Stunde beendeten Gespräche mit den Ausgabe-Token je Zusammenfassung, addieren die Token der Live-Vorschläge und teilen durch die Token pro Sekunde, mit denen Sie je Karte planen.
Ein Beispiel zu Schritt 4: Sprechen 1.000 Agenten 5 Stunden am Tag auf zwei Kanälen, entstehen 10.000 Kanalstunden pro Tag. Das erfordert in einem nächtlichen Fenster von 12 Stunden eine RTFx von etwa 833 und 2.000, um mit einer Spitzenstunde Schritt zu halten, in der jeder Agent im Gespräch ist.
GPU-Schätzung für 200, 500 und 1.000 Agenten
| AGENTEN, SPITZE | LIVE-STREAMS | SPRACHE NACH ANRUF | LIVE-SPRACHE, L40S | LLM, RTX PRO 6000 |
|---|---|---|---|---|
| 200 Agenten, 200 Anrufe | 400 | 1 L40S (Englisch) oder 4 L4 | 1 bei 960 ms, 4 bei 160 ms | 1, mit oder ohne Assistenz |
| 500 Agenten, 500 Anrufe | 1.000 | 1 L40S (Englisch) oder 9 L4 | 2 bei 960 ms, 8 bei 160 ms | 1, mit oder ohne Assistenz |
| 1.000 Agenten, 1.000 Anrufe | 2.000 | 2 L40S (Englisch) oder 17 L4 | 4 bei 960 ms, 16 bei 160 ms | 1 für Zusammenfassungen, 2 mit Assistenz |
Unsere Schätzungen, keine Messungen, aus den Werten der ersten Tabelle: Live-Streams mit 70 Prozent der von NVIDIA angegebenen Maxima (133 und 630 je L40S, Englisch), Spracherkennung nach dem Gespräch mit der Hälfte der veröffentlichten Raten (RTFx 1.819 je L40S für Englisch, 119 je L4 für das Modell mit 25 Sprachen, aus einem englischen Test, Schritt halten mit der Spitzenstunde), LLM mit der Hälfte der MLPerf-Raten je Karte (3.038 Token pro Sekunde offline, 2.974 im Server-Szenario). Mit Live-Spracherkennung nutzen die Zusammenfassungen das Live-Transkript, und die Spalte für die Spracherkennung nach dem Anruf entfällt. Ein strengeres Latenzziel für Live-Vorschläge als das von MLPerf senkt die Rate je Karte.
Die Tabelle nimmt an, dass in der Spitzenstunde jeder Agent im Gespräch ist und Gespräche im Durchschnitt 6 Minuten dauern. Sie nimmt außerdem Zusammenfassungen mit 150 Ausgabe-Token an und, mit Live-Assistenz, alle 20 Sekunden je Gespräch einen Vorschlag mit 80 Token.
Bei 1.000 Agenten enden in der Spitzenstunde 10.000 Gespräche, und ihre Zusammenfassungen ergeben etwa 417 Ausgabe-Token pro Sekunde, etwa 14 Prozent dessen, womit wir je RTX PRO 6000 planen. Live-Vorschläge kommen mit etwa 4.000 Token pro Sekunde hinzu; deshalb verdoppelt die Assistenz die LLM-Karten. Für den Weg mit 25 Sprachen ist der einzige veröffentlichte Wert für Parakeet TDT v3, den wir gefunden haben, der englische Test auf der L4, und für die L40S oder die RTX PRO 6000 haben wir keinen gefunden; ein Testlauf mit Ihren eigenen Aufzeichnungen bestimmt daher die Karte. Dürfen die Zusammenfassungen bis zur Nacht warten, passt die Sprachstufe für 1.000 Agenten nach derselben Rechnung auf 7 L4.
Wir bauen KI-Server auf Bestellung mit Karten vom Typ L4, L40S und RTX PRO 6000 Server Edition und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Agentenzahl, Gespräche in der Spitzenstunde und Sprachen über das Formular unten.
Aufzeichnungen und Transkripte: Speicher und Aufbewahrung nach der DSGVO
ITU-T G.711, der PCM-Codec für Sprache, legt „8.000 Abtastwerte pro Sekunde“ mit acht Bit je Abtastwert fest; ein Kanal belegt also 64 kbit/s oder nach unserer Rechnung 28,8 MB pro Stunde. Bei dieser Rate ergeben die 10.000 Kanalstunden von 1.000 Agenten 288 GB Audio pro Tag. Transkripte und Zusammenfassungen belegen einen kleinen Bruchteil davon.
Aufgezeichnete Gespräche, in denen ein Anrufer oder ein Agent identifiziert werden kann, sind personenbezogene Daten. Die DSGVO verlangt, dass sie „auf das für die Zwecke der Verarbeitung notwendige Maß beschränkt“ sind (Artikel 5 Absatz 1 Buchstabe c) und in einer Form gespeichert werden, die die Identifizierung „nur so lange ermöglicht, wie es für die Zwecke, für die sie verarbeitet werden, erforderlich ist“ (Artikel 5 Absatz 1 Buchstabe e). Audio, Transkript und Zusammenfassung können getrennte Aufbewahrungsfristen haben, und der Löschjob entfernt das Transkript aus dem Suchindex ebenso wie aus dem Dateispeicher. Gespräche können Gesundheitsdaten enthalten, eine besondere Kategorie nach Artikel 9 Absatz 1; vergeben Sie den Zugriff daher nach Rollen und protokollieren Sie Suchen über Transkripte.
Ob Gespräche aufgezeichnet, transkribiert und zusammengefasst werden dürfen und wie lange jeder Teil aufbewahrt wird, ist eine rechtliche Bewertung für die Rechtsabteilung des Unternehmens. Unser Leitfaden zu einer Datenschutz-Folgenabschätzung für ein internes LLM behandelt die Dokumentation für ein solches System.
Emotionserkennung und der AI Act im Contact Center
Artikel 5 Absatz 1 Buchstabe f des AI Act verbietet die Verwendung von KI-Systemen, die Emotionen einer natürlichen Person am Arbeitsplatz und in Bildungseinrichtungen ableiten, außer aus medizinischen Gründen oder Sicherheitsgründen, und die Verbote gelten seit dem 2. Februar 2025. Erwägungsgrund 18 erläutert, dass ein Emotionserkennungssystem Emotionen oder Absichten natürlicher Personen „auf der Grundlage ihrer biometrischen Daten“ erkennt oder ableitet. Die bloße Erkennung von Stimmmerkmalen einer Person, „wie eine erhobene Stimme oder ein Flüstern“, fällt nicht darunter, „es sei denn, sie werden zum Erkennen oder Ableiten von Emotionen verwendet“.
Die Kommission hat am 4. Februar 2025 Leitlinien zu verbotenen Praktiken veröffentlicht, und CMS hat deren Beispiele am 10. Februar 2025 zusammengefasst. Unter den verbotenen Beispielen nennt diese Zusammenfassung, in unserer Übersetzung, „Webcams und Spracherkennungssysteme, mit denen ein Callcenter die Emotionen seiner Beschäftigten verfolgt“. Unter den Beispielen außerhalb des Verbots nennt sie Spracherkennung, die die Emotionen von Kunden verfolgt, und „KI-Systeme, die Emotionen aus geschriebenem Text ableiten und nicht auf biometrischen Daten beruhen“.
Auf der Plattform geht der Kanal des Agenten an kein Modell, das Emotionen aus der Stimme bewertet, und getrennte Kanäle machen daraus eine Routing-Regel. Emotionserkennung bei Kunden anhand ihrer Stimme bleibt ein Emotionserkennungssystem: Nach Artikel 50 Absatz 3 informieren die Betreiber die davon betroffenen Personen, und Anhang III Nummer 1 Buchstabe c führt es als hochriskant auf. Die Bewertung von Agenten anhand ihrer Transkripte kann unter Anhang III Nummer 4 Buchstabe b fallen, der Systeme für die „Beobachtung und Bewertung der Leistung und des Verhaltens von Personen in solchen Beschäftigungsverhältnissen“ erfasst. Nach dem geänderten AI Act gelten die Hochrisiko-Vorschriften für Nutzungen nach Anhang III ab dem 2. Dezember 2027, wie unser Leitfaden zum EU AI Act für Unternehmen, die LLMs nutzen erläutert, und Zusammenfassungen, Suche und Vorschläge sind in Anhang III keine aufgeführten Zwecke.
Spracherkennung und LLM auf einer Plattform mit zwei Servern
Live-Assistenz ist Teil des Arbeitstags der Agenten; planen Sie daher für den Ausfall eines Servers. Zwei Server, die jeweils die Sprachmodelle und das LLM ausführen, lassen einen mit halber Kapazität weiterlaufen, während der andere repariert oder aktualisiert wird. Die Aufzeichnung hängt nicht von den GPU-Servern ab, und Jobs nach dem Gespräch warten in einer Warteschlange, bis die Server wieder verfügbar sind.
Die L40S und die RTX PRO 6000 Server Edition sind passiv gekühlte Karten, die den Luftstrom eines Servers brauchen, und die L4 mit 72 W eignet sich für dichte Knoten zur Verarbeitung nach dem Gespräch. NVIDIAs NIM-Container brauchen für den Produktiveinsatz eine Lizenz für NVIDIA AI Enterprise, während Open-Source-Engines wie vLLM ohne sie laufen.
Unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO, setzt offene und kommerzielle Modelle auf Servern unter Ihrer Kontrolle ein. Nennen Sie uns die Gespräche, die Sie zuerst zusammenfassen würden, und die Sprachen Ihrer Agenten.
Was wir liefern
Wir liefern die NVIDIA L4 und L40S und die RTX PRO 6000 Server Edition als GPUs für Server, die Sie bereits betreiben, oder in KI-Servern auf Bestellung, montiert und im Burn-in getestet, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Lizenzen für NVIDIA AI Enterprise für NIM kommen auf dieselbe Rechnung. Die Bereitstellung der Modelle on-premise ist unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO und Support unter einem vereinbarten SLA.
FAQ
Kann Callcenter-KI on-premise laufen?
Welchen Server brauche ich, um Anrufe zu transkribieren?
Wie viel GPU braucht eine Gesprächszusammenfassung mit KI?
Welche GPU eignet sich für KI im Callcenter?
Was braucht Echtzeit-Agentenassistenz on-premise?
Verbietet der AI Act Emotionserkennung im Callcenter?
Schicken Sie uns die Zahl der Agenten, die gleichzeitigen Gespräche in der Spitzenstunde, die Gesprächsminuten pro Tag, die Sprachen und ob Sie Live-Assistenz für Agenten oder Zusammenfassungen nach dem Gespräch brauchen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages