KI für Kanzleien und Steuerberater on-premise: privates LLM, Vertraulichkeit, Dokumentvolumen und GPUs
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Eine Kanzlei oder Steuerkanzlei mit 200 bis 2.000 Mitarbeitern betreibt ein privates LLM auf GPU-Servern unter eigener Kontrolle, sodass Mandantendokumente, Prompts und Antworten ihren eigenen Zugriffsregeln unterliegen, mit Suche über das DMS je Mandat, Vertragsprüfung mit langem Kontext, Entwürfen und Übersetzung
- Auf EU-Ebene gelten für die Plattform die DSGVO und die KI-Verordnung, und der CCBE (2. Oktober 2025) und CFE Tax Advisers Europe (25. Februar 2026) haben Leitlinien zur KI-Nutzung durch Rechtsanwälte und Steuerberater veröffentlicht
- Das Dokumentvolumen bestimmt die Retrieval-Seite: Nach unserer Rechnung dauert das Embedding von 10 Millionen Chunks mit 512 Token bei NVIDIAs veröffentlichten NIM-Raten mit Nebenläufigkeit 1 rund 19 Stunden auf einer L40S und rund 56 Stunden auf einer L4, und die Vektoren mit 1.024 Dimensionen belegen rund 41 GB
- Die Kontextlänge bestimmt den GPU-Speicher: Mit gpt-oss-120b braucht ein Gespräch mit 32K 1,125 GiB 16-Bit-KV-Cache und eine Vertragsprüfung mit 128K 4,5 GiB, sodass nach unserer Schätzung eine RTX PRO 6000 19 oder 4 davon hält und eine H200 NVL 55 oder 13
- Mit den Beispielwerten dieses Artikels braucht eine Kanzlei mit 800 Mitarbeitern zwei Server mit je vier RTX PRO 6000 Server Edition oder zwei H200 NVL und dazu einer L40S, damit jeder Server die Spitze allein trägt
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Privates LLM für Kanzleien und Steuerberater: die kurze Antwort
Private KI für Kanzleien und Steuerkanzleien mit 200 bis 2.000 Mitarbeitern läuft on-premise als LLM auf GPU-Servern unter Kontrolle der Kanzlei, sodass Mandantendokumente, Prompts und Antworten auf Hardware bleiben, die den Zugriffsregeln der Kanzlei unterliegt. Die Plattform beantwortet Fragen über das Dokumentenmanagementsystem (DMS) mit Zugriff je Mandat, prüft lange Verträge in einem Kontextfenster und hilft bei Entwürfen und Übersetzungen. Die Hardware richtet sich nach dem Dokumentvolumen, das die Embedding- und Indexseite bestimmt, und nach der Kontextlänge der Prüfungen, die den GPU-Speicher je Gespräch bestimmt. Die Mitarbeiterzahl legt nur fest, wie viele Gespräche in der Spitze laufen.
Nach unserer Schätzung braucht eine Kanzlei mit 800 Mitarbeitern mit den Beispielwerten unten zwei Server mit je vier RTX PRO 6000 Server Edition oder zwei H200 NVL für das Sprachmodell und einer L40S für die Retrieval-Modelle, damit jeder Server die Spitze allein tragen kann. Die Zahlen sind Speicherschätzungen aus veröffentlichten Modellkonfigurationen, keine Messungen, und ein Pilot ersetzt die Nutzungswerte durch die eigenen Werte der Kanzlei.
Vertraulichkeit, DSGVO und KI-Verordnung auf EU-Ebene
Die Verschwiegenheitspflichten von Rechtsanwälten und Steuerberatern werden national geregelt, und wie sie auf eine KI-Plattform anzuwenden sind, klärt die eigene rechtliche Bewertung der Kanzlei. Auf EU-Ebene haben die europäischen Dachorganisationen beider Berufe Leitlinien veröffentlicht. Der Rat der Europäischen Anwaltschaften (CCBE) veröffentlichte am 2. Oktober 2025 seinen Leitfaden zur Nutzung generativer KI durch Rechtsanwälte. Der Bericht von eucrim vom 31. Oktober 2025 fasst seinen Punkt zur Vertraulichkeit so zusammen: „Rechtsanwälte dürfen keine personenbezogenen, vertraulichen oder mandantenbezogenen Informationen in Werkzeuge generativer KI eingeben.“ Der Bericht sagt nicht, ob dieser Punkt auch Werkzeuge erfasst, die auf Hardware unter Kontrolle der Kanzlei laufen.
CFE Tax Advisers Europe veröffentlichte am 25. Februar 2026 seine „Charter of Tax Advisers’ Rights and Obligations in an AI-Influenced Tax Advisory Environment“. Unter Datenschutz und Vertraulichkeit heißt es dort: „Die Einhaltung der DSGVO muss gewahrt werden, ebenso wie die Regeln zum Berufsgeheimnis und vertragliche Pflichten bei der Nutzung externer Werkzeuge.“ Unter Autonomie und professioneller Skepsis fügt die Charta hinzu, dass „Steuerberater die volle Verantwortung behalten, KI-Ausgaben anzunehmen, anzupassen oder zu verwerfen“.
Die DSGVO gilt für die Mandanten- und Mitarbeiterdaten in der Plattform wie für jedes andere System. Artikel 5 Absatz 1 Buchstabe f verlangt eine Verarbeitung, „die eine angemessene Sicherheit der personenbezogenen Daten gewährleistet“. Artikel 32 Absatz 1 nennt Maßnahmen wie die Verschlüsselung, die dauerhafte Vertraulichkeit der Systeme der Verarbeitung und die Fähigkeit, den Zugang zu den Daten nach einem Zwischenfall wiederherzustellen, und Artikel 28 regelt jeden Auftragsverarbeiter, der die Daten im Auftrag der Kanzlei verarbeitet. Akten in Arbeits- und Familiensachen oder zu Personenschäden können Gesundheitsdaten enthalten, eine besondere Kategorie nach Artikel 9 Absatz 1.
Nach der KI-Verordnung ist eine Kanzlei, die ein KI-System in eigener Verantwortung verwendet, Betreiber (Artikel 3 Nummer 4). Artikel 4 gilt seit dem 2. Februar 2025 und verlangt in der Fassung der Verordnung (EU) 2026/1744 von Betreibern, Maßnahmen zu ergreifen, um die Entwicklung der KI-Kompetenz ihres Personals zu unterstützen. Anhang III Nummer 8 Buchstabe a führt als hochriskant die Systeme auf, die bestimmungsgemäß von einer oder im Namen einer Justizbehörde verwendet werden sollen, um eine Justizbehörde „bei der Ermittlung und Auslegung von Sachverhalten und Rechtsvorschriften und bei der Anwendung des Rechts auf konkrete Sachverhalte zu unterstützen“, oder die auf ähnliche Weise für die alternative Streitbeilegung genutzt werden sollen. Die Verordnung (EU) 2026/1744 hat Anhang III nicht geändert, und Artikel 113 in der geänderten Fassung wendet die Hochrisiko-Vorschriften auf Nutzungen nach Anhang III ab dem 2. Dezember 2027 an. Ob eine bestimmte Nutzung in einer Kanzlei unter Nummer 8 Buchstabe a fällt, gehört zur selben rechtlichen Bewertung.
Workloads einer Kanzlei und die passende GPU
Das Sprachmodell in unseren Beispielen ist gpt-oss-120b, veröffentlicht unter Apache 2.0 mit 117B Parametern, davon 5,1B aktiv; seine Model Card ordnet es Anwendungsfällen zu, „die auf eine einzelne 80-GB-GPU passen“. Seine config.json nennt 36 Schichten, die Hälfte davon mit einem Sliding Window von 128 Token, mit 8 Key-Value-Köpfen der Dimension 64. Der 16-Bit-KV-Cache kostet deshalb in den Schichten mit voller Attention 36 KiB je Token: 1,125 GiB für ein Gespräch mit 32K und 4,5 GiB bei 128K, dem Maximum des Modells von 131.072 Token. Mit der Regel aus unserem Leitfaden zur Auslegung eines privaten ChatGPT-Servers lässt eine RTX PRO 6000 neben den 60,8 GiB Gewichten rund 22,2 GiB für den Cache und eine H200 NVL rund 62,5 GiB.
| WORKLOAD | MODELLKLASSE | SPEICHER JE EINHEIT | GPU IM BEISPIEL |
|---|---|---|---|
| Suche und Q&A über das DMS | 1B-Embedding-Modell und Reranker | kleine Gewichte; der Durchsatz entscheidet | L40S oder L4, oder eine MIG-Instanz mit 24 GB |
| Entwürfe, Zusammenfassungen | gpt-oss-120b, 32K Kontext | 1,125 GiB je Gespräch | RTX PRO 6000: 19; H200 NVL: 55 |
| Vertragsprüfung mit 128K | gpt-oss-120b, voller Kontext | 4,5 GiB je Gespräch | RTX PRO 6000: 4; H200 NVL: 13 |
| Übersetzung von Dokumenten | Übersetzungs-LLM mit 9B bis 12B | 16-Bit-Gewichte auf einer Karte | L40S oder RTX PRO 5000 für rund 1 Million Wörter am Tag |
| Indexierung des Archivs | Embedding-Modell in Batches | Durchsatz je Karte | L40S: 144,3 Chunks mit 512 Token pro Sekunde |
Unsere Schätzungen für gpt-oss-120b mit 16-Bit-KV-Cache, eine Kopie je Karte: 0,9 × vom Treiber gemeldeter Speicher, abzüglich 3 GiB, abzüglich 60,8 GiB Gewichte; Schichten und Köpfe aus der config.json des Modells auf Hugging Face, abgerufen am 10. Oktober 2026. Embedding-Rate von NVIDIAs Performance-Seite zu NIM 1.14.0 (aktualisiert am 30. September 2026, Llama Nemotron Embed 1B, FP8, Batch 64, Nebenläufigkeit 1); Übersetzung aus unserem Leitfaden zur maschinellen Übersetzung.
Mit einem anderen Modell ändern sich die Zahlen, und die Methode bleibt dieselbe. Unser Leitfaden zu Embedding- und Reranker-Servern vergleicht die Modelle und Serving-Engines. Für die Übersetzung legt unser Leitfaden zur maschinellen Übersetzung On-Premise Server nach Wörtern pro Tag aus und nennt die Übersetzungsmodelle mit nicht kommerziellen Lizenzen.
Dokumentvolumen: den Index für das DMS auslegen
Die Retrieval-Seite wird nach dem DMS-Archiv aus Schriftsätzen, Verträgen, Korrespondenz, Steuererklärungen und Arbeitspapieren ausgelegt. Nehmen Sie als Beispielwerte 1 Million Dokumente, jedes in 10 Chunks mit 512 Token zerlegt, also 10 Millionen Chunks. NVIDIAs Performance-Seite zu NIM 1.14.0 nennt für ihr 1B-Embedding-Modell in FP8 bei Batchgröße 64 und Nebenläufigkeit 1 144,3 Texte mit 512 Token pro Sekunde auf einer L40S und 49,2 auf einer L4. Nach unserer Rechnung dauert der erste vollständige Indexlauf auf einer L40S rund 19 Stunden und auf einer L4 rund 56 Stunden.
Das Modell liefert Vektoren mit 384 bis 2.048 Dimensionen. Bei 1.024 Dimensionen und vier Byte je Wert belegt jeder Vektor 4 KiB, 10 Millionen Chunks brauchen also rund 41 GB vor Indexstrukturen, Chunk-Text und Metadaten. Vektordatenbanken, die quantisierte Vektoren speichern, brauchen weniger, und der Index liegt im Arbeitsspeicher des Servers, sofern die Datenbank ihn nicht auf dem Datenträger hält; das bestimmt den Arbeitsspeicher des Retrieval-Servers. Jeder Chunk trägt außerdem die Mandatsnummer, den Mandanten, das Dokumentdatum und die Zugriffsliste seiner Quelle, die der Filter je Mandat braucht.
Nach dem ersten Lauf werden nur neue und geänderte Dokumente eingebettet, eine kleine tägliche Last. Ein Wechsel des Embedding-Modells bedeutet, das ganze Archiv neu einzubetten; die Karte für den Index wird deshalb auch für diesen Lauf ausgelegt. Gescannte Akten brauchen vor dem Embedding eine Texterkennung, die eigene Verarbeitungszeit hinzufügt.
Lange Verträge: die Kontextlänge bestimmt den Speicher
Die Prüfung eines vollständigen Vertrags mit seinen Anlagen in einer Anfrage braucht ein langes Kontextfenster, während eine Frage über das ganze Archiv über das Retrieval läuft. Bei 128K Token hält eine Prüfung auf gpt-oss-120b 4,5 GiB Cache, viermal so viel wie ein Chat mit 32K; drei gleichzeitige Prüfungen belegen also so viel Speicher wie zwölf Chats. Dokumente, die länger sind als die 131.072 Token des Modells, werden aufgeteilt oder über das Retrieval bearbeitet.
Ein Prompt mit 128K braucht außerdem Rechenzeit, bevor das erste Token erscheint; die Antwortzeit der Prüfungen wird deshalb auf der Zielkarte mit den eigenen Verträgen der Kanzlei geprüft. Wenn mehrere Anwälte Fragen zum selben Vertrag stellen, verwendet Prefix Caching den bereits verarbeiteten Prompt wieder. Unser Leitfaden zur Hardware für LLMs mit langem Kontext vergleicht den Cache je Token anderer Modelle und die Konfigurationen für 256K und 1M Token.
Rechenbeispiele für 300, 800 und 2.000 Mitarbeiter
Wir verwenden die Beispielwerte unseres Leitfadens zur Auslegung: 40 Prozent der Mitarbeiter in der Spitzenstunde aktiv, je 6 Anfragen pro Stunde, 30 Sekunden je Anfrage und ein Spitzenfaktor von 2. Für 800 Mitarbeiter ergibt das 320 Nutzer, 1.920 Anfragen pro Stunde und 32 Gespräche in der Spitze. Zusätzlich nehmen wir als Beispielwerte lange Prüfungen in der Spitze an, 2, 6 und 15 für die drei Größen. Jede Größe sieht zwei Server vor, von denen jeder die ganze Spitze hält, damit der Dienst weiterläuft, wenn einer ausfällt.
| MITARBEITER | SPITZENCHATS BEI 32K | PRÜFUNGEN BEI 128K | CACHE IN DER SPITZE | JEDER VON 2 SERVERN |
|---|---|---|---|---|
| 300 | 12 | 2 | 22,5 GiB | 2 × RTX PRO 6000 oder 1 × H200 NVL, dazu 1 × L4 |
| 800 | 32 | 6 | 63 GiB | 4 × RTX PRO 6000 oder 2 × H200 NVL, dazu 1 × L40S |
| 2.000 | 80 | 15 | 157,5 GiB | 8 × RTX PRO 6000 mit der L40S in einem dritten Server, oder 3 × H200 NVL und 1 × L40S |
Nutzer und Spitzen aus den Beispielwerten oben; die Prüfungen in der Spitze sind Beispielwerte; Cache mit 1,125 GiB je Chat mit 32K und 4,5 GiB je Prüfung mit 128K für gpt-oss-120b in 16 Bit, mit 22,2 GiB je RTX PRO 6000 und 62,5 GiB je H200 NVL nach unserer Schätzung.
Bei 300 Mitarbeitern braucht die Spitze 22,5 GiB Cache, knapp mehr als eine RTX PRO 6000; jeder Server bekommt deshalb zwei Karten oder eine H200 NVL mit Reserve. Bei 800 Mitarbeitern halten vier RTX PRO 6000 88,8 GiB und zwei H200 NVL 125 GiB gegenüber den benötigten 63 GiB. Bei 2.000 Mitarbeitern halten acht RTX PRO 6000 177,6 GiB und füllen damit einen Server mit acht GPUs; die L40S für die Retrieval-Modelle kommt deshalb in die Variante mit H200 NVL oder in einen dritten, kleineren Server. Jede Zeile ist eine Speicherobergrenze, und die Antwortzeit unter Last braucht einen eigenen Test.
Wir bauen Inferenz-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern, und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns Mitarbeiterzahl, Dokumentvolumen und die Vertragslängen Ihrer Prüfungen über das Formular unten.
Zugriff je Mandat, Protokollierung und Aufbewahrung
In einer Kanzlei ist das Mandat die Einheit des Zugriffs. Der Assistent darf nur Passagen aus Dokumenten abrufen, die der anfragende Nutzer im DMS öffnen kann, und wird ein Anwalt von einem Mandat abgeschirmt, folgt der Index dieser Änderung. Unser Leitfaden zu RAG auf Unternehmensdaten erklärt, wie der Filter beim Abruf arbeitet und warum eine Anweisung im Prompt den Zugriff nicht steuert. Die Tabelle ordnet die Kontrollen, die eine Kanzlei verlangt, der Plattform und den EU-Texten oben zu.
| KONTROLLE | UMSETZUNG | EU-BEZUG |
|---|---|---|
| Zugriff je Mandat | jeder Chunk trägt das Mandat und die Zugriffsliste seiner DMS-Quelle; der Abruf filtert vor dem Ranking | DSGVO Art. 5 Abs. 1 Buchst. f, Art. 32 Abs. 1 Buchst. b |
| Informationsbarrieren | die Rechte eines abgeschirmten Nutzers ändern sich im DMS, und der Index synchronisiert sich bei dieser Änderung neu | DSGVO Art. 32 Abs. 1 Buchst. b |
| Anfrage- und Antwort-Log | Nutzer, Zeit, Mandat, abgerufene Passagen und Antwort, auf dem Storage der Kanzlei gespeichert | DSGVO Art. 5 Abs. 2 |
| Aufbewahrung | Prompts, Antworten und Logs nach der von der Kanzlei festgelegten Frist gelöscht, Testkopien eingeschlossen | DSGVO Art. 5 Abs. 1 Buchst. e, Art. 30 Abs. 1 Buchst. f |
| Keine externen Dienste | öffentliche Modell-APIs abgeschaltet; ein externer Aufruf nur nach ausdrücklicher Entscheidung, sichtbar im Log | DSGVO Art. 28, Art. 44 |
| Wiederherstellung | Backup von Index, Konfiguration und Logs, mit Wiederherstellungstests | DSGVO Art. 32 Abs. 1 Buchst. c und d |
| Überprüfung | Antworten nennen das Quelldokument und sein Datum zur Prüfung durch den Anwalt | CCBE-Leitfaden; CFE-Charta |
Verordnung (EU) 2016/679 auf eur-lex.europa.eu; CCBE-Leitfaden nach dem Bericht von eucrim vom 31. Oktober 2025; CFE-Charta vom 25. Februar 2026. Die Zuordnung ist unsere technische Lesart, keine rechtliche Bewertung.
Artikel 30 Absatz 1 Buchstabe f verlangt im Verzeichnis von Verarbeitungstätigkeiten, „wenn möglich, die vorgesehenen Fristen für die Löschung“ anzugeben; die Aufbewahrungsfrist für Prompts und Logs wird deshalb vor dem Produktivstart festgelegt.
Assistenten, die wir in unserer Leistung Private AI/ML bauen, geben die Quelle an und beachten die Zugriffsrechte jedes Nutzers, und Anfragen und Antworten werden protokolliert. Beschreiben Sie Ihr DMS und wie der Zugriff auf Mandate vergeben wird im Formular unten.
Was wir liefern
Wir liefern die RTX PRO 6000 Server Edition, die H200 NVL, die L40S, die L4 und die RTX PRO 5000 aus diesem Artikel, als Karten für Server, die Sie betreiben, oder in nach Auftrag gebauten KI-Servern mit 2 bis 8 GPUs je Knoten, im Burn-in getestet, mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen, und liefern Konfiguration und Angebot innerhalb eines Werktages. Die Plattform darüber, mit RAG, Zugriffsrechten und dem Query-Log, ist unsere Leistung Private AI/ML mit Engineering von unserem Engineering-Partner Vixen.UNO, in Ihrer Infrastruktur oder auf dedizierter Hardware in einem Tier-3-Rechenzentrum in Litauen. Lizenzen für NVIDIA AI Enterprise kommen auf dieselbe Rechnung, und unser Sortiment professioneller GPUs führt die Karten.
FAQ
Was braucht KI für Kanzleien on-premise?
Ist ein privates LLM in der Kanzlei mit Berufsgeheimnis und Datenschutz vereinbar?
Wie viele GPUs braucht ein KI-Server für eine Kanzlei mit 800 Mitarbeitern?
Welche Hardware brauchen Steuerberater für KI on-premise?
Wie groß ist der Vektorindex für das DMS einer Kanzlei?
Ist juristische KI on-premise nach der KI-Verordnung hochriskant?
Schicken Sie uns Ihre Mitarbeiterzahl, die Zahl der Dokumente in Ihrem DMS, die Vertragslängen, die Sie in einer Anfrage prüfen, und wie der Zugriff auf Mandate heute vergeben wird. Wir antworten innerhalb eines Werktages mit Konfiguration und Angebot und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages