BLOG · GUIDE ·

Prompt Injection und LLM-Sicherheit für interne Assistenten: OWASP Top 10, RAG und Agenten

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Prompt Injection ist Text, der verändert, was ein Sprachmodell tut, von einem Nutzer eingegeben oder versteckt in einem Dokument, einer E-Mail, einer Webseite oder dem Ergebnis eines Werkzeugs, das das Modell liest; OWASP führt sie in den Top 10 for LLM Applications 2026 als LLM01 an erster Stelle
  • Indirekte Prompt Injection braucht kein Konto beim Assistenten: Wer in ein Wiki, eine Dateifreigabe, ein Postfach oder eine Webseite schreiben kann, die der Assistent liest, kann dort Anweisungen unterbringen, auch als weißen Text auf weißem Grund oder als Text in einem Bild
  • Berechtigungsprüfungen beim Abruf halten die Dokumente anderer Personen aus dem Kontext heraus, doch eine eingeschleuste Anweisung kann trotzdem versuchen, die eigenen Daten des Nutzers über einen gerenderten Bildlink, eine E-Mail oder ein anderes Werkzeug nach außen zu schicken
  • Für Agenten verlangt OWASPs Eintrag zu Excessive Agency, seit der Ausgabe 2026 LLM03, minimale Werkzeuge und Berechtigungen, Aktionen im Kontext des anfragenden Nutzers, eine Autorisierung außerhalb des Modells und eine menschliche Freigabe für folgenreiche Aktionen
  • Das britische NCSC schrieb im Dezember 2025, dass sich Prompt Injection möglicherweise nie so vollständig entschärfen lässt wie SQL-Injection, und Meta nennt sie eine ungelöste Schwachstelle aller LLMs, deshalb ist das Ziel des Designs ein begrenzter Schaden

Eurokommerz × Vixen.UNO: Private AI/ML  Experten kontaktieren →

Prompt Injection: was sie ist und was sie anrichten kann

Prompt Injection ist ein Angriff, bei dem Text, der ein Sprachmodell erreicht, das Verhalten des Modells verändert. Ein Nutzer kann ihn eingeben, oder er steckt in einem Dokument, einer E-Mail, einer Webseite oder dem Ergebnis eines Werkzeugs, das der Assistent liest. OWASP führt Prompt Injection in den Top 10 for LLM Applications 2026 als LLM01 an erster Stelle und hält fest, dass „heute kein zuverlässiger Mechanismus zur Verhinderung existiert“. Bei einem internen Assistenten hängt die LLM-Sicherheit deshalb vor allem davon ab, dass begrenzt wird, was eine eingeschleuste Anweisung erreichen kann: die für den Nutzer abgerufenen Dokumente, die Werkzeuge, die der Assistent aufrufen darf, und die Ziele, an die seine Ausgaben gehen.

Das britische National Cyber Security Centre (NCSC) erklärte die Ursache am 8. Dezember 2025 und schrieb, dass in einem LLM „nicht zwischen ‚Daten‘ und ‚Anweisungen‘ unterschieden wird“. Systemprompt, Frage und jeder abgerufene Abschnitt erreichen das Modell als eine einzige Folge von Token. Mit Zugriff auf Postfächer oder APIs kann eine eingeschleuste Anweisung im Namen des Nutzers handeln. Den Server und seine Inferenz-API behandelt unser Leitfaden zum Absichern eines GPU-Servers.

Direkte und indirekte Prompt Injection

Nach OWASPs Text von 2026 ist eine Prompt Injection direkt, wenn ein Nutzer oder ein Angreifer mit dem Zugangsweg des Nutzers „Eingaben liefert, die das Verhalten des Modells auf unerwünschte Weise verändern“, und Jailbreaking ist die Teilmenge der Prompt Injection, die das Modell dazu bringen soll, seine Sicherheitsprotokolle zu verletzen. Eine indirekte Prompt Injection entsteht, wenn das Modell „Inhalte aus einer externen Quelle aufnimmt“, die „Daten enthalten, die als Prompt Injection wirken“. Wer in eine Quelle schreiben kann, die der Assistent liest, kann dort Anweisungen unterbringen: im PDF eines Lieferanten, auf einer bearbeitbaren Wiki-Seite, in einer E-Mail an ein überwachtes Postfach, in einem Ticket oder in einem Suchergebnis. Solche Eingaben „müssen in der gerenderten Oberfläche nicht sichtbar sein, um das Modell zu beeinflussen“, und eines der Szenarien von OWASP versteckt eine Anweisung in einem Bild, unterhalb der visuellen Wahrnehmungsschwelle des Menschen.

NIST AI 100-2 E2025, die Taxonomie des NIST zu Angriffen auf Systeme des maschinellen Lernens vom März 2025, behandelt direkte Prompting-Angriffe (Abschnitt 3.3), indirekte Prompt Injection (3.4) und die Sicherheit von Agenten (3.5) getrennt. Ihr Index führt sowohl Prompt Injection (NISTAML.018) als auch indirekte Prompt Injection (NISTAML.015) unter Verletzungen der Verfügbarkeit, Verletzungen der Integrität und Kompromittierungen der Privatsphäre bei generativer KI, Prompt Injection außerdem unter Verletzungen durch Missbrauch.

OWASP Top 10 für LLM-Anwendungen 2026

Die Ressourcenseite von OWASP datiert die Ausgabe 2026 auf den 3. August 2026. Hidden Context Exposure, von OWASP „ein breiter gefasster Rahmen“ genannt, ersetzt System Prompt Leakage, und Excessive Agency rückt auf den dritten Platz vor. Die Tabelle ergänzt zu jedem Eintrag seine Nummer von 2025, ein Beispiel aus einem internen Assistenten und die Maßnahme, die wir zuerst umsetzen würden.

ID 2026RISIKOID 2025BEISPIELERSTE MASSNAHME
LLM01Prompt Injection (Einschleusen von Anweisungen)LLM01versteckter Text im PDF eines Lieferanten weist den Assistenten an, den Chat an eine externe Adresse zu mailenminimale Berechtigungen für Werkzeuge; Freigabe für Aktionen
LLM02Sensitive Information Disclosure (Offenlegung sensibler Informationen)LLM02die Antwort zitiert eine Gehaltsdatei, die der Nutzer nicht öffnen darfAutorisierung innerhalb der Retrieval-Abfrage
LLM03Excessive Agency (übermäßiger Handlungs­spielraum)LLM06ein Agent mit vollen Rechten auf ein Postfach leitet Mails weiter, nachdem er eine präparierte E-Mail gelesen hatScopes nur mit Leserechten; Freigabe vor dem Senden
LLM04Supply Chain (Lieferkette)LLM03ein Adapter mit Hintertür oder eine pickle-Datei, die beim Laden Code ausführtverifizierte Quellen, gepinnte Revisionen, Datei-Hashes
LLM05Data and Model Poisoning (Vergiftung von Daten und Modellen)LLM04eine untergeschobene Wiki-Seite lenkt die Antworten zu einem Themabegrenzen, wer in indexierte Quellen schreibt; vor dem Indexieren prüfen
LLM06Unbounded Consumption (unbegrenzter Ressourcen­verbrauch)LLM10ein Agent in einer Schleife füllt die GPU-Warte­schlange für alleToken-Limits je Nutzer; Schritt- und Zeitlimits für Agenten
LLM07Misinformation (Fehl­information)LLM09eine Selbst­sichere Antwort, die eine erfundene Klausel zitiertQuellen­angaben mit Dokument­datum; Prüfung durch einen Menschen
LLM08Hidden Context Exposure (Preisgabe verborgenen Kontexts)LLM07ein Nutzer extrahiert einen Systemprompt, der einen API-Schlüssel enthältkeine Zugangsdaten oder Zugriffs­regeln im Systemprompt
LLM09Vector and Embedding Weaknesses (Schwach­stellen bei Vektoren und Embeddings)LLM08eine Sammlung ohne Zugriffs­filter bedient jede AbteilungZugriffs­filter innerhalb der Indexabfrage
LLM10Improper Output Handling (unsachgemäßer Umgang mit Ausgaben)LLM05ein Markdown-Bild in der Antwort schickt Chatinhalte an einen externen ServerAusgaben kodieren; Bilder nur von Ihren eigenen Domains

OWASP Top 10 for LLM Applications 2026 (PDF; Ressourcenseite vom 3. August 2026) und die Risikoseiten von 2025 auf genai.owasp.org, abgerufen am 6. Oktober 2026; OWASP schreibt die IDs als LLM01:2026 und LLM01:2025; Beispiele und erste Maßnahmen sind unsere Zusammenfassung.

OWASPs separate Liste Top 10 for Agentic Applications for 2026, veröffentlicht am 9. Dezember 2025, beginnt mit ASI01 Agent Goal Hijack, ASI02 Tool Misuse und ASI03 Identity & Privilege Abuse.

RAG-Sicherheit: Berechtigungsprüfung und untergeschobene Dokumente

Der Abruf entscheidet, was ein Assistent preisgeben kann. Liefert die Suche einen Abschnitt, den der Nutzer nicht öffnen darf, kann das Modell ihn wiedergeben, ganz gleich, was im Systemprompt steht. OWASPs LLM02 verlangt deshalb, „die Autorisierung auf Dokument- und Chunk-Ebene innerhalb der Indexabfrage durchzusetzen, nicht in der Anwendungsschicht nach dem Abruf“. Unser Artikel zu RAG auf Unternehmensdaten erklärt, warum der Berechtigungsfilter in die Suche gehört, und unser Vergleich der Vektordatenbanken für RAG zeigt, wie pgvector, Qdrant, Milvus und OpenSearch ihn anwenden; die Identität, nach der er filtert, kommt aus der Anmeldung, nie aus dem Prompt.

Das zweite Risiko sind die indexierten Dokumente. Wer Schreibzugriff auf eine indexierte Quelle hat, kann Anweisungen unterbringen, deshalb gehört die Liste der Schreibberechtigten ins Bedrohungsmodell. OWASPs Eintrag zu Vector and Embedding Weaknesses, in der Ausgabe 2026 LLM09, verlangt, „Zeichen mit Nullbreite, weißen Text auf weißem Grund und Unicode-Homoglyphen bei der Extraktion zu entfernen“. Speichern Sie zu jedem Chunk die Quelle und den letzten Bearbeiter, damit sich ein verdächtiger Abschnitt zurückverfolgen und entfernen lässt.

Unsere Leistung Private AI/ML umfasst den Schutz der Modelle vor Prompt Injection, Daten- und Berechtigungsverwaltung und die Protokollierung von Anfragen und Antworten. Nennen Sie uns die Quellen, die Ihr Assistent liest, und wer in sie schreiben darf.

Agenten mit Werkzeugen: Excessive Agency und menschliche Freigabe

OWASPs LLM03 definiert Excessive Agency als die Schwachstelle, „die es ermöglicht, als Reaktion auf unerwartete, mehrdeutige oder manipulierte Ausgaben schädliche Aktionen auszuführen“, verursacht durch übermäßige Funktionalität, Berechtigungen oder Autonomie. Dagegen empfiehlt OWASP, einem Agenten nur die Werkzeuge zu geben, die er braucht, offene Werkzeuge wie eine Shell oder den Abruf beliebiger URLs zu vermeiden, die Berechtigungen jedes Werkzeugs zu begrenzen und Aktionen mit den Rechten des Nutzers auszuführen, der die Anfrage gestellt hat. Die Autorisierung wird in der Anwendungslogik durchgesetzt, „statt sich bei der Entscheidung auf ein LLM zu verlassen“, und ein Mensch gibt folgenreiche Aktionen frei. Die gemeinsamen Leitlinien für die Entwicklung sicherer KI-Systeme, am 27. November 2023 vom britischen NCSC, der US-Behörde CISA und 21 internationalen Partnern veröffentlicht, verlangen „angemessene Beschränkungen der möglichen Aktionen“ von KI-Komponenten.

Das NCSC greift aus einer öffentlichen Diskussion die Regel auf, dass ein LLM, das Informationen einer Partei verarbeitet, auf die Rechte dieser Partei herabgestuft werden sollte, und rät: „Lassen Sie ein LLM, das E-Mails von beliebigen externen Personen verarbeitet, nicht auf privilegierte Werkzeuge zugreifen.“ Meta veröffentlichte am 31. Oktober 2025 eine „Agents Rule of Two“. Innerhalb einer Sitzung sollte ein Agent höchstens zwei von drei Eigenschaften verbinden: die Verarbeitung nicht vertrauenswürdiger Eingaben, den Zugriff auf sensible Systeme oder private Daten und die Änderung von Zuständen oder die Kommunikation nach außen. Ein Agent, der alle drei braucht, „sollte nicht autonom arbeiten dürfen“.

Eine Freigabe schützt nur, wenn die prüfende Person „die exakt wiedergegebene Aktion statt einer Zusammenfassung“ sieht, wie es in OWASPs LLM01 heißt. In n8n hält ein Schritt Human review für die Werkzeuge eines Agenten den Workflow an, bis eine Person den Aufruf freigibt oder ablehnt, und seine Nachricht kann den Namen des Werkzeugs und die vom Modell gewählten Parameter zeigen; unser Artikel zu KI-Agenten mit n8n auf einem privaten LLM behandelt diesen Schritt und Zugangsdaten je Werkzeug.

Unsere Leistung Private AI/ML umfasst Agenten-Workflows und ITOps-Automatisierung mit n8n und Ansible, damit Routineabläufe nach Regeln laufen, die Sie kontrollieren. Beschreiben Sie im Formular unten die Aktionen, die ein Agent ausführen soll, und wer sie heute freigibt.

Umgang mit Ausgaben und Preisgabe des Systemprompts

Modellausgaben sind nicht vertrauenswürdige Eingaben für alles, was sie als Nächstes verarbeitet. OWASPs Seite von 2025 zu Improper Output Handling, seit 2026 LLM10, rät, das Modell so zu behandeln „wie jeden anderen Nutzer, mit einem Zero-Trust-Ansatz“; das bedeutet, Ausgaben für den Browser zu kodieren, parametrisierte Abfragen zu verwenden, wo Ausgaben in eine Datenbank fließen, und Werkzeugargumente vor der Ausführung zu validieren.

Im zweiten Szenario von OWASPs LLM01 bringen versteckte Anweisungen auf einer Webseite das Modell dazu, ein Bild einzufügen, dessen URL das private Gespräch preisgibt. Rendert das Chat-Frontend Markdown-Bilder, ruft der Browser diese URL ab, sobald die Antwort erscheint. Eine Content Security Policy, deren Direktive img-src nur Ihre eigenen Domains aufführt, blockiert die Anfrage, und Links zu unbekannten Domains werden sicherer als reiner Text angezeigt. Open WebUI setzt standardmäßig keine Sicherheits-Header, und sein Härtungsleitfaden, der die Policy über CONTENT_SECURITY_POLICY ergänzt, warnt, dass „eine übermäßig strenge CSP das Frontend lahmlegt“.

Für Hidden Context Exposure, LLM08, verlangt OWASP ein Design „unter der Annahme, dass verborgener Kontext auffindbar ist“. Zugangsdaten, Geheimnisse und Zugriffsregeln bleiben aus dem Systemprompt heraus, und Prüfungen wie die Privilegientrennung laufen außerhalb des Modells.

Was sich nicht vollständig lösen lässt

Die Quellen sind sich einig, dass sich Prompt Injection durch keinen Filter und kein Prompt-Design zuverlässig aufhalten lässt. Das NCSC schrieb, „es ist sehr gut möglich, dass Prompt-Injection-Angriffe nie so vollständig entschärft werden können wie SQL-Injection-Angriffe“, und empfiehlt stattdessen, „das Risiko und die Auswirkungen“ zu verringern. Meta nennt Prompt Injection „eine grundlegende, ungelöste Schwachstelle aller LLMs“. OWASP erwartet, dass einige seiner eigenen Maßnahmen „gegenüber adaptiven Angreifern an Wirkung verlieren“. Die Taxonomie des NIST hält fest, dass viele Gegenmaßnahmen gegen Angriffe des Adversarial Machine Learning „tendenziell empirisch und ihrem Wesen nach begrenzt sind“.

Erkennungsmodelle senken das Risiko, ohne es zu beseitigen. Metas Llama Prompt Guard 2 stuft einen Text als bösartig ein, wenn er „ausdrücklich versucht, vorherige Anweisungen außer Kraft zu setzen“, und hat anders als Prompt Guard 1 kein eigenes Label für Text, der zum unbeabsichtigten Befolgen von Anweisungen führen kann. Es liest jeweils 512 Token, sodass längere Texte aufgeteilt werden, und wurde in acht Sprachen evaluiert, darunter Deutsch, nicht aber Polnisch, Tschechisch oder Ungarisch. Seine Model Card sagt, es konzentriere sich auf „explizite, bekannte Angriffsmuster“, und warnt, dass „Angreifer ausgefeilte Angriffe speziell zur Umgehung der Erkennung entwickeln können“. OWASPs Maßnahme aus LLM01, externe Inhalte über „einen strukturell getrennten, nach Herkunft gekennzeichneten Kanal“ zu leiten, etwa eine eigene Nachricht für abgerufenen Text, hat dieselbe Grenze.

Eine Prompt Injection wird manchmal gelingen, deshalb muss das Design den Schaden klein halten. Berechtigungsfilter halten die Daten anderer Personen außer Reichweite, verhindern aber nicht die Exfiltration dessen, was der Nutzer lesen darf; dafür braucht es geschlossene Ausgabekanäle und freigegebene Aktionen. Wer den Anwendungsfall verantwortet, sollte das verbleibende Risiko schriftlich akzeptieren.

Protokollierung, Angriffstests und Prüfung vor dem Produktivstart

Die gemeinsamen Leitlinien verlangen von Anbietern, „die Eingaben in Ihr System (etwa Inferenzanfragen, Abfragen oder Prompts) zu überwachen und zu protokollieren“, und das NCSC schlägt vor, so viel zu protokollieren, dass sich verdächtige Aktivitäten erkennen lassen, „unter Umständen einschließlich der vollständigen Ein- und Ausgabe des LLM“, dazu Werkzeugnutzung und API-Aufrufe. Für einen Assistenten ist das ein Datensatz je Anfrage mit dem Nutzer, dem Prompt, den IDs der abgerufenen Abschnitte, jedem Werkzeugaufruf mit Argumenten und Ergebnis, jeder Freigabe und der Antwort. Das Protokoll enthält personenbezogene Daten und braucht Zugriffsregeln und eine Aufbewahrungsfrist. Das Audit-Log von Open WebUI enthält die Antworten nicht, und unser Leitfaden zu einer privaten ChatGPT-Alternative zeigt, woher ein vollständiges Protokoll kommt.

Jemand sollte das Protokoll in festen Abständen lesen und dabei nach abgerufenen Abschnitten suchen, die eine KI mit Anweisungen ansprechen, nach Werkzeugaufrufen an ungewöhnliche Ziele, abgelehnten Freigaben und plötzlichen Spitzen je Nutzer. OWASPs LLM01 verlangt außerdem Tests „gegen adaptive Angreifer, die die eingesetzte Abwehr studiert haben“. NVIDIAs Open-Source-Werkzeug garak, das sein README als „LLM vulnerability scanner“ bezeichnet, prüft unter anderem auf Prompt Injection, Jailbreaks und Datenlecks und kann fast alles ansprechen, was über REST erreichbar ist. Eine Prüfung vor dem Produktivstart umfasst sieben Schritte.

  1. Erfassen Sie jede Quelle, die der Assistent liest, und wer in sie schreiben darf.
  2. Erfassen Sie jedes Werkzeug, seine Berechtigungen und ob es Zustände ändern oder Daten nach außen senden kann.
  3. Trennen Sie Sitzungen, die nicht vertrauenswürdige Eingaben, sensible Daten und externe Aktionen verbinden, oder ergänzen Sie einen Freigabeschritt.
  4. Halten Sie Geheimnisse und Zugriffsregeln aus dem Systemprompt heraus und setzen Sie Berechtigungen beim Abruf durch.
  5. Lassen Sie Bilder und Links im Chat-Frontend nur von Ihren eigenen Domains zu.
  6. Schalten Sie das oben beschriebene Protokoll mit einer Aufbewahrungsfrist ein.
  7. Testen Sie vor dem Produktivstart und nach jeder Änderung mit untergeschobenen Dokumenten und einem Scanner wie garak.

Was wir tun

Unsere Leistung Private AI/ML umfasst den Schutz der Modelle vor Prompt Injection, Daten- und Berechtigungsverwaltung und die Protokollierung von Anfragen und Antworten, damit Security und Legal sehen, wer worauf zugreift. Nichts geht an öffentliche Dienste, solange Sie es nicht freigeben, und was dorthin geht, zeigt das Query-Log. Das erste Gespräch ist kostenlos; der Preis des technischen Assessments steht vor Beginn fest. Eurokommerz hält den Vertrag und liefert die Hardware, das Engineering kommt von unserem Engineering-Partner Vixen.UNO, und wie wir während eines Projekts mit Daten umgehen, beschreibt unsere Seite Sicherheit & Compliance.

FAQ

Was ist Prompt Injection?
Prompt Injection ist ein Angriff, bei dem Text, der ein Sprachmodell erreicht, das Verhalten des Modells verändert, ob ein Nutzer ihn eingibt oder ob er in einem Dokument, einer E-Mail, einer Webseite oder dem Ergebnis eines Werkzeugs versteckt ist. OWASP führt sie in den Top 10 for LLM Applications 2026 als LLM01 an erster Stelle. In einem internen Assistenten kann sie irreführende Antworten erzeugen, Daten offenlegen oder, wo der Assistent Werkzeuge hat, Aktionen im Namen des Nutzers auslösen.
Was ist indirekte Prompt Injection?
Indirekte Prompt Injection platziert Anweisungen in Inhalten, die das Modell verarbeitet, statt im eigenen Prompt des Nutzers: in einem Dokument im RAG-Index, einer E-Mail, einer Webseite oder dem Ergebnis eines Werkzeugaufrufs. Der Angreifer braucht keinen Zugang zum Assistenten, nur Schreibzugriff auf etwas, das dieser liest, und die Anweisungen können für Menschen unsichtbar sein, zum Beispiel als weißer Text auf weißem Grund. NIST AI 100-2 E2025 behandelt sie in Abschnitt 3.4 getrennt von direkten Prompting-Angriffen.
Was sind die OWASP Top 10 für LLM-Anwendungen?
Die OWASP Top 10 für LLM-Anwendungen sind die Liste des OWASP GenAI Security Project mit den zentralen Sicherheitsrisiken von Anwendungen auf Basis großer Sprachmodelle; die Ausgabe 2026 vom 3. August 2026 nennt Prompt Injection, Sensitive Information Disclosure, Excessive Agency, Supply Chain, Data and Model Poisoning, Unbounded Consumption, Misinformation, Hidden Context Exposure, Vector and Embedding Weaknesses und Improper Output Handling, nummeriert von LLM01 bis LLM10. Hidden Context Exposure ersetzt System Prompt Leakage, in der Ausgabe 2025 LLM07, und Excessive Agency ist vom sechsten auf den dritten Platz aufgerückt. Für Agenten hat OWASP im Dezember 2025 eine separate Liste veröffentlicht, die Top 10 for Agentic Applications for 2026.
Lässt sich Prompt Injection verhindern?
OWASP hält fest, dass es heute keinen zuverlässigen Mechanismus zur Verhinderung gibt, und das britische NCSC schrieb im Dezember 2025, dass sich Prompt-Injection-Angriffe möglicherweise nie so vollständig entschärfen lassen wie SQL-Injection-Angriffe. Filter, Klassifikatoren und gehärtete Systemprompts senken die Erfolgsquote, während minimale Berechtigungen für Werkzeuge, Berechtigungsprüfungen beim Abruf, geschlossene Exfiltrationskanäle und menschliche Freigaben für Aktionen den Schaden begrenzen, wenn eine Prompt Injection gelingt. Protokollierung und regelmäßige Angriffstests zeigen, ob diese Grenzen halten.
Wie lässt sich ein RAG-System absichern?
Setzen Sie die Zugriffsrechte jedes Nutzers in der Suche selbst durch, sodass der Retriever nie einen Abschnitt zurückgibt, den der Nutzer im Quellsystem nicht öffnen kann, und nehmen Sie die Identität aus der Anmeldung statt aus dem Prompt. Kontrollieren Sie, wer in indexierte Quellen schreiben darf, prüfen Sie Dokumente vor dem Indexieren mit einer Textextraktion, die versteckte Inhalte erkennt, und speichern Sie zu jedem Chunk die Quelle. Behandeln Sie abgerufenen Text als nicht vertrauenswürdig, weil ein untergeschobenes Dokument Anweisungen enthalten kann, und protokollieren Sie, welche Abschnitte für wen abgerufen wurden.
Was bedeutet Excessive Agency bei LLM-Anwendungen?
OWASPs LLM03, in der Ausgabe 2025 als LLM06 nummeriert, beschreibt Excessive Agency als die Schwachstelle, die es einem LLM-basierten System ermöglicht, als Reaktion auf unerwartete, mehrdeutige oder manipulierte Ausgaben schädliche Aktionen auszuführen, verursacht durch übermäßige Funktionalität, Berechtigungen oder Autonomie. Die Maßnahmen sind weniger und enger gefasste Werkzeuge, auf den Bedarf jeder Aufgabe begrenzte Berechtigungen, Aktionen mit den Rechten des anfragenden Nutzers, Autorisierungsprüfungen außerhalb des Modells und eine menschliche Freigabe für folgenreiche Aktionen. Metas Agents Rule of Two ergänzt, dass ein Agent, der in einer Sitzung nicht vertrauenswürdige Eingaben, Zugriff auf sensible Daten und externe Aktionen verbindet, nicht ohne Aufsicht arbeiten sollte.

Schicken Sie uns eine kurze Beschreibung des Assistenten oder Agenten, den Sie betreiben oder planen: die Quellen, die er liest, die Werkzeuge, die er aufrufen darf, und wie sich die Nutzer anmelden. Wir antworten innerhalb eines Werktages mit den nächsten Schritten, beginnend mit einem ersten Gespräch, nach dem Sie zwei oder drei mögliche Lösungsszenarien haben. Das erste Gespräch ist kostenlos.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien