Zum Inhalt springen

KI-gestützte Prompt-Injection: Wie Angriffe funktionieren und wie man das Risiko reduzieren kann

KI-Systeme werden immer nützlicher, weil sie auf mehr zugreifen können.

Sie können Unternehmensdokumente durchsuchen, Daten über RAG abrufen, Websites durchsuchen, mit SaaS-Anwendungen interagieren, APIs aufrufen, Tools nutzen und zunehmend auch Aktionen über KI-Agenten ausführen.

Diese gleichen Fähigkeiten machen KI-Prompt-Injektion weitreichendere Folgen haben.

Bei einem Prompt-Injection-Angriff wird versucht, Anweisungen in den Kontext einzufügen, den ein KI-System verarbeitet, sodass das System der Absicht des Angreifers folgt, anstatt der vom Benutzer beabsichtigten Aufgabe oder den Regeln der Anwendung.

Der Angriff kann direkt von einem Benutzer ausgehen. Er kann sich aber auch in einer E-Mail, einem Dokument, einer Webseite, einer abgerufenen Datei, einem Datenbankeintrag, einer API-Antwort oder anderen Inhalten verbergen, die die KI als Kontext interpretiert.

Dadurch entsteht ein Sicherheitsproblem, mit dem herkömmliche Anwendungen in dieser Form nicht konfrontiert waren:

KI-Systeme verarbeiten Anweisungen und Daten häufig über dieselbe natürlichsprachliche Schnittstelle.

Da KI Zugang zu sensiblen Daten erhält und autonom Bei Sicherheitsmaßnahmen müssen Teams mehr fragen, als ob ein Modell eine Aktion erkennen kann. bösartige Aufforderung.

Sie müssen fragen:

  • Welche nicht vertrauenswürdigen Inhalte können in den Kontext der KI gelangen?
  • Auf welche sensiblen Daten kann die KI zugreifen?
  • Welche Berechtigungen erbt die KI?
  • Welche Werkzeuge und Anwendungen kann es nutzen?
  • Welche Aktionen kann es ohne menschliche Zustimmung ausführen?
  • Wie würden Teams eine unangemessene Datenweitergabe erkennen?
  • Wie schnell könnten sie den Zugriff einschränken oder den Arbeitsablauf unterbrechen?

Prompt Injection wird zu einem Sicherheitsproblem für Unternehmen, wenn bösartige Anweisungen Zugriff auf vertrauenswürdige Daten, privilegierte Zugriffsrechte oder entsprechende Folgeaktionen erhalten.

KI-gestützte Eingabeaufforderung: Wichtigste Erkenntnisse

- Die Prompt-Injektion manipuliert die KI durch Anweisungen. Angreifer versuchen, ein KI-System dazu zu bringen, seine vorgesehene Aufgabe oder seine Kontrollmechanismen zu ignorieren, neu zu interpretieren oder zu umgehen.

- Indirekte Prompt-Injection erweitert die Angriffsfläche. Bösartige Anweisungen können sich in Websites, Dokumenten, E-Mails, RAG-Quellen, API-Antworten und anderen externen Inhalten verstecken, die eine KI abruft.

- Zugang bestimmt Wirkung. Eine manipulierte KI ohne Zugriff auf sensible Daten birgt ein anderes Risiko als ein Agent, der mit Kundendatensätzen, Zugangsdaten, Finanzdaten oder Produktionssystemen verbunden ist.

- Agenten wandeln Manipulation in Handlungsrisiko um. Die Gefahr der Prompt-Injection wird noch größer, wenn KI Nachrichten senden, APIs aufrufen, Datensätze ändern, Daten verschieben oder Arbeitsabläufe auslösen kann.

- Kein einzelner Filter löst das Problem der Schnellinjektion. Organisationen benötigen mehrschichtige Schutzmechanismen, die Modelle, Aufforderungen, Daten, Zugriffe, Werkzeuge, menschliche Genehmigungen, Überwachung und Fehlerbehebung umfassen.

- BigID reduziert das Datenrisiko im Zusammenhang mit KI-Risiken. BigID verbindet sofortigen Schutz mit der Erkennung sensibler Daten, KI-gestützter Zugriffssteuerung, dem Prinzip der minimalen Berechtigungen, der Durchsetzung von Richtlinien, Überwachung und Fehlerbehebung.

Was ist KI-Prompt-Injektion?

Bei der KI-Prompt-Injection handelt es sich um eine Angriffstechnik, bei der bösartige oder irreführende Anweisungen in den von einem KI-System verarbeiteten Kontext eingefügt werden, um dessen Verhalten zu verändern, Informationen preiszugeben, Werkzeuge zu missbrauchen oder unbeabsichtigte Aktionen auszulösen.

Die Prompt-Injektion nutzt eine grundlegende Eigenschaft großer Sprachmodellanwendungen: Modelle verarbeiten natürliche Sprache sowohl als Information als auch als Anweisung.

Ein KI-System kann Kontextinformationen erhalten von:

  • Eine Benutzeraufforderung
  • Eine Systemaufforderung
  • Ein hochgeladenes Dokument
  • Eine Webseite
  • Eine E-Mail
  • Eine RAG-Wissensquelle
  • Eine Vektordatenbank
  • Eine API-Antwort
  • Eine SaaS-Anwendung
  • Ein weiterer KI-Agent
  • Werkzeugausgabe

Kann das System vertrauenswürdige Anweisungen nicht zuverlässig von nicht vertrauenswürdigen Inhalten unterscheiden, kann ein Angreifer versuchen, Einfluss darauf zu nehmen, was die KI abruft, offenbart, generiert oder tut.

OWASP betrachtet Prompt Injection seit jeher als eines der größten Sicherheitsrisiken für generative KI-Anwendungen. Die Vorfallanalyse von OWASP aus dem Jahr 2026 zeigt, dass Prompt Injection über theoretische Demonstrationen hinaus zu praktischen Angriffsmethoden geworden ist, die Datenlecks in Unternehmen, Manipulation von Agentenzielen und Werkzeugmissbrauch umfassen. OWASPs GenAI-Sicherheitsprojekt bietet weiterhin Leitlinien sowohl für LLM als auch für die Sicherheit agentenbasierter KI.

Schutz sensibler Daten in KI-Konversationen

Kontrollieren Sie, was in die KI-Abfragen eingegeben und was in den Antworten hinterlassen wird.

Sensible Informationen erkennen, gezielte Richtlinien anwenden, riskante Werte schwärzen, den Zugriff steuern und die Gefährdung durch sofortige Reaktionen im gesamten KI-System des Unternehmens untersuchen.

Entdecken Sie den KI-gestützten Schutz →

Direkte vs. indirekte Sofortinjektion

Die Prompt-Einspeisung erreicht ein KI-System im Allgemeinen über zwei Wege.

Direkte Prompt-Injektion

A direkte Sofortinjektion entsteht durch die Interaktion eines Benutzers mit dem KI-System.

Der Benutzer gibt dem Modell absichtlich Anweisungen, die das beabsichtigte Verhalten der Anwendung außer Kraft setzen oder mit ihm in Konflikt geraten sollen.

Beispielsweise könnte jemand versuchen, einen internen KI-Assistenten dazu zu überreden, seine festgelegten Beschränkungen zu ignorieren und Informationen preiszugeben, die außerhalb der vom Benutzer autorisierten Aufgabe liegen.

Die direkte Einschleusung birgt ein Risiko, da die schädliche Anweisung über dieselbe Schnittstelle eingeschleust wird, die für legitime Anweisungen vorgesehen ist.

Indirekte Prompt-Injektion

Indirekte Sofortinjektion platziert bösartige Anweisungen in Inhalten, die die KI später abruft oder verarbeitet.

Der Angreifer wird möglicherweise nie direkt mit dem KI-System interagieren.

Die schädliche Anweisung könnte darin enthalten sein:

  • Eine Webseite
  • Eine E-Mail
  • Ein PDF- oder Office-Dokument
  • Ein Support-Ticket
  • Eine Kalendereinladung
  • Eine Produktrezension
  • Ein Code-Repository
  • Ein RAG-Dokument
  • Ein Datenbankfeld
  • Ein API-Ergebnis

Dieser Angriff gewinnt für KI-Agenten besondere Bedeutung, da diese zunehmend Informationen aus Quellen durchsuchen, abrufen, zusammenfassen und darauf reagieren, die der Benutzer nicht vollständig kontrolliert.

OpenAI beschreibt moderne Prompt-Injection als zunehmend ähnlich dem Social Engineering gegen KI-Agenten: Angreifer platzieren irreführende Anweisungen in externen Inhalten und versuchen, die KI dazu zu bringen, entgegen der Absicht des Benutzers zu handeln.

Wie ein Prompt-Injection-Angriff funktioniert

Der Angriffspfad für die sofortige Einschleusung

Die Anweisung ist wichtig. Der Zugang dazu bestimmt die Wirkung.

1. InhaltAngreifer platziert Anweisungen in einer Eingabeaufforderung oder einer externen Quelle
2. KontextDie KI ruft die schädlichen Inhalte ab oder empfängt sie.
3. ManipulationDie KI interpretiert die Inhalte des Angreifers als Anweisung
4. ZugangBerechtigungen legen fest, welche Daten oder Tools zugänglich sind.
5. HandlungKI ruft etwas ab, legt es offen, sendet es, ändert es oder löst etwas aus.
6. AuswirkungenDatenleck, Missbrauch, Richtlinienverstoß oder Geschäftsschädigung

Die böswillige Anweisung allein bestimmt nicht den Schweregrad.

Eine hilfreiche Herangehensweise an das Risiko einer sofortigen Injektion ist folgende:

Nicht vertrauenswürdige Anweisungen | Sensible Daten | Privilegierter Zugriff | Autonomes Handeln

Dies ist keine mathematische Formel. Es handelt sich um ein Risikopriorisierungsmodell.

Ein manipulierter Chatbot, der nur Fragen zu öffentlichen Dokumenten beantworten kann, bietet nur begrenzte Möglichkeiten zur Offenlegung von Informationen.

Ein manipulierter Agent mit Zugriff auf personenbezogene Kundendaten, Mitarbeiterdatensätze, Anmeldeinformationen, Finanzsysteme, APIs und Schreibberechtigungen stellt ein ganz anderes Sicherheitsproblem dar.

Beispiele für die Eingabeaufforderung

Beispiel 1: Schadhafte Anweisungen innerhalb einer Webseite

Ein Benutzer bittet einen KI-Agenten, nach Anbietern zu recherchieren.

Eine Anbieterseite enthält Anweisungen, die für KI-Systeme und nicht für menschliche Leser bestimmt sind. Die Anweisungen zielen darauf ab, den Agenten dazu zu bringen, die Auswahlkriterien des Nutzers zu ignorieren und diesen Anbieter zu bevorzugen.

Das unmittelbare Risiko besteht in der Manipulation der Ergebnisse.

Wenn derselbe Agent Zugriff auf vertrauliche Firmendateien hat oder Transaktionen durchführen kann, können die Folgen deutlich schwerwiegender werden.

Beispiel 2: Indirekte Prompt-Einschleusung per E-Mail

Ein Mitarbeiter bittet einen KI-Assistenten, ungelesene E-Mails zu überprüfen und Antworten vorzubereiten.

Ein Angreifer versendet eine E-Mail mit Anweisungen zur Manipulation des Assistenten.

Verfügt die KI über umfassenden Zugriff auf E-Mails, Dateien und Cloud-Speicher, könnte der Angreifer versuchen, sie dazu zu bringen, vertrauliche Informationen abzurufen oder Inhalte an einen Ort zu senden, den der Benutzer niemals beabsichtigt hat.

OpenAI nutzt dieses Szenario, um zu veranschaulichen, warum Agentenzugriff, Bestätigungen und eng definierte Aufgaben neben den Schutzmechanismen auf Modellebene wichtig sind.

Beispiel 3: RAG-Prompt-Eingabe

Ein unternehmensweites RAG-System indexiert Dokumente aus mehreren Repositories.

Ein Dokument enthält schädliche Anweisungen.

Ein späterer Abruf ordnet diese Anweisungen in den Kontext des Modells ein.

Das System kann versuchen, ihnen zu folgen, auch wenn der Benutzer die schädlichen Inhalte nie eingegeben hat.

Die potenziellen Auswirkungen hängen davon ab, welche anderen Informationen die RAG-Anwendung abrufen kann und ob beim Abruf die Zugriffsrechte der anfragenden Identität beachtet werden.

Beispiel 4: Missbrauch eines KI-Agenten-Tools

Ein autonomer Agent erhält die Berechtigung, auf Dateien zuzugreifen, APIs aufzurufen und Geschäftsanwendungen zu aktualisieren.

Eine im abgerufenen Inhalt versteckte Aufforderungseingabe versucht, das Ziel des Agenten umzuleiten.

Verfügt der Agent über übermäßige Berechtigungen und schwache Aktionskontrollen, kann die Manipulation über die fehlerhafte Textgenerierung hinausgehen und Datenverschiebungen, Datensatzänderungen, Nachrichten oder Workflow-Ausführungen umfassen.

Darum geringstes Privileg für KI-Agenten ist zu einer grundlegenden KI-Sicherheitsmaßnahme geworden.

Prompt Injection vs. Jailbreaking

Die Begriffe überschneiden sich im alltäglichen Sprachgebrauch, beschreiben aber unterschiedliche Angriffsziele.

Bereich Sofortige Injektion Gefängnisausbruch
Hauptziel Manipulieren Sie, wie eine KI-Anwendung Anweisungen befolgt oder den Kontext nutzt. Sicherheitsbeschränkungen auf Modellebene umgehen
Typisches Ziel KI-Anwendung, Workflow, Agent, Ampelsystem oder Werkzeugkette Vorbildliches Sicherheitsverhalten
Auswirkungen auf das Unternehmen Kann den Zugriff auf sensible Daten, den Missbrauch von Werkzeugen, die Manipulation von Arbeitsabläufen oder unbeabsichtigte Aktionen umfassen. Kann verbotene oder unsichere Modellausgaben erzeugen

Ein Angreifer kann die Techniken kombinieren, aber Organisationen sollten nicht davon ausgehen, dass Abwehrmaßnahmen gegen die eine Technik automatisch auch die andere lösen.

Warum RAG die sofortige Injektion erschwert

RAG verbessert die KI-Reaktionen, indem es Modelle mit externen Informationen verknüpft.

Das bedeutet auch, dass das Modell Inhalte verarbeitet, die von verschiedenen Vertrauensstufen stammen können.

Eine RAG-Anwendung kann Folgendes abrufen:

  • Interne Dokumente
  • Wiki-Seiten
  • Kundendatensätze
  • Support-Tickets
  • Gemeinsame Laufwerke
  • Externe Websites
  • Hochgeladene Dateien
  • Vektor-Speicherinhalt

Die Anwendung muss die abgerufenen Informationen als Daten, nicht automatisch als vertrauenswürdige Anweisungen.

Sicherheitsteams sollten auch wissen, welche sensiblen Daten sich hinter der Abrufschicht befinden.

Eine Abwehr gegen Prompt-Injection, die zwar bösartige Anweisungen erfolgreich erkennt, aber jedem Benutzer den Zugriff auf alle indizierten Dokumente ermöglicht, lässt dennoch eine große Sicherheitslücke bestehen.

RAG-Sicherheit erfordert daher sowohl Befehlsgrenzenkontrollen als auch Datenzugriffskontrollen.

Warum KI-Agenten das Risiko der sofortigen Injektion erhöhen

Generative KI kann eine unsichere Reaktion hervorrufen.

Agentische KI kann eine Antwort erzeugen und dann etwas damit anfangen.

Agenten können:

  • Websites durchsuchen
  • E-Mail lesen
  • Dokumente abrufen
  • Datenbanken abfragen
  • APIs aufrufen
  • Nachrichten senden
  • Datensätze bearbeiten
  • Dateien erstellen
  • Trigger-Workflows
  • Interagieren Sie mit anderen Agenten

Dadurch wandelt sich die Prompt-Injektion von einem primären Ausgabeintegritätsproblem zu einem Identitäts-, Zugriffs- und Aktionskontrollproblem.

Google-Sicherheitsforscher haben ein verwandtes agentenbasiertes Muster beschrieben, das sie nennen. Aufgabeneinspeisung, wobei bösartige Inhalte versuchen, die übergeordnete Aufgabe eines autonomen Agenten umzuleiten und dessen Handlungsfähigkeit auszunutzen.

Organisationen sollten Folgendes für jeden Agenten verstehen:

  • Welche Identität es verwendet
  • Wie es die Berechtigungen erhielt
  • Welche sensiblen Daten kann es erreichen?
  • Welche Werkzeuge kann es aufrufen?
  • Welche Aktionen es ausführen kann
  • Welche Aktionen erfordern eine Bestätigung?
  • Wie Teams die Aktivitäten überwachen
  • Wie schnell sie den Zugriff widerrufen können

AI Access Governance verbindet KI-Identitäten und geerbte Berechtigungen BigID verwendet sensible Daten und Zugriffspfade, um Organisationen zu ermöglichen, zu erkennen, wo maschinengesteuerte Zugriffe über legitime Geschäftsanforderungen hinausgehen. Der aktuelle Ansatz von BigID erweitert das Prinzip der minimalen Berechtigungen insbesondere auf Agenten, Copiloten, Anwendungen, APIs und autonome Systeme.

Was kann eine sofortige Injektion verursachen?

Die Auswirkungen hängen von der Anwendung und ihren Berechtigungen ab.

Mögliche Folgen sind:

  • Offenlegung sensibler Informationen
  • Unbefugter Abruf
  • Manipulierte Empfehlungen
  • Systemgesteuerte Offenlegung
  • Richtlinienumgehung
  • Werkzeugmissbrauch
  • Unautorisierte Nachrichten oder API-Aufrufe
  • Datensatzänderung
  • Datenexfiltration
  • Workflow-Manipulation
  • Verlust der Ausgabeintegrität
  • Compliance-Verstöße

Der OWASP-Vorfallsbericht 2026 hebt die Häufung von Prompt-Injection mit der Offenlegung sensibler Informationen, unsachgemäßer Ausgabeverarbeitung, dem Übernehmen von Agentenzielen und dem Missbrauch von Tools hervor. Dies unterstreicht einen entscheidenden Punkt: Moderne Prompt-Injection-Angriffe fungieren oft als Teil einer umfassenderen Angriffskette und nicht als isolierter Trick.

Wie man das Risiko einer sofortigen Injektion verhindern und verringern kann

Kein einzelner Filter kann Schutz garantieren.

Organisationen sollten mehrstufige Kontrollmechanismen einsetzen, die sowohl die Wahrscheinlichkeit einer erfolgreichen Manipulation als auch deren Auswirkungen im Erfolgsfall verringern.

1. Externe Inhalte als nicht vertrauenswürdig behandeln

Webseiten, Dokumente, E-Mails, API-Ergebnisse, abgerufene Datensätze, Tool-Ausgaben und Benutzer-Uploads sollten nicht automatisch die gleiche Autorität wie System- oder Entwickleranweisungen erhalten.

Architekturanwendungen mit klaren Vertrauensgrenzen zwischen Anweisungen und externen Daten.

2. KI-Zugriff minimieren

Beschränken Sie KI-Systeme auf die Daten, die für ihre genehmigte Aufgabe erforderlich sind.

Ein Injection-Angriff kann keine Informationen exfiltrieren, auf die die KI keinen Zugriff hat.

Anwenden geringste Privilegien über Benutzer, Anwendungen, Dienstkonten, Maschinenidentitäten, APIs, Copiloten und Agenten hinweg.

3. Agentenwerkzeuge und -aktionen einschränken

Gewähren Sie nicht jedem Agenten uneingeschränkten Zugriff auf jedes verfügbare Tool.

Limit:

  • Verfügbare Werkzeuge
  • Zulässige APIs
  • Lese- und Schreibrechte
  • Externe Kommunikation
  • Finanzielle oder administrative Maßnahmen
  • Systemübergreifende Arbeitsabläufe

4. Menschliche Genehmigung für folgenreiche Maßnahmen einholen

Vor Aktionen mit weitreichenden Folgen, wie dem Versenden sensibler Informationen, dem Ändern kritischer Datensätze, dem Initiieren von Transaktionen, dem Löschen von Daten oder dem Ändern von Berechtigungen, ist eine explizite Bestätigung erforderlich.

Die aktuellen Richtlinien von OpenAI zur Agentensicherheit empfehlen ebenfalls eine Bestätigung vor und eine präzise Formulierung der Anweisungen für Agentenaufgaben.

5. Schutz sensibler Daten in Eingabeaufforderungen und Antworten

Schnelle Dateneinspeisung und schnelles Datenleck stellen unterschiedliche Risiken dar, die sich jedoch gegenseitig verstärken können.

Organisationen sollten sensible Daten, die in KI-Konversationen gelangen, erkennen und die Antworten auf unangemessene Offenlegung überwachen.

BigID KI-gestützter Prompt-Schutz Hilft dabei, sensible Werte in Eingabeaufforderungen und Antworten zu erkennen, Schwärzungen anzuwenden, gezielte Zugriffs- und Datenrichtlinien durchzusetzen, Gespräche zu überwachen und Beweismaterial für Untersuchungen und Abhilfemaßnahmen zu erstellen.

6. Abrufberechtigungen erzwingen

RAG sollte durchsuchbare Inhalte nicht in allgemein zugängliche Inhalte umwandeln.

Die Zugriffskontrollen müssen während des Abrufs beibehalten werden, damit ein KI-System nur Informationen zurückgibt, zu deren Verwendung die anfragende Identität berechtigt ist.

7. Ergebnisse vor der Ausführung prüfen

Behandeln Sie die Modellausgabe nicht automatisch als vertrauenswürdigen Code, Befehle, URLs, Abfragen oder Anwendungsanweisungen.

Die vom Modell generierten Ausgaben müssen validiert und eingeschränkt werden, bevor sie an nachgelagerte Systeme weitergeleitet werden.

8. KI-Anwendungen und Agenten für Red-Teams

Testen Sie realistische Angriffspfade über Eingabeaufforderungen, Datenabruf, Tools, Identitäten, Berechtigungen, APIs, Datenquellen und Agenten-Workflows hinweg.

Die Arbeit von OWASP im Jahr 2026 legt den Schwerpunkt auf adversarielle Tests über den gesamten Lebenszyklus hinweg, da KI zunehmend in autonome, geschäftskritische Systeme Einzug hält.

9. KI-Aktivität kontinuierlich überwachen

KI-Systeme verändern sich nach der Implementierung.

Modelle werden aktualisiert. Quellen ändern sich. Berechtigungen werden angehäuft. Agenten erhalten neue Werkzeuge. Anwendungen verbinden sich mit neuen Repositories.

KI-Zugriff und -Aktivitäten überwachen anstatt sich ausschließlich auf Tests vor der Bereitstellung zu verlassen.

10. Einen Sanierungsplan erstellen

Sicherheitsbedenken sollten zu Maßnahmen führen.

Teams müssen möglicherweise Folgendes tun:

  • Widerrufen übermäßiger Zugriff
  • Ein Werkzeug deaktivieren
  • Eine Datenquelle blockieren
  • Schwärzen Sie vertrauliche Informationen
  • Riskante Inhalte unter Quarantäne stellen
  • Eine Richtlinie ändern
  • Agenten deaktivieren
  • Weisen Sie einen Eigentümer zu
  • Untersuchen Sie die betroffenen Daten

Die Auswirkungen der sofortigen Injektion verringern

Kontrolliere, was KI erreichen kann, bevor bösartige Anweisungen sie finden.

Verbinden Sie KI-Agenten, Copiloten, Anwendungen und Maschinenidentitäten mit sensiblen Daten, Berechtigungen, Zugriffspfaden, Aktivitäten und Least-Privilege-Kontrollen.

Mehr über KI-Zugriffsverwaltung erfahren →

Schnelle Einschleusungsabwehr: Was Sicherheitsteams oft übersehen

Die Eingangsfilterung allein kann die Sicherheitsgrenze nicht definieren.

Angreifer ändern ständig Formulierung, Kodierung, Formatierung, Kontext und Übermittlungsmechanismen.

Ein System sollte nicht darauf angewiesen sein, dass jede bösartige Anweisung perfekt erkannt wird, bevor andere Kontrollmechanismen greifen.

Gehen Sie davon aus, dass einige bösartige Anweisungen das Modell erreichen, und entwerfen Sie das umgebende System so, dass sie nicht automatisch auf sensible Daten oder mächtige Aktionen zugreifen können.

Ein sicheres Modell kann dennoch in einer unsicheren Anwendung enthalten sein.

Ein starkes Modellverhalten kann eine RAG-Anwendung, die Berechtigungen ignoriert, oder einen Agenten mit weitreichenden administrativen Zugriffsrechten nicht kompensieren.

Bewerten Sie das gesamte KI-System.

Die Schwere der sofortigen Injektion hängt von den Daten ab.

Eine erfolgreiche Einschleusung gegen öffentliche Informationen unterscheidet sich von einer solchen, die Folgendes beinhaltet:

  • PII
  • PHI
  • Zahlungsdaten
  • Anmeldeinformationen
  • Geheimnisse
  • Finanzinformationen
  • Quellcode
  • Geistiges Eigentum
  • Vertrauliche Geschäftsunterlagen

Sicherheitsteams benötigen Erkennung und Klassifizierung sensibler Daten um zu verstehen, was hinter dem KI-Zugang steckt.

Maschinenidentitäten verändern den Explosionsradius

Maschinenidentitäten Zugriff auf Unternehmensressourcen ist über Dienstkonten, APIs, OAuth-Bereiche, Anwendungen, Konnektoren, delegierte Benutzerberechtigungen und andere nicht-menschliche Zugriffswege möglich.

Über diese Zugriffswege kann eine scheinbar risikoarme KI-Anwendung deutlich leistungsfähiger werden, als ihre Benutzeroberfläche vermuten lässt.

Prompt Injection ist ein Lebenszyklusproblem

Das Testen einer Anwendung vor der Markteinführung garantiert keine zukünftige Sicherheit.

Neue Datenquellen, Plugins, Konnektoren, Berechtigungen, Agenten, Modelle und Tools können die Angriffsfläche nach der Genehmigung verändern.

Checkliste für die Sicherheit bei der Prompt-Injektion

Sofortige Injektionsbereitschaft

Kann Ihr Sicherheitsteam diese Fragen beantworten?

✓ Welche KI-Anwendungen, Agenten, Copiloten, RAG-Systeme und Assistenten sind in unserer Umgebung im Einsatz?

✓ Welche Quellen können nicht vertrauenswürdige Inhalte in den KI-Kontext einbringen?

✓ Welche sensiblen Daten kann jedes KI-System abrufen?

✓ Welche Identitäten und Berechtigungen gewähren der KI diesen Zugriff?

✓ Bleibt die Benutzerautorisierung beim Abruf erhalten?

✓ Welche Tools kann jeder KI-Agent aufrufen?

✓ Welche Aktionen erfordern eine ausdrückliche menschliche Zustimmung?

✓ Können wir Eingabeaufforderungen für sensible Daten erkennen?

✓ Können wir sensible Informationen in den Antworten erkennen oder unkenntlich machen?

✓ Validieren wir die KI-Ausgabe vor der nachgelagerten Ausführung?

✓ Testen wir indirekte Prompt-Injection-Pfade?

✓ Können wir übermäßigen KI-Zugriff identifizieren?

✓ Können wir die KI-Aktivität nach der Bereitstellung überwachen?

✓ Können wir den Zugriff widerrufen und schnell Abhilfe schaffen, wenn sich das Risiko ändert?

Wie BigID mit dem Risiko der sofortigen Injektion umgeht

BigID begegnet dem Risiko von Prompt-Injection aus der Perspektive der Daten und Zugriffsrechte des KI-Systems.

Keine Sicherheitsplattform kann garantieren, dass jede schädliche Anweisung immer erkannt wird, bevor ein Modell sie verarbeitet.

Organisationen müssen daher beides reduzieren die Möglichkeit der Offenlegung sensibler Daten und die potenziellen Auswirkungen eines manipulierten KI-Systems.

BigID unterstützt Organisationen:

  • Eingabeaufforderungen und Antworten schützen: Sensible Werte in KI-Konversationen erkennen, riskante Informationen schwärzen, gezielte Richtlinien anwenden, Zugriffskontrollen durchsetzen und die Untersuchung und Behebung unterstützen.
  • Entdecken Sie sensible KI-Daten: Identifizieren Sie PII, PHI, PCI, Anmeldeinformationen, Geheimnisse, geistiges Eigentum, Finanzinformationen und andere sensible oder regulierte Daten, die KI-Systeme verwenden oder auf die sie zugreifen können.
  • KI-Zugang steuern: Verbinden Sie Agenten, Copiloten, Anwendungen, Dienstkonten, Maschinenidentitäten, APIs und Berechtigungen mit den sensiblen Daten, die diesem Zugriff zugrunde liegen.
  • Übermäßigen Zugriff reduzieren: Wenden Sie das Prinzip der datenbewussten minimalen Berechtigung an, damit ein manipuliertes KI-System nicht auf Informationen zugreifen kann, die über seinen genehmigten Zweck hinausgehen.
  • KI-Systeme steuern: Entdecken Sie KI-Assets und verknüpfen Sie sie mit sensiblen Daten, Herkunftsnachweisen, Eigentumsverhältnissen, Zugriffsrechten, Richtlinien, Risikoanalysen und Governance-Informationen.
  • Prompt- und KI-Richtlinien anwenden: Identifizieren Sie sensible Meldungen, unangemessene Datennutzung, Zugriffsprobleme und andere Verstöße gegen KI-Richtlinien in unternehmensweiten Arbeitsabläufen.
  • Laufwerksbereinigung: Zugriffe einschränken, Richtlinien durchsetzen, Zuständigkeiten zuweisen, Ergebnisse untersuchen und Korrekturmaßnahmen koordinieren, wenn KI-Risiken auftreten.

Der aktuelle Ansatz von BigID im Bereich KI-Sicherheit und -Governance verknüpft Modelle, Agenten, Copiloten, Eingabeaufforderungen, Datensätze, Vektorspeicher, Identitäten, Zugriffe, Herkunft, Richtlinien und Abhilfemaßnahmen, anstatt die Sicherheit von Eingabeaufforderungen als ein isoliertes Modellproblem zu behandeln.

Ziel ist es nicht, anzunehmen, dass jede schädliche Anweisung blockiert werden kann. Vielmehr soll sichergestellt werden, dass eine manipulierte KI-Interaktion nicht ungehindert auf die wichtigsten Daten und Aktionen zugreifen kann.

Die Punkte zwischen Daten und KI verbinden

Reduzierung des Datenrisikos bei KI-gestützter Prompt-Einspeisung

Erfahren Sie, wie BigID sensible KI-Konversationen schützt, den KI-Zugriff steuert, übermäßige Berechtigungen erkennt, Richtlinien anwendet und die Gefährdung durch Eingabeaufforderungen, Antworten, Copiloten, RAG und Agenten reduziert.

Siehe BigID AI Security in Aktion →

Häufig gestellte Fragen zur KI-gestützten Eingabeaufforderung

Was ist KI-Prompt-Injektion?

Bei der KI-Prompt-Injection handelt es sich um eine Angriffstechnik, bei der bösartige oder irreführende Anweisungen in den von einem KI-System verarbeiteten Kontext eingefügt werden, um dessen Verhalten zu verändern, Informationen preiszugeben, Werkzeuge zu missbrauchen oder unbeabsichtigte Aktionen auszulösen.

Was ist ein Beispiel für eine prompte Injektion?

Ein Angreifer könnte schädliche Anweisungen in eine Webseite, E-Mail, ein Dokument oder eine RAG-Quelle einbetten, die eine KI später abruft. Diese Anweisungen könnten versuchen, die KI dazu zu bringen, ihre eigentliche Aufgabe zu ignorieren, Informationen preiszugeben, ein bestimmtes Werkzeug zu verwenden oder eine andere unautorisierte Aktion auszuführen.

Was ist eine indirekte Provokationsinjektion?

Indirekte Prompt-Injektion liegt vor, wenn schädliche Anweisungen über externe Inhalte und nicht direkt vom Benutzer in ein KI-System gelangen. Zu den Quellen können Websites, Dokumente, E-Mails, API-Antworten, Datenbankeinträge, abgerufene RAG-Inhalte und Tool-Ausgaben gehören.

Worin besteht der Unterschied zwischen Prompt-Injection und Jailbreaking?

Prompt Injection zielt im Allgemeinen darauf ab, wie eine KI-Anwendung Anweisungen und Kontext verarbeitet, während Jailbreaking darauf abzielt, Sicherheitsbeschränkungen auf Modellebene zu umgehen. Angreifer können die Techniken kombinieren, sie stellen jedoch unterschiedliche Sicherheitsprobleme dar.

Warum ist eine sofortige Injektion gefährlich?

Prompt-Injection kann KI-Ausgaben manipulieren, sensible Informationen offenlegen, den Datenabruf umleiten, Werkzeuge missbrauchen oder unbeabsichtigte Aktionen auslösen. Die Schwere des Problems steigt, wenn ein KI-System Zugriff auf sensible Daten, weitreichende Berechtigungen, externe Werkzeuge oder autonome Funktionen hat.

Wie entsteht durch RAG ein Risiko für eine zu schnelle Injektion?

RAG-Systeme rufen externe Inhalte ab und betten sie in den Kontext des Modells ein. Enthält der abgerufene Inhalt schädliche Anweisungen, kann die KI diese Anweisungen im Rahmen ihrer Aufgabe interpretieren. Eine starke RAG-Sicherheit sollte nicht vertrauenswürdige Inhalte von vertrauenswürdigen Anweisungen trennen und die Autorisierung der abgerufenen Daten sicherstellen.

Warum sind KI-Agenten stärker von Prompt-Injection betroffen?

KI-Agenten können mithilfe von Tools, APIs, Anwendungen und Workflows Informationen abrufen und Aktionen ausführen. Ein erfolgreicher Angriff auf einen Agenten mit übermäßigen Berechtigungen kann daher Daten und Systeme beeinflussen und nicht nur generierten Text verändern.

Lässt sich eine sofortige Injektion vollständig verhindern?

Keine einzelne Verteidigungsmaßnahme kann garantieren, dass jeder Angriffsversuch fehlschlägt. Organisationen sollten daher mehrschichtige Kontrollmechanismen einsetzen, die Modellschutzmaßnahmen, Vertrauensgrenzen, das Prinzip der minimalen Berechtigungen, eingeschränkte Tools, menschliche Genehmigung, Schutz sensibler Daten, Ausgabevalidierung, Überwachung, Tests und Fehlerbehebung kombinieren.

Wie können Organisationen das Risiko einer zu schnellen Injektion reduzieren?

Organisationen können externe Inhalte als nicht vertrauenswürdig behandeln, den KI-Zugriff minimieren, die Autorisierung in RAG beibehalten, Agententools einschränken, die Genehmigung für Folgeaktionen verlangen, Eingabeaufforderungen und Antworten schützen, Ausgaben validieren, KI-Workflows per Red Teaming testen, den Zugriff kontinuierlich überwachen und einen klaren Abhilfeplan aufrechterhalten.

Wie hilft das Prinzip der minimalen Privilegien bei der schnellen Injektion?

Das Prinzip der minimalen Berechtigungen beschränkt die Daten, Systeme und Aktionen, die einem KI-System zur Verfügung stehen. Gelingt eine Prompt-Injection, können eingeschränkte Berechtigungen die Menge an sensiblen Informationen oder Funktionen reduzieren, auf die der Angreifer über die manipulierte KI zugreifen kann.

Wie trägt BigID zur Reduzierung des Risikos einer zu schnellen Injektion bei?

BigID hilft dabei, sensible Daten in KI-Abfragen und -Antworten zu schützen, die hinter der KI stehenden Daten zu ermitteln und zu klassifizieren, KI-Identitäten und -Berechtigungen mit sensiblen Informationen zu verknüpfen, übermäßigen Zugriff zu erkennen, KI-Richtlinien durchzusetzen, das Prinzip der minimalen Berechtigungen zu unterstützen und die Behebung von Problemen in unternehmensweiten KI-Systemen zu koordinieren.

Inhalt

BigID-Promptschutz für KI

BigID Prompt Protection für KI bietet Echtzeit-Erkennung, Schwärzung und Richtliniendurchsetzung für jede KI-Interaktion. Laden Sie die Lösungsbeschreibung herunter, um zu erfahren, wie BigID die Datensicherheit reduziert und die KI-Einführung fördert.

Laden Sie die Lösungsübersicht herunter