Zum Inhalt springen

RAG-Sicherheit: Wie Sie Unternehmensdaten beim Abruf schützen

Die durch Retrieval erweiterte Generierung gibt der KI etwas, was Basismodelle von sich aus nicht haben: direkten Zugriff auf das Unternehmenswissen.

Das ist sein Wert.

Es ist auch ein Sicherheitsproblem.

Ein RAG-System kann Dokumente, Datenbanken, Kollaborationsplattformen, Wissensdatenbanken, Cloud-Speicher, SaaS-Anwendungen, Vektordatenbanken und andere Unternehmensquellen durchsuchen, bevor die gefundenen Informationen an ein generatives KI-Modell weitergegeben werden.

Die Sicherheitsfrage ist nicht mehr einfach, “Können wir dem Modell vertrauen?”

Es wird zu:

“Hätte dieser Benutzer, diese Anwendung, dieser Copilot oder dieser KI-Agent diese Daten überhaupt abrufen können?”

Dieser Unterschied ist wichtig.

Eine einwandfrei funktionierende RAG-Anwendung kann dennoch einen Sicherheitsvorfall verursachen, wenn sie Daten abruft. sensible Informationen für die falsche Identität. Ein starker Sofort-Injektion Die Verteidigung kann übermäßigen Zugriff nicht kompensieren. Eine sichere Vektordatenbank garantiert nicht, dass die darin enthaltenen Daten auch tatsächlich dorthin gehören.

Die RAG-Sicherheit beginnt daher, bevor die Eingabeaufforderung das Modell erreicht.

Organisationen benötigen einen umfassenden Ansatz für RAG-Sicherheit entlang des gesamten Abrufprozesses, von Quelldaten und Indizierung bis hin zu Vektorspeichern, Identitäten, Berechtigungen, Abruf, Eingabeaufforderungen, Antworten, Agenten und nachgelagerten Aktionen.

RAG-Sicherheit: Wichtigste Erkenntnisse

- Der Abruf ist ein Autorisierungsereignis. Ein RAG-System sollte Informationen sowohl nach Relevanz als auch danach abrufen, ob die anfragende Identität die Berechtigung zum Zugriff darauf hat.

- RAG-Sicherheit ist mehr als nur die sofortige Injektion. Organisationen müssen sich außerdem mit folgenden Themen auseinandersetzen: Offenlegung sensibler Daten, übermäßiger Zugriff, unsichere Indizierung, manipulierte Inhalte, Risiken durch Vektordatenbanken, Datenlecks, Herkunftsnachverfolgung und Ausgabeverarbeitung.

- Suchbar sollte nicht gleichbedeutend mit zugänglich sein. Die Indexierung von Unternehmensdaten für KI sollte nicht stillschweigend den Kreis derjenigen erweitern, die auf diese Daten zugreifen können.

- Abgerufene Inhalte sollten weiterhin als nicht vertrauenswürdig eingestuft werden. Dokumente, Websites, E-Mails, Aufzeichnungen und andere abgerufene Informationen können bösartige oder irreführende Anweisungen enthalten.

- Agenten erhöhen den Einsatz. Ein RAG-fähiger Agent kann sensible Informationen abrufen und anschließend APIs, Anwendungen und Tools verwenden, um damit Aktionen durchzuführen.

- Sicheres RAG erfordert Datenkontext. Sensibilität, Identität, Zugriff, Eigentumsverhältnisse, Herkunft, Richtlinien, Aktivitäten und Geschäftszweck bestimmen, ob die Datenabfrage ein relevantes Risiko darstellt.

Was ist RAG-Sicherheit?

RAG-Sicherheit ist die Praxis, Daten, Abrufprozesse, Identitäten, Berechtigungen, Eingabeaufforderungen, Ausgaben und nachfolgende Aktionen zu schützen, die auftreten, wenn abruferweiterte Generierungssysteme externe Informationen verwenden, um KI-Antworten zu generieren.

Retrieval-augmented generation, oder RAG, verbindet ein generatives KI-Modell mit Informationen außerhalb der ursprünglichen Trainingsdaten des Modells.

Ein typischer RAG-Workflow sieht etwa so aus:

  1. Unternehmensdaten gelangen in eine Indexierungs- oder Erfassungspipeline.
  2. Das System verarbeitet Inhalte und kann Einbettungen erstellen.
  3. Eine Index- oder Vektordatenbank speichert durchsuchbare Darstellungen.
  4. Ein Benutzer oder ein KI-System stellt eine Anfrage.
  5. Die Abrufschicht findet relevante Informationen.
  6. Die Anwendung fügt den abgerufenen Kontext der Eingabeaufforderung des Modells hinzu.
  7. Das Modell generiert eine Antwort unter Verwendung dieses Kontextes.
  8. Eine Anwendung oder ein Agent kann die Antwort in einem anderen Workflow oder einer anderen Aktion verwenden.

Jede Phase birgt Sicherheitsrisiken.

Das bedeutet, dass die Sicherung lediglich der Modell-, Prompt- oder Vektordatenbank wichtige Teile der RAG-Architektur außerhalb der Sicherheitsgrenze lässt.

Sichern Sie die Daten hinter RAG

Wissen, was die KI abrufen kann, bevor sie die Eingabeaufforderung erreicht?

Entdecken Sie sensible RAG-Daten, verstehen Sie den Zugriff, verfolgen Sie die Herkunft, schützen Sie KI-Interaktionen und reduzieren Sie das Risiko von der Quelle über den Abruf bis hin zur Aktion.

RAG Security entdecken →

Warum RAG-Sicherheit mehr ist als nur die sofortige Injektion

Sofortige Injektion verdient Beachtung, da RAG-Systeme regelmäßig externe Inhalte verarbeiten, die möglicherweise schädliche Anweisungen enthalten.

Die sofortige Injektion stellt jedoch nur einen Teil der RAG-Angriffsfläche dar.

Man stelle sich eine RAG-Anwendung vor, die jede bösartige Anweisung perfekt ablehnt, aber für jeden Mitarbeiter vertrauliche Dokumente der Geschäftsleitung abruft.

Die Eingabeaufforderung ist sicher. Der Datenzugriff ist es nicht.

Oder man erwägt ein RAG-System, das Berechtigungen respektiert, aber Geheimnisse, veraltete Datensätze, unnötige personenbezogene Daten oder Daten, deren Verwendung durch KI aufgrund von Richtlinien untersagt ist, indexiert.

Die Autorisierung funktioniert. Die Datenverwaltung nicht.

Secure RAG benötigt daher mehrere Ebenen:

Ziel ist es nicht nur, fehlerhafte Eingabeaufforderungen zu verhindern. Vielmehr geht es darum, zu verhindern, dass ungeeignete Daten überhaupt erst die falsche KI-Interaktion erreichen.

Der RAG-Sicherheitslebenszyklus

Der RAG-Sicherheitspfad

Schützen Sie Unternehmensdaten von der Quelle über den Abruf bis hin zur Umsetzung.

1. QuelleWelche Unternehmensdaten speisen RAG?
2. InhaltsverzeichnisWas wird indexiert und eingebettet?
3. ZugangWer oder was hat die Erlaubnis dazu?
4. AbrufenWas kann diese Identität nun abrufen?
5. GenerierenWas sind die Eingabe- und Ausgabeparameter?
6. GesetzWas kann KI mit den Daten anfangen?

In jeder Phase wird eine andere Sicherheitsfrage gestellt.

Bei der Quellensicherheit stellt sich die Frage, ob die Daten überhaupt für die Entwicklung von KI geeignet sind.

Die Indexsicherheit fragt ab, ob sensible oder eingeschränkte Inhalte in die Abrufschicht gelangt sind.

Bei der Zugriffssteuerung wird gefragt, welche Identitäten ein legitimes geschäftliches Bedürfnis haben.

Die Abfragesicherheit fragt, ob die aktuelle Anfrage eine bestimmte Information zurückgeben soll.

Die Sicherheitsabfrage fragt umgehend, ob sensible Daten oder bösartige Anweisungen in die KI-Interaktion eingedrungen sind.

Agentensicherheit fragt, was die KI nach dem Abruf tun kann.

Die RAG-Sicherheit versagt, wenn Organisationen diese als ein einziges Kontrollproblem behandeln.

Was sind die größten Sicherheitsrisiken für RAG-Systeme?

1. Offenlegung sensibler Daten

RAG-Systeme verbinden KI häufig direkt mit wertvollen Unternehmensinformationen.

Das kann Folgendes umfassen:

  • PII
  • PHI
  • Zahlungsinformationen
  • Zugangsdaten und Geheimnisse
  • Quellcode
  • Geistiges Eigentum
  • Rechtsdokumente
  • Finanzinformationen
  • Mitarbeiterakten
  • Kundendaten
  • Vertrauliche Geschäftsinformationen

Wenn die Teams nicht wissen, welche sensiblen Informationen in die RAG-Architektur einfließen, können sie nicht zuverlässig bestimmen, welche Abrufereignisse ein Risiko darstellen.

Datenermittlung und -klassifizierung sollte daher vor und während des gesamten RAG-Einsatzes erfolgen.

2. Übermäßiger Zugriff auf die Ampel

Ein Benutzer kann legitimen Zugriff auf die RAG-Anwendung haben, ohne jedoch legitimen Zugriff auf alles zu haben, was die Anwendung abrufen kann.

Diese Unterscheidung wird entscheidend, wenn RAG Informationen aus Repositories mit unterschiedlichen Berechtigungen kombiniert.

Sicherheitsteams sollten Folgendes verstehen:

  • Wer kann das Ampelsystem abfragen?
  • Welche Identität führt den Abruf durch?
  • Welche Quellberechtigungen gelten
  • Ob das System diese Berechtigungen nach der Indizierung beibehält
  • Ob Servicekonten oder Maschinenidentitäten breiteren Zugang einführen
  • Ob KI-Agenten übermäßige Berechtigungen erben

Der Zugang zur KI-Schnittstelle sollte nicht gleichbedeutend mit dem Zugang zu allen dahinterliegenden Dokumenten sein.

3. Berechtigungsverlust während der Indizierung

Unternehmens-Repositorys enthalten bereits Zugriffskontrollen.

RAG-Architekturen können diese Kontrollmechanismen schwächen, wenn die Indizierung den Inhalt von den mit der Quelle verknüpften Berechtigungen trennt.

Eine vertrauliche Datei, auf die nur fünf Mitarbeiter Zugriff haben, kann in einen gemeinsamen Index oder Vektorspeicher gelangen. Wenn die Abrufschicht den ursprünglichen Autorisierungskontext nicht mehr versteht, kann ein größerer Personenkreis auf deren Inhalt zugreifen.

Secure RAG muss den Autorisierungskontext zum Abrufzeitpunkt erhalten oder wiederherstellen können.

4. Indirekte Prompt-Injektion

RAG-Systeme rufen absichtlich Inhalte ab, die das Modell nicht erstellt hat und über die der Benutzer möglicherweise keine Kontrolle hat.

Dieser Inhalt kann schädliche Anweisungen enthalten.

Ein Angreifer kann Anweisungen in einem Dokument, einer E-Mail, einer Webseite, einem Support-Ticket, einem Eintrag in einer Wissensdatenbank oder einer anderen Quelle platzieren, die das RAG-System später abruft.

Das Modell kann diese Anweisungen dann als Teil seiner Aufgabe interpretieren.

Das ist indirekte Sofortinjektion.

Organisationen sollten abgerufene Inhalte als nicht vertrauenswürdige Daten behandeln und ihnen nicht automatisch die Autorität von Anwendungs- oder Systemanweisungen zuerkennen.

5. Vektordatenbank-Exponierung

Vektordatenbanken und -indizes können Repräsentationen sensibler Unternehmensinhalte und Metadaten enthalten, die wertvollen Kontext für den KI-gestützten Abruf liefern.

Sicherheitsteams sollten verstehen, welche Daten in Vektorspeicher gelangen, welche sensiblen Informationen diese Speicher enthalten, wer Zugriff darauf hat und ob sie weiterhin den entsprechenden Richtlinien unterliegen.

BigID kann Vektordatenbanken nach sensiblen und regulierten Informationen durchsuchen, Dadurch erhalten die Teams Einblick in Daten, die RAG-Workloads unterstützen.

6. Datenvergiftung und nicht vertrauenswürdige Quellen

Angreifer oder unbefugte Benutzer könnten versuchen, irreführende, bösartige oder manipulierte Inhalte in eine RAG-Wissensdatenbank einzufügen.

Auch ohne sofortige Eingabe können verfälschte Informationen die Abrufqualität und die Modellreaktionen beeinträchtigen.

Organisationen sollten wissen, woher RAG-Inhalte stammen, wer sie ändern kann, ob die Quelle weiterhin maßgebend ist und wie Teams Änderungen validieren.

7. Veraltete oder ungeeignete Daten

Sicherheit ist nicht der einzige Grund, RAG-Inhalte zu kontrollieren.

Veraltete, doppelte, ungenaue, unnötige oder schlecht verwaltete Daten können zu falschen oder unangemessenen Antworten führen.

Eine sichere RAG-Pipeline sollte auch Datenqualität, Aufbewahrung, Eigentumsverhältnisse, Zweck und Lebenszyklus berücksichtigen.

8. Sensibles Auffordern und Reagieren

RAG kann sensible Informationen in den Modellkontext einbringen, selbst wenn der Benutzer diese Informationen nie direkt eingegeben hat.

Einmal abgerufen, können sensible Inhalte in Eingabeaufforderungen, Antworten, Protokollen, Gesprächsverläufen oder nachgelagerten Anwendungen erscheinen.

KI-gestützter Sofortschutz hilft dabei, sensible Werte in KI-Aufforderungen und -Antworten zu identifizieren, gezielte Richtlinien anzuwenden, riskante Werte zu schwärzen und die Gefährdung zu untersuchen.

9. Unvollständige RAG-Datenherkunft

Wenn eine KI-Antwort sensible, ungenaue oder verbotene Informationen enthält, müssen die Teams verstehen, woher diese stammen.

Dies erfordert eine nachvollziehbare Datenherkunft über Quellsysteme, Pipelines, Abrufprozesse und nachgelagerte KI-Workflows hinweg.

Datenherkunft Hilft dabei, KI-Daten mit ihrem Ursprung zu verknüpfen und Kontext für Steuerung, Untersuchung und Behebung zu liefern.

10. Agentisches RAG-Risiko

RAG gewinnt an Bedeutung, wenn ein KI-Agent auf Basis der abgerufenen Informationen handeln kann.

Ein Agent kann Kundendaten abrufen und ein CRM-System aktualisieren. Er kann ein Dokument lesen und eine E-Mail versenden. Er kann eine Datenbank abfragen und eine andere API aufrufen.

Dadurch entsteht eine Kette:

Abruf → Information → Entscheidung → Werkzeug → Handlung

Verfügt der Agent über übermäßige Berechtigungen, kann eine unzulässige Datenabfrage zu einer unzulässigen Handlung führen.

AI Access Governance Hilft dabei, Agenten, Copiloten, Anwendungen, Maschinenidentitäten, Berechtigungen und sensible Daten zu verbinden, damit Teams erkennen können, wo der KI-Zugriff über legitime Geschäftsanforderungen hinausgeht.

RAG-Sicherheit vs. Prompt-Sicherheit vs. Vektordatenbanksicherheit

Diese Begriffe beschreiben zwar verwandte Probleme, sollten aber nicht synonym verwendet werden.

Bereich Primäre Sicherheitsfrage Typische Risiken
RAG Security Kann die richtige Identität sicher auf die richtigen Daten zugreifen? Sensibler Datenabruf, übermäßiger Zugriff, Verlust von Berechtigungen, manipulierte Inhalte, sofortiges Einschleusen von Daten, Datenlecks, unsichere Weiterverwendung
Sofortige Sicherheit Welche sensiblen oder schädlichen Inhalte gelangen in KI-Konversationen hinein und verlassen sie wieder. Prompt-Einspeisung, sensible Prompt-Daten, Antwortleck, Richtlinienverstöße
Sicherheit der Vektordatenbank Welche Daten enthält die Vektorebene und wer kann darauf zugreifen? Offenlegung sensibler Daten, schwache Zugriffskontrollen, ungeeignete Indizierung, unkontrollierte Datenspeicher, Datenlecks

Eine starke RAG-Sicherheit erfordert alle drei Perspektiven.

Warum die Ampelregelung für die Zutrittskontrolle wichtig ist

Die traditionelle Suche fragt:

“Welcher Inhalt passt am besten zu dieser Suchanfrage?”

Enterprise RAG muss eine weitere Frage stellen:

“Welche übereinstimmenden Inhalte kann diese Identität tatsächlich abrufen?”

Dadurch wird der Abruf zu einem Autorisierungsereignis.

Man stelle sich zwei Mitarbeiter vor, die demselben Unternehmensassistenten dieselbe Frage stellen.

Eine Person arbeitet in der Personalabteilung und hat rechtmäßigen Zugriff auf die Gehaltsabrechnungen der Mitarbeiter. Die andere Person hat diesen Zugriff nicht.

Die semantische Relevanz der Dokumente ändert sich nicht zwischen den Benutzern.

Die Genehmigungsentscheidung sollte getroffen werden.

Microsofts aktuelle Ampelregelung Es wird empfohlen, die Zugriffskontrolle bereits beim Abruf anzuwenden und abgerufene Inhalte als nicht vertrauenswürdige Eingaben zu behandeln. Microsoft Azure AI Search unterstützt zudem Zugriffskontrollen auf Dokumentebene und die Durchsetzung von Berechtigungen zur Abfragezeit, sodass die Suchergebnisse die Autorisierung der anfragenden Identität widerspiegeln. Diese Vorgehensweisen unterstreichen die Notwendigkeit, die Relevanz der Suchergebnisse mit der Autorisierung zu kombinieren, anstatt Suchergebnisse als grundsätzlich sicheren Kontext zu betrachten.

Secure RAG sollte daher Folgendes berücksichtigen:

  • Benutzeridentität
  • Agenten- oder Anwendungsidentität
  • Quellenberechtigungen
  • Gruppen und Rollen
  • Datensensibilität
  • Geschäftszweck
  • Eigentum
  • Politik
  • Aktuelle Zugriffsrechte

Die Relevanz bestimmt, was die KI abrufen kann. Die Autorisierung bestimmt, was sie abrufen soll.

Warum Identität in RAG kompliziert wird

RAG ruft Daten nicht immer direkt ab, so wie es der menschliche Benutzer tut.

Der Abrufprozess kann Folgendes umfassen:

  • Benutzeridentitäten
  • Anwendungsidentitäten
  • Servicekonten
  • Maschinenidentitäten
  • OAuth-Berechtigungen
  • Cloud-Rollen
  • API-Zugangsdaten
  • KI-Agenten

Dadurch kann eine gefährliche Diskrepanz entstehen.

Ein Benutzer mit eingeschränktem Zugriff kann mit einer KI-Anwendung interagieren, deren Backend-Dienstkonto über einen wesentlich umfassenderen Zugriff verfügt.

Wenn die RAG-Anwendung Daten unter Verwendung dieser umfassenderen Identität abruft, ohne den Autorisierungskontext des Benutzers beizubehalten, kann die KI zu einem Weg werden, bestehende Zugriffskontrollen zu umgehen.

Sicherheitsteams müssen daher beides verstehen Wer hat die Frage gestellt? und Welche Identität hat tatsächlich die Antwort abgerufen?.

So sichern Sie RAG: 10 bewährte Methoden

1. Alle Datenquellen ermitteln, die RAG speisen

Inventarisieren Sie die Datenbanken, Dateisysteme, Kollaborationsplattformen, SaaS-Anwendungen, Cloud-Speicher, Wissensdatenbanken, Vektorspeicher und externen Quellen, die die Datenabfrage speisen.

Teams können RAG-Daten nicht verwalten, wenn sie diese nicht einsehen können.

2. Daten vor der Indizierung klassifizieren

Identifizieren Sie sensible, regulierte, vertrauliche, geschützte, anerkennungsrelevante, finanzielle, gesundheitliche, persönliche und andere risikoreiche Informationen, bevor diese in die Abrufschicht gelangen.

Mithilfe der Klassifizierung lässt sich bestimmen, welche Daten die KI verwenden darf, welche Daten zusätzliche Kontrollen erfordern und welche Daten außerhalb der RAG-Pipeline bleiben sollten.

3. Minimierung der RAG-Daten

Informationen sollten nicht einfach deshalb indexiert werden, weil sie existieren.

Fragen Sie sich, ob der Anwendungsfall der KI die Daten tatsächlich erfordert.

Datenminimierung reduziert die Menge an unnötigen oder ungeeigneten Informationen, die den Abrufsystemen zur Verfügung stehen.

4. Autorisierung durch Abruf aufrechterhalten

Die Quellberechtigungen dürfen nicht verworfen werden, wenn Inhalte in einen Index aufgenommen werden.

Wenden Sie den Kontext von Identität und Zugriff so an, dass der Abruf legitimen Geschäftsbedürfnissen Rechnung trägt.

Wenn möglich, sollte der Zugriff zum Zeitpunkt der Abfrage geprüft werden, anstatt anzunehmen, dass jeder authentifizierte RAG-Benutzer den gesamten Korpus durchsuchen sollte.

5. Prinzip der minimalen Berechtigungen auf RAG-Identitäten anwenden

Beschränken Sie Servicekonten, Anwendungen, APIs, Maschinenidentitäten, Copiloten und Agenten auf die Informationen, die für ihren genehmigten Zweck erforderlich sind.

Ein kompromittiertes oder manipuliertes KI-System kann keine Daten abrufen, auf die seine Identität keinen Zugriff hat.

6. Abgerufene Inhalte als nicht vertrauenswürdig behandeln

Externe Inhalte sollten von vertrauenswürdigen System- und Anwendungsanweisungen getrennt werden.

Testen Sie Dokumente, Webinhalte, E-Mails und andere RAG-Quellen für indirekte Prompt-Injektion Szenarien.

7. Eingabeaufforderungen und Antworten schützen

Überwachen Sie die Interaktionen der KI auf sensible Informationen, die in Eingabeaufforderungen eingegeben oder in Antworten auftauchen.

Wenden Sie gegebenenfalls Richtlinien, Zugriffskontrollen, Schwärzungsmaßnahmen und Untersuchungsabläufe an.

8. RAG-Datenherkunft kartieren

Verknüpfen Sie indexierte und abgerufene Informationen mit maßgeblichen Quellen.

Lineage hilft Teams dabei, problematische Antworten zu untersuchen, die Verantwortlichkeiten zu klären, die Datenherkunft zu validieren und festzustellen, wo Korrekturmaßnahmen angebracht sind.

9. Zugriff und Aktivität überwachen

Verstehen, welche Identitäten auf sensible Daten zugreifen und wie sich dieses Verhalten im Laufe der Zeit verändert.

Überwachung der Datenaktivität Fügt einen Nutzungskontext hinzu, der Teams dabei helfen kann, riskante oder unerwartete Zugriffe auf sensible Informationen zu erkennen.

10. Integration der Sanierungsmaßnahmen in den RAG-Lebenszyklus

Die Ergebnisse des Ampelsystems sollten zu Maßnahmen führen.

Teams müssen möglicherweise Folgendes tun:

  • Daten aus einem Index entfernen
  • Übermäßigen Zugang reduzieren
  • Korrekte Quellberechtigungen
  • Schwärzen Sie vertrauliche Informationen
  • Unangemessene Inhalte unter Quarantäne stellen
  • Änderungsbeibehaltung
  • Agentenzugriff widerrufen
  • Datenquelle deaktivieren
  • Weisen Sie einen Eigentümer zu
  • Aktualisierungsrichtlinie

Kontrolliere, was RAG erreichen kann

Verknüpfung von Datenabruf mit sensiblen Daten und legitimem Zugriff

Verstehen Sie, welche Benutzer, Anwendungen, Maschinenidentitäten, Copiloten und Agenten auf sensible Unternehmensdaten zugreifen können, und identifizieren Sie dann, wo die Berechtigungen den Geschäftsbedarf übersteigen.

Mehr über KI-Zugriffsverwaltung erfahren →

RAG-Sicherheitscheckliste

RAG-Sicherheitsbereitschaft

Kann Ihr Sicherheitsteam diese Fragen beantworten?

✓ Welche Repositories und Datenquellen speisen die einzelnen RAG-Systeme?

✓ Welche sensiblen oder regulierten Informationen werden abgerufen?

✓ Welche Daten sollten niemals in die RAG-Pipeline gelangen?

✓ Wo sind Einbettungen und Vektordarstellungen gespeichert?

✓ Erhalten Indizes die Quellenautorisierung aufrecht?

✓ Welche Identität führt den Abruf durch?

✓ Können verschiedene Benutzer je nach Zugriffsberechtigung unterschiedliche Informationen abrufen?

✓ Haben Servicekonten oder Maschinenidentitäten übermäßige Zugriffsrechte?

✓ Können die abgerufenen Inhalte schädliche Anweisungen enthalten?

✓ Können sensible, abgerufene Daten in Eingabeaufforderungen oder Antworten erscheinen?

✓ Können Teams abgerufene Inhalte bis zu ihrer Quelle zurückverfolgen?

✓ Welche Akteure können auf Basis der abgerufenen Informationen handeln?

✓ Können Teams den Zugriff auf sensible RAG-Daten überwachen?

✓ Können Teams Daten entfernen, den Zugriff einschränken und die Behebung von Problemen nachweisen, wenn sich das Risiko ändert?

Häufige Sicherheitsfehler im RAG-System

Sicherung des Modells, aber nicht der Abrufschicht

Modellbasierte Schutzmechanismen können übermäßigen Zugriff oder unangemessene Indizierung im vorgelagerten Bereich nicht korrigieren.

Annahme: Authentifizierung entspricht Autorisierung

Ein Benutzer, der sich bei einer RAG-Anwendung anmelden kann, sollte nicht automatisch Zugriff auf jedes Dokument erhalten, das mit dieser Anwendung durchsucht werden kann.

Verwendung eines privilegierten Dienstkontos für jeden Datenabruf

Eine breit privilegierte Backend-Identität kann sinnvolle Unterschiede zwischen Benutzern auslöschen, es sei denn, die Anwendung bewahrt und erzwingt den Autorisierungskontext.

Unter der Annahme, dass der Vektorspeicher keine sensiblen Daten enthält

Einbettungen und Vektorinfrastruktur gehören in das Datensicherheitsprogramm. Die Teams benötigen Einblick in die zugrunde liegenden Inhalte, Metadaten und sensiblen Informationen, die durch die Abrufschicht repräsentiert werden.

Fokus ausschließlich auf die sofortige Injektion

Die zeitnahe Injektion ist wichtig, aber ebenso wichtig sind die Offenlegung sensibler Daten, der Zugriff, die Vergiftung, die Herkunft, die Datenqualität, übermäßige Berechtigungen, das Auslaufen von Ausgaben und die Aktionen von Agenten.

Vergessen, was nach dem Abruf geschieht

Eine Antwort kann eine andere Anwendung, einen Agenten, eine API, eine Entscheidung oder einen Workflow speisen.

Die RAG-Sicherheit sollte sensible Daten auch nach der Datenabfrage begleiten, wenn KI diese Informationen für Aktionen nutzen kann.

Wie BigID zur Sicherung von RAG beiträgt

BigID-Ansätze Unternehmenssicherheit nach dem RAG-Modell von den Daten nach außen.

Das RAG-Risiko hängt von mehr als nur dem Modell oder der Vektordatenbank ab. Es hängt ab von Welche Unternehmensdaten werden abgerufen, wie sensibel sind diese Daten, woher stammen sie, welche Identitäten haben Zugriff darauf, welche Richtlinien gelten und was kann die KI nach dem Abruf tun?.

BigID unterstützt Organisationen:

  • RAG-Daten entdecken und klassifizieren: Identifizieren Sie sensible, regulierte, vertrauliche, geschützte, persönliche, anmeldebezogene und geschäftskritische Informationen aus unternehmensweiten Datenquellen und KI-Workloads.
  • Sensible Daten in Vektordatenbanken identifizieren: Scannen Sie Vektordatenbanken und identifizieren Sie sensible und regulierte Informationen, die von KI-gestützten Suchvorgängen verwendet werden.
  • Herkunft der Map AI-Daten: Daten werden über Quellsysteme, Pipelines, Abruf, Inferenz und nachgelagerte KI-Workflows miteinander verbunden.
  • KI-Zugang steuern: Verknüpfen Sie Benutzer, Agenten, Copiloten, Anwendungen, Dienstkonten, Maschinenidentitäten, Berechtigungen und sensible Daten, um übermäßigen Zugriff zu erkennen.
  • Eingabeaufforderungen und Antworten schützen: Sensible Werte in KI-Konversationen erkennen, gezielte Richtlinien anwenden, riskante Informationen schwärzen, Verstöße überwachen und die Untersuchung und Behebung unterstützen.
  • Sichere KI-Datenpipelines: Daten entdecken, klassifizieren, bereinigen, verwalten und kontrollieren, bevor sie in Trainings-, Optimierungs-, Abruf- oder Produktions-KI-Workflows einfließen.
  • Aktivitätskontext hinzufügen: Verstehen Sie, wie auf sensible Daten in Unternehmensumgebungen zugegriffen und diese verwendet werden.
  • Laufwerksbereinigung: Verknüpfen Sie die Ergebnisse mit Zugangsbeschränkungen, der Durchsetzung von Richtlinien, Verantwortlichkeiten, Arbeitsabläufen und Korrekturmaßnahmen.

Ziel ist es nicht einfach, dass RAG bessere Ergebnisse liefert. Es geht darum sicherzustellen, dass die KI die richtigen Daten für die richtige Identität, gemäß den richtigen Richtlinien und für den richtigen Zweck abruft.

Die Punkte zwischen Daten und KI verbinden

Sicheres RAG – beginnend mit den zugrunde liegenden Daten

Erfahren Sie, wie BigID sensible RAG-Daten aufdeckt, Herkunft und Zugriff abbildet, KI-Interaktionen schützt, übermäßige Berechtigungen identifiziert, Richtlinien durchsetzt und die Behebung von Problemen im gesamten KI-System des Unternehmens vorantreibt.

Siehe BigID AI Security in Aktion →

Häufig gestellte Fragen zur RAG-Sicherheit

Was ist RAG-Sicherheit?

Die RAG-Sicherheit schützt die Daten, den Abrufprozess, die Identitäten, die Berechtigungen, die Eingabeaufforderungen, die Ausgaben und die nachfolgenden Aktionen, die damit verbunden sind, wenn abruferweiterte Generierungssysteme externe Informationen verwenden, um KI-Antworten zu generieren.

Was sind die wichtigsten Sicherheitsrisiken von RAG?

Zu den wichtigsten Sicherheitsrisiken von RAG gehören die Offenlegung sensibler Daten, übermäßiger Zugriff, Berechtigungsverlust während der Indizierung, indirekte Eingabe von Prompts, Offenlegung von Vektordatenbanken, Datenvergiftung, veraltete oder ungeeignete Daten, Leckagen von Prompts und Antworten, unvollständige Herkunftsnachweise und riskante Agentenaktionen.

Wie birgt das RAG-System ein Datensicherheitsrisiko?

RAG verbindet generative KI direkt mit externen Daten während der Inferenz. Enthält die Abrufschicht sensible Informationen oder verwendet sie eine schwache Autorisierung, kann die KI Informationen abrufen, auf die der anfragende Benutzer, die Anwendung oder der Agent keinen Zugriff haben sollte.

Was ist RAG-Zugriffskontrolle?

Die RAG-Zugriffskontrolle legt fest, welche Informationen ein Benutzer, eine Anwendung oder eine KI-Identität basierend auf Berechtigungen, Rollen, Datensensibilität, Richtlinien und Geschäftsanforderungen abrufen darf. Sichere RAG-Zugriffskontrolle sollte semantische Relevanz mit Autorisierung kombinieren.

Warum sollte RAG die Autorisierung zum Abrufzeitpunkt anwenden?

Unterschiedliche Identitäten können unterschiedliche Rechte an denselben Inhalten haben. Die Überprüfung der Autorisierung beim Abruf trägt dazu bei, dass eine gemeinsam genutzte KI-Schnittstelle keine Informationen preisgibt, die über den legitimen Zugriff der anfragenden Identität hinausgehen.

Was ist ein berechtigungsbasiertes RAG?

Das Berechtigungsbasierte RAG-System bewahrt oder bewertet den Zugriffskontext beim Abrufen von Unternehmensinformationen, sodass Benutzer und KI-Systeme nur Inhalte erhalten, zu deren Zugriff sie eine legitime Berechtigung haben.

Wie wirkt sich die prompte Injektion auf den RAG-Wert aus?

RAG kann Dokumente, Webseiten, E-Mails, Datensätze oder andere Inhalte abrufen, die schädliche Anweisungen enthalten. Wenn die KI diese Anweisungen als vertrauenswürdige Befehle interpretiert, kann ein Angreifer das Verhalten des Modells durch indirekte Eingabeaufforderungen manipulieren.

Stellen Vektordatenbanken ein RAG-Sicherheitsrisiko dar?

Vektordatenbanken und -indizes können sensible Unternehmensinformationen und Metadaten abbilden. Unternehmen sollten daher wissen, welche Daten sie enthalten, wer darauf zugreifen kann, wie die Berechtigungen gelten und ob sensible oder regulierte Inhalte in die Abfrageschicht gehören.

Wie erhöhen KI-Agenten das Sicherheitsrisiko von RAG-Systemen?

KI-Agenten können nach dem Abruf von Informationen Aktionen ausführen, indem sie APIs aufrufen, Anwendungen aktualisieren, Nachrichten senden, Datensätze ändern oder Workflows auslösen. Zu hohe Berechtigungen für Agenten können daher dazu führen, dass ein unangemessener Datenabruf zu einer unangemessenen Aktion führt.

Wie können Organisationen RAG-Systeme absichern?

Organisationen können RAG sichern, indem sie Quelldaten ermitteln und klassifizieren, indizierte Inhalte minimieren, die Autorisierung durch Abruf aufrechterhalten, das Prinzip der minimalen Berechtigungen anwenden, abgerufene Inhalte als nicht vertrauenswürdig behandeln, Eingabeaufforderungen und Antworten schützen, die Herkunft abbilden, Aktivitäten überwachen und Erkenntnisse mit Abhilfemaßnahmen verknüpfen.

Wie unterstützt BigID RAG-Sicherheit?

BigID hilft Unternehmen dabei, sensible RAG-Daten zu entdecken und zu klassifizieren, sensible Informationen in Vektordatenbanken zu identifizieren, die Herkunft von KI-Daten abzubilden, KI-Identitäten und Berechtigungen mit Daten zu verknüpfen, Eingabeaufforderungen und Antworten zu schützen, KI-Pipelines zu steuern, Aktivitätskontext hinzuzufügen und die Behebung von Problemen in unternehmensweiten KI-Umgebungen voranzutreiben.

Inhalt

BigID Next: Die KI-gestützte Datensicherheits-, Compliance- und Datenschutzplattform der nächsten Generation

Laden Sie die Lösungsübersicht herunter