Organisationen entscheiden sich selten dafür, Dark Data zu erzeugen.
Sie häufen es an.
Ein Team exportiert Kundendatensätze für ein Projekt.
Eine Anwendung erstellt Protokolle, die niemand überprüft.
Eine Kollaborationsplattform bewahrt jahrelang ungenutzte Dokumente auf.
Bei einer Migration bleiben alte Daten zurück.
Mitarbeiter erstellen doppelte Tabellenkalkulationen.
Eine Datensicherung bewahrt Informationen lange, nachdem das Unternehmen die Datenquelle nicht mehr nutzt.
Ein Entwicklungsteam kopiert Produktionsdaten in eine Testumgebung.
Dann kommt die KI ins Spiel.
Ein Enterprise-Copilot indexiert ein altes Repository. Ein RAG-System ruft ein veraltetes Dokument ab. Ein Agent erhält über ein Dienstkonto Zugriff. Eine Trainingspipeline entdeckt einen Datensatz, dessen Existenz niemand mehr in Erinnerung hatte.
Informationen, die jahrelang operativ unsichtbar blieben, können plötzlich durchsuchbar, abrufbar und nutzbar werden.
Das ändert die Problematik der ungenutzten Daten.
Dunkle Daten stellen nicht länger nur einen entgangenen analytischen Wert oder unnötigen Speicherplatz dar.
Es kann Folgendes erzeugen:
- Unbekannte Offenlegung sensibler Daten
- Übermäßiger Zugriff
- Datenschutz- und Aufbewahrungsrisiko
- Höhere Auswirkungen von Verstößen
- Doppelte und widersprüchliche KI-Kontexte
- Unnötige Cloud- und Speicherkosten
- KI-Zugriff auf Daten, die das Unternehmen nie für die Nutzung durch KI vorgesehen hatte
Dark Data sind Unternehmensinformationen, die eine Organisation sammelt, speichert oder aufbewahrt, aber nicht aktiv nutzt, vollständig versteht oder konsequent steuert.
Der wichtigste Punkt wird leicht übersehen:
Dark Data ist keine spezifische Datenart. Es handelt sich um einen Zustand, in den Daten geraten, wenn Sichtbarkeit, Nutzung, Eigentumsverhältnisse, Zweck oder die Kontrolle darüber verloren gehen.
Dunkle Daten: Wichtigste Erkenntnisse
- Dark Data ist ein Zustand der Regierungsführung, kein Dateityp. Jeder Datensatz, jedes Dokument, jedes Protokoll, jeder Datensatz, jedes Bild, jede Nachricht, jede Sicherungskopie oder jedes KI-Asset kann verloren gehen, wenn die Organisation aufhört, es zu verstehen oder zu nutzen.
- Dunkel bedeutet nicht automatisch nutzlos. Manche ungenutzten Daten besitzen nach wie vor geschäftlichen, rechtlichen, analytischen, historischen oder KI-relevanten Wert. Andere ungenutzte Daten verursachen Kosten und Risiken, ohne dass es einen legitimen Grund für ihre Speicherung gibt.
- Unbekannte Daten können dennoch sensible Informationen enthalten. Personenbezogene Daten (PII), Gesundheitsdaten (PHI), Zugangsdaten, Quellcode, Finanzunterlagen, geistiges Eigentum und vertrauliche Dokumente werden nicht weniger sensibel, nur weil sie niemand aktiv nutzt.
- KI kann ungenutzte Daten reaktivieren. Copiloten, RAG, Unternehmenssuche, Vektordatenbanken, Modelle und Agenten können vergessene Informationen wieder auffindbar und nutzbar machen.
- Die Recherche sollte zu einer Entscheidung führen. Organisationen sollten festlegen, ob ungenutzte Daten Schutz, Eigentum, Klassifizierung, Aufbewahrung, genehmigte Nutzung, Minimierung oder Löschung verdienen.
- BigID verbindet Erkenntnisgewinnung mit Handlung. BigID hilft Organisationen dabei, ungenutzte und unnötige Daten zu finden, deren Inhalt zu klassifizieren, Zugriff und Risiken zu verstehen, Lebenszyklusrichtlinien durchzusetzen, sicherere Daten für KI aufzubereiten und Korrekturmaßnahmen zu koordinieren.
Was sind Dark Data?
Dark Data sind Informationen, die eine Organisation sammelt, verarbeitet oder speichert, aber nicht aktiv nutzt, angemessen versteht oder konsequent steuert.
IBM beschreibt Dark Data ähnlich als Informationen, die Organisationen zwar sammeln, aber im Allgemeinen nicht für Analysen oder Entscheidungsfindung nutzen.
Der Begriff kann Daten beschreiben, die Teams:
- Vergessen, dass es existierte
- Nicht mehr verwenden
- Lässt sich nicht leicht finden
- Verstehen nicht
- Verbindung zum Besitzer nicht möglich
- Kann nicht mit einem aktuellen Geschäftszweck verknüpft werden
- Nicht klassifiziert
- Nicht unter die Lebenszyklusrichtlinie fallend
- In nicht verwaltete Umgebungen kopiert
- Behalten, ohne zu wissen, warum
Dunkle Daten können in strukturierten, halbstrukturierten und unstrukturierten Formaten vorliegen.
Beispiele hierfür sind:
- Alte Datenbanken
- Verlassener Cloud-Speicher
- Tabellenkalkulationen
- Unterlagen
- Chat- und Kollaborationsinhalte
- Protokolldateien
- Anwendungstelemetrie
- Archivierte Datensätze
- Backups und Snapshots
- Bilder, Audio und Video
- Forschungsdatensätze
- Entwicklerdaten
- Exporte und Extrakte
- KI-Trainingsdatensätze
- Vektor- und Abrufdaten
Das Format lässt die Daten nicht dunkel erscheinen.
Der Verlust von Sichtbarkeit, Zweck, Nutzen, Eigentum oder Kontrolle führt dazu.
Finden Sie die Daten, von denen Sie vergessen hatten, dass Sie sie hatten
Unbekannte Daten in eine fundierte Entscheidung umwandeln
Entdecken Sie dunkle, sensible, veraltete, doppelte, Schatten- und unnötige Daten, verstehen Sie deren Risiko und Wert und entscheiden Sie dann, welche Daten verwaltet, geschützt, aufbewahrt, verwendet oder entfernt werden sollen.
Dark Data ist ein Zustand, kein Datentyp
Diese Unterscheidung verändert die Art und Weise, wie Organisationen damit umgehen sollten.
Eine Tabellenkalkulation kann mit wertvollen Geschäftsdaten beginnen.
Sechs Monate später wird das Projekt beendet.
Drei Jahre später verlässt der Besitzer das Haus.
Die Tabellenkalkulation befindet sich weiterhin auf einem gemeinsamen Laufwerk.
Das Unternehmen nutzt es nicht mehr.
Die Aufbewahrungspflicht ändert sich.
Die Genehmigungen bleiben bestehen.
Die Organisation weiß möglicherweise nicht mehr, dass die Datei personenbezogene Daten von Kunden enthält.
Das Tabellenformat hat sich nicht geändert.
Der Geschäfts- und Governance-Kontext hat sich verändert.
Die dunkle Datenverschiebung
Nützliche Daten können verloren gehen, ohne dass sie sich bewegen.
Das Datenobjekt kann unverändert bleiben, während sein Eigentümer, sein Zweck, seine Aktivität, seine Richtlinie und sein Geschäftswert verschwinden.
Bekannt + Verwendet
Klare Eigentümer, Zweck, Verwendung und Richtlinie
Der Sinn verblasst
Nutzungsrückgänge und Eigentümerwechsel
Unbekannt + Unbenutzt
Wert, Eigentümer, Empfindlichkeit oder Zweck werden unklar
KI findet es
Suche, RAG oder Agenten machen es wieder betriebsbereit
Regieren oder Reduzieren
Aufbewahren, schützen, verwenden, archivieren, minimieren oder löschen
Dunkeldaten können wieder nutzbar gemacht werden. Künstliche Intelligenz beschleunigt und vereinfacht diesen Übergang im Vergleich zu herkömmlichen Suchmethoden.
Was sind Beispiele für Dark Data?
Dunkle Daten können fast überall auftauchen.
Unbenutzte Geschäftsdateien
Alte Präsentationen, Dokumente, Tabellenkalkulationen, PDFs, Verträge, Projektdateien und Exporte können noch lange bestehen bleiben, nachdem Teams aufgehört haben, sie zu nutzen.
Protokolle und maschinell generierte Daten
Anwendungen, Infrastruktur, Sicherheitstools, Geräte, APIs und automatisierte Systeme erzeugen kontinuierlich Protokolle und Telemetriedaten.
Organisationen können große Datenmengen speichern, ohne sie aktiv zu analysieren oder zu steuern.
Historische Kunden- und Mitarbeiterdaten
Alte Kundendatensätze, Bewerbungen, Mitarbeiterakten, Supportfälle, Transaktionshistorien und Kontoinformationen können auch dann noch vorhanden sein, wenn ihr ursprünglicher betrieblicher Bedarf wegfällt.
Backups und Snapshots
Backup-Umgebungen können vergessene Kopien sensibler Informationen lange bewahren, nachdem die Teams die primären Repositories bereinigt haben.
Entwickler- und Testdaten
Entwickler können Produktionsinformationen in Entwicklungs-, Test-, Staging-, Sandbox- oder Fehlerbehebungsumgebungen kopieren.
Diese Kopien können das Projekt überdauern und die Eigentumsverhältnisse können unklar werden.
Kollaborationsdaten
E-Mails, Chats, gemeinsame Laufwerke, Kollaborationsplattformen, Besprechungsnotizen, Anhänge und Arbeitsbereichsexporte können große Mengen an Informationen enthalten, die Teams selten wieder aufrufen.
Erworbene und migrierte Daten
Fusionen, Übernahmen, Migrationen und die Stilllegung von Anwendungen können Datensätze hinterlassen, deren geschäftlichen Zweck, Eigentümer oder Aufbewahrungsregeln niemand mehr vollständig versteht.
KI- und Analysedaten
Trainingsdatensätze, Zwischendateien, Einbettungen, Evaluierungsdatensätze, generierte Ausgaben, Prompt-Verläufe, Vektorinhalte, analytische Auszüge und abgeleitete Datensätze können ebenfalls verloren gehen, wenn Teams den Zweck oder den Lebenszyklus aus den Augen verlieren.
Warum sammeln sich dunkle Daten an?
Organisationen erzeugen im Rahmen ihrer normalen Geschäftstätigkeit sogenannte Dark Data.
Das Problem verschärft sich, wenn die Schöpfung schneller voranschreitet als die Regierungsführung.
Häufige Ursachen sind:
- Kostengünstige und flexible Speicherung
- “Für alle Fälle aufbewahren”-Praktiken
- Schwache oder inkonsistente Speicherung
- Anwendungsmigrationen
- Fusionen und Übernahmen
- Mitarbeiterfluktuation
- Projektabschluss
- Doppelte Dateien und Exporte
- Unverwaltete SaaS-Anwendungen
- Backups und Snapshots
- Entwicklungskopien
- Unvollständige Lagerbestände
- Unklare Eigentumsverhältnisse
- Unzusammenhängende Datenschutz-, Sicherheits- und Governance-Programme
Die Organisation benötigt kein dramatisches Scheitern, um dunkle Daten zu erzeugen.
Dunkle Daten stammen oft aus Tausenden von alltäglichen Entscheidungen, die niemand mehr überprüft.
Dunkle Daten vs. Schattendaten vs. ROT-Daten
Diese Begriffe überschneiden sich zwar, beschreiben aber unterschiedliche Probleme.
| Kategorie | Kernproblem | Beispiel | Wahrscheinliche Aktion |
|---|---|---|---|
| Dunkle Daten | Die Organisation nutzt die Daten nicht aktiv, versteht sie nicht vollständig und kontrolliert sie nicht konsequent. | Ein altes Archiv, das niemandem gehört oder von niemandem überprüft wird. | Entdecken, klassifizieren, einen Zweck zuweisen, dann entscheiden. |
| Schattendaten | Daten existieren außerhalb der genehmigten oder erwarteten Governance- und Sicherheitstransparenz. | Ein Mitarbeiter kopiert Kundendaten in eine nicht verwaltete SaaS-Anwendung. | Identifizieren Sie Quelle, Eigentümer, Gefährdungspotenzial, Richtlinie und genehmigten Standort. |
| ROT-Daten | Daten sind überflüssig, veraltet oder trivial geworden. | Sieben veraltete Exemplare desselben Projektberichts. | Überprüfen, minimieren, bei Bedarf beibehalten oder löschen. |
| Veraltete Daten | Die Daten haben sich über einen definierten Zeitraum weder verändert noch wurden sie sinnvoll genutzt. | Eine Datei, die vier Jahre lang niemand aufgerufen hat. | Bewertungszweck, Frische, Haltbarkeit und Wert. |
| Verwaiste Daten | Den Daten fehlt ein klarer, verantwortlicher Eigentümer. | Eine Teamfahrt bleibt auch dann noch bestehen, wenn das gesamte Team abgereist ist. | Zuständigkeit zuweisen oder Lebenszyklusprüfung einleiten. |
Ein Datensatz kann mehreren Kategorien zugeordnet werden.
Ein nicht verwalteter Projektordner kann gleichzeitig dunkel, veraltet, verwaist und voller fehlerhafter Daten sein.
Die Bezeichnungen helfen, den Zustand zu beschreiben. Die Sicherheitsentscheidung sollte von der Sensibilität, dem Wert, dem Zugriff, der Aktivität, den Richtlinien und dem Zweck der Daten abhängen.
Weitere Informationen zu unkontrollierten Informationen finden Sie unter Was sind Schattendaten?
Sind Dark Data immer schlecht?
NEIN.
Dies ist eines der größten Missverständnisse im Zusammenhang mit Dark Data.
Einige dunkle Daten könnten noch Folgendes enthalten:
- Rechtswert
- Historischer Wert
- Forschungswert
- Wert der Betrugsanalyse
- Wertpapierwert
- Analytischer Wert
- KI-Wert
- Regulatorische Aufbewahrungspflichten
Der Fehler besteht darin, nicht alle ungenutzten Daten zu speichern.
Der Fehler besteht darin, es zu behalten. ohne zu wissen, warum.
Organisationen müssen unterscheiden:
Dunkel, aber wertvoll Daten, die Eigentum und Kontrolle verdienen.
Aus:
Dunkel und unnötig Daten, die Kosten, Risiken und politische Belastungen verursachen, ohne einen sinnvollen Nutzen zu bringen.
Warum ungeschützte Daten ein Sicherheitsrisiko darstellen
Sicherheitsteams können sensible Informationen nicht effektiv schützen, wenn sie nicht wissen, dass diese existieren.
Dunkle Daten können Folgendes enthalten:
- PII
- PHI
- Zahlungsinformationen
- Anmeldeinformationen
- Geheimnisse
- API-Schlüssel
- Quellcode
- Finanzinformationen
- Geistiges Eigentum
- Kundendatensätze
- Mitarbeiterinformationen
- Rechtsdokumente
- Vertrauliche Mitteilungen
Das Risiko verschärft sich, wenn Dark Data auch Folgendes aufweist:
- Öffentliche Exposition
- Externe Freigabe
- Breiter interner Zugang
- Veraltete Berechtigungen
- Kein verantwortlicher Eigentümer
- Schwache Rückhaltekontrollen
- Unbekannte Kopien
- KI-Zugänglichkeit
Unbekannte Daten bedeuten nicht automatisch risikoarme Daten.
In manchen Fällen trifft das Gegenteil zu. Informationen ohne aktiven Eigentümer werden möglicherweise weniger genau geprüft, während ihr Zugriff und ihre Sensibilität unverändert bleiben.
Warum Dark Data Datenschutz- und Compliance-Risiken birgt
Die Datenschutzverpflichtungen verschwinden nicht, wenn Mitarbeiter die Daten nicht mehr aktiv nutzen.
Eine Organisation muss möglicherweise noch Folgendes verstehen:
- Welche personenbezogenen Daten es speichert
- Warum es das behält
- Auf welche Personen sich die Daten beziehen
- Welche Gerichtsbarkeit gilt?
- Ob eine Einwilligung oder andere Rechtsgrundlagen noch gelten
- Wie lange bleibt die Aufbewahrung angemessen?
- Ob eine rechtliche Sperre die Löschung verhindert
- Ob die Organisation Lösch- oder Zugriffsanfragen erfüllen kann
Dunkle personenbezogene Daten stellen ein besonderes Problem dar, da Teams Informationen möglicherweise ohne klaren operativen Grund aufbewahren, gleichzeitig aber dennoch datenschutzrechtliche Verpflichtungen erfüllen müssen.
Dadurch sind dunkle Daten eng miteinander verknüpft mit Datenlebenszyklusverwaltung und Datensparsamkeit.
Warum ungeschützte Daten Kosten verursachen
Lagerung kostet Geld.
Die Lagerung stellt jedoch nur einen Teil der Kosten dar.
Auch die Zunahme von Dark Data kann sich bemerkbar machen:
- Sicherungsvolumes
- Replikation
- Cloud-Speicherverbrauch
- Migrationsumfang
- Rechtsermittlungsband
- Anforderungen an Sicherheitsscans
- Datenschutzprüfung
- Datenzugriffskomplexität
- KI-Indexierung und -Verarbeitung
Die wichtige Frage lautet nicht einfach:
“Wie viel kostet die Speicherung dieser Daten?”
Organisationen sollten sich außerdem fragen:
“Wie viel kostet die Sicherung, Verwaltung, Überprüfung, Migration, Suche, Aufbewahrung, Verarbeitung und potenzielle Offenlegung dieser Daten?”
Wie KI das Problem der dunklen Daten verändert
Künstliche Intelligenz bewirkt den wichtigsten Wandel im Bereich des Dark-Data-Managements seit Jahren.
Historisch gesehen konnten dunkle Daten relativ ungenutzt bleiben.
Die Informationen existierten zwar, aber die Mitarbeiter würden möglicherweise nie danach suchen, sie öffnen oder wissen, wo sie gespeichert sind.
Unternehmensbasierte KI verändert dieses Modell.
KI kann unerforschte Daten durchsuchbar machen
Unternehmensweite Suche und Copiloten können durch natürlichsprachliche Fragen das Auffinden vergessener Informationen erleichtern.
Ein schwer auffindbares Dokument kann sehr leicht auffindbar werden, wenn sein Inhalt den Absichten des Nutzers entspricht.
RAG kann ungenutzte Daten in aktiven Kontext verwandeln
A RAG-System kann alte Dokumente abrufen, weil deren Inhalt semantisch relevant erscheint.
Wenn die Informationen veraltet, unpassend, sensibel oder überholt sind, kann die KI den falschen Kontext verwenden, selbst wenn die Abruffunktion korrekt ist.
Dunkle Daten können in KI-Pipelines gelangen
Trainings-, Optimierungs-, Evaluierungs-, Analyse- und KI-Vorbereitungsworkflows können Datensätze verwenden, die von den Teams nicht ausreichend klassifiziert oder verwaltet wurden.
Verfügbarkeit ist kein Garant für Eignung für KI.
KI-Agenten können auf vergessene Informationen reagieren
Ein Agent darf nicht einfach nur ungenutzte Daten abrufen.
Es kann dazu verwendet werden:
- Geben Sie eine Empfehlung ab
- Eine Anwendung aktualisieren
- Nachricht senden
- Erstellen Sie einen Bericht
- API aufrufen
- Einen Workflow auslösen
Künstliche Intelligenz kann Dark Data von einem passiven Speicherrisiko in ein aktives Entscheidungs- und Handlungsrisiko umwandeln.
Dunkle Daten im Zeitalter der KI
KI kann vergessene Informationen in einen aktiven Kontext umwandeln.
Dunkle Daten
Vergessen, ungenutzt, schlecht verstanden
KI-Suche
Natürliche Sprache fördert verborgene Informationen zutage.
RAG-Kontext
Relevante Informationen gelangen in den KI-Kontext.
KI-Nutzung
Modelle oder Copiloten verarbeiten die Informationen
Agentenaktion
KI nutzt die Daten, um die Arbeit zu beeinflussen oder auszuführen.
Ein in Vergessenheit geratener Datensatz kann wieder nutzbar werden, ohne dass ihn jemand absichtlich wieder öffnet.
Macht KI dunkle Daten wertvoll?
Manchmal.
Organisationen sollten sich jedoch der Annahme widersetzen, dass mehr Daten automatisch zu besserer KI führen.
Dark Data kann nützliche historische, Kunden-, Betriebs-, Sicherheits- oder Forschungsinformationen enthalten.
Es kann auch Folgendes enthalten:
- Veraltete Informationen
- Doppelte Datensätze
- Falsche Informationen
- Abgelaufene personenbezogene Daten
- Eingeschränkte Daten
- Vertrauliche Informationen
- Alte Richtlinien
- Veraltete Produktinformationen
- Herkunft unbekannt
- Übermäßig leicht zugängliche Inhalte
Die richtige Frage lautet nicht:
“Kann KI diese Daten nutzen?”
Es ist:
“Sollte diese KI diese Daten für diesen Zweck verwenden?”
Dazu bedarf es eines Kontextes hinsichtlich Sensibilität, Qualität, Herkunft, Eigentumsverhältnissen, Zugang, Richtlinien, Frische und Verwendungszweck.
Einen umfassenderen Rahmen finden Sie unter KI-fähige Daten beginnen mit der Geschäftsentscheidung, nicht mit dem Modell..
Die Entscheidung bezüglich der Dark Data: Behalten, Verwalten, Nutzen oder Löschen?
Das Auffinden ungenutzter Daten beantwortet nicht die Frage, was damit zu tun ist.
Die Entdeckung sollte eine Entscheidung auslösen.
Die Entscheidung über dunkle Daten
Wert und Verpflichtung sollten bestimmen, was als Nächstes geschieht.
Nutzung + Steuerung
Die Daten haben einen legitimen Wert. Weisen Sie die Eigentumsrechte zu, klassifizieren Sie sie, sichern Sie den Zugriff und legen Sie Richtlinien fest.
Bewahren + Schützen
Das Unternehmen nutzt es möglicherweise nicht aktiv, aber Aufbewahrungs-, Rechtsstreit-, Regulierungs- oder Vertragsanforderungen rechtfertigen die Aufbewahrung.
Überprüfen + Zuweisen
Vor dem Ergreifen von Maßnahmen sollten Eigentümer, Sensibilität, Zweck, Zugriff, Lebenszyklusanforderungen und KI-Eignung ermittelt werden.
Minimieren + Löschen
Wenn kein geschäftlicher, rechtlicher, regulatorischer oder betrieblicher Zweck mehr besteht, reduzieren Sie unnötige Daten durch kontrollierte Maßnahmen im Rahmen des Datenlebenszyklus.
Wie man Dark Data findet
Das Management dunkler Daten beginnt mit deren Aufdeckung.
Organisationen sollten mehr als nur primäre Datenbanken und Cloud-Speicher berücksichtigen.
Ein vollständiger Ansatz sollte Folgendes umfassen:
- Cloud-Umgebungen
- SaaS-Anwendungen
- Lokale Systeme
- Hybridumgebungen
- Strukturierte Datenbanken
- Dateisysteme
- Kollaborationsplattformen
- Data Lakes und Data Warehouses
- Entwicklungssysteme
- Backups
- KI-vernetzte Umgebungen
Datenermittlung und -klassifizierung Teams dabei unterstützen, festzustellen, welche Informationen vorhanden sind und was sie enthalten.
Das Auffinden von Dark Data ist jedoch nur der erste Schritt.
Teams sollten die Recherche durch Folgendes bereichern:
- Empfindlichkeit
- Eigentümer
- Geschäftszweck
- Alter
- Aktivität
- Berechtigungen
- Verordnung
- Aufbewahrungspflichten
- Ähnlichkeit und Duplikation
- KI-Einsatz
Die Datenerhebung zeigt Ihnen, dass die Daten existieren. Der Kontext sagt Ihnen, was Sie damit anfangen sollen.
Wie man ungenutzte Daten verwaltet
1. Entdecke es kontinuierlich
Gewährleisten Sie die Transparenz über alle Umgebungen hinweg, in denen die Organisation Daten erstellt, kopiert, speichert und verarbeitet.
Einmalige Inventarisierungen veralten genauso schnell, wie Teams neue Systeme und Kopien erstellen.
2. Inhalte klassifizieren
Ermitteln Sie, ob die ungeschützten Daten sensible, regulierte, vertrauliche, firmeneigene, finanzielle, gesundheitsbezogene, anmeldebezogene, persönliche oder geschäftskritische Informationen enthalten.
3. Eigentumsverhältnisse klären
Verknüpfen Sie ungenutzte Daten nach Möglichkeit mit einem geschäftlichen oder technischen Verantwortlichen.
Daten ohne Eigentümer bleiben oft ungelöst, weil niemand die Befugnis oder Verantwortung hat, eine Entscheidung über den gesamten Lebenszyklus zu treffen.
4. Zugang und Reichweite verstehen
Ermitteln, welche Benutzer, Gruppen, Anwendungen, Dienstkonten, Maschinenidentitäten und KI-Systeme Zugriff auf Dark Data haben können.
Bei besonders sensiblen Informationen sollte einem breiten Zugang Vorrang eingeräumt werden.
5. Überprüfungsaktivität
Aktivitätsdaten können dabei helfen, wirklich ruhende Daten von Informationen zu unterscheiden, die von Anwendungen, Benutzern oder KI-Systemen weiterhin genutzt werden.
Überwachung der Datenaktivität kann den Nutzungskontext von Entscheidungen zu sensiblen Daten ergänzen.
6. Aufbewahrungs- und Rechtssicherungsmaßnahmen anwenden
Löschen Sie Daten nicht einfach, nur weil sie niemand benutzt.
Prüfen Sie, ob rechtliche, behördliche, vertragliche, ermittlungstechnische oder geschäftliche Anforderungen eine fortgesetzte Aufbewahrung erfordern.
Datenaufbewahrung Die Richtlinien sollten mit den tatsächlichen Daten, die sie regeln, verknüpft werden.
7. Identifizieren Sie fehlerhafte und doppelte Daten.
Dunkle Daten überschneiden sich häufig mit veralteten, doppelten, redundanten, überholten oder trivialen Informationen.
Die Identifizierung dieser Bedingungen hilft Teams dabei, unnötige Daten zur Überprüfung zu priorisieren.
8. KI-Eignung bestimmen
Bevor Sie ungenutzte Daten mit Trainings-, RAG-, Unternehmenssuch-, Copilot- oder Agentensystemen verknüpfen, prüfen Sie, ob die Informationen für den jeweiligen KI-Zweck noch geeignet sind.
9. Minimieren Sie, was das Unternehmen nicht mehr benötigt.
Bewahren Sie unnötige Daten nicht auf, nur weil Speicherplatz verfügbar ist.
Datenminimierung kann die Angriffsfläche, die Gefährdung der Privatsphäre, das KI-Risiko und die Speicherkosten reduzieren.
10. Löschen Sie verteidigungsfähig
Wenn es keinen legitimen Grund mehr gibt, Daten aufzubewahren, sollten Organisationen eine kontrollierte Löschung mit Richtlinien, Genehmigungen, Aufbewahrungsprüfungen, Validierungen und Nachweisen durchführen.
11. Kontinuierlich neu bewerten
Die heute aktiven Daten können morgen zu den dunklen Daten werden.
Das Lebenszyklusmanagement sollte kontinuierlich Änderungen in Bezug auf Nutzung, Eigentumsverhältnisse, Alter, Richtlinien, Wert, Verfügbarkeit von KI und Risiko überprüfen.
Weniger Daten speichern. Mehr Risiken reduzieren.
Finden Sie die ungenutzten Daten, die ihren Platz nicht mehr verdienen
Identifizieren Sie dunkle, veraltete, doppelte, redundante, überholte, triviale, sensible und übermäßig aufbewahrte Daten und verknüpfen Sie die Ergebnisse mit Entscheidungen zur Aufbewahrung, Minimierung, Löschung und KI-Bereitschaft.
Dark Data und Datenlebenszyklusmanagement
Dunkle Daten deuten oft auf ein Scheitern im Lebenszyklus hin.
Die Organisation hat Informationen zu einem bestimmten Zweck erstellt oder gesammelt.
Dann änderte sich der Zweck, aber die Daten blieben erhalten.
Ein reifer Datenlebenszyklusverwaltung Das Programm sollte ständig fragen:
- Warum existieren diese Daten?
- Wem gehört es?
- Benutzt das überhaupt noch jemand?
- Was ist darin enthalten?
- Welche Richtlinie gilt?
- Müssen wir es behalten?
- Ist eine rechtliche Sicherungsmaßnahme anwendbar?
- Sollte KI es nutzen?
- Können wir es minimieren?
- Sollen wir es löschen?
Ziel ist es nicht, alle unentdeckten Daten sofort zu eliminieren. Ziel ist es, die Unsicherheit darüber zu beseitigen, warum Daten weiterhin bestehen.
Dark Data und DSPM
Dunkle Daten erzeugen auch ein Management von Datensicherheitsmaßnahmen Problem.
Ein Sicherheitsteam kann die Gefährdung sensibler Daten nicht genau beurteilen, wenn unbekannte oder vergessene Speicherorte außerhalb seines Blickfelds bleiben.
Moderne DSPM-Systeme sollten Teams dabei helfen, ungenutzte Daten mit folgenden Informationen zu verknüpfen:
- Empfindlichkeit
- Belichtung
- Identität
- Zugang
- Aktivität
- Eigentum
- KI-Einsatz
- Geschäftlicher Kontext
- Sanierung
Das Risiko ergibt sich nicht allein aus der Tatsache, dass die Daten ungeschützt sind.
Das Risiko ergibt sich aus dem Inhalt der Daten und den damit verbundenen Bedingungen.
Was Sicherheits- und Datenverantwortliche oft über Dark Data falsch verstehen
“Unbenutzt bedeutet harmlos”
Auch ungenutzte Daten können sensibel, übermäßig exponiert, zugänglich, reguliert und durch KI abrufbar bleiben.
“Wir können alles löschen.”
Manche Dark Data besitzen einen legitimen geschäftlichen, historischen, vertraglichen, regulatorischen oder rechtlichen Wert.
Teams benötigen Kontext vor dem Löschen.
“Dunkle Daten existieren nur in alten Systemen”
Neue Cloud- und SaaS-Umgebungen können durch Kopien, Exporte, Protokolle, Zusammenarbeit, Automatisierung und abgebrochene Projekte schnell zu ungenutzten Daten führen.
“Wenn KI es finden kann, sollten wir sie nutzen.”
Auffindbarkeit ist kein Garant für Qualität, Berechtigung, Relevanz, Aktualität oder Eignung für politische Zwecke.
Künstliche Intelligenz kann dazu beitragen, dass ungeeignete Daten leichter konsumiert werden.
“Eine Dateninventur löst das Problem.”
Eine Bestandsaufnahme trägt zur Transparenz bei.
Es entscheidet nicht darüber, ob Teams die Daten behalten, sichern, minimieren, löschen oder verwenden sollen.
“Die Lagerkosten stellen das größte Risiko dar.”
Dark Data birgt außerdem Risiken in den Bereichen Sicherheit, Datenschutz, Zugriff, Recht, Migration, Betrieb und KI.
Wie man das Risiko von Dark Data misst
Organisationen sollten den Erfolg nicht ausschließlich an der Gesamtmenge der entdeckten Terabytes messen.
Weitere sinnvolle Maßnahmen können sein:
- Umfang der entdeckten dunklen Daten
- Dunkle Daten, die sensible Informationen enthalten
- Dunkle Daten mit öffentlicher oder externer Zugänglichkeit
- Dunkle Daten mit übermäßigem Zugriff
- Dunkle Daten ohne Besitzer
- Aufbewahrungspflichten für Dark Data
- Dunkeldaten überlappen sich mit ROT-Daten
- Dunkle Daten, die für KI zugänglich sind
- Speicherkapazität durch Minimierung reduziert
- Dunkle Daten: Besitzer und Zweck zugewiesen
- Dunkeldaten unterliegen der Aufbewahrungsrichtlinie
- Dunkeldaten mit Beweisen gelöscht
Ziel ist es nicht, immer mehr ungenutzte Daten aufzudecken. Vielmehr geht es darum, die Menge an unstrukturierten Daten zu reduzieren, deren Wert, Offenlegung, Zweck und Lebenszyklus unbekannt sind.
Checkliste zur Vorbereitung auf dunkle Daten
Bereitschaft für dunkle Daten
Kann Ihre Organisation diese Fragen beantworten?
✓ Wo befinden sich unbekannte, ungenutzte, veraltete oder vergessene Daten?
✓ Welche sensiblen oder regulierten Informationen enthält es?
✓ Wem gehört es?
✓ Warum behält die Organisation es trotzdem?
✓ Welche Benutzer, Anwendungen, Dienstkonten, Maschinenidentitäten oder KI-Systeme können darauf zugreifen?
✓ Welche Dark Data haben öffentlichen, externen oder übermäßigen Zugriff?
✓ Wird es heute noch von irgendjemandem oder irgendetwas aktiv genutzt?
✓ Welche Aufbewahrungspflicht gilt?
✓ Verhindert eine rechtliche Sperre die Löschung?
✓ Welche der unerschlossenen Daten sind ebenfalls veraltet, doppelt vorhanden, redundant, überholt oder trivial?
✓ Können RAG, die Unternehmenssuche, Copiloten oder Agenten es abrufen?
✓ Sind die Daten für den Einsatz mit KI geeignet?
✓ Welche Daten verdienen eine erneute geschäftliche Nutzung?
✓ Welche Daten sollte die Organisation minimieren oder löschen?
✓ Können die Teams die von ihnen durchgeführten Maßnahmen im Lebenszyklus nachweisen?
Wie BigID beim Auffinden und Verwalten von Dark Data hilft
BigID nähert sich Dark Data von der Datenebene nach außen.
Entdeckung schafft den Ausgangspunkt.
Doch die Erkenntnis, dass vergessene Daten existieren, sagt den Teams nicht, was sie damit anfangen sollen.
Organisationen müssen außerdem verstehen Was die Daten enthalten, wem sie gehören, wer und was darauf zugreifen kann, ob sie noch genutzt werden, welche Richtlinien gelten, ob KI sie verarbeiten soll und ob die Organisation sie behalten oder löschen soll.
BigID unterstützt Organisationen:
- Entdecken Sie verborgene und unbekannte Daten: Finden Sie strukturierte, semistrukturierte und unstrukturierte Informationen in unterstützten Cloud-, SaaS-, Hybrid-, On-Premises- und KI-vernetzten Umgebungen.
- Klassifizieren Sie den Inhalt von Dark Data: Identifizieren Sie persönliche, regulierte, vertrauliche, geschützte, Berechtigungs-, Finanz-, Gesundheits- und geschäftskritische Informationen, damit Teams ihre Maßnahmen entsprechend dem tatsächlichen Inhalt priorisieren können.
- Priorisierung der Offenlegung von Dark Data: Verknüpfen Sie Sensibilität mit Zugriff, Gefährdung, Eigentumsverhältnissen, Aktivitäten, Standort und Geschäftskontext, um aussagekräftige Sicherheitsrisiken zu identifizieren.
- Verstehen Sie, wer und was darauf zugreifen kann: Verknüpfen Sie sensible Daten mit Benutzern, Gruppen, Anwendungen, Dienstkonten, Maschinenidentitäten und KI-Systemen.
- Aktivitätskontext hinzufügen: Ermitteln Sie, ob sensible Daten ungenutzt bleiben oder ob Identitäten weiterhin darauf zugreifen, sie teilen, verschieben, verändern, herunterladen oder löschen.
- Unnötige Daten reduzieren: Identifizieren Sie dunkle, veraltete, doppelte, ähnliche, redundante, überholte, triviale und übermäßig aufbewahrte Daten, damit die Teams die Bereinigung nach Richtlinien und Risiko priorisieren können.
- Den Lebenszyklus steuern: Verknüpfung von Ermittlung und Klassifizierung mit Aufbewahrung, rechtlicher Aufbewahrung, Minimierung, Löschung, Behebung und Lebenszyklusbeweisen.
- Anwendung der Rückbehaltung: Verknüpfen Sie Aufbewahrungsvorschriften mit tatsächlichen Unternehmensdaten und identifizieren Sie Informationen, die Teams aufbewahren, überprüfen oder entfernen sollten.
- Sicherere Daten für KI vorbereiten: Sensible, veraltete, doppelte, eingeschränkte oder unnötige Informationen sollten erkannt werden, bevor sie in Schulungen, RAG-Systeme, Eingabeaufforderungen, Copiloten, Modelle oder Agenten-Workflows gelangen.
- Laufwerksbereinigung: Weisen Sie Verantwortliche zu, beschränken Sie den Zugriff, wenden Sie Richtlinien an, setzen Sie die Aufbewahrung durch, löschen Sie unnötige Daten und koordinieren Sie gegebenenfalls Korrekturmaßnahmen.
BigID macht aus der Frage der Dark Data einen Entscheidungspfad:
Entdecken → Verstehen → Einordnen → Entscheiden → Handeln → Beweisen
Das ist sinnvoller als die bloße Berechnung der Menge an ungenutzten Daten.
Ziel ist es, zu ermitteln, welche ungenutzten Daten im Unternehmen noch ihren Platz verdienen, welche Daten einer stärkeren Governance bedürfen, welche Daten die KI nutzen sollte und auf welche Daten die Organisation verzichten kann.
Die Punkte zwischen Daten und KI verbinden
Aus ungenutzten Daten eine Entscheidungsgrundlage schaffen
Erfahren Sie, wie BigID verborgene und sensible Daten aufspürt, sie mit Eigentumsrechten, Zugriffsrechten, Aktivitäten, Lebenszyklus, KI-Nutzung, Richtlinien und Risiken verknüpft und Teams anschließend dabei unterstützt, das Wesentliche zu steuern und Unwesentliches zu reduzieren.
Häufig gestellte Fragen zu Dark Data
Was sind Dark Data?
Dark Data sind Informationen, die eine Organisation sammelt, speichert oder aufbewahrt, aber nicht aktiv nutzt, vollständig versteht oder konsequent verwaltet. Dazu gehören Dateien, Datenbanken, Protokolle, Backups, Nachrichten, Analysedaten, KI-Datensätze und andere strukturierte oder unstrukturierte Informationen.
Warum werden sie als dunkle Daten bezeichnet?
Der Begriff beschreibt Daten, die außerhalb der regulären Geschäftsnutzung, -analyse, -sichtbarkeit oder -verwaltung liegen. Die Daten existieren zwar weiterhin, aber dem Unternehmen fehlt möglicherweise ein klares Wissen über ihren Zweck, ihren Inhalt, ihren Eigentümer, ihren Wert oder das damit verbundene Risiko.
Was sind Beispiele für Dark Data?
Beispiele hierfür sind verlassene Dateien, Anwendungsprotokolle, alte Kundendatensätze, ungenutzte Datenbanken, Backups, archivierte E-Mails, vergessene Kollaborationsinhalte, Entwicklungskopien, historische Exporte, erworbene Daten, ungenutzte Forschungsdatensätze und KI-bezogene Datensätze, die keinen klaren Zweck oder Eigentümer mehr haben.
Sind dunkle Daten dasselbe wie Schattendaten?
Nein. Dunkle Daten bezeichnen im Allgemeinen Informationen, die Organisationen nicht aktiv nutzen oder vollständig verstehen. Schattendaten hingegen beschreiben Informationen, die außerhalb der genehmigten oder erwarteten Governance- und Sicherheitsrichtlinien liegen. Ein Datensatz kann beides sein.
Worin besteht der Unterschied zwischen Dark Data und ROT-Daten?
ROT-Daten sind redundante, veraltete oder triviale Informationen. Dark Data beschreibt Informationen, deren Verwendung, Wert, Eigentumsverhältnisse oder Verwaltung unklar sind. Manche Dark Data sind wertvoll, andere hingegen werden zu ROT-Daten und sollten minimiert oder gelöscht werden.
Sind Dark Data immer nutzlos?
Nein. Auch ungenutzte Daten können legitimen geschäftlichen, rechtlichen, historischen, sicherheitsrelevanten, forschungsbezogenen, analytischen oder KI-Wert besitzen. Organisationen sollten Zweck, Sensibilität, Qualität, Eigentumsverhältnisse, Richtlinien und Geschäftsbedarf prüfen, bevor sie über deren Aufbewahrung oder Löschung entscheiden.
Warum stellen ungenutzte Daten ein Sicherheitsrisiko dar?
Ungeklärte Daten können sensible Informationen enthalten, während sie oft unzureichend verstanden, allgemein zugänglich, extern geteilt, niemandem zugeordnet oder nicht aktiv sicherheitsüberprüft sind. Unbekannte sensible Daten können das Risiko von Sicherheitsverletzungen erhöhen und die Risikopriorisierung erschweren.
Wie bergen unerkannte Daten ein Datenschutzrisiko?
Dunkle Daten können personenbezogene Daten enthalten, die das Unternehmen nicht mehr benötigt, aber weiterhin speichert. Dies kann Probleme hinsichtlich Zweck, Aufbewahrung, Zugriff, Datenrechten, Datenminimierung, Löschung und anderer Datenschutzanforderungen aufwerfen.
Wie wirkt sich KI auf Dark Data aus?
KI kann ungenutzte Daten wieder durchsuchbar und nutzbar machen. Unternehmenssuche, RAG-Systeme, Copiloten, Vektordatenbanken, Trainingspipelines und Agenten können vergessene Informationen wiederfinden oder verarbeiten, auf die Mitarbeiter vor dem Einsatz von KI kaum zugegriffen haben.
Sollten ungenutzte Daten für KI verwendet werden?
Nicht automatisch. Organisationen sollten prüfen, ob die Dark Data korrekt, aktuell, relevant, angemessen zugänglich, ausreichend reguliert und für den beabsichtigten KI-Einsatz zulässig sind, bevor sie sie mit Trainingsdaten, RAG, Copiloten, Modellen oder Agenten verbinden.
Wie können Organisationen ungenutzte Daten aufspüren?
Unternehmen können Datenermittlung und -klassifizierung in Cloud-, SaaS-, Hybrid-, On-Premises-, Datei-, Datenbank-, Kollaborations-, Entwicklungs- und KI-vernetzten Umgebungen nutzen. Anschließend sollten sie Kontextinformationen wie Sensibilität, Eigentumsverhältnisse, Alter, Zugriff, Aktivität, Aufbewahrungsfrist und Geschäftszweck hinzufügen.
Wie sollten Organisationen mit ungenutzten Daten umgehen?
Organisationen sollten ungenutzte Daten aufspüren und klassifizieren, die Eigentumsrechte zuweisen, Zugriff und Aktivitäten verstehen, Aufbewahrungs- und Legal-Hold-Vorschriften anwenden, den Geschäfts- und KI-Wert bewerten, doppelte und veraltete Daten identifizieren, unnötige Informationen minimieren und Daten nachvollziehbar löschen, wenn kein legitimer Bedarf mehr besteht.
Wie hilft BigID bei der Verwaltung von Dark Data?
BigID hilft Organisationen dabei, ungenutzte und unbekannte Daten zu entdecken und zu klassifizieren, sensible Informationen zu identifizieren, Daten mit Eigentumsverhältnissen, Identitäten, Zugriffen, Aktivitäten, Offenlegung, Richtlinien, Aufbewahrung und KI-Nutzung zu verknüpfen, veraltete und unnötige Daten zu erkennen und Lebenszyklus- und Abhilfemaßnahmen zu koordinieren.

