Les organisations décident rarement de créer des données dormantes.
Ils l'accumulent.
Une équipe exporte les dossiers clients d'un projet.
Une application crée des journaux que personne ne consulte.
Une plateforme collaborative conserve des années de documents abandonnés.
Une migration laisse derrière elle les anciennes données.
Les employés créent des feuilles de calcul en double.
Une sauvegarde préserve les informations longtemps après que l'entreprise a cessé d'utiliser la source.
Une équipe de développement copie les données de production dans un environnement de test.
Puis l'IA entre en scène.
Un copilote d'entreprise indexe un ancien référentiel. Un système RAG récupère un document obsolète. Un agent obtient un accès via un compte de service. Un pipeline d'entraînement découvre un ensemble de données dont personne ne se souvenait.
Des informations restées opérationnellement invisibles pendant des années peuvent soudainement devenir consultables, récupérables et exploitables.
Cela change la donne concernant le problème des données non structurées.
Les données dormantes ne représentent plus seulement une perte de valeur analytique ou un stockage inutile.
Il peut créer :
- Exposition inconnue à des données sensibles
- Accès excessif
- Risques liés à la confidentialité et à la conservation des données
- Impact plus important des brèches
- Contexte d'IA dupliqué et contradictoire
- Coûts inutiles du cloud et du stockage
- L'accès de l'IA à des données que l'entreprise n'avait jamais prévu d'utiliser
Les données dormantes sont des informations d'entreprise qu'une organisation collecte, stocke ou conserve mais qu'elle n'utilise pas activement, ne comprend pas pleinement ou ne gouverne pas de manière cohérente.
Le point le plus important est facile à négliger :
Les données obscures ne constituent pas un type de données spécifique. Il s'agit d'un état dans lequel les données entrent lorsque leur visibilité, leur utilisation, leur propriété, leur finalité ou leur gouvernance disparaissent.
Données obscures : principaux enseignements
- Les données dormantes constituent un état de gouvernance, et non un type de fichier. Toute donnée, document, journal, enregistrement, image, message, sauvegarde ou ressource d'IA peut devenir inaccessible lorsque l'organisation cesse de la comprendre ou de l'utiliser.
- Sombre ne signifie pas automatiquement inutile. Certaines données dormantes conservent une valeur commerciale, juridique, analytique, historique ou pour l'IA. D'autres, en revanche, engendrent des coûts et des risques sans raison légitime de les conserver.
- Les données inconnues peuvent néanmoins contenir des informations sensibles. Les informations personnelles identifiables (PII), les informations de santé protégées (PHI), les identifiants, le code source, les données financières, la propriété intellectuelle et les documents confidentiels ne deviennent pas moins sensibles simplement parce que personne ne les utilise activement.
- L'IA peut réactiver les données dormantes. Les copilotes, RAG, la recherche d'entreprise, les bases de données vectorielles, les modèles et les agents peuvent rendre à nouveau consultables et opérationnelles les informations oubliées.
- La phase de découverte doit mener à une décision. Les organisations doivent déterminer si les données dormantes méritent protection, propriété, classification, conservation, utilisation approuvée, minimisation ou suppression.
- BigID fait le lien entre la découverte et l'action. BigID aide les organisations à identifier les données dormantes et inutiles, à classifier leur contenu, à comprendre les accès et les risques, à appliquer une politique de cycle de vie, à préparer des données plus sûres pour l'IA et à coordonner les mesures correctives.
Qu'est-ce que les Dark Data ?
Les données dormantes sont des informations qu'une organisation collecte, traite ou stocke mais qu'elle n'utilise pas activement, ne comprend pas adéquatement ou ne gouverne pas de manière cohérente.
IBM décrit de la même manière les données dormantes comme des informations que les organisations accumulent mais qu'elles n'utilisent généralement pas à des fins d'analyse ou de prise de décision.
Ce terme peut décrire des données que les équipes :
- Oublié son existence
- N'utilise plus
- Difficile à trouver
- Ne comprennent pas
- Impossible de se connecter à un propriétaire
- Impossible de l'associer à un objectif commercial actuel
- Non classé
- N'ont pas été placés sous la politique de cycle de vie
- Copie effectuée dans des environnements non gérés
- Conserver sans savoir pourquoi
Les données dormantes peuvent exister sous forme structurée, semi-structurée et non structurée.
Exemples :
- Anciennes bases de données
- Stockage cloud abandonné
- Tableurs
- Documents
- Contenu de chat et de collaboration
- Fichiers journaux
- Télémétrie d'application
- Archives
- Sauvegardes et instantanés
- Images, audio et vidéo
- ensembles de données de recherche
- Données du développeur
- Exportations et extraits
- ensembles de données d'entraînement pour l'IA
- Données vectorielles et de récupération
Le format ne rend pas les données illisibles.
La perte de visibilité, de finalité, d'usage, de propriété ou de gouvernance, oui.
Retrouvez les données que vous aviez oubliées
Transformer des données inconnues en une décision éclairée
Découvrez les données obscures, sensibles, obsolètes, dupliquées, fantômes et inutiles, comprenez leurs risques et leur valeur, puis décidez ce qu'il faut gouverner, protéger, conserver, utiliser ou supprimer.
Les données cachées constituent un état, et non un type de données.
Cette distinction change la façon dont les organisations doivent la gérer.
Une feuille de calcul peut contenir à l'origine de précieuses données commerciales.
Six mois plus tard, le projet prend fin.
Trois ans plus tard, le propriétaire part.
Le tableur reste sur un lecteur partagé.
L'entreprise cesse de l'utiliser.
Ses exigences en matière de conservation changent.
Ses autorisations restent valides.
L'organisation peut ne plus savoir que le fichier contient des informations personnelles identifiables de clients.
Le format de la feuille de calcul n'a pas changé.
Son contexte commercial et de gouvernance a évolué.
Le décalage des données obscures
Des données utiles peuvent devenir inaccessibles sans pour autant être déplacées.
L'objet de données peut rester inchangé tandis que son propriétaire, son objectif, son activité, sa politique et sa valeur commerciale disparaissent.
Connus + Utilisés
Propriétaire, objectif, utilisation et politique clairement définis
Objectif s'estompe
Baisse de l'utilisation et changements de propriété
Inconnu + Inutilisé
La valeur, le propriétaire, la sensibilité ou le but deviennent flous.
L'IA le découvre
Recherche, RAG ou agents le rendent à nouveau opérationnel
Gouverner ou réduire
Conserver, protéger, utiliser, archiver, minimiser ou supprimer
Les données dormantes peuvent être réactivées. L'IA rend cette transition plus rapide et plus facile que la recherche traditionnelle.
Quels sont des exemples de données cachées ?
Les données non structurées peuvent apparaître presque partout.
Fichiers commerciaux inutilisés
Les anciennes présentations, documents, feuilles de calcul, PDF, contrats, fichiers de projet et exportations peuvent persister longtemps après que les équipes aient cessé de les utiliser.
Journaux et données générées par machine
Les applications, l'infrastructure, les outils de sécurité, les appareils, les API et les systèmes automatisés génèrent en continu des journaux et des données de télémétrie.
Les organisations peuvent conserver d'importants volumes de données sans les analyser ni les gérer activement.
Données historiques sur les clients et les employés
Les anciens dossiers clients, les candidatures d'emploi, les dossiers des employés, les demandes d'assistance, l'historique des transactions et les informations de compte peuvent être conservés même après que leur utilité opérationnelle initiale ait diminué.
Sauvegardes et instantanés
Les environnements de sauvegarde permettent de conserver des copies oubliées d'informations sensibles longtemps après que les équipes aient nettoyé les référentiels principaux.
Données de développement et de test
Les développeurs peuvent copier les informations de production dans des environnements de développement, de test, de préproduction, de bac à sable ou de dépannage.
Ces copies peuvent survivre au projet et leur propriété peut devenir incertaine.
Données de collaboration
Les e-mails, les messageries instantanées, les lecteurs partagés, les plateformes de collaboration, les comptes rendus de réunion, les pièces jointes et les exportations d'espace de travail peuvent contenir une grande quantité d'informations que les équipes consultent rarement.
Données acquises et migrées
Les fusions, acquisitions, migrations et mises hors service d'applications peuvent laisser des ensembles de données dont personne ne comprend pleinement la finalité commerciale, le propriétaire ou les règles de conservation.
IA et données analytiques
Les ensembles de données d'entraînement, les fichiers intermédiaires, les plongements lexicaux, les ensembles de données d'évaluation, les sorties générées, les historiques d'invites, le contenu vectoriel, les extraits analytiques et les ensembles de données dérivés peuvent également devenir obscurs lorsque les équipes perdent de vue l'objectif ou le cycle de vie.
Pourquoi les données dormantes s'accumulent-elles ?
Les organisations créent des données dormantes par le biais de leurs activités commerciales normales.
Le problème s'aggrave lorsque la création va plus vite que la gouvernance.
Les causes courantes comprennent :
- Stockage économique et flexible
- “pratiques ” à conserver au cas où »
- rétention faible ou incohérente
- Migrations d'applications
- Fusions et acquisitions
- roulement du personnel
- Achèvement du projet
- Fichiers et exportations en double
- Applications SaaS non gérées
- Sauvegardes et instantanés
- exemplaires de développement
- Inventaires incomplets
- Propriété incertaine
- Programmes de confidentialité, de sécurité et de gouvernance déconnectés
L'organisation n'a pas besoin d'un échec retentissant pour créer des données obscures.
Les données obscures proviennent souvent de milliers de décisions ordinaires que personne ne remet en question.
Données obscures vs. Données fantômes vs. Données ROT
Ces termes se recoupent, mais ils décrivent des problèmes différents.
| Catégorie | Problème fondamental | Exemple | Action probable |
|---|---|---|---|
| Dark Data | L'organisation n'utilise pas activement les données, ne les comprend pas pleinement et ne les gère pas de manière cohérente. | Un vieux dépôt qui n'appartient à personne et que personne ne consulte. | Découvrir, classer, attribuer une finalité, puis décider. |
| Données fantômes | Les données existent en dehors de toute visibilité en matière de gouvernance et de sécurité approuvée ou attendue. | Un employé copie des données clients dans une application SaaS non gérée. | Identifier la source, le propriétaire, l'exposition, la politique et l'emplacement approuvé. |
| Données ROT | Les données sont devenues redondantes, obsolètes ou insignifiantes. | Sept exemplaires obsolètes du même rapport de projet. | Examiner, réduire, conserver si nécessaire ou supprimer. |
| Données périmées | Les données n'ont pas changé ni fait l'objet d'une utilisation significative pendant une période définie. | Un fichier auquel personne n'a accédé depuis quatre ans. | Objectif, fraîcheur, conservation et valeur de l'évaluation. |
| Données orphelines | Les données n'ont pas de responsable clairement identifié. | Il reste un effort collectif à fournir après le départ de toute l'équipe. | Attribuer la propriété ou entamer un examen du cycle de vie. |
Un ensemble de données peut correspondre à plusieurs catégories.
Un dossier de projet non géré peut être à la fois obscur, obsolète, orphelin et rempli de données ROT.
Les étiquettes permettent de décrire l'état des données. La décision en matière de sécurité doit tenir compte de la sensibilité, de la valeur, de l'accès, de l'activité, de la politique et de la finalité des données.
Pour en savoir plus sur les informations non gérées, consultez Que sont les données fantômes ?
Les données non structurées sont-elles toujours néfastes ?
Non.
Il s'agit là d'une des plus grandes idées fausses concernant les données non structurées.
Certaines données obscures peuvent encore contenir :
- valeur légale
- valeur historique
- Valeur de la recherche
- Valeur de l'analyse de la fraude
- Valeur de sécurité
- valeur analytique
- Valeur de l'IA
- Exigences réglementaires de conservation
L'erreur consiste à ne pas conserver toutes les données non structurées.
L'erreur est de le garder sans savoir pourquoi.
Les organisations doivent faire la distinction suivante :
Sombre mais précieux Des données qui méritent d'être possédées et gouvernées.
Depuis:
Sombre et inutile des données qui engendrent des coûts, des risques et un fardeau politique sans valeur ajoutée significative.
Pourquoi les données non structurées créent un risque de sécurité
Les équipes de sécurité ne peuvent pas protéger efficacement les informations sensibles lorsqu'elles ignorent leur existence.
Les données dormantes peuvent contenir :
- PII
- PHI
- Informations de paiement
- Informations d'identification
- Secrets
- Clés API
- Code source
- Informations financières
- propriété intellectuelle
- Dossiers clients
- Informations sur les employés
- documents juridiques
- Communications confidentielles
Le risque s'aggrave lorsque les données non structurées présentent également les caractéristiques suivantes :
- Exposition publique
- Partage externe
- Accès interne étendu
- Autorisations obsolètes
- Aucun propriétaire responsable
- Contrôles de rétention faibles
- Copies inconnues
- Accessibilité de l'IA
Des données inconnues ne signifient pas des données à faible risque.
Dans certains cas, c'est l'inverse qui se produit. Les informations sans propriétaire actif peuvent faire l'objet d'un examen moins approfondi, tandis que leur accessibilité et leur sensibilité restent inchangées.
Pourquoi les données non structurées créent des risques en matière de confidentialité et de conformité
Les obligations en matière de protection de la vie privée ne disparaissent pas lorsque les employés cessent d'utiliser activement les données.
Une organisation peut encore avoir besoin de comprendre :
- Quelles informations personnelles conserve-t-elle ?
- Pourquoi elle le conserve
- À quelles personnes les données se rapportent-elles ?
- Quelle juridiction s'applique
- Que le consentement ou d'autres fondements juridiques soient toujours applicables
- La durée de rétention reste appropriée
- La question de savoir si une obligation de conservation légale empêche la suppression
- L'organisation peut-elle répondre aux demandes de suppression ou d'accès ?
Les données personnelles non structurées posent un problème particulier car les équipes peuvent conserver des informations sans raison opérationnelle claire tout en étant soumises à des obligations de confidentialité à leur égard.
Cela rend les données non structurées étroitement liées à gestion du cycle de vie des données et minimisation des données.
Pourquoi les données non structurées engendrent des coûts
Le stockage coûte cher.
Mais le stockage ne représente qu'une partie des dépenses.
Les données non structurées peuvent également augmenter :
- volumes de sauvegarde
- Réplication
- consommation de stockage cloud
- Étendue de la migration
- Volume de découverte légale
- exigences en matière de numérisation de sécurité
- examen de la confidentialité
- Complexité de l'accès aux données
- Indexation et traitement par IA
La question importante n'est pas simplement :
“ Combien coûte le stockage de ces données ? ”
Les organisations devraient également se demander :
“ Combien coûte la sécurisation, la gouvernance, l’examen, la migration, la recherche, la préservation, le traitement et l’éventuelle divulgation de ces données ? ”
Comment l'IA change le problème des données obscures
L'IA crée le changement le plus important de ces dernières années dans la gestion des données non structurées.
Historiquement, les données non structurées pouvaient rester relativement inactives.
L'information existait, mais les employés ne la rechercheraient peut-être jamais, ne l'ouvriraient jamais, ni ne sauraient où elle était stockée.
L'IA d'entreprise change ce modèle.
L'IA peut rendre les données non structurées consultables
La recherche d'entreprise et les copilotes peuvent faciliter la localisation d'informations oubliées grâce à des questions en langage naturel.
Un document obscur peut devenir très facilement trouvable lorsque son contenu correspond à l'intention de l'utilisateur.
RAG peut transformer des données obscures en contexte actif
A Système RAG peut récupérer d'anciens documents car leur contenu semble sémantiquement pertinent.
Si l'information est devenue obsolète, inappropriée, sensible ou périmée, l'IA peut utiliser un contexte erroné même si la récupération fonctionne correctement.
Les données non structurées peuvent intégrer les pipelines d'IA
Les processus de formation, de réglage, d'évaluation, d'analyse et de préparation à l'IA peuvent consommer des ensembles de données que les équipes n'ont pas suffisamment classés ou gérés.
La disponibilité ne garantit pas l'adéquation à l'IA.
Les agents d'IA peuvent agir sur des informations oubliées
Un agent ne peut pas se contenter de récupérer des données non structurées.
Il peut l'utiliser pour :
- Faites une recommandation
- Mettre à jour une application
- Envoyer un message
- Générer un rapport
- Appeler une API
- Déclencher un flux de travail
L'IA peut transformer les données dormantes, d'un risque de stockage passif en un risque actif de décision et d'action.
Les données obscures à l'ère de l'IA
L'IA peut transformer des informations oubliées en contexte actif
Dark Data
Oublié, inutilisé, mal compris
Recherche IA
Le langage naturel permet de découvrir des informations cachées.
Contexte RAG
Les informations pertinentes entrent dans le contexte de l'IA
Utilisation de l'IA
Les modèles ou copilotes traitent l'information
Action de l'agent
L'IA utilise les données pour influencer ou exécuter des tâches
Un ensemble de données oublié peut redevenir opérationnel sans qu'une personne ne le rouvre intentionnellement.
L'IA rend-elle les données non structurées précieuses ?
Parfois.
Mais les organisations doivent se garder de croire que plus de données créent automatiquement une meilleure IA.
Les données dormantes peuvent contenir des informations utiles concernant l'histoire, les clients, les opérations, la sécurité ou la recherche.
Il peut également contenir :
- Informations obsolètes
- Enregistrements en double
- Informations incorrectes
- Données personnelles expirées
- Données restreintes
- Informations confidentielles
- Anciennes politiques
- Informations produit obsolètes
- Provenance inconnue
- Contenu excessivement accessible
La bonne question n'est pas :
“ L’IA peut-elle utiliser ces données ? ”
C'est:
“ Cette IA devrait-elle utiliser ces données à cette fin ? ”
Cela nécessite de contextualiser la sensibilité, la qualité, la provenance, la propriété, l'accès, la politique, la fraîcheur et l'usage prévu.
Pour un cadre plus large, voir Les données prêtes pour l'IA commencent par la décision commerciale, et non par le modèle..
La décision concernant les données non structurées : les conserver, les gérer, les utiliser ou les supprimer ?
La découverte de données dormantes ne répond pas à la question de savoir quoi en faire.
La découverte d'éléments de preuve devrait déclencher une décision.
La décision concernant les données obscures
La valeur et l'obligation devraient déterminer la suite des événements.
Utiliser + Gouverner
Ces données ont une valeur légitime. Il convient d'en attribuer la propriété, de les classer, d'en sécuriser l'accès et de les soumettre à une politique de confidentialité.
Conserver + Protéger
L'entreprise peut ne pas l'utiliser activement, mais des exigences en matière de conservation, de litiges, de réglementation ou de contrats justifient sa conservation.
Révision et attribution
Déterminez le propriétaire, la sensibilité, la finalité, l'accès, les exigences du cycle de vie et la pertinence de l'IA avant d'agir.
Réduire + Supprimer
Lorsqu'il ne subsiste plus aucune finalité commerciale, juridique, réglementaire ou opérationnelle, réduisez les données inutiles grâce à une action contrôlée tout au long de leur cycle de vie.
Comment trouver des données cachées
La gestion des données non structurées commence par leur découverte.
Les organisations devraient envisager des solutions allant au-delà des bases de données principales et du stockage cloud.
Une approche complète devrait inclure les éléments suivants :
- Environnements cloud
- Applications SaaS
- Systèmes sur site
- Environnements hybrides
- Bases de données structurées
- Systèmes de fichiers
- Plateformes de collaboration
- lacs de données et entrepôts de données
- Systèmes de développement
- Sauvegardes
- Environnements connectés à l'IA
Découverte et classification des données aider les équipes à déterminer quelles informations existent et ce qu'elles contiennent.
Mais la découverte de données non structurées ne représente que la première étape.
Les équipes devraient enrichir la découverte avec :
- Sensibilité
- Propriétaire
- Objectif commercial
- Âge
- Activité
- Autorisations
- Règlement
- exigences de rétention
- Similitude et duplication
- Utilisation de l'IA
La découverte vous indique que les données existent. Le contexte vous indique comment les exploiter.
Comment gérer les données dormantes
1. Découvrez-le continuellement
Maintenir une visibilité sur l'ensemble des environnements où l'organisation crée, copie, stocke et traite les données.
Les inventaires ponctuels deviennent obsolètes aussi vite que les équipes créent de nouveaux systèmes et de nouvelles copies.
2. Classer le contenu
Déterminer si les données non structurées contiennent des informations sensibles, réglementées, confidentielles, exclusives, financières, de santé, d'identification, personnelles ou essentielles à l'activité de l'entreprise.
3. Identifier le propriétaire
Dans la mesure du possible, associez les données dormantes à un responsable métier ou technique.
Les données sans propriétaire restent souvent en suspens car personne n'a l'autorité ou la responsabilité de prendre une décision concernant leur cycle de vie.
4. Comprendre l'accès et l'exposition
Déterminez quels utilisateurs, groupes, applications, comptes de service, identités de machines et systèmes d'IA peuvent accéder aux données non structurées.
Privilégier un accès large lorsque les informations sous-jacentes sont plus sensibles.
5. Activité de révision
L'activité peut aider à distinguer les données véritablement inactives des informations que les applications, les utilisateurs ou les systèmes d'IA continuent de consommer.
Surveillance de l'activité des données peut ajouter un contexte d'utilisation aux décisions relatives aux données sensibles.
6. Appliquer les mesures de conservation et de mise sous séquestre.
Ne supprimez pas des données simplement parce que personne ne les utilise.
Déterminer si des exigences légales, réglementaires, contractuelles, d'enquête ou commerciales nécessitent une conservation continue.
Conservation des données Il faudrait établir un lien entre la politique et les données réelles qu'elle régit.
7. Identifier les données ROT et les données dupliquées
Les données dormantes se recoupent souvent avec des informations obsolètes, dupliquées, redondantes ou triviales.
L'identification de ces conditions aide les équipes à prioriser les données inutiles à examiner.
8. Déterminer la pertinence de l'IA
Avant de connecter des données dormantes à l'entraînement, au RAG, à la recherche d'entreprise, aux copilotes ou aux agents, déterminez si les informations restent appropriées pour cet objectif spécifique d'IA.
9. Réduisez au minimum ce dont l'entreprise n'a plus besoin.
Ne conservez pas de données inutiles simplement parce que de l'espace de stockage reste disponible.
Minimisation des données peut réduire la surface d'attaque, l'exposition des données personnelles, les risques liés à l'IA et les coûts de stockage.
10. Supprimer de manière justifiée
Lorsque les données n'ont plus de raison légitime d'être conservées, les organisations doivent appliquer une suppression contrôlée avec une politique, une approbation, des vérifications de conservation, une validation et des preuves.
11. Réévaluer en continu
Les données actives d'aujourd'hui peuvent devenir les données dormantes de demain.
La gestion du cycle de vie doit examiner en permanence les changements d'utilisation, de propriété, d'âge, de politique, de valeur, de disponibilité de l'IA et de risque.
Conservez moins de données. Réduisez davantage les risques.
Trouvez les données obscures qui ne méritent plus leur place
Identifiez les données obsolètes, périmées, dupliquées, redondantes, insignifiantes, sensibles et surconservées, puis reliez ces constatations aux décisions de conservation, de minimisation, de suppression et de préparation à l'IA.
Données dormantes et gestion du cycle de vie des données
Les données dormantes signalent souvent une défaillance du cycle de vie.
L'organisation a créé ou collecté des informations dans un but précis.
Puis l'objectif a changé, mais les données sont restées.
Un adulte gestion du cycle de vie des données Le programme devrait demander en permanence :
- Pourquoi ces données existent-elles ?
- À qui appartient-il ?
- Est-ce que quelqu'un l'utilise encore ?
- Que contient-il ?
- Quelle politique s'applique ?
- Devons-nous le conserver ?
- Une mesure de conservation légale s'applique-t-elle ?
- L'IA devrait-elle l'utiliser ?
- Peut-on le minimiser ?
- Devrions-nous le supprimer ?
L'objectif n'est pas d'éliminer immédiatement toutes les données non structurées, mais de lever l'incertitude quant aux raisons de leur persistance.
Données obscures et DSPM
Les données obscures créent également un Gestion de la sécurité des données problème.
Une équipe de sécurité ne peut pas évaluer avec précision l'exposition des données sensibles si des référentiels inconnus ou oubliés restent hors de sa vue.
Les modèles DSPM modernes devraient aider les équipes à relier les données dormantes à :
- Sensibilité
- Exposition
- Identité
- Accéder
- Activité
- Possession
- Utilisation de l'IA
- Contexte commercial
- Remédiation
Le risque ne provient pas simplement du fait que les données sont obscures.
Le risque provient du contenu des données et des conditions qui les entourent.
Ce que les responsables de la sécurité et des données ignorent souvent à propos des données dormantes
“ Inutilisé signifie inoffensif ”
Les données inutilisées peuvent néanmoins rester sensibles, surexposées, accessibles, réglementées et récupérables par l'IA.
“ Nous pouvons tout supprimer ”
Certaines données non structurées ont une valeur légitime d'ordre commercial, historique, contractuel, réglementaire ou juridique.
Les équipes ont besoin de contexte avant la suppression.
“ Les données obscures ne vivent que dans les anciens systèmes ”
Les nouveaux environnements cloud et SaaS peuvent générer rapidement des données dormantes via les copies, les exportations, les journaux, la collaboration, l'automatisation et les projets abandonnés.
“ Si l’IA peut le trouver, nous devrions l’utiliser. ”
La possibilité de trouver des informations ne garantit ni la qualité, ni l'autorisation, ni la pertinence, ni la fraîcheur, ni l'adéquation aux politiques.
L'IA peut faciliter la consommation de données inappropriées.
“ Un inventaire des données résout le problème ”
Un inventaire permet d'établir une visibilité.
Il ne détermine pas si les équipes doivent conserver, sécuriser, minimiser, supprimer ou utiliser les données.
“ Le coût du stockage est le principal risque. ”
Les données dormantes engendrent également des risques liés à la sécurité, la confidentialité, l'accès, les aspects juridiques, la migration, les opérations et l'IA.
Comment mesurer le risque lié aux données non structurées
Les organisations devraient éviter de mesurer leur succès uniquement par le nombre total de téraoctets découverts.
Des mesures plus utiles peuvent inclure :
- Volume de données obscures découvertes
- Données cachées contenant des informations sensibles
- Données non structurées exposées publiquement ou de manière externe
- Données obscures avec un accès excessif
- Données obscures sans propriétaire
- Les données non structurées au-delà des exigences de conservation
- Données sombres se chevauchant avec les données ROT
- Données obscures accessibles à l'IA
- Stockage réduit par minimisation
- Les données non structurées se voient attribuer un propriétaire et une finalité.
- Les données dormantes sont désormais soumises à une politique de conservation.
- Données occultes supprimées avec preuves
L’objectif n’est pas de découvrir indéfiniment davantage de données non structurées, mais de réduire la quantité de données dont la valeur, la visibilité, la finalité et le cycle de vie restent inconnus.
Liste de contrôle de préparation aux données non structurées
Préparation aux données sombres
Votre organisation peut-elle répondre à ces questions ?
✓ Où se trouvent les données inconnues, inutilisées, obsolètes ou oubliées ?
✓ Quelles informations sensibles ou réglementées contient-il ?
✓ À qui appartient-il ?
✓ Pourquoi l'organisation le conserve-t-elle encore ?
✓ Quels utilisateurs, applications, comptes de service, identités de machines ou systèmes d'IA peuvent y accéder ?
✓ Quelles données non structurées bénéficient d'un accès public, externe ou excessif ?
✓ Est-ce que quelqu'un ou quelque chose l'utilise encore activement ?
✓ Quelle exigence de conservation s'applique ?
✓ Une obligation légale de conservation empêche-t-elle la suppression ?
✓ Quelles données dormantes sont également obsolètes, dupliquées, redondantes, périmées ou triviales ?
✓ Est-ce que RAG, la recherche d'entreprise, les copilotes ou les agents peuvent le récupérer ?
✓ Les données sont-elles appropriées pour une utilisation avec l'IA ?
✓ Quelles données méritent une nouvelle utilisation commerciale ?
✓ Quelles données l'organisation devrait-elle minimiser ou supprimer ?
✓ Les équipes peuvent-elles prouver les actions qu'elles ont entreprises tout au long du cycle de vie ?
Comment BigID aide à trouver et à gérer les données dormantes
BigID aborde les données obscures en partant des données elles-mêmes.
La découverte crée le point de départ.
Mais savoir que des données oubliées existent n'indique pas aux équipes ce qu'elles doivent en faire.
Les organisations doivent également comprendre Ce que contiennent les données, à qui elles appartiennent, qui et quoi peut y accéder, si quelqu'un les utilise encore, quelles politiques s'appliquent, si l'IA devrait les exploiter et si l'organisation devrait les conserver ou les supprimer.
BigID aide les organisations :
- Découvrez des données obscures et inconnues : Trouvez des informations structurées, semi-structurées et non structurées dans les environnements cloud, SaaS, hybrides, sur site et connectés à l'IA pris en charge.
- Classer le contenu des données non structurées : Identifier les informations personnelles, réglementées, confidentielles, exclusives, d'identification, financières, de santé et essentielles à l'activité afin que les équipes puissent prioriser les actions en fonction du contenu réel.
- Prioriser l'exposition aux données non structurées : Associez la sensibilité aux notions d'accès, d'exposition, de propriété, d'activité, de localisation et de contexte commercial afin d'identifier les risques de sécurité significatifs.
- Comprendre qui et quoi peut y accéder : Associez les données sensibles aux utilisateurs, aux groupes, aux applications, aux comptes de service, aux identités des machines et aux systèmes d'IA.
- Ajouter le contexte de l'activité : Déterminer si des données sensibles restent inactives ou si des identités continuent d'y accéder, de les partager, de les déplacer, de les modifier, de les télécharger ou de les supprimer.
- Réduire les données inutiles : Identifier les données obsolètes, périmées, dupliquées, similaires, redondantes, inutiles, triviales et conservées en excès afin que les équipes puissent prioriser le nettoyage en fonction des politiques et des risques.
- Gouverner le cycle de vie : Reliez la découverte et la classification à la conservation, à la mise sous séquestre légale, à la minimisation, à la suppression, à la remédiation et aux preuves tout au long de leur cycle de vie.
- Appliquer la rétention : Reliez les exigences de conservation aux données réelles de l'entreprise et identifiez les informations que les équipes doivent conserver, examiner ou supprimer.
- Préparer des données plus sûres pour l'IA : Identifiez les informations sensibles, obsolètes, dupliquées, confidentielles ou inutiles avant qu'elles ne soient intégrées aux processus de formation, aux systèmes RAG, aux invites, aux copilotes, aux modèles ou aux flux de travail des agents.
- Remise en état du lecteur : Désigner les propriétaires, limiter l'accès, appliquer la politique de confidentialité, imposer la conservation des données, supprimer les données inutiles et coordonner les mesures correctives lorsque cela est possible.
BigID transforme la question des données obscures en un chemin de décision :
Découvrir → Comprendre → Contextualiser → Décider → Agir → Prouver
C'est plus utile que de simplement calculer la quantité de données non structurées existantes.
L’objectif est de déterminer quelles données dormantes méritent encore leur place au sein de l’entreprise, quelles données nécessitent une gouvernance plus stricte, quelles données l’IA devrait utiliser et quelles données l’organisation peut cesser de conserver.
Connecter les points entre les données et l'IA
Transformer les données obscures en décision
Découvrez comment BigID détecte les données obscures et sensibles, les relie à la propriété, à l'accès, à l'activité, au cycle de vie, à l'utilisation de l'IA, aux politiques et aux risques, puis aide les équipes à gouverner ce qui compte et à réduire ce qui ne compte pas.
FAQ sur les données cachées
Que sont les données non structurées ?
Les données dormantes sont des informations qu'une organisation collecte, stocke ou conserve sans les utiliser activement, les comprendre pleinement ou les gérer de manière cohérente. Elles peuvent inclure des fichiers, des bases de données, des journaux, des sauvegardes, des messages, des données analytiques, des ensembles de données d'IA et d'autres informations structurées ou non structurées.
Pourquoi parle-t-on de données obscures ?
Ce terme désigne les données qui ne font pas l'objet d'une utilisation, d'une analyse, d'une visibilité ou d'une gouvernance courantes au sein de l'entreprise. Ces données existent bel et bien, mais l'organisation peut ignorer leur finalité, leur contenu, leur propriétaire, leur valeur et les risques qu'elles représentent.
Quels sont des exemples de données cachées ?
Il peut s'agir, par exemple, de fichiers abandonnés, de journaux d'applications, d'anciens enregistrements clients, de bases de données inutilisées, de sauvegardes, de courriels archivés, de contenus de collaboration oubliés, de copies de développement, d'exportations historiques, de données acquises, d'ensembles de données de recherche inutilisés et d'ensembles de données liés à l'IA qui n'ont plus d'objectif clair ni de propriétaire.
Les données obscures sont-elles la même chose que les données fantômes ?
Non. Les données dormantes désignent généralement les informations que les organisations n'utilisent pas activement ou qu'elles ne comprennent pas pleinement. Les données fantômes désignent les informations qui échappent à la visibilité des instances de gouvernance et de sécurité approuvées ou attendues. Un même ensemble de données peut correspondre aux deux catégories.
Quelle est la différence entre les données sombres et les données ROT ?
Les données ROT sont des informations redondantes, obsolètes ou triviales. Les données obscures désignent les informations dont l'utilisation, la valeur, la propriété ou la gouvernance restent floues. Certaines données obscures sont précieuses, tandis que d'autres deviennent ROT et peuvent être minimisées ou supprimées.
Les données dormantes sont-elles toujours inutiles ?
Non. Les données dormantes peuvent présenter une valeur légitime en matière commerciale, juridique, historique, de sécurité, de recherche, d'analyse ou d'IA. Les organisations doivent évaluer leur finalité, leur sensibilité, leur qualité, leur propriété, leur conformité aux politiques en vigueur et les besoins de l'entreprise avant de décider de les conserver ou de les supprimer.
Pourquoi les données non structurées représentent-elles un risque pour la sécurité ?
Les données dormantes peuvent contenir des informations sensibles tout en restant mal comprises, largement accessibles, partagées avec des tiers, sans propriétaire ni contrôle de sécurité actif. Ces données sensibles inconnues peuvent accroître le risque de violation de données et compliquer la priorisation des risques.
Comment les données non structurées créent-elles des risques pour la vie privée ?
Les données dormantes peuvent contenir des informations personnelles dont l'organisation n'a plus besoin, mais qu'elle conserve néanmoins. Cela peut soulever des problèmes liés à la finalité, la conservation, l'accès, les droits sur les données, la minimisation, la suppression et d'autres exigences en matière de protection de la vie privée.
Quel est l'impact de l'IA sur les données non structurées ?
L'IA peut rendre les données dormantes à nouveau consultables et exploitables. La recherche d'entreprise, les systèmes RAG, les copilotes, les bases de données vectorielles, les pipelines de formation et les agents peuvent extraire ou traiter des informations oubliées auxquelles les employés accédaient rarement avant l'avènement de l'IA.
Les données non structurées devraient-elles être utilisées pour l'IA ?
Pas automatiquement. Les organisations doivent évaluer si les données non structurées sont exactes, à jour, pertinentes, accessibles de manière appropriée, suffisamment encadrées et autorisées pour l'utilisation prévue de l'IA avant de les connecter à l'entraînement, aux systèmes d'analyse, de génération de bruit et de contrôle (RAG), aux copilotes, aux modèles ou aux agents.
Comment les organisations peuvent-elles trouver des données dormantes ?
Les organisations peuvent exploiter la découverte et la classification des données dans les environnements cloud, SaaS, hybrides, sur site, de fichiers, de bases de données, de collaboration, de développement et connectés à l'IA. Elles doivent ensuite ajouter un contexte tel que la sensibilité, la propriété, l'ancienneté, l'accès, l'activité, la durée de conservation et la finalité métier.
Comment les organisations doivent-elles gérer les données dormantes ?
Les organisations doivent découvrir et classer les données dormantes, en attribuer la propriété, comprendre l'accès et l'activité, appliquer les exigences de conservation et de mise sous séquestre légale, évaluer la valeur commerciale et d'IA, identifier les données dupliquées et les données ROT, minimiser les informations inutiles et supprimer les données de manière justifiée lorsqu'il n'y a plus de besoin légitime.
Comment BigID aide-t-il à gérer les données dormantes ?
BigID aide les organisations à découvrir et à classer les données obscures et inconnues, à identifier les informations sensibles, à relier les données à la propriété, aux identités, à l'accès, à l'activité, à l'exposition, à la politique, à la conservation et à l'utilisation de l'IA, à identifier les données ROT et inutiles et à coordonner les actions de cycle de vie et de remédiation.

