Skip to content

Que sont les données fantômes ? Risques, exemples et comment les détecter

Que sont les données fantômes ?

Les données fantômes sont des données organisationnelles qui existent en dehors des contrôles de visibilité, de gestion ou de sécurité censés les protéger.

Cela peut inclure des données sensibles copiées dans des environnements de développement, des sauvegardes cloud oubliées, des exportations SaaS non gérées, d'anciens instantanés de bases de données, des fichiers locaux, un stockage abandonné ou des ensembles de données créés pour l'analyse et l'IA.

Le problème ne réside pas seulement dans l'emplacement des données. Il réside dans le fait que les équipes de sécurité ignorent peut-être leur existence, leur contenu, qui peut y accéder, ou encore si elles servent toujours un objectif commercial légitime.

Par exemple, un développeur peut copier une base de données clients de production dans un environnement de test. Le projet se termine, mais la copie demeure. Des mois plus tard, cette base de données oubliée contient toujours des informations personnelles identifiables (IPI) de clients, mais n'est plus soumise aux mêmes contrôles d'accès, à la même surveillance ni au même système de propriété que la base de données de production.

Ce sont des données fantômes.

Données fantômes : principaux enseignements

- Les données parallèles existent en dehors de toute gouvernance attendue. Les équipes de sécurité ignorent peut-être où il se trouve, ce qu'il contient et qui peut y accéder.

- L'expansion du cloud et du SaaS crée davantage de copies. Les sauvegardes, les instantanés, les exportations, les environnements de développement et les ressources abandonnées peuvent tous créer des données fantômes.

- L'IA ajoute une source supplémentaire de données cachées. Les ensembles de données d'entraînement, les référentiels RAG, les bases de données vectorielles, les invites, les sorties et les projets d'IA expérimentaux peuvent créer de nouvelles copies et utilisations des données d'entreprise.

- Le risque dépend des données. Les données sensibles, réglementées, confidentielles ou essentielles à l'activité, oubliées, présentent un risque plus important que les données ordinaires.

- DSPM aide les organisations à identifier et à réduire les risques liés aux données fantômes. La découverte, la classification, le contexte d'accès, la hiérarchisation des risques et la remédiation permettent de reprendre le contrôle des données cachées.

D’où proviennent les données fantômes ?

Les données fantômes ne résultent pas toujours d'un contournement délibéré du service informatique par les employés. Une grande partie se développe par le biais des processus métiers et techniques normaux.

Les sources courantes comprennent :

  • Sauvegardes et instantanés dans le cloud : Les copies persistent même après que les équipes ont cessé d'utiliser la charge de travail d'origine.
  • Environnements de développement et de test : Les données de production sont copiées dans les environnements inférieurs et y restent après la fin des tests.
  • Exportations SaaS : Les employés exportent des données clients, financières ou opérationnelles vers des tableurs et d'autres applications.
  • pipelines analytiques : Les équipes dupliquent les ensembles de données entre les entrepôts de données, les lacs de données, les notebooks et les plateformes d'analyse.
  • Stockage personnel ou non géré : Les employés enregistrent des informations professionnelles sur des appareils locaux ou des services cloud non autorisés.
  • Projets abandonnés : Les données subsistent après la fin de vie des applications, des ressources cloud ou des initiatives commerciales.
  • Développement de l'IA : Les équipes créent des ensembles de données d'entraînement, des magasins de vecteurs, des entrées de modèles, des référentiels RAG et des copies de données expérimentales sans appliquer de gouvernance établie.

Le point commun est la perte de visibilité ou de contrôle. L'organisation reste propriétaire des données ou responsable de celles-ci, mais ses processus habituels de sécurité et de gouvernance peuvent ne plus les couvrir.

Découvrez les données que les équipes de sécurité ne peuvent pas voir.

Découvrez les données sensibles, réglementées, critiques, cachées et non publiques dans les environnements cloud, SaaS, sur site, hybrides et d'IA.


Explorez DSPM

Pourquoi les données fantômes constituent-elles un risque pour la sécurité ?

Des données inconnues engendrent une exposition inconnue.

Si les équipes de sécurité ignorent l'existence d'un ensemble de données, elles ne peuvent pas déterminer avec certitude s'il dispose de contrôles d'accès, d'un chiffrement, de politiques de conservation, d'une surveillance ou d'une propriété appropriés.

Les données fantômes deviennent particulièrement importantes lorsqu'elles contiennent :

  • Informations personnelles identifiables (PII)
  • Informations de santé protégées (PHI)
  • Dossiers financiers
  • Informations client
  • Identifiants et secrets
  • Code source
  • propriété intellectuelle
  • Informations commerciales confidentielles
  • Autres données réglementées ou essentielles à l'activité

Une base de données de test oubliée, contenant des informations synthétiques, présente un certain niveau de risque. La même base de données, contenant des millions d'enregistrements clients réels, en présente un autre.

C’est pourquoi les organisations ont besoin de plus qu’un simple inventaire de leurs ressources de stockage. Elles doivent comprendre Quelles données elles contiennent et comment ces données sont exposées ?.

Exemples concrets de données fantômes

Une base de données de développement oubliée

Une équipe d'ingénieurs copie les données clients de production dans une base de données de développement afin de tester une nouvelle application.

L'application est lancée, mais personne ne supprime la base de données de test. Ses contrôles d'accès restent plus étendus que ceux de la production, et le responsable initial du projet finit par quitter l'entreprise.

L'organisation détient désormais une copie oubliée de données clients sensibles, dont la propriété est mal définie et l'accès potentiellement inutile.

Une exportation SaaS non gérée

Un employé des opérations de vente exporte des milliers de fiches clients d'un CRM approuvé afin de les analyser dans une autre application.

Le CRM reste sous contrôle. La copie exportée, elle, peut ne pas l'être.

Si le fichier reste indéfiniment dans un stockage cloud personnel ou une application SaaS non gérée, les équipes de sécurité peuvent perdre la visibilité sur qui y a accès et combien de temps les données y restent.

Un instantané de base de données que personne ne supprime

Un administrateur cloud crée un instantané avant une migration. La migration réussit, mais l'instantané persiste longtemps après que le besoin initial ait disparu.

Si cet instantané contient des données sensibles, l'organisation dispose désormais d'une autre copie à sécuriser, à gérer et, à terme, à éliminer.

Un ensemble de données d'IA créé pour l'expérimentation

Une équipe de data scientists copie des documents internes dans un nouveau référentiel afin de tester une application d'IA générative.

L'expérience se termine, mais l'ensemble de données reste stocké dans le cloud ou dans une base de données vectorielle.

Même si le projet d'IA n'est jamais mis en production, les données sous-jacentes peuvent rester accessibles. L'IA ouvre donc la voie au développement de données fantômes.

Données fantômes contre informatique fantôme contre IA fantôme

Ces termes se recoupent, mais ils décrivent des problèmes différents.

Données fantômes contre informatique fantôme contre IA fantôme

La technologie peut être à l'origine du problème. Ce sont les données qui déterminent l'exposition.

Terme Ce que cela décrit Exemple
Données fantômes Données hors de la visibilité, de la gestion ou de la gouvernance attendues Une capture de base de données oubliée contenant des informations personnelles de clients
L'informatique fantôme Utilisation de technologies sans approbation ni supervision informatique appropriée Un employé stocke des fichiers de l'entreprise dans une application SaaS non autorisée.
IA de l'ombre Outils, modèles, agents, ensembles de données ou flux de travail d'IA fonctionnant en dehors de toute gouvernance établie Une équipe connecte des documents internes à un assistant IA non autorisé

Shadow IT et l'IA fantôme Les deux peuvent créer des données fantômes. Mais des données fantômes peuvent également se développer au sein d'une infrastructure approuvée, via des copies oubliées, des sauvegardes, des exportations et des ressources abandonnées.

Comment les données fantômes affectent la conformité

Les obligations réglementaires et de protection de la vie privée ne disparaissent pas simplement parce qu'une organisation a oublié où sont passées ses données.

Les données fantômes peuvent rendre plus difficile la détermination de l'emplacement des informations réglementées, l'application des exigences de conservation, la réponse aux demandes de confidentialité, l'application des contrôles d'accès, l'enquête sur les incidents et la démonstration de la conformité.

Cela crée également un problème fondamental de responsabilité : les équipes ne peuvent pas protéger ou gérer de manière cohérente les données dont elles ignorent l'existence.

Comment trouver les données fantômes ?

La découverte de données fantômes nécessite d'aller au-delà des bases de données connues et des référentiels approuvés.

Une approche pratique devrait :

  1. Explorez les données en profondeur. Analyser les données structurées, semi-structurées et non structurées dans les environnements cloud, SaaS, sur site, hybrides, de développement et d'IA.
  2. Classifiez ce que vous trouvez. Déterminer quels actifs contiennent des informations sensibles, réglementées, confidentielles ou de grande valeur.
  3. Ajouter le contexte de propriété et d'accès. Identifier qui est propriétaire des données, qui peut y accéder et si cet accès reste nécessaire.
  4. Identifier l'exposition. Recherchez les accès publics, les autorisations excessives, les données obsolètes, les erreurs de configuration, les ressources abandonnées et autres conditions à risque.
  5. Prioriser par niveau de risque. Un entrepôt oublié contenant des informations hautement sensibles et largement accessible mérite plus d'attention qu'un dépôt inutilisé contenant des informations publiques.
  6. Remédier au problème sous-jacent. Supprimez les copies inutiles, limitez l'accès, imposez la conservation des données, corrigez les configurations ou déplacez les données vers des emplacements contrôlés.
  7. Surveiller en permanence. De nouvelles données parallèles se développent à mesure que les personnes, les applications, les services cloud et les systèmes d'IA créent et déplacent des informations.

Comment DSPM contribue à réduire les risques liés aux données fantômes

Gestion de la sécurité des données (DSPM) offre aux équipes de sécurité une méthode axée sur les données pour identifier et réduire les risques liés aux données fantômes.

Au lieu de se fier uniquement aux inventaires d'infrastructure, DSPM découvre les données dans tous les environnements d'entreprise et ajoute un contexte concernant la sensibilité, l'accès, la propriété, l'exposition et le risque.

Cela permet aux équipes de passer de :

“Nous avons trouvé une autre ressource de stockage.”

à :

“ Cette ressource oubliée contient des informations personnelles de clients, bénéficie d'un accès excessif, n'a pas de propriétaire clairement identifié et n'a aucune finalité commerciale actuelle. ”

La deuxième constatation offre à l'équipe de sécurité un élément exploitable.

Transformer les données cachées en risques exploitables

Associer les données sensibles aux notions d'accès, de propriété, d'exposition et de contexte commercial afin que les équipes sachent quelles données cachées traiter en priorité.


Explorer la réduction des risques liés aux données

Comment l'IA change le problème des données fantômes

L'IA rend les données fantômes plus importantes car les projets d'IA consomment et créent des copies supplémentaires des informations de l'entreprise.

Les équipes peuvent déplacer les données vers :

  • ensembles de données d'entraînement
  • Bases de données vectorielles
  • dépôts RAG
  • environnements de développement de l'IA
  • Journaux d'invites et de réponses
  • pipelines de modélisation
  • Stockage cloud expérimental

L'organisation peut approuver l'initiative en matière d'IA tout en perdant la visibilité sur certaines des copies de données qui la sous-tendent.

Il existe également un lien entre les données fantômes et l'IA fantôme. Les employés ou les développeurs qui utilisent des outils d'IA non approuvés peuvent introduire des informations d'entreprise dans des systèmes situés en dehors du cadre de gouvernance normal, créant ainsi un problème de gouvernance de l'IA et un problème de sécurité des données.

Les équipes de sécurité ont donc besoin d'une visibilité sur les deux là où résident les données sensibles et où l'IA les utilise.

Comment BigID aide à trouver et à réduire les données fantômes

BigID aide les organisations à découvrir les données sensibles, réglementées, critiques, cachées et non structurées dans les environnements cloud, SaaS, sur site, hybrides, de développement et d'IA.

Plutôt que de s'arrêter à la découverte, BigID relie les données à leur sensibilité, leur propriété, leur accès, leur activité, leur exposition et leur contexte commercial afin que les équipes puissent comprendre quelles données cachées créent un risque significatif.

Les organisations peuvent utiliser BigID pour :

  • Découvrir et classer les données fantômes : Trouvez des informations sensibles et à forte valeur ajoutée dans des sources de données structurées, non structurées et semi-structurées.
  • Comprendre l'exposition : Identifiez les données sensibles qui présentent un accès excessif, des configurations risquées, une propriété mal définie ou d'autres problèmes de sécurité.
  • Prioriser les risques : Les équipes de sécurité doivent concentrer leurs efforts sur les données non structurées qui présentent le plus grand risque d'exposition en fonction de leur sensibilité, de leur accès, de leur propriété et de leur impact sur l'activité.
  • Réduire les accès inutiles : Identifier les données surexposées et les autorisations qui dépassent les besoins légitimes de l'entreprise.
  • Remédier aux risques liés aux données : Agissez par le biais de flux de travail pour la suppression, la conservation, la réduction de l'accès, l'étiquetage et d'autres mesures correctives fondées sur des politiques.
  • Surveiller en continu : Identifier les changements à mesure que de nouvelles données, copies, utilisateurs, applications et systèmes d'IA enrichissent l'environnement de données.

Le résultat est bien plus qu'une simple cartographie de l'emplacement des données. Les équipes de sécurité disposent du contexte nécessaire pour déterminer Ce qui compte, pourquoi cela crée un risque et par quoi ils devraient s'attaquer en premier.

Découvrez les risques liés à vos données cachées

Découvrez comment BigID détecte les données cachées, identifie les expositions sensibles, hiérarchise les risques et aide les équipes à agir à l'échelle de l'entreprise.


Demander une démo BigID

FAQ sur les données fantômes

Que sont les données fantômes ?

Les données fantômes sont des données organisationnelles qui échappent aux contrôles de visibilité, de gestion et de sécurité habituels. On peut citer comme exemples les sauvegardes oubliées, les instantanés de bases de données, les exportations SaaS non gérées, les copies de développement, le stockage cloud abandonné et les ensembles de données d'IA.

Qu'est-ce qu'un exemple de données fantômes ?

Un exemple courant est celui d'une copie d'une base de données clients de production créée pour le développement ou les tests et qui subsiste après la fin du projet. Si personne ne suit ni ne contrôle cette copie, elle peut devenir une donnée fantôme.

Qu’est-ce qui provoque les données fantômes ?

Les données fantômes se développent à travers la prolifération du cloud et du SaaS, les sauvegardes, les instantanés, les environnements de développement, les exportations de données, les projets d'analyse, les applications non gérées, les ressources abandonnées et les initiatives d'IA qui créent des copies supplémentaires des données d'entreprise.

Quelle est la différence entre les données fantômes et l'informatique fantôme ?

L'informatique parallèle désigne les technologies utilisées sans supervision informatique adéquate. Les données parallèles désignent les données qui échappent à la visibilité et à la gouvernance attendues. L'informatique parallèle peut créer des données parallèles, mais ces dernières peuvent également exister au sein d'environnements technologiques approuvés.

Quelle est la différence entre les données d'ombre et les données sombres ?

Les données fantômes manquent de visibilité et de gouvernance. On parle généralement de données obscures pour désigner les informations qu'une organisation conserve mais n'utilise pas activement ni ne tire de valeur de ses données. Les données peuvent être à la fois obscures et fantômes lorsqu'elles sont inutilisées et échappent à un contrôle efficace.

Comment les données fantômes créent-elles des risques de sécurité ?

Les données fantômes peuvent contenir des informations sensibles sans contrôles d'accès, surveillance, conservation, propriété ni politiques de sécurité appropriés. Cela peut accroître le risque d'accès non autorisé, de divulgation des données, de non-conformité et de violations de données.

Comment DSPM aide-t-il à gérer les données fantômes ?

DSPM aide à découvrir et à classer les données fantômes, à les relier à l'accès et à la propriété, à identifier l'exposition, à prioriser les risques et à faciliter la remédiation dans les environnements cloud, SaaS, hybrides, sur site et d'IA.

Comment BigID aide-t-il à trouver les données fantômes ?

BigID détecte et classe les données au sein des environnements d'entreprise et associe les données sensibles à leur accès, leur propriété, leur activité, leur exposition et les risques associés. Grâce à ce contexte, les équipes peuvent identifier les données cachées à haut risque, prioriser les actions correctives et réduire l'exposition inutile.

Contenu

BigID Data Security Suite

Découvrez des données sensibles, critiques et réglementées n'importe où - dans le cloud ou sur site avec BigID.

Télécharger le résumé de la solution