Las organizaciones rara vez deciden crear datos ocultos.
Lo acumulan.
Un equipo exporta los registros de clientes de un proyecto.
Una aplicación crea registros que nadie revisa.
Una plataforma de colaboración conserva años de documentos abandonados.
Una migración deja atrás los datos antiguos.
Los empleados crean hojas de cálculo duplicadas.
Una copia de seguridad conserva la información mucho después de que la empresa deje de utilizar la fuente original.
Un equipo de desarrollo copia los datos de producción en un entorno de prueba.
Entonces entra en escena la IA.
Un copiloto empresarial indexa un repositorio antiguo. Un sistema RAG recupera un documento obsoleto. Un agente accede mediante una cuenta de servicio. Un proceso de entrenamiento descubre un conjunto de datos cuya existencia nadie recordaba.
La información que permaneció invisible desde el punto de vista operativo durante años puede, de repente, volverse localizable, recuperable y utilizable.
Eso cambia el problema de los datos ocultos.
Los datos oscuros ya no representan únicamente una pérdida de valor analítico o un almacenamiento innecesario.
Puede crear:
- Exposición desconocida de datos confidenciales
- Acceso excesivo
- Riesgo de privacidad y retención
- Mayor impacto de la violación
- Contexto de IA duplicado y contradictorio
- Costes innecesarios de almacenamiento y nube
- Acceso de la IA a datos que la empresa nunca tuvo previsto que la IA utilizara.
Los datos oscuros son información empresarial que una organización recopila, almacena o conserva, pero que no utiliza activamente, no comprende completamente ni gestiona de forma consistente.
El punto más importante es fácil de pasar por alto:
Los datos oscuros no son un tipo específico de datos. Son una condición en la que se encuentran los datos cuando desaparecen su visibilidad, uso, propiedad, propósito o gobernanza.
Datos oscuros: Conclusiones clave
- Los datos oscuros son un estado de gobernanza, no un tipo de archivo. Cualquier conjunto de datos, documento, registro, grabación, imagen, mensaje, copia de seguridad o activo de IA puede volverse inaccesible cuando la organización deja de comprenderlo o utilizarlo.
- Oscuro no significa automáticamente inútil. Algunos datos ocultos aún tienen valor comercial, legal, analítico, histórico o para la inteligencia artificial. Otros datos ocultos generan costos y riesgos sin una razón legítima para conservarlos.
- Los datos desconocidos aún pueden contener información confidencial. La información de identificación personal (PII), la información de salud protegida (PHI), las credenciales, el código fuente, los registros financieros, la propiedad intelectual y los documentos confidenciales no se vuelven menos sensibles porque nadie los utilice activamente.
- La IA puede reactivar datos ocultos. Los copilotos, RAG, la búsqueda empresarial, las bases de datos vectoriales, los modelos y los agentes pueden hacer que la información olvidada vuelva a ser localizable y operativa.
- El proceso de descubrimiento debe conducir a una decisión. Las organizaciones deben determinar si los datos ocultos merecen protección, propiedad, clasificación, retención, uso autorizado, minimización o eliminación.
- BigID conecta el descubrimiento con la acción. BigID ayuda a las organizaciones a encontrar datos ocultos e innecesarios, clasificar su contenido, comprender el acceso y el riesgo, aplicar políticas de ciclo de vida, preparar datos más seguros para la IA y coordinar la remediación.
¿Qué son los datos oscuros?
Los datos oscuros son información que una organización recopila, procesa o almacena, pero que no utiliza activamente, no comprende adecuadamente ni gestiona de forma coherente.
De manera similar, IBM describe los datos oscuros como información que las organizaciones acumulan pero que, por lo general, no utilizan para análisis o toma de decisiones.
El término puede describir datos que los equipos:
- Olvidé que existía
- Ya no se usa
- No se puede encontrar fácilmente
- No entiendo
- No se puede conectar con un propietario.
- No se puede vincular a un propósito comercial actual.
- No he clasificado
- No se han incluido en la política de ciclo de vida.
- Se han copiado en entornos no administrados.
- Retener sin saber por qué
Los datos oscuros pueden existir en formatos estructurados, semiestructurados y no estructurados.
Los ejemplos incluyen:
- Bases de datos antiguas
- Almacenamiento en la nube abandonado
- Hojas de cálculo
- Documentos
- Correo electrónico
- Contenido de chat y colaboración
- Archivos de registro
- Telemetría de aplicaciones
- Registros archivados
- Copias de seguridad e instantáneas
- Imágenes, audio y vídeo
- conjuntos de datos de investigación
- Datos del desarrollador
- Exportaciones y extractos
- Conjuntos de datos de entrenamiento de IA
- Datos vectoriales y de recuperación
El formato no hace que los datos sean oscuros.
La pérdida de visibilidad, propósito, uso, propiedad o gobernanza sí lo hace.
Encuentra los datos que olvidaste que tenías.
Convertir datos desconocidos en una decisión fundamentada.
Descubra datos oscuros, sensibles, obsoletos, duplicados, ocultos e innecesarios, comprenda su riesgo y valor, y luego decida qué gestionar, proteger, conservar, usar o eliminar.
Los datos oscuros son un estado, no un tipo de dato.
Esta distinción cambia la forma en que las organizaciones deben gestionarlo.
Una hoja de cálculo puede comenzar siendo una valiosa fuente de datos empresariales.
Seis meses después, el proyecto finaliza.
Tres años después, el propietario se marcha.
La hoja de cálculo permanece en una unidad compartida.
La empresa deja de usarlo.
Su requisito de retención cambia.
Sus permisos siguen vigentes.
Es posible que la organización ya no sepa que el archivo contiene información personal identificable de los clientes.
La hoja de cálculo no cambió de formato.
Su contexto empresarial y de gobernanza cambió.
El cambio de datos oscuros
Los datos útiles pueden volverse inaccesibles sin moverse de su sitio.
El objeto de datos puede permanecer inalterado mientras que su propietario, propósito, actividad, política y valor comercial desaparecen.
Conocido + Usado
Propietario, propósito, uso y política claros
El propósito se desvanece
Disminución del uso y cambios de propiedad
Desconocido + Sin usar
El valor, el propietario, la sensibilidad o el propósito se vuelven poco claros.
La IA lo encuentra
La búsqueda, RAG o los agentes lo vuelven a poner en funcionamiento.
Gobernar o reducir
Conservar, proteger, usar, archivar, minimizar o eliminar
Los datos ocultos pueden volver a estar disponibles. La IA hace que esa transición sea más rápida y sencilla que la búsqueda tradicional.
¿Cuáles son algunos ejemplos de datos oscuros?
Los datos ocultos pueden aparecer en casi cualquier lugar.
Archivos comerciales sin usar
Las presentaciones, documentos, hojas de cálculo, archivos PDF, contratos, archivos de proyecto y exportaciones antiguos pueden permanecer disponibles mucho después de que los equipos dejen de utilizarlos.
Registros y datos generados por máquinas
Las aplicaciones, la infraestructura, las herramientas de seguridad, los dispositivos, las API y los sistemas automatizados generan continuamente registros y telemetría.
Las organizaciones pueden retener grandes volúmenes de datos sin analizarlos ni gestionarlos activamente.
Datos históricos de clientes y empleados
Los registros antiguos de clientes, las solicitudes de empleo, los archivos de empleados, los casos de soporte, los historiales de transacciones y la información de las cuentas pueden conservarse incluso después de que desaparezca su necesidad operativa original.
Copias de seguridad e instantáneas
Los entornos de respaldo pueden conservar copias olvidadas de información confidencial mucho después de que los equipos limpien los repositorios principales.
Datos de desarrollo y prueba
Los desarrolladores pueden copiar información de producción en entornos de desarrollo, prueba, preproducción, sandbox o resolución de problemas.
Esas copias pueden sobrevivir al proyecto y perder la titularidad clara.
Datos de colaboración
El correo electrónico, el chat, las unidades compartidas, las plataformas de colaboración, las notas de las reuniones, los archivos adjuntos y las exportaciones del espacio de trabajo pueden contener grandes cantidades de información que los equipos rara vez revisan.
Datos adquiridos y migrados
Las fusiones, adquisiciones, migraciones y la retirada de aplicaciones pueden dejar conjuntos de datos cuyo propósito comercial, propietario o normas de retención nadie comprende del todo.
IA y datos analíticos
Los conjuntos de datos de entrenamiento, los archivos intermedios, las incrustaciones, los conjuntos de datos de evaluación, los resultados generados, los historiales de indicaciones, el contenido vectorial, los extractos analíticos y los conjuntos de datos derivados también pueden volverse inaccesibles cuando los equipos pierden de vista su propósito o ciclo de vida.
¿Por qué se acumulan los datos ocultos?
Las organizaciones generan datos ocultos a través de su actividad empresarial normal.
El problema se agrava cuando la creación avanza más rápido que la gobernanza.
Las causas comunes incluyen:
- Almacenamiento económico y flexible
- “Prácticas de ”guardarlo por si acaso”
- Retención débil o inconsistente
- Migraciones de aplicaciones
- Fusiones y adquisiciones
- Rotación de empleados
- Finalización del proyecto
- Archivos duplicados y exportaciones
- Aplicaciones SaaS no gestionadas
- Copias de seguridad e instantáneas
- Copias de desarrollo
- Inventarios incompletos
- Propiedad poco clara
- Programas de privacidad, seguridad y gobernanza desconectados
La organización no necesita un fracaso estrepitoso para generar datos ocultos.
Los datos ocultos suelen provenir de miles de decisiones cotidianas que nadie revisa.
Datos oscuros vs. Datos en la sombra vs. Datos ROT
Estos términos se solapan, pero describen problemas diferentes.
| Categoría | Problema central | Ejemplo | Acción probable |
|---|---|---|---|
| Datos oscuros | La organización no utiliza activamente los datos, no los comprende completamente ni los gestiona de forma coherente. | Un repositorio antiguo que nadie posee ni revisa. | Descubre, clasifica, asigna un propósito y luego decide. |
| Datos de sombra | Los datos existen fuera del alcance de la gobernanza y la visibilidad de seguridad aprobadas o previstas. | Un empleado copia datos de clientes en una aplicación SaaS no gestionada. | Identifique la fuente, el propietario, la exposición, la política y la ubicación aprobada. |
| Datos ROT | Los datos se han vuelto redundantes, obsoletos o triviales. | Siete copias desactualizadas del mismo informe del proyecto. | Revisar, minimizar, conservar cuando sea necesario o eliminar. |
| Datos obsoletos | Los datos no han cambiado ni han tenido un uso significativo durante un período definido. | Un archivo al que nadie ha accedido en cuatro años. | Analizar el propósito, la frescura, la retención y el valor. |
| Datos huérfanos | Los datos carecen de un propietario claro y responsable. | Una vez que todo el equipo se haya marchado, seguirá habiendo una actividad en equipo. | Asigne la propiedad o inicie la revisión del ciclo de vida. |
Un conjunto de datos puede pertenecer a más de una categoría.
Una carpeta de proyecto no administrada puede estar oscura, obsoleta, huérfana y llena de datos corruptos al mismo tiempo.
Las etiquetas ayudan a describir la situación. La decisión de seguridad debe depender de la sensibilidad, el valor, el acceso, la actividad, la política y el propósito de los datos.
Para obtener más información sobre la información no gestionada, consulte ¿Qué son los datos en la sombra?
¿Los datos oscuros siempre son malos?
No.
Esta es una de las mayores ideas erróneas en torno a los datos oscuros.
Algunos datos ocultos aún pueden contener:
- Valor legal
- Valor histórico
- Valor de la investigación
- Valor del análisis de fraude
- Valor de seguridad
- Valor analítico
- valor de la IA
- Requisitos reglamentarios de retención
El error consiste en no conservar todos los datos ocultos.
El error es mantenerlo sin saber por qué.
Las organizaciones necesitan distinguir:
Oscuro pero valioso Datos que merecen propiedad y gobernanza.
De:
Oscuro e innecesario Datos que generan costes, riesgos y cargas normativas sin aportar valor significativo.
Por qué los datos oscuros crean riesgos de seguridad
Los equipos de seguridad no pueden proteger la información confidencial de forma eficaz si desconocen su existencia.
Los datos oscuros pueden contener:
- PII
- PHI
- Información de pago
- Cartas credenciales
- Misterios
- claves API
- Código fuente
- Información financiera
- Propiedad intelectual
- Registros de clientes
- Información del empleado
- Documentos legales
- Comunicaciones confidenciales
El riesgo se agrava cuando los datos oscuros también tienen:
- Exposición pública
- Compartir externamente
- Amplio acceso interno
- Permisos obsoletos
- No hay propietario responsable
- Controles de retención débiles
- Copias desconocidas
- Accesibilidad a la IA
Los datos desconocidos no implican datos de bajo riesgo.
En algunos casos, ocurre lo contrario. La información sin un propietario activo puede recibir menos atención, mientras que su acceso y confidencialidad permanecen inalterados.
Por qué los datos oscuros generan riesgos para la privacidad y el cumplimiento normativo.
Las obligaciones de privacidad no desaparecen cuando los empleados dejan de utilizar activamente los datos.
Es posible que una organización aún necesite comprender:
- Qué información personal conserva
- Por qué lo conserva
- ¿A qué personas se refieren los datos?
- ¿Qué jurisdicción se aplica?
- Si el consentimiento u otros fundamentos legales siguen siendo aplicables
- ¿Cuánto tiempo sigue siendo apropiada la retención?
- Si una retención legal impide la eliminación
- Si la organización puede cumplir con las solicitudes de eliminación o acceso.
Los datos personales no confidenciales crean un problema particular porque los equipos pueden retener información sin una razón operativa clara, al tiempo que mantienen obligaciones de privacidad relacionadas con ella.
Esto hace que los datos oscuros estén estrechamente conectados con gestión del ciclo de vida de los datos y minimización de datos.
Por qué los datos oscuros generan costos
El almacenamiento cuesta dinero.
Pero el almacenamiento representa solo una parte del gasto.
Los datos oscuros también pueden aumentar:
- Volúmenes de copia de seguridad
- Replicación
- Consumo de almacenamiento en la nube
- Alcance de la migración
- Volumen de descubrimiento legal
- Requisitos de escaneo de seguridad
- Revisión de privacidad
- Complejidad del acceso a los datos
- Indexación y procesamiento de IA
La pregunta importante no es simplemente:
“¿Cuánto cuesta almacenar estos datos?”
Las organizaciones también deberían preguntar:
“¿Cuánto cuesta proteger, gestionar, revisar, migrar, buscar, preservar, procesar y, potencialmente, exponer estos datos?”
Cómo la IA cambia el problema de los datos oscuros
La IA está generando el cambio más importante en la gestión de datos ocultos en años.
Históricamente, los datos ocultos podían permanecer relativamente inactivos.
La información existía, pero los empleados podrían no buscarla nunca, abrirla ni saber dónde se almacenó.
La IA empresarial cambia ese modelo.
La IA puede hacer que los datos oscuros sean consultables.
La búsqueda empresarial y los asistentes virtuales pueden facilitar la localización de información olvidada mediante preguntas en lenguaje natural.
Un documento poco conocido puede volverse fácilmente accesible cuando su contenido coincide con la intención del usuario.
RAG puede convertir datos oscuros en contexto activo.
A Sistema RAG Es posible que se recuperen documentos antiguos porque su contenido parece semánticamente relevante.
Si la información se ha vuelto obsoleta, inapropiada, sensible o está desactualizada, la IA puede usar el contexto incorrecto incluso cuando las funciones de recuperación funcionan correctamente.
Los datos oscuros pueden incorporarse a los sistemas de IA.
Los flujos de trabajo de capacitación, ajuste, evaluación, análisis y preparación de IA pueden consumir conjuntos de datos que los equipos no han clasificado o gestionado adecuadamente.
La disponibilidad no garantiza la idoneidad de la IA.
Los agentes de IA pueden actuar sobre información olvidada.
Un agente no puede simplemente recuperar datos ocultos.
Puede utilizarlo para:
- Haz una recomendación
- Actualizar una aplicación
- Enviar mensaje
- Generar un informe
- Llamar a una API
- Activar un flujo de trabajo
La IA puede transformar los datos ocultos, pasando de un riesgo de almacenamiento pasivo a un riesgo de decisión y acción activa.
Datos oscuros en la era de la IA
La IA puede convertir información olvidada en contexto activo.
Datos oscuros
Olvidado, sin usar, mal comprendido
Búsqueda de IA
El lenguaje natural encuentra información oculta
Contexto RAG
La información relevante entra en el contexto de la IA.
Uso de IA
Los modelos o copilotos procesan la información.
Acción del agente
La IA utiliza los datos para influir o ejecutar el trabajo.
Un conjunto de datos olvidado puede volver a estar operativo sin que nadie lo vuelva a abrir intencionadamente.
¿La IA hace que los datos ocultos sean valiosos?
A veces.
Pero las organizaciones deben resistir la tentación de asumir que más datos generan automáticamente una mejor IA.
Los datos ocultos pueden contener información útil sobre hechos históricos, clientes, operaciones, seguridad o investigación.
También puede contener:
- Información obsoleta
- Registros duplicados
- Información incorrecta
- Datos personales caducados
- Datos restringidos
- Información confidencial
- Políticas antiguas
- Información de producto obsoleta
- Procedencia desconocida
- Contenido excesivamente accesible
La pregunta correcta no es:
“¿Puede la IA utilizar estos datos?”
Es:
“¿Debería esta IA utilizar estos datos para este propósito?”
Eso requiere contexto en torno a la sensibilidad, la calidad, el linaje, la propiedad, el acceso, las políticas, la frescura y el uso previsto.
Para un marco más amplio, consulte Los datos preparados para la IA comienzan con la decisión empresarial, no con el modelo..
La decisión sobre los datos ocultos: ¿Conservar, gestionar, usar o eliminar?
Encontrar datos ocultos no da respuesta a qué hacer con ellos.
El descubrimiento debería dar lugar a una decisión.
La decisión sobre los datos oscuros
El valor y la obligación deberían determinar qué sucede a continuación.
Uso + Gobernanza
Los datos tienen un valor legítimo. Asigne propietarios, clasifíquelos, asegure el acceso y someta su uso a políticas.
Retener + Proteger
Puede que la empresa no lo utilice activamente, pero la retención de datos, los litigios, las normativas o los requisitos contractuales justifican su conservación.
Revisar + Asignar
Antes de tomar medidas, determine el propietario, la sensibilidad, el propósito, el acceso, los requisitos del ciclo de vida y la idoneidad de la IA.
Minimizar + Eliminar
Cuando ya no exista ningún propósito comercial, legal, regulatorio u operativo, reduzca los datos innecesarios mediante acciones controladas a lo largo de su ciclo de vida.
Cómo encontrar datos oscuros
La gestión de datos ocultos comienza con su descubrimiento.
Las organizaciones deberían considerar otros ámbitos además de las bases de datos principales y el almacenamiento en la nube.
Un enfoque completo debe incluir lo siguiente:
- Entornos en la nube
- Aplicaciones SaaS
- Sistemas locales
- Entornos híbridos
- Bases de datos estructuradas
- Sistemas de archivos
- Plataformas de colaboración
- Lagos y almacenes de datos
- Sistemas de desarrollo
- Copias de seguridad
- entornos conectados por IA
Descubrimiento y clasificación de datos ayudar a los equipos a determinar qué información existe y qué contiene.
Pero encontrar datos ocultos representa solo el primer paso.
Los equipos deberían enriquecer el proceso de descubrimiento con:
- Sensibilidad
- Dueño
- Propósito comercial
- Edad
- Actividad
- Permisos
- Regulación
- Requisitos de retención
- Similitud y duplicación
- Uso de IA
El descubrimiento te indica que los datos existen. El contexto te dice qué hacer con ellos.
Cómo gestionar los datos oscuros
1. Descúbrelo continuamente
Mantenga la visibilidad en todos los entornos donde la organización crea, copia, almacena y procesa datos.
Los inventarios puntuales quedan obsoletos tan pronto como los equipos crean nuevos sistemas y copias.
2. Clasifica el contenido
Determinar si los datos ocultos contienen información sensible, regulada, confidencial, de propiedad exclusiva, financiera, de salud, de credenciales, personal o crítica para el negocio.
3. Identificar la propiedad
Siempre que sea posible, conecte los datos ocultos con un responsable empresarial o técnico.
Los datos sin propietario a menudo quedan sin resolver porque nadie tiene la autoridad ni la responsabilidad de tomar decisiones sobre su ciclo de vida.
4. Comprender el acceso y la exposición
Determinar qué usuarios, grupos, aplicaciones, cuentas de servicio, identidades de máquinas y sistemas de IA pueden acceder a los datos ocultos.
Priorice el acceso generalizado cuando la información subyacente sea de alta sensibilidad.
5. Actividad de repaso
La actividad puede ayudar a distinguir los datos verdaderamente inactivos de la información que las aplicaciones, los usuarios o los sistemas de IA aún consumen.
Monitoreo de la actividad de datos Puede añadir contexto de uso a las decisiones sobre datos confidenciales.
6. Aplicar retención y suspensión legal
No elimines datos simplemente porque nadie los usa.
Determinar si los requisitos legales, reglamentarios, contractuales, de investigación o comerciales exigen la continuidad de la retención de datos.
Retención de datos Debe vincular la política con los datos reales que rige.
7. Identificar datos rotos y duplicados
Los datos ocultos suelen superponerse con información obsoleta, duplicada, redundante o trivial.
Identificar esas condiciones ayuda a los equipos a priorizar los datos innecesarios para su revisión.
8. Determinar la idoneidad de la IA
Antes de conectar los datos ocultos al entrenamiento, RAG, búsqueda empresarial, copilotos o agentes, determine si la información sigue siendo apropiada para ese propósito específico de IA.
9. Minimiza lo que la empresa ya no necesita.
No guarde datos innecesarios simplemente porque haya espacio de almacenamiento disponible.
Minimización de datos Puede reducir la superficie de ataque, la exposición de la privacidad, el riesgo de la IA y el coste de almacenamiento.
10. Eliminar de forma justificable
Cuando los datos ya no tienen una razón legítima para conservarse, las organizaciones deben aplicar la eliminación controlada con políticas, aprobación, controles de retención, validación y evidencia.
11. Reevaluar continuamente
Los datos activos de hoy pueden convertirse en datos ocultos mañana.
La gestión del ciclo de vida debe revisar continuamente los cambios en el uso, la propiedad, la antigüedad, las políticas, el valor, la disponibilidad de IA y el riesgo.
Conserva menos datos. Reduce más riesgos.
Encuentra los datos oscuros que ya no tienen cabida.
Identificar datos oscuros, obsoletos, duplicados, redundantes, triviales, sensibles y sobreconservados, y luego relacionar los hallazgos con las decisiones de retención, minimización, eliminación y preparación para la IA.
Datos oscuros y gestión del ciclo de vida de los datos
Los datos oscuros suelen ser un indicio de un fallo en el ciclo de vida.
La organización creó o recopiló información con un propósito.
Luego cambió el propósito, pero los datos permanecieron.
Un maduro gestión del ciclo de vida de los datos El programa debería preguntar continuamente:
- ¿Por qué existen estos datos?
- ¿Quién es su propietario?
- ¿Alguien lo sigue usando?
- ¿Qué contiene?
- ¿Qué política se aplica?
- ¿Debemos conservarlo?
- ¿Se aplica alguna medida cautelar?
- ¿Debería la IA utilizarlo?
- ¿Podemos minimizarlo?
- ¿Deberíamos borrarlo?
El objetivo no es eliminar de inmediato todos los datos ocultos, sino eliminar la incertidumbre sobre por qué se conservan.
Datos oscuros y DSPM
Los datos oscuros también crean una Gestión de la seguridad de los datos problema.
Un equipo de seguridad no puede evaluar con precisión la exposición de datos confidenciales si existen repositorios desconocidos u olvidados que quedan fuera de su alcance.
El DSPM moderno debería ayudar a los equipos a conectar los datos ocultos con:
- Sensibilidad
- Exposición
- Identidad
- Acceso
- Actividad
- Propiedad
- Uso de IA
- Contexto empresarial
- Remediación
El riesgo no proviene simplemente del hecho de que los datos sean inaccesibles.
El riesgo proviene del contenido de los datos y de las condiciones que los rodean.
Lo que los líderes en seguridad y datos suelen entender mal sobre los datos oscuros.
“Lo que no se usa, no hace daño”
Los datos no utilizados aún pueden seguir siendo sensibles, estar sobreexpuestos, ser accesibles, estar regulados y ser recuperados por la IA.
“Podemos borrarlo todo”
Algunos datos ocultos tienen un valor legítimo en materia comercial, histórica, contractual, regulatoria o legal.
Los equipos necesitan contexto antes de eliminar información.
“Los datos ocultos solo existen en sistemas antiguos”
Los nuevos entornos de nube y SaaS pueden generar datos ocultos rápidamente a través de copias, exportaciones, registros, colaboración, automatización y proyectos abandonados.
“Si la IA puede encontrarlo, deberíamos usarlo”.”
La capacidad de búsqueda no determina la calidad, el permiso, la relevancia, la actualidad ni la adecuación a las políticas.
La IA puede facilitar el consumo de datos inapropiados.
“Un inventario de datos resuelve el problema”
Un inventario ayuda a establecer visibilidad.
No decide si los equipos deben conservar, proteger, minimizar, eliminar o utilizar los datos.
“El costo del almacenamiento es el principal riesgo”
Los datos oscuros también generan riesgos en materia de seguridad, privacidad, acceso, aspectos legales, migración, operaciones e inteligencia artificial.
Cómo medir el riesgo de los datos oscuros
Las organizaciones deberían evitar medir el éxito únicamente por el total de terabytes descubiertos.
Entre las medidas más útiles se incluyen:
- Volumen de datos oscuros descubiertos
- Datos ocultos que contienen información sensible
- Datos oscuros con exposición pública o externa
- Datos oscuros con acceso excesivo
- Datos oscuros sin propietario
- Requisitos de retención de datos oscuros
- Datos oscuros superpuestos con datos ROT
- Datos oscuros accesibles a la IA
- Almacenamiento reducido mediante minimización
- Datos oscuros con propietario y propósito asignados.
- Los datos oscuros quedan sujetos a la política de retención.
- Datos ocultos eliminados con pruebas
El objetivo no es descubrir indefinidamente más datos ocultos, sino reducir la cantidad de datos no gestionados cuyo valor, exposición, propósito y ciclo de vida siguen siendo desconocidos.
Lista de verificación de preparación para datos oscuros
Preparación para los datos oscuros
¿Puede su organización responder a estas preguntas?
✓ ¿Dónde existen datos desconocidos, no utilizados, obsoletos u olvidados?
✓ ¿Qué información sensible o regulada contiene?
✓ ¿Quién es el propietario?
✓ ¿Por qué la organización aún lo conserva?
✓ ¿Qué usuarios, aplicaciones, cuentas de servicio, identidades de máquinas o sistemas de IA pueden acceder a él?
✓ ¿Qué datos oscuros tienen acceso público, externo o excesivo?
✓ ¿Alguien o algo lo sigue usando activamente?
✓ ¿Qué requisito de retención se aplica?
✓ ¿Una retención legal impide la eliminación?
✓ ¿Qué datos oscuros también son obsoletos, duplicados, redundantes, anticuados o triviales?
✓ ¿Pueden RAG, la búsqueda empresarial, los copilotos o los agentes recuperarlo?
✓ ¿Son los datos adecuados para su uso en IA?
✓ ¿Qué datos merecen un uso empresarial renovado?
✓ ¿Qué datos debería minimizar o eliminar la organización?
✓ ¿Pueden los equipos demostrar las acciones del ciclo de vida que llevaron a cabo?
Cómo BigID ayuda a encontrar y gestionar datos ocultos
BigID aborda los datos oscuros desde los datos hacia afuera.
El descubrimiento crea el punto de partida.
Pero saber que existen datos olvidados no les dice a los equipos qué deben hacer con ellos.
Las organizaciones también necesitan comprender qué contienen los datos, quién es su propietario, quién y qué puede acceder a ellos, si alguien todavía los utiliza, qué políticas se aplican, si la IA debería consumirlos y si la organización debería conservarlos o eliminarlos.
BigID ayuda a las organizaciones a:
- Descubre datos oscuros y desconocidos: Encuentre información estructurada, semiestructurada y no estructurada en entornos compatibles de nube, SaaS, híbridos, locales y conectados a IA.
- Clasifica qué contienen los datos ocultos: Identificar información personal, regulada, confidencial, de propiedad exclusiva, credenciales, información financiera, de salud y de importancia crítica para el negocio, de modo que los equipos puedan priorizar las acciones según el contenido real.
- Priorizar la exposición de datos ocultos: Relacione la sensibilidad con el acceso, la exposición, la propiedad, la actividad, la ubicación y el contexto empresarial para identificar riesgos de seguridad significativos.
- Comprenda quién y qué puede acceder a ella: Conectar datos confidenciales con usuarios, grupos, aplicaciones, cuentas de servicio, identidades de máquinas y sistemas de IA.
- Agregar contexto de actividad: Es importante comprender si los datos confidenciales permanecen inactivos o si las personas siguen accediendo a ellos, compartiéndolos, transfiriéndolos, modificándolos, descargándolos o eliminándolos.
- Reduzca los datos innecesarios: Identificar datos oscuros, obsoletos, duplicados, similares, redundantes, triviales y sobrecontenidos para que los equipos puedan priorizar la limpieza según las políticas y los riesgos.
- Gestionar el ciclo de vida: Conectar el descubrimiento y la clasificación con la retención, la retención legal, la minimización, la eliminación, la remediación y la evidencia del ciclo de vida.
- Aplicar retención: Vincula los requisitos de retención con los datos reales de la empresa e identifica la información que los equipos deben conservar, revisar o eliminar.
- Prepare datos más seguros para la IA: Comprenda la información sensible, obsoleta, duplicada, restringida o innecesaria antes de que ingrese a la capacitación, RAG, indicaciones, copilotos, modelos o flujos de trabajo de los agentes.
- Solución de problemas de la unidad: Asigne propietarios, restrinja el acceso, aplique políticas, haga cumplir la retención, elimine los datos innecesarios y coordine las acciones correctivas cuando sea necesario.
BigID convierte la cuestión de los datos oscuros en un proceso de toma de decisiones:
Descubrir → Comprender → Contextualizar → Decidir → Actuar → Demostrar
Eso es más útil que simplemente calcular cuántos datos ocultos existen.
El objetivo es determinar qué datos ocultos aún merecen un lugar en la empresa, qué datos necesitan una gobernanza más sólida, qué datos debería utilizar la IA y qué datos puede dejar de almacenar la organización.
Conectar los datos y la IA
Convierta los datos oscuros en una decisión.
Descubre cómo BigID detecta datos confidenciales y poco transparentes, los relaciona con la propiedad, el acceso, la actividad, el ciclo de vida, el uso de la IA, las políticas y los riesgos, y luego ayuda a los equipos a gestionar lo que importa y a reducir lo que no.
Preguntas frecuentes sobre datos oscuros
¿Qué son los datos oscuros?
Los datos oscuros son información que una organización recopila, almacena o conserva, pero que no utiliza activamente, no comprende completamente ni gestiona de forma consistente. Pueden incluir archivos, bases de datos, registros, copias de seguridad, mensajes, datos analíticos, conjuntos de datos de IA y otra información estructurada o no estructurada.
¿Por qué se les llama datos oscuros?
El término describe datos que quedan fuera del uso, análisis, visibilidad o gobernanza habituales de la empresa. Los datos existen, pero la organización puede carecer de un conocimiento claro de su propósito, contenido, propietario, valor o riesgo.
¿Cuáles son algunos ejemplos de datos ocultos?
Algunos ejemplos son archivos abandonados, registros de aplicaciones, registros antiguos de clientes, bases de datos sin usar, copias de seguridad, correos electrónicos archivados, contenido de colaboración olvidado, copias de desarrollo, exportaciones históricas, datos adquiridos, conjuntos de datos de investigación sin usar y conjuntos de datos relacionados con la IA que ya no tienen un propósito o propietario claros.
¿Son los datos oscuros lo mismo que los datos en la sombra?
No. Los datos oscuros generalmente describen información que las organizaciones no utilizan activamente o que no comprenden del todo. Los datos en la sombra describen información que existe fuera de la gobernanza y la visibilidad de seguridad aprobadas o esperadas. Un conjunto de datos puede calificarse como ambos.
¿Cuál es la diferencia entre datos oscuros y datos ROT?
Los datos ROT son información redundante, obsoleta o trivial. Los datos oscuros describen información cuyo uso, valor, propiedad o gobernanza no están claros. Algunos datos oscuros son valiosos, mientras que otros se convierten en ROT y deben minimizarse o eliminarse.
¿Los datos ocultos son siempre inútiles?
No. Los datos ocultos pueden conservar un valor legítimo para negocios, asuntos legales, información histórica, seguridad, investigación, análisis o inteligencia artificial. Las organizaciones deben evaluar el propósito, la sensibilidad, la calidad, la propiedad, las políticas y las necesidades del negocio antes de decidir si los conservan o los eliminan.
¿Por qué los datos ocultos representan un riesgo para la seguridad?
Los datos ocultos pueden contener información sensible sin ser comprendidos, ser ampliamente accesibles, compartirse externamente, no tener propietario o estar fuera de la revisión de seguridad activa. Los datos sensibles desconocidos pueden aumentar la exposición a filtraciones y dificultar la priorización de riesgos.
¿Cómo generan los datos ocultos riesgos para la privacidad?
Los datos ocultos pueden contener información personal que la organización ya no necesita, pero que aún conserva. Esto puede generar problemas relacionados con la finalidad, la retención, el acceso, los derechos sobre los datos, la minimización, la eliminación y otros requisitos de privacidad.
¿Cómo afecta la IA a los datos ocultos?
La IA puede hacer que los datos ocultos vuelvan a ser consultables y operativos. La búsqueda empresarial, RAG, los copilotos, las bases de datos vectoriales, los sistemas de entrenamiento y los agentes pueden recuperar o procesar información olvidada a la que los empleados rara vez accedían antes de la llegada de la IA.
¿Deberían utilizarse los datos ocultos para la IA?
No automáticamente. Las organizaciones deben evaluar si los datos ocultos son precisos, actuales, relevantes, accesibles adecuadamente, están suficientemente regulados y permitidos para el uso previsto de la IA antes de conectarlos al entrenamiento, RAG, copilotos, modelos o agentes.
¿Cómo pueden las organizaciones encontrar datos ocultos?
Las organizaciones pueden utilizar el descubrimiento y la clasificación de datos en entornos conectados a la nube, SaaS, híbridos, locales, de archivos, bases de datos, colaboración, desarrollo e inteligencia artificial. Posteriormente, deben añadir información contextual como la confidencialidad, la propiedad, la antigüedad, el acceso, la actividad, la retención y la finalidad comercial.
¿Cómo deben gestionar las organizaciones los datos ocultos?
Las organizaciones deben descubrir y clasificar los datos ocultos, asignarles propietarios, comprender el acceso y la actividad, aplicar los requisitos de retención y conservación legal, evaluar su valor para el negocio y la IA, identificar los datos duplicados y obsoletos, minimizar la información innecesaria y eliminar los datos de forma justificada cuando ya no exista una necesidad legítima.
¿Cómo ayuda BigID con los datos ocultos?
BigID ayuda a las organizaciones a descubrir y clasificar datos ocultos y desconocidos, identificar información confidencial, vincular los datos con la propiedad, las identidades, el acceso, la actividad, la exposición, las políticas, la retención y el uso de la IA, identificar datos obsoletos e innecesarios, y coordinar las acciones de ciclo de vida y remediación.

