¿Qué son los datos en la sombra?
Los datos en la sombra son datos organizacionales que existen fuera de los controles de visibilidad, gestión o seguridad que los equipos esperan para protegerlos.
Puede incluir datos confidenciales copiados en entornos de desarrollo, copias de seguridad en la nube olvidadas, exportaciones SaaS no gestionadas, instantáneas antiguas de bases de datos, archivos locales, almacenamiento abandonado o conjuntos de datos creados para análisis e inteligencia artificial.
El problema no radica simplemente en dónde se almacenan los datos. El problema es que los equipos de seguridad pueden desconocer su existencia, su contenido, quién puede acceder a ellos o si aún cumplen una función comercial legítima.
Por ejemplo, un desarrollador podría copiar una base de datos de clientes de producción a un entorno de prueba. El proyecto finaliza, pero la copia permanece. Meses después, esa base de datos olvidada aún contiene información personal identificable de los clientes, pero ya no cuenta con los mismos controles de acceso, supervisión ni propiedad que el sistema de producción.
Esos son datos ocultos.
Datos ocultos: Conclusiones clave
- Los datos ocultos existen fuera de la gobernanza prevista. Es posible que los equipos de seguridad desconozcan dónde se encuentra, qué contiene o quién puede acceder a él.
- La proliferación de soluciones en la nube y SaaS crea más copias. Las copias de seguridad, las instantáneas, las exportaciones, los entornos de desarrollo y los recursos abandonados pueden generar datos en la sombra.
- La IA añade otra fuente de datos ocultos. Los conjuntos de datos de entrenamiento, los repositorios RAG, las bases de datos vectoriales, las indicaciones, los resultados y los proyectos experimentales de IA pueden crear nuevas copias y usos de los datos empresariales.
- El riesgo depende de los datos. Los datos sensibles, regulados, confidenciales o críticos para el negocio que se olvidan generan un mayor riesgo que los datos ordinarios.
- DSPM ayuda a las organizaciones a detectar y reducir el riesgo de datos ocultos. El descubrimiento, la clasificación, el contexto de acceso, la priorización de riesgos y la corrección permiten volver a controlar los datos ocultos.
¿De dónde provienen los datos ocultos?
Los datos ocultos no siempre son el resultado de que los empleados eludan deliberadamente los sistemas de TI. Gran parte de ellos se generan a través de los procesos comerciales y técnicos habituales.
Las fuentes comunes incluyen:
- Copias de seguridad y instantáneas en la nube: Las copias se conservan incluso después de que los equipos dejen de usar la carga de trabajo original.
- Entornos de desarrollo y prueba: Los datos de producción se copian en entornos de producción y permanecen allí una vez finalizadas las pruebas.
- Exportaciones de SaaS: Los empleados exportan datos de clientes, financieros u operativos a hojas de cálculo y otras aplicaciones.
- Canalizaciones analíticas: Los equipos duplican conjuntos de datos en almacenes de datos, lagos de datos, cuadernos y plataformas de análisis.
- Almacenamiento personal o no gestionado: Los empleados guardan información empresarial en dispositivos locales o en servicios en la nube no autorizados.
- Proyectos abandonados: Los datos permanecen incluso después de que las aplicaciones, los recursos en la nube o las iniciativas empresariales lleguen al final de su ciclo de vida.
- Desarrollo de la IA: Los equipos crean conjuntos de datos de entrenamiento, almacenes de vectores, entradas de modelos, repositorios RAG y copias de datos experimentales sin aplicar la gobernanza establecida.
El denominador común es la pérdida de visibilidad o control. La organización sigue siendo propietaria de los datos o responsable de ellos, pero sus procesos habituales de seguridad y gobernanza pueden dejar de cubrirlos.
Encuentra los equipos de seguridad de datos que no pueden ver
Descubra datos sensibles, regulados, críticos, ocultos y en la sombra en entornos de nube, SaaS, locales, híbridos y de IA.
¿Por qué los datos ocultos representan un riesgo para la seguridad?
Los datos desconocidos generan riesgos desconocidos.
Si los equipos de seguridad desconocen la existencia de un conjunto de datos, no pueden determinar con fiabilidad si cuenta con los controles de acceso, el cifrado, las políticas de retención, la monitorización o la propiedad adecuados.
Los datos en la sombra se vuelven particularmente importantes cuando contienen:
- Información de identificación personal (PII)
- Información sanitaria protegida (PHI)
- registros financieros
- Información del cliente
- Credenciales y secretos
- Código fuente
- Propiedad intelectual
- Información comercial confidencial
- Otros datos regulados o críticos para el negocio
Una base de datos de prueba olvidada que contiene información sintética presenta un nivel de riesgo. La misma base de datos que contiene millones de registros de clientes reales presenta otro.
Por eso las organizaciones necesitan más que un inventario de recursos de almacenamiento. Necesitan comprender qué datos contienen y cómo se exponen esos datos.
Ejemplos reales de datos ocultos
Una base de datos de desarrollo olvidada
Un equipo de ingeniería copia los datos de los clientes de producción en una base de datos de desarrollo para probar una nueva aplicación.
La aplicación se lanza, pero nadie elimina la base de datos de prueba. Sus controles de acceso siguen siendo más amplios que los de producción, y el responsable original del proyecto acaba abandonando la empresa.
La organización ahora posee una copia olvidada de datos confidenciales de clientes, con una propiedad poco definida y un acceso potencialmente innecesario.
Exportación de SaaS no gestionada
Un empleado del departamento de operaciones de ventas exporta miles de registros de clientes desde un CRM aprobado para analizarlos en otra aplicación.
El CRM sigue estando gobernado. La copia exportada podría no estarlo.
Si el archivo permanece indefinidamente en un almacenamiento en la nube personal o en una aplicación SaaS no administrada, los equipos de seguridad pueden perder visibilidad sobre quién tiene acceso y cuánto tiempo permanecen allí los datos.
Una instantánea de la base de datos que nadie borra
Un administrador de la nube crea una instantánea antes de una migración. La migración se realiza correctamente, pero la instantánea permanece mucho tiempo después de que la necesidad original haya desaparecido.
Si esa instantánea contiene datos confidenciales, la organización ahora tiene otra copia que proteger, gestionar y, finalmente, eliminar.
Un conjunto de datos de IA creado para la experimentación.
Un equipo de ciencia de datos copia documentos internos en un nuevo repositorio para probar una aplicación de IA generativa.
El experimento finaliza, pero el conjunto de datos permanece almacenado en la nube o en una base de datos vectorial.
Aunque el proyecto de IA nunca llegue a producción, los datos subyacentes pueden quedar expuestos. Por lo tanto, la IA crea otra vía para el desarrollo de datos ocultos.
Datos ocultos frente a TI oculta frente a IA oculta
Estos términos se solapan, pero describen problemas diferentes.
TI en la sombra y IA en la sombra Ambos métodos pueden generar datos en la sombra. Sin embargo, los datos en la sombra también pueden desarrollarse dentro de la infraestructura aprobada a través de copias olvidadas, copias de seguridad, exportaciones y recursos abandonados.
Cómo los datos ocultos afectan al cumplimiento normativo
Las obligaciones normativas y de privacidad no desaparecen porque una organización haya olvidado dónde fueron a parar los datos.
Los datos ocultos pueden dificultar la determinación de dónde reside la información regulada, el cumplimiento de los requisitos de retención, la respuesta a las solicitudes de privacidad, la aplicación de controles de acceso, la investigación de incidentes y la demostración del cumplimiento normativo.
Además, esto genera un problema fundamental de rendición de cuentas: los equipos no pueden proteger ni gestionar de forma consistente los datos que desconocen que poseen.
¿Cómo se encuentran los datos ocultos?
Para encontrar datos ocultos es necesario ir más allá de las bases de datos conocidas y los repositorios aprobados.
Un enfoque práctico debería:
- Descubra datos de forma amplia. Analice datos estructurados, semiestructurados y no estructurados en entornos de nube, SaaS, locales, híbridos, de desarrollo y de IA.
- Clasifica lo que encuentres. Determinar qué activos contienen información sensible, regulada, confidencial o de alto valor.
- Agregue contexto de propiedad y acceso. Identificar quién es el propietario de los datos, quién puede acceder a ellos y si dicho acceso sigue siendo necesario.
- Identificar la exposición. Busque acceso público, permisos excesivos, datos obsoletos, configuraciones incorrectas, recursos abandonados y otras condiciones de riesgo.
- Priorizar según el riesgo. Un almacén olvidado que contiene información altamente sensible y de amplio acceso merece más atención que un repositorio en desuso que contiene información pública.
- Solucionar el problema subyacente. Elimine las copias innecesarias, restrinja el acceso, aplique políticas de retención, corrija las configuraciones o mueva los datos a ubicaciones controladas.
- Monitorear continuamente. Se generan nuevos datos ocultos a medida que las personas, las aplicaciones, los servicios en la nube y los sistemas de IA crean y transfieren información.
Cómo DSPM ayuda a reducir el riesgo de datos ocultos
Gestión de posturas de seguridad de datos (DSPM) Ofrece a los equipos de seguridad una forma centrada en los datos para encontrar y reducir el riesgo de datos ocultos.
En lugar de depender únicamente de los inventarios de infraestructura, DSPM descubre datos en todos los entornos empresariales y añade contexto en torno a la sensibilidad, el acceso, la propiedad, la exposición y el riesgo.
Eso permite a los equipos pasar de:
“Hemos encontrado otro recurso de almacenamiento.”
a:
“Este recurso olvidado contiene información personal identificable de los clientes, tiene un acceso excesivo, no tiene un propietario claro y no tiene una finalidad comercial actual.”
El segundo hallazgo proporciona al equipo de seguridad información útil para tomar medidas.
Transformar los datos ocultos en riesgos procesables
Vincula los datos confidenciales con el acceso, la propiedad, la exposición y el contexto empresarial para que los equipos sepan qué datos ocultos deben abordar primero.
Cómo la IA cambia el problema de los datos ocultos
La IA hace que los datos en la sombra sean más importantes porque los proyectos de IA consumen y crean copias adicionales de la información empresarial.
Los equipos pueden mover datos a:
- Conjuntos de datos de entrenamiento
- Bases de datos vectoriales
- Repositorios RAG
- entornos de desarrollo de IA
- Registros de mensajes y respuestas
- Tuberías modelo
- Almacenamiento experimental en la nube
La organización puede aprobar la iniciativa de IA aun perdiendo visibilidad sobre algunas de las copias de datos que la respaldan.
También existe una conexión entre los datos en la sombra y IA en la sombra. Los empleados o desarrolladores que utilicen herramientas de IA no autorizadas pueden introducir información empresarial en sistemas que no se rigen por la gobernanza habitual, lo que genera un problema de gobernanza de la IA y un problema de seguridad de los datos.
Por lo tanto, los equipos de seguridad necesitan visibilidad de ambos. dónde se almacenan los datos confidenciales y dónde los utiliza la IA.
Cómo BigID ayuda a encontrar y reducir los datos ocultos
BigID ayuda a las organizaciones a descubrir datos sensibles, regulados, críticos, ocultos y en la sombra en entornos de nube, SaaS, locales, híbridos, de desarrollo e inteligencia artificial.
En lugar de limitarse al descubrimiento, BigID conecta los datos con la sensibilidad, la propiedad, el acceso, la actividad, la exposición y el contexto empresarial, de modo que los equipos puedan comprender qué datos ocultos generan riesgos significativos.
Las organizaciones pueden utilizar BigID para:
- Descubra y clasifique datos ocultos: Encuentre información sensible y de alto valor en fuentes de datos estructuradas, no estructuradas y semiestructuradas.
- Comprender la exposición: Identifique dónde los datos confidenciales tienen acceso excesivo, configuraciones riesgosas, una propiedad débil u otros problemas de seguridad.
- Priorizar el riesgo: Los equipos de seguridad deben centrarse en los datos ocultos que generan mayor riesgo en función de su sensibilidad, acceso, propiedad e impacto en el negocio.
- Reduzca el acceso innecesario: Identificar datos y permisos sobreexpuestos que excedan las necesidades comerciales legítimas.
- Corregir el riesgo de los datos: Tome medidas mediante flujos de trabajo para la eliminación, retención, reducción de acceso, etiquetado y otras medidas correctivas basadas en políticas.
- Monitorear continuamente: Identifique los cambios a medida que nuevos datos, copias, usuarios, aplicaciones y sistemas de IA amplían el entorno de datos.
El resultado es más que un mapa de dónde se encuentran los datos. Los equipos de seguridad obtienen el contexto para determinar Qué es importante, por qué genera riesgos y qué deberían abordar primero.
Vea el riesgo oculto de sus datos
Descubra cómo BigID detecta datos ocultos, identifica la exposición a información confidencial, prioriza los riesgos y ayuda a los equipos a tomar medidas en toda la empresa.
Preguntas frecuentes sobre datos en la sombra
¿Qué son los datos en la sombra?
Los datos ocultos son datos organizacionales que existen fuera de la visibilidad, la gestión o los controles de seguridad previstos. Algunos ejemplos son las copias de seguridad olvidadas, las instantáneas de bases de datos, las exportaciones SaaS no gestionadas, las copias de desarrollo, el almacenamiento en la nube abandonado y los conjuntos de datos de IA.
¿Qué es un ejemplo de datos ocultos?
Un ejemplo común es una copia de una base de datos de clientes de producción creada para desarrollo o pruebas que permanece después de que finaliza el proyecto. Si nadie realiza un seguimiento ni gestiona la copia, puede convertirse en datos no autorizados.
¿Qué causa los datos ocultos?
Los datos en la sombra se generan a través de la proliferación de la nube y el SaaS, las copias de seguridad, las instantáneas, los entornos de desarrollo, las exportaciones de datos, los proyectos de análisis, las aplicaciones no gestionadas, los recursos abandonados y las iniciativas de IA que crean copias adicionales de los datos empresariales.
¿Cuál es la diferencia entre datos en la sombra y TI en la sombra?
La tecnología en la sombra se refiere al uso de tecnología sin la supervisión adecuada de TI. Los datos en la sombra se refieren a datos que existen fuera de la visibilidad o gobernanza esperadas. La tecnología en la sombra puede generar datos en la sombra, pero estos también pueden existir dentro de entornos tecnológicos aprobados.
¿Cuál es la diferencia entre datos en sombra y datos oscuros?
Los datos en la sombra carecen de la visibilidad y la gobernanza esperadas. Los datos oscuros se refieren generalmente a la información que una organización conserva, pero de la que no obtiene valor ni utiliza activamente. Los datos pueden ser tanto oscuros como en la sombra cuando no se utilizan y están fuera de una supervisión efectiva.
¿Cómo generan riesgos de seguridad los datos ocultos?
Los datos en la sombra pueden contener información confidencial si no se aplican los controles de acceso, la supervisión, la retención, la propiedad o las políticas de seguridad adecuadas. Esto puede aumentar el riesgo de acceso no autorizado, exposición de datos, incumplimiento normativo e infracciones.
¿Cómo ayuda DSPM con los datos en la sombra?
DSPM ayuda a descubrir y clasificar datos ocultos, vincularlos con el acceso y la propiedad, identificar la exposición, priorizar el riesgo y respaldar la remediación en entornos de nube, SaaS, híbridos, locales y de IA.
¿Cómo ayuda BigID a encontrar datos ocultos?
BigID descubre y clasifica datos en entornos empresariales y vincula los datos confidenciales con el acceso, la propiedad, la actividad, la exposición y el riesgo. Los equipos pueden usar este contexto para identificar datos ocultos de alto riesgo, priorizar las medidas correctivas y reducir la exposición innecesaria.

