Definición:
El dark data es el conjunto de datos que una organización recopila, procesa o almacena durante su actividad habitual, pero que no utiliza de forma efectiva para operar, analizar resultados o tomar decisiones. Puede incluir información conocida pero inactiva, conjuntos cuyo propietario o finalidad se han perdido y datos que la organización ni siquiera ha inventariado correctamente.
El concepto forma parte del ámbito del Big Data, aunque no depende del volumen ni de un formato concreto. El dark data puede ser estructurado, semiestructurado o no estructurado. Lo define su falta de uso y gobierno, no que carezca de etiquetas o resulte técnicamente inaccesible.
Alcance del Dark Data
Una organización puede conocer la existencia de unos datos y no utilizarlos porque no dispone de un propósito, responsable o procedimiento para hacerlo. En otros casos, la información queda repartida entre aplicaciones, cuentas, dispositivos, copias de seguridad y repositorios que no aparecen en el inventario corporativo.
La analogía del iceberg representa esta diferencia entre los datos visibles y utilizados y aquellos que permanecen bajo la superficie. No existe un porcentaje universal que determine qué parte de los datos de una organización es oscura, inútil o aprovechable. La proporción depende de su actividad, arquitectura, políticas y capacidad de gestión.
Un data lake puede almacenar información en formatos diversos sin convertirla automáticamente en dark data. Del mismo modo, un data warehouse puede contener tablas que han dejado de utilizarse. El estado depende del conocimiento, finalidad y uso real de cada conjunto.
Origen del Dark Data
El dark data suele acumularse por una combinación de decisiones técnicas y organizativas:
- Recopilación sin finalidad definida: Sistemas, formularios y dispositivos conservan datos porque pueden obtenerlos, aunque no exista un caso de uso ni un plazo de retención acordado.
- Silos y pérdida de contexto: Los datos quedan aislados en herramientas, departamentos o cuentas sin propietario, documentación o relación con otros sistemas.
- Cambios tecnológicos: Migraciones, sustituciones de aplicaciones y formatos antiguos dejan archivos y copias que siguen almacenados pero ya no forman parte de los procesos activos.
- Falta de capacidad o prioridad: La organización conoce los datos, pero no dispone de calidad, permisos, herramientas, tiempo o conocimientos suficientes para evaluarlos y utilizarlos.
Los datos que nunca llegaron a recopilarse no son dark data. El término se aplica a información que ya existe dentro del entorno de la organización, aunque resulte difícil de localizar o interpretar.
Fuentes de Dark Data
Los ejemplos varían según la actividad, pero suelen agruparse en cuatro fuentes:
- Operaciones y sistemas: Archivos de registro, telemetría, eventos, errores, historiales de acceso y datos generados por dispositivos o aplicaciones.
- Comunicaciones y contenidos: Correos electrónicos, chats, documentos, grabaciones, imágenes, vídeos, transcripciones y versiones intermedias.
- Relaciones comerciales: Formularios, interacciones con atención al cliente, historiales de CRM, encuestas, solicitudes y datos vinculados a cuentas.
- Archivos administrativos y heredados: Copias de seguridad, exportaciones, bases antiguas, documentos financieros, expedientes de exempleados y archivos duplicados u obsoletos.
Un tipo de archivo no es dark data por naturaleza. Un registro puede ser esencial para seguridad o diagnóstico, mientras que otro idéntico puede carecer de finalidad y conservarse más tiempo del necesario.
Gestión del Dark Data
Gestionar estos datos no significa analizarlos todos. El proceso debe determinar cuáles existen, qué obligaciones afectan a cada conjunto y qué decisión resulta justificable:
- Inventariar: Localizar repositorios, fuentes, copias, responsables, formatos, accesos y flujos de información.
- Clasificar: Identificar finalidad, sensibilidad, calidad, antigüedad, duplicación, restricciones y requisitos de conservación.
- Decidir: Mantener los datos necesarios, activar los que tengan un uso legítimo, archivar los que deban conservarse y eliminar los que carezcan de finalidad u obligación.
- Controlar: Aplicar permisos, cifrado, trazabilidad, plazos de retención y revisiones periódicas durante todo el ciclo de vida.
Las técnicas de data mining pueden ayudar a encontrar patrones en determinados conjuntos, pero deben aplicarse después de comprobar procedencia, calidad, permisos y finalidad. Que un dato pueda analizarse no significa que sea fiable, relevante o lícito utilizarlo para cualquier objetivo.
Riesgos del Dark Data
El almacenamiento sin control consume capacidad y puede multiplicar copias, versiones y costes operativos. También dificulta saber qué información es vigente y favorece que análisis posteriores mezclen datos incompletos, duplicados o fuera de contexto.
Los repositorios olvidados pueden contener datos personales, credenciales, contratos o información confidencial con permisos inadecuados. La falta de uso no elimina las obligaciones de seguridad, acceso, conservación y supresión. Mantener información indefinidamente tampoco constituye una medida de cumplimiento por sí misma.
Parte del dark data puede adquirir valor cuando aparece una pregunta nueva o mejora la capacidad de análisis. Otra parte seguirá sin ser útil o deberá eliminarse. Su evaluación debe equilibrar utilidad, calidad, coste, riesgo y base legítima de conservación, sin asumir que todos los datos ocultos representan una oportunidad desaprovechada.
