La huella invisible: metadatos, correlación e identificación digital
Cómo documentos, navegadores, dominios, repositorios, infraestructuras y patrones aparentemente inconexos pueden converger hasta reconstruir una identidad digital
OIDSEC / OBSERVATORIO DE INVESTIGACIÓN DIGITAL
ÁREA / OSINT · PRIVACIDAD · IDENTIDAD DIGITAL · CIBERINTELIGENCIA
TIPO / INFORME DE ANÁLISIS ESTRATÉGICO Y TÉCNICO
NIVEL / AVANZADO
CLASIFICACIÓN / INVESTIGACIÓN ABIERTA
METODOLOGÍA / ANÁLISIS MULTIFUENTE · CORRELACIÓN · PRIVACY RISK ASSESSMENT
REFERENCIAS / NIST · EDPB · IETF · W3C · ICANN · OWASP · GITHUB
MODELO / OIDSEC DIGITAL EXPOSURE MODEL — DEM-5
VERSIÓN / 1.0
FECHA / 2026
Resumen ejecutivo
La identidad digital contemporánea rara vez se encuentra contenida en un único perfil, una única base de datos o un único identificador.
Se encuentra distribuida.
Una fotografía puede revelar un dispositivo.
Un documento puede conservar un nombre de autor.
Un repositorio de código puede asociar una dirección de correo con una actividad concreta.
Un registro de dominio puede aportar información sobre infraestructura.
Una cabecera temporal puede establecer una zona horaria.
Una cuenta reutilizada puede unir dos contextos que su propietario creía independientes.
Una configuración de navegador puede contribuir a distinguir un dispositivo.
Una secuencia repetida de comportamientos puede construir un patrón.
Ninguna de estas evidencias tiene necesariamente gran valor de manera aislada.
El problema aparece cuando comienzan a converger.
El IETF define precisamente la correlación como la combinación de elementos de información relativos a una persona —o que adquieren esa característica cuando se combinan— y reconoce el fingerprinting como el uso combinado de información para identificar, con suficiente probabilidad, una aplicación o dispositivo.
El fenómeno analizado en este informe puede resumirse mediante una ecuación conceptual:
IDENTIDAD DIGITAL ≠ DATO ÚNICO
IDENTIDAD DIGITAL = CONVERGENCIA DE INDICADORES
Este principio modifica profundamente la forma en que deben comprenderse tanto OSINT como privacidad.
El problema ya no consiste únicamente en determinar qué datos hemos publicado.
Debe analizarse además:
- qué metadatos acompañan a esos datos;
- qué identificadores se reutilizan;
- qué relaciones pueden inferirse;
- qué información permanece en terceros;
- qué patrones temporales producimos;
- qué infraestructura puede atribuirse;
- qué características técnicas resultan observables;
- y qué nuevas conclusiones pueden producirse al combinar diferentes fuentes.
La consecuencia es especialmente relevante:
una persona puede no haber publicado jamás directamente determinada información y, aun así, haber proporcionado suficientes elementos para que pueda ser inferida.
Este informe propone el OIDSEC Digital Exposure Model — DEM-5, que separa la exposición digital en cinco niveles:
01 / VISIBLE
Información expresamente publicada.
02 / METADATA
Información añadida al objeto o a su entorno técnico.
03 / CORRELATABLE
Elementos que permiten vincular contextos inicialmente separados.
04 / INFERRED
Información no publicada directamente pero deducible mediante análisis.
05 / ATTRIBUTABLE
Conjunto de evidencias suficientemente convergentes para asociar razonablemente una actividad, activo o identidad.
La tesis fundamental es que la privacidad digital no puede gestionarse únicamente preguntando:
«¿Qué he publicado?»
Debe preguntarse:
«¿Qué puede reconstruirse sobre mí combinando aquello que he publicado, lo que mis dispositivos producen, lo que terceros conservan y aquello que puede inferirse?»
Conclusiones ejecutivas
El análisis permite establecer ocho conclusiones fundamentales.
01 / LA EXPOSICIÓN ES ACUMULATIVA
La sensibilidad de un conjunto de datos puede ser significativamente superior a la sensibilidad de cada elemento individual.
02 / LOS METADATOS SON INFORMACIÓN
No deben tratarse como simples propiedades técnicas carentes de significado analítico.
03 / LA CORRELACIÓN PRODUCE INFORMACIÓN NUEVA
Relacionar correctamente dos datos puede generar un tercer conocimiento que nunca fue publicado directamente.
04 / LA IDENTIDAD ES PROBABILÍSTICA
En numerosos escenarios OSINT no existe una prueba única definitiva. La atribución depende de convergencia, independencia de fuentes y ausencia de explicaciones alternativas.
05 / LA PERSISTENCIA MULTIPLICA EL RIESGO
Una pequeña exposición repetida durante años puede resultar más reveladora que una divulgación puntual.
06 / LA DESIDENTIFICACIÓN NO ELIMINA AUTOMÁTICAMENTE EL RIESGO
NIST trata la desidentificación como un proceso destinado a reducir la asociación con individuos y analiza expresamente el riesgo posterior de reidentificación.
07 / LO PÚBLICO NO EQUIVALE A LO IRRELEVANTE PARA LA PRIVACIDAD
El tratamiento sistemático y la agregación modifican sustancialmente el riesgo.
08 / LA MEJOR DEFENSA ES REDUCIR LA CORRELACIONABILIDAD
No basta con ocultar datos individuales. Hay que reducir los puntos capaces de unir contextos distintos.
CLAVE DE ANÁLISIS / 01
La huella digital más peligrosa no siempre es aquello que publicamos.
Con frecuencia es la relación que puede establecerse entre elementos que nunca imaginamos que serían observados conjuntamente.
1. Objeto del informe
El presente informe analiza los mecanismos mediante los cuales información dispersa puede contribuir a identificar, perfilar o relacionar una identidad digital.
El análisis comprende:
- metadatos;
- documentos;
- imágenes;
- identificadores;
- infraestructura;
- dominios;
- repositorios de código;
- registros temporales;
- navegadores;
- fingerprinting;
- información de red;
- correlación;
- grafos;
- reidentificación;
- atribución;
- publicación;
- mitigación.
El objetivo es doble.
Objetivo analítico
Comprender cómo se construye una identidad digital mediante fuentes heterogéneas.
Objetivo defensivo
Establecer controles para reducir la exposición involuntaria de individuos y organizaciones.
No se pretende proporcionar una metodología destinada a identificar clandestinamente a terceros, sino desarrollar un marco profesional para auditar y reducir la propia exposición digital dentro de actividades legítimas y autorizadas.
2. Alcance
El modelo resulta aplicable a:
- organizaciones;
- directivos;
- investigadores;
- periodistas;
- profesionales expuestos públicamente;
- equipos de ciberinteligencia;
- desarrolladores;
- personal de seguridad;
- unidades de comunicación;
- investigadores OSINT;
- propietarios de infraestructura digital.
La intensidad del análisis debe adaptarse siempre al nivel de riesgo.
No necesita la misma evaluación un ciudadano con baja exposición pública que:
un directivo estratégico;
un investigador en un asunto sensible;
un responsable tecnológico;
una persona con acceso privilegiado;
una organización sometida a espionaje competitivo;
o un profesional especialmente expuesto a campañas de ingeniería social.
3. Metodología
OIDSEC propone una metodología basada en seis principios.
MULTISOURCE
Nunca se considera concluyente un indicador simplemente porque aparezca en una fuente.
PROVENANCE
Toda evidencia relevante debe mantener relación con su origen.
TEMPORALITY
La fecha del dato forma parte del dato.
INDEPENDENCE
Cinco páginas que reproducen la misma fuente no constituyen cinco fuentes independientes.
ALTERNATIVE HYPOTHESES
Toda atribución debe considerar explicaciones alternativas.
MINIMIZATION
La investigación defensiva debe recopilar únicamente aquello que resulte necesario para evaluar el riesgo.
4. El concepto de huella invisible
La expresión huella digital suele asociarse a publicaciones visibles:
fotografías;
comentarios;
perfiles;
vídeos;
entradas;
mensajes.
Esta visión es incompleta.
Una identidad también genera información fuera del contenido explícito.
Podemos dividirla en:
HUELLA DECLARADA
Aquello que publicamos conscientemente.
HUELLA TÉCNICA
Aquello que producen dispositivos, software y servicios.
HUELLA RELACIONAL
Aquello que surge de nuestras relaciones con otras entidades.
HUELLA TEMPORAL
Aquello que revelan nuestras secuencias y horarios.
HUELLA INFERIDA
Aquello que otros pueden deducir.
La quinta categoría es la más importante.
No existe necesariamente como dato almacenado.
Existe como conclusión analítica.
5. OIDSEC DIGITAL EXPOSURE MODEL — DEM-5
El modelo DEM-5 propone separar la exposición en cinco capas.
DEM-01 / VISIBLE
Información explícitamente accesible.
Ejemplos:
nombre;
fotografía;
cargo;
publicaciones;
organización;
biografía;
contactos profesionales declarados.
Riesgo principal
Sobreexposición consciente o semiconsciente.
Pregunta de auditoría
¿Qué conoce un tercero sin realizar ninguna correlación?
DEM-02 / METADATA
Información que acompaña al objeto.
Puede incluir:
autor;
software;
dispositivo;
fecha;
ubicación;
propiedades de archivo;
identificadores;
versiones;
atributos técnicos.
ExifTool, una de las herramientas más extendidas para examinar metainformación, soporta formatos como EXIF, GPS, IPTC y XMP, mostrando la enorme variedad de información que puede acompañar a archivos multimedia.
Riesgo principal
Publicar involuntariamente información que nunca se pretendió mostrar.
Pregunta
¿Qué revela el archivo además de aquello que vemos?
DEM-03 / CORRELATABLE
Datos capaces de unir dos contextos.
Ejemplos conceptuales:
mismo correo;
mismo alias;
mismo avatar;
mismo dominio;
mismo identificador;
mismo dispositivo;
mismo patrón temporal.
Riesgo principal
Colapso de identidades que pretendían mantenerse separadas.
Pregunta
¿Qué elemento puede funcionar como puente entre dos conjuntos de datos?
DEM-04 / INFERRED
Información deducida mediante combinación.
Ejemplos:
posible zona horaria;
relación probable entre cuentas;
área habitual de actividad;
infraestructura vinculada;
patrones profesionales.
Riesgo principal
Creer que aquello que nunca se publicó no puede conocerse.
Pregunta
¿Qué nueva información aparece cuando correlacionamos lo ya conocido?
DEM-05 / ATTRIBUTABLE
Nivel en el que diferentes indicadores independientes convergen hasta permitir una atribución razonada.
Riesgo principal
Asociación de una identidad con una actividad o activo.
Pregunta
¿Existe suficiente evidencia independiente para sostener la atribución frente a hipótesis alternativas?
6. El salto crítico: de dato a inferencia
Existen cuatro estados que no deben confundirse.
OBSERVACIÓN
La fuente contiene un dato.
ASOCIACIÓN
Dos elementos aparecen relacionados.
INFERENCIA
El analista propone una explicación.
ATRIBUCIÓN
La convergencia de evidencias permite asignar razonablemente una relación.
El error analítico más peligroso consiste en saltar directamente:
observación → atribución.
Entre ambas debe existir razonamiento.
CLAVE DE ANÁLISIS / 02
Un nombre idéntico es una coincidencia.
Un alias reutilizado es un indicador.
Varios indicadores independientes son una convergencia.
Solo una convergencia adecuadamente evaluada puede comenzar a sostener una atribución.
7. Metadatos de imágenes
Una imagen contiene dos realidades.
La primera es visual.
La segunda es informacional.
Determinados formatos pueden conservar datos relativos a:
- dispositivo;
- parámetros de captura;
- fecha;
- orientación;
- software;
- campos descriptivos;
- coordenadas cuando estén presentes.
ExifTool documenta soporte para numerosas familias de metadatos, incluyendo EXIF, GPS, IPTC y XMP.
Pero incluso una imagen completamente desprovista de metadatos puede continuar revelando información mediante:
arquitectura;
paisaje;
meteorología;
reflejos;
idioma;
cartelería;
objetos;
disposición espacial.
Eliminar metadatos reduce una categoría de exposición.
No elimina la capacidad de análisis visual.
8. Metadatos documentales
PDF, documentos ofimáticos, hojas de cálculo y otros formatos pueden incorporar información adicional al contenido visible.
OWASP advierte expresamente de que archivos descargables, como PDF, hojas de cálculo, facturas o informes, pueden contener metadatos sobre el software o las bibliotecas utilizadas para generarlos.
Dependiendo del formato y proceso de creación pueden encontrarse:
autor;
organización;
aplicación;
versiones;
fechas;
comentarios;
propiedades;
nombres internos.
Para una organización esto implica una conclusión importante:
la revisión de documentos públicos debe incluir el contenido visible y su estructura digital.
9. La dimensión temporal
El tiempo es uno de los identificadores indirectos más subestimados.
Una única acción dice poco.
Cientos de acciones pueden formar un patrón.
Un conjunto de publicaciones podría revelar, por ejemplo:
periodos de actividad;
días laborables;
pausas;
cambios de rutina;
franjas horarias predominantes.
El riesgo no reside necesariamente en un timestamp.
Reside en la serie temporal.
Por ello OIDSEC distingue:
EVENT TIME
Momento del hecho.
PUBLICATION TIME
Momento de publicación.
ACQUISITION TIME
Momento en que el investigador obtuvo la evidencia.
VERIFICATION TIME
Última comprobación.
Confundir estas dimensiones puede producir errores significativos.
10. Alias y reutilización de identidad
Un alias puede parecer anónimo.
En realidad funciona frecuentemente como identificador persistente.
Cuanto más tiempo se utiliza, más contexto acumula.
Puede relacionarse con:
idioma;
intereses;
contactos;
horarios;
estilo;
plataformas;
repositorios;
correos.
La cuestión no consiste únicamente en saber si un nombre de usuario es único.
Debe evaluarse qué características convergen alrededor de él.
11. Correo electrónico como pivote
La dirección de correo posee una particular capacidad de correlación porque puede aparecer simultáneamente en:
comunicaciones;
repositorios;
perfiles;
documentos;
servicios;
registros históricos.
Un ejemplo especialmente relevante aparece en repositorios de código.
GitHub explica que los commits realizados desde Git pueden mostrar la dirección configurada para su autor y ofrece direcciones noreply específicamente para quienes desean mantener privada su dirección real. Los commits previos mantienen la dirección con la que fueron creados.
La enseñanza defensiva es clara:
la privacidad debe configurarse antes de generar el histórico.
Sanitizar el presente no elimina automáticamente el pasado.
12. Repositorios de código como fuente de exposición
Un repositorio puede revelar más que código.
Puede revelar:
historial;
cronología;
autores;
ramas;
mensajes;
arquitectura;
dependencias;
nombres internos;
documentación;
correos asociados a commits.
Desde una perspectiva corporativa, los repositorios deberían formar parte de cualquier auditoría de exposición externa.
No porque toda esa información constituya necesariamente una vulnerabilidad.
Sino porque contribuye al contexto de atribución.
13. Dominios e infraestructura
Los dominios han sido históricamente una fuente relevante para análisis de infraestructura.
Existe aquí un cambio técnico importante.
Para los dominios genéricos de primer nivel, ICANN sustituyó WHOIS por RDAP como fuente definitiva de datos de registro desde el 28 de enero de 2025. RDAP ofrece, entre otras capacidades, respuestas estructuradas, internacionalización, descubrimiento autoritativo y mecanismos de acceso diferenciados.
Además, la nueva Registration Data Policy de ICANN entró en vigor para las partes contratadas el 21 de agosto de 2025.
Por tanto, en un análisis profesional actualizado no debería hablarse genéricamente de «consultar WHOIS» como si continuara siendo el mecanismo operativo principal para gTLD.
El concepto actual es:
REGISTRATION DATA → RDAP
14. Lo que un dominio puede relacionar
Sin entrar en procedimientos intrusivos, un dominio puede asociarse conceptualmente con:
registrador;
fechas;
servidores autoritativos;
certificados;
infraestructura;
subdominios públicamente expuestos;
servicios;
historial público.
La importancia no se encuentra necesariamente en un campo.
Se encuentra en la capacidad de reconstruir una topología.
15. DNS como fuente de contexto
El DNS constituye una capa fundamental de Internet y posee importantes consecuencias de privacidad.
RFC 9076 analiza específicamente los riesgos derivados de las consultas DNS y recuerda que prácticamente toda actividad de Internet comienza mediante una consulta de nombres.
Desde un punto de vista defensivo, esto demuestra que:
el contenido cifrado no significa ausencia completa de metadatos.
Las capas de transporte y resolución continúan generando contexto.
16. Dirección IP: indicador, no identidad
Uno de los errores más frecuentes en análisis superficial consiste en tratar una dirección IP como equivalente a una persona.
No lo es.
Una IP representa un elemento de infraestructura o conectividad en un determinado momento.
Puede estar afectada por:
asignación dinámica;
NAT;
VPN;
proxies;
infraestructura compartida;
redes corporativas;
servicios cloud.
Por ello, una IP debe considerarse normalmente un indicador contextual, no una prueba autónoma de identidad.
17. Fingerprinting del navegador
La Web posee otra fuente de correlación: las características observables del cliente.
El W3C publicó en septiembre de 2025 una guía específica destinada a mitigar los riesgos de fingerprinting. El documento distingue fingerprinting pasivo, activo, correlación transitoria y mecanismos similares a cookies, y reconoce que la exposición de características del navegador puede permitir identificar usuarios, dispositivos o correlacionar actividad.
El IETF ya había definido fingerprinting como la utilización de múltiples elementos de información para identificar con suficiente probabilidad una instancia de aplicación o dispositivo.
Esto introduce una idea central:
no existe necesariamente un identificador único.
El identificador puede ser la combinación.
18. Entropía y singularidad
Imaginemos cinco atributos individualmente poco informativos.
Cada uno es compartido por millones de usuarios.
Sin embargo, su combinación puede ser mucho menos frecuente.
El riesgo de fingerprinting aparece precisamente cuando la intersección de atributos reduce progresivamente el conjunto de candidatos.
Por eso una auditoría defensiva no debe preguntar solamente:
¿Este dato me identifica?
Debe preguntar:
¿Cuánto reduce este dato el conjunto de personas que podrían ser yo cuando se combina con otros?
19. Client Hints y exposición
El estándar HTTP Client Hints reconoce explícitamente riesgos de fingerprinting derivados de información que un cliente puede proporcionar sobre sus características.
La implicación metodológica es importante:
cada nueva característica que expone contexto del cliente debe analizarse también como una potencial contribución a la superficie de identificación.
20. Fingerprinting no es necesariamente identificación personal
Debe introducirse aquí una precisión.
Distinguir un navegador de otros navegadores no significa automáticamente conocer el nombre de su propietario.
La correlación puede comenzar como:
DEVICE A = DEVICE A
Posteriormente otra evidencia podría permitir establecer:
DEVICE A ↔ ACCOUNT B
y, finalmente:
ACCOUNT B ↔ PERSON C
La atribución aparece mediante escalones.
21. OIDSEC CORRELATION CHAIN
Proponemos formalizarlo así:
OBSERVABLE
↓
IDENTIFIER
↓
LINK
↓
CLUSTER
↓
HYPOTHESIS
↓
CORROBORATION
↓
ATTRIBUTION
Cada transición necesita evidencia.
No debe suponerse.
22. Grafos: visualización no equivale a demostración
Los grafos son extraordinariamente útiles para representar entidades y relaciones.
Pero presentan un riesgo cognitivo:
una línea parece una prueba.
No necesariamente lo es.
Una arista puede representar:
propiedad;
uso;
aparición conjunta;
mención;
resolución;
similitud;
hipótesis.
Todas son relaciones distintas.
Una arquitectura madura debería asignar semántica explícita a cada vínculo.
23. El problema de los grafos densos
Cuanto más crece un grafo, más conexiones aparecen.
Y cuanto más conexiones aparecen, más fácil resulta encontrar relaciones casuales.
Esto genera el riesgo de:
apofenia analítica.
Encontrar patrones donde únicamente existe ruido.
La protección frente a este problema consiste en trabajar con:
hipótesis;
criterios;
fuentes independientes;
niveles de confianza.
CLAVE DE ANÁLISIS / 03
La existencia de una conexión técnica no demuestra necesariamente una relación significativa.
OSINT profesional no consiste en encontrar enlaces. Consiste en determinar cuáles de esos enlaces merecen significado analítico.
24. Correlación temporal
Dos identidades diferentes pueden presentar patrones temporales similares.
Esto puede constituir un indicador.
Pero rara vez debería considerarse suficiente.
El análisis debería valorar:
frecuencia;
regularidad;
duración;
independencia;
probabilidad de coincidencia.
La combinación de patrones temporales con identificadores técnicos puede incrementar la confianza.
Pero cada elemento debe conservar su propio peso.
25. Correlación lingüística
La escritura también contiene características.
Vocabulario;
construcciones;
errores repetitivos;
puntuación;
preferencias;
expresiones.
Puede existir análisis estilométrico.
Sin embargo, su uso para atribución requiere enorme prudencia.
Las personas modifican su estilo.
Los textos pueden ser editados.
Pueden existir colaboradores.
Los modelos generativos complican todavía más las inferencias.
Por ello debe tratarse como indicador auxiliar, nunca como sustituto de evidencia técnica o documental cuando ésta sea necesaria.
26. Del identificador al cluster
Una investigación madura no intenta primero identificar a una persona.
Primero construye clusters de elementos compatibles.
Por ejemplo:
CLUSTER A
- alias;
- correo;
- repositorio;
- horario;
- dominio.
Posteriormente se pregunta:
¿Existe evidencia suficiente para afirmar que todos esos elementos pertenecen al mismo sujeto?
Este enfoque reduce el sesgo producido por comenzar con una identidad preconcebida.
27. La reidentificación
Uno de los problemas centrales de privacidad consiste en que la eliminación de identificadores directos no garantiza que los datos no puedan volver a relacionarse con una persona.
NIST SP 800-188 aborda específicamente la desidentificación y el riesgo de divulgación/reidentificación, considerando la gestión de ese riesgo parte del proceso.
Esto es fundamental.
Eliminar:
nombre;
correo;
teléfono;
dirección;
puede no ser suficiente si permanecen combinaciones altamente singulares.
28. Pseudonimización no es anonimización
El EDPB diferencia expresamente ambos conceptos.
La pseudonimización reduce la vinculación directa con un individuo, pero mantiene la posibilidad de establecerla mediante información adicional. La anonimización pretende romper esa vinculación de forma efectiva.
Por tanto:
PERSONA → SUBJECT-004
no convierte necesariamente un dataset en anónimo.
Simplemente sustituye el identificador.
29. Riesgo residual
Toda protección debe evaluarse frente a información auxiliar razonablemente disponible.
Una base aparentemente anónima puede ser más identificable cuando se combina con:
registros públicos;
información empresarial;
redes sociales;
publicaciones;
datos geográficos.
El análisis de privacidad debe considerar precisamente esa capacidad de composición.
30. El problema de la información pública auxiliar
Esta cuestión es especialmente relevante para OSINT.
Una organización puede anonimizar una tabla considerando únicamente sus propios datos.
Pero Internet proporciona potencialmente un enorme conjunto de información auxiliar.
Por ello, el análisis debe preguntar:
¿Qué podría ocurrir si este dataset se cruza con información pública externa?
No:
¿Contiene nombres?
La segunda pregunta es demasiado limitada.
31. Web scraping y escala de correlación
El Comité Europeo de Protección de Datos adoptó en julio de 2026 directrices sobre web scraping en el contexto de IA generativa que, a fecha de este informe, permanecen sometidas a consulta pública hasta el 30 de octubre de 2026.
Entre las cuestiones tratadas se encuentran minimización, finalidad, medidas para excluir información innecesaria y evaluación de grandes operaciones de recopilación.
Aunque el documento posee un ámbito específico, ilustra una realidad mucho más amplia:
cuando automatizamos la recopilación, cambiamos la escala del riesgo.
32. Persistencia
Internet posee memoria distribuida.
Eliminar un recurso original no garantiza la desaparición de:
copias;
índices;
cachés;
repositorios;
archivos;
datasets derivados.
Por ello, la privacidad preventiva resulta significativamente más eficaz que intentar reparar posteriormente una exposición ampliamente replicada.
33. El historial importa
Un investigador que audita únicamente el estado actual puede perder elementos esenciales.
La huella digital debe entenderse como una función temporal:
E(t)
donde la exposición actual depende de publicaciones presentes y pasadas.
Una dirección de correo abandonada hace diez años puede continuar vinculando dos contextos actuales.
34. OIDSEC DIGITAL EXPOSURE INDEX — DEI
Para auditorías defensivas proponemos un índice conceptual basado en cinco dimensiones.
Cada dimensión puede puntuarse entre 0 y 4.
E / EXPOSURE
¿Cuánto del dato resulta accesible?
L / LINKABILITY
¿Con cuántos contextos puede relacionarse?
P / PERSISTENCE
¿Cuánto tiempo puede permanecer disponible?
U / UNIQUENESS
¿Cuánto reduce el conjunto de posibles identidades?
S / SENSITIVITY
¿Qué impacto tendría una atribución correcta?
Fórmula
DEI = E + L + P + U + S
Rango:
0–5 / BAJO
6–10 / MODERADO
11–15 / ELEVADO
16–20 / CRÍTICO
Este índice es un modelo metodológico propio de OIDSEC, no un estándar normativo.
Su finalidad consiste en facilitar comparación y priorización.
35. Ejemplo defensivo
Supongamos una organización que publica un informe técnico.
El PDF no contiene información sensible visible.
Sin embargo:
E = 3
Está públicamente accesible.
L = 3
Sus propiedades pueden relacionarse con infraestructura interna.
P = 4
Una vez distribuido, probablemente persistirá.
U = 2
Algunos atributos reducen el conjunto de candidatos.
S = 2
Impacto moderado.
DEI = 14 / ELEVADO
La prioridad no sería retirar necesariamente el informe.
Sería identificar qué componente está generando el riesgo y sanitizar futuros documentos.
36. El principio de reducción de enlace
OIDSEC propone un principio sencillo:
Cuando un dato no pueda eliminarse, debe evaluarse si puede reducirse su capacidad de relacionarse con otros contextos.
Esto puede implicar defensivamente:
separar identidades;
sanitizar documentos;
evitar reutilizaciones;
minimizar metadatos;
revisar repositorios;
controlar publicación.
37. Auditoría de exposición corporativa
Una evaluación profesional debería dividirse en ocho fases.
FASE 0 / AUTORIZACIÓN
Definir exactamente qué activos pueden analizarse.
FASE 1 / INVENTARIO
Identificar activos públicos autorizados.
FASE 2 / OBSERVACIÓN
Registrar lo inmediatamente visible.
FASE 3 / METADATA
Examinar metadatos de material propio autorizado.
FASE 4 / CORRELATION
Determinar qué contextos internos pueden relacionarse entre sí.
FASE 5 / INFERENCE
Evaluar qué información adicional podría razonablemente inferirse.
FASE 6 / RISK
Asignar riesgo.
FASE 7 / REMEDIATION
Reducir exposición.
38. El principio de auditoría propia
El análisis de reidentificación debería realizarse prioritariamente sobre:
datos propios;
entornos de prueba;
datasets sintéticos;
infraestructura autorizada.
La finalidad defensiva no consiste en demostrar que «podemos identificar a alguien».
Consiste en determinar:
«¿qué podría identificar un tercero sobre nosotros?»
Este cambio conceptual convierte OSINT en herramienta de autoprotección.
39. Superficie documental
Una organización debería inventariar:
PDF;
presentaciones;
hojas de cálculo;
plantillas;
informes;
imágenes;
comunicados;
documentos históricos.
OWASP recomienda revisar contenido y metadatos de ficheros para detectar posibles fugas de información.
La revisión debería realizarse antes de publicar.
No después.
40. Superficie de desarrollo
Deberían auditarse:
repositorios;
commits;
correos;
documentación;
issues;
nombres internos;
archivos de configuración expuestos accidentalmente.
GitHub dispone expresamente de mecanismos noreply para proteger el correo utilizado en commits, lo que demuestra que la identidad del autor forma parte de la superficie de privacidad del repositorio.
41. Superficie de infraestructura
Inventario:
dominios;
subdominios;
certificados;
sistemas públicos;
servicios autorizados;
registros RDAP.
Desde 2025, RDAP es el mecanismo de referencia para datos de registro de gTLD, lo que debe reflejarse en metodologías OSINT actualizadas.
42. Superficie humana
El ser humano suele unir sistemas técnicamente separados.
Puede reutilizar:
nombres;
fotografías;
alias;
biografías;
correos;
patrones.
La solución no consiste en prohibir toda presencia pública.
Consiste en diseñarla conscientemente.
43. Riesgo de ingeniería social
Una identidad digital bien reconstruida puede mejorar significativamente la credibilidad de un intento de engaño.
Cuanto más contexto conoce un adversario, más plausible puede resultar una comunicación fraudulenta.
Por ello, la reducción de exposición pública debe considerarse también una medida preventiva frente a determinadas formas de ingeniería social.
44. Matriz de riesgos
| Vector | Probabilidad | Impacto | Riesgo |
|---|---|---|---|
| Metadatos documentales | Alta | Medio | Alto |
| Reutilización de alias | Alta | Alto | Crítico |
| Correo expuesto en repositorios | Media | Alto | Alto |
| Correlación temporal | Media | Medio | Medio |
| Fingerprinting de navegador | Media | Medio | Medio |
| Infraestructura relacionable | Media | Alto | Alto |
| Reidentificación de datasets | Baja/Media | Muy alto | Alto |
| Documentos históricos | Alta | Medio | Alto |
| Grafos mal interpretados | Media | Alto | Alto |
| Publicación de inferencias incorrectas | Media | Muy alto | Crítico |
45. Riesgo analítico: el falso positivo
Una atribución incorrecta puede producir daños muy superiores a la ausencia de atribución.
Por ello:
precisión > espectacularidad
Un informe profesional debe diferenciar claramente:
FACT
OBSERVATION
ASSESSMENT
INFERENCE
HYPOTHESIS
UNKNOWN
46. Niveles de confianza OIDSEC
VERY HIGH
Evidencia directa y múltiples corroboraciones independientes.
HIGH
Convergencia fuerte con pocas explicaciones alternativas plausibles.
MODERATE
Evidencia consistente pero incompleta.
LOW
Indicadores parciales o correlaciones débiles.
UNASSESSED
No existe base suficiente.
El lenguaje del informe debe reflejar esa incertidumbre.
47. La incertidumbre forma parte de la inteligencia
Decir:
«No puede determinarse con la evidencia disponible»
no constituye fracaso.
Puede constituir la conclusión técnicamente correcta.
Una cultura de inteligencia madura recompensa la precisión.
No la seguridad retórica.
48. Sanitización de fotografías
Antes de publicar material corporativo debe evaluarse:
contenido visual;
metadatos;
personas secundarias;
pantallas;
documentos;
reflejos;
identificadores;
entorno.
Eliminar EXIF sin revisar la fotografía sería insuficiente.
49. Sanitización documental
Un Publication Gate debería comprobar:
CONTENIDO
¿Existe información visible innecesaria?
METADATA
¿Permanece información interna?
NOMBRES
¿Aparecen autores no previstos?
VERSIÓN
¿El fichero contiene revisiones?
ADJUNTOS
¿Existen objetos incrustados?
FILENAME
¿El nombre revela información interna?
CONTEXTO
¿El documento permite relacionarse con otro activo?
50. Política de repositorios
Una organización debería definir:
direcciones autorizadas de autor;
política de privacidad del correo;
identidades corporativas;
nombres de repositorio;
información prohibida;
secret scanning;
revisión previa a publicación.
El objetivo no consiste en eliminar trazabilidad.
Consiste en que la trazabilidad sea intencionada.
51. Política de dominios
Inventariar:
dominios activos;
dominios históricos relevantes;
registradores;
DNS;
certificados;
responsables;
finalidad.
La existencia de infraestructura desconocida para la propia organización constituye por sí sola un riesgo de gobierno.
52. Browser exposure review
La guía del W3C de 2025 sobre fingerprinting recomienda identificar y reducir la superficie observable susceptible de contribuir a identificación o correlación.
Para una organización, esto se traduce defensivamente en:
comprender qué información proporciona el entorno;
evitar personalizaciones innecesariamente singulares en contextos sensibles;
separar perfiles incompatibles;
reducir extensiones innecesarias;
aplicar navegación adecuada al modelo de amenaza.
53. Reducción frente a ocultación
Existe una diferencia conceptual importante.
Ocultar pretende evitar que un dato sea visto.
Reducir pretende disminuir cuánto puede inferirse.
La privacidad moderna necesita ambas estrategias.
No todo puede ocultarse.
Pero muchas exposiciones pueden hacerse menos correlacionables.
54. Gestión del ciclo de vida
Cada identidad digital posee un ciclo.
CREATE
↓
USE
↓
CORRELATE
↓
MAINTAIN
↓
RETIRE
El error más frecuente aparece en el último punto.
Una identidad abandonada no deja necesariamente de existir.
Continúa formando parte del histórico.
55. Legacy Exposure
OIDSEC denomina Legacy Exposure a información antigua que continúa afectando a la identidad presente.
Ejemplos:
correo histórico;
antiguo dominio;
documento archivado;
repositorio olvidado;
biografía anterior;
perfil abandonado.
La auditoría debe mirar hacia atrás.
No únicamente al estado actual.
56. Modelo temporal de exposición
Podemos representar conceptualmente la exposición como:
R(t) = V + M + C + I + H
donde:
V = visible
M = metadata
C = correlatable
I = inferred
H = historical
El riesgo no es estático.
Evoluciona.
57. Publication Gate OIDSEC
Antes de publicar cualquier documento:
PG-01 / CONTENT
Revisión editorial.
PG-02 / METADATA
Revisión técnica.
PG-03 / PERSONAL DATA
Minimización.
PG-04 / INFRASTRUCTURE
Eliminación de referencias innecesarias.
PG-05 / CORRELATION
Evaluación de posibles enlaces imprevistos.
PG-06 / LEGAL
Revisión jurídica cuando proceda.
PG-07 / ARCHIVE
Conservar versión aprobada.
58. Remediación
Las prioridades deberían establecerse según:
impacto × correlacionabilidad × persistencia
No toda exposición necesita eliminación inmediata.
Algunas necesitan:
corrección;
segmentación;
seudonimización;
sustitución;
sanitización;
retirada;
monitorización.
59. Plan 0–30 días
Inventario
Identidades.
Dominios.
Repositorios.
Documentos.
Perfiles.
Contención
Eliminar exposiciones evidentes de alto impacto.
Configuración
Revisar privacidad de commits y cuentas.
Publicación
Implementar Publication Gate.
60. Plan 31–90 días
Análisis histórico
Buscar Legacy Exposure.
Correlación
Identificar identificadores reutilizados.
Infraestructura
Actualizar inventario RDAP/DNS autorizado.
Documentación
Automatizar revisión de metadatos donde resulte viable.
Formación
Capacitar a personal expuesto.
61. Plan 91–180 días
Métricas
Implementar DEI.
Monitorización
Controlar nuevas exposiciones.
Procesos
Integrar privacidad en desarrollo y comunicación.
Validación
Repetir auditoría.
Gobierno
Presentar resultados a dirección.
62. KPIs y KRIs
KPI
% de documentos sometidos a Publication Gate
% de repositorios con política de identidad
% de activos públicos inventariados
% de identidades críticas auditadas
% de hallazgos críticos corregidos
KRI
número de alias reutilizados
número de correos personales visibles
número de documentos con metadatos innecesarios
número de activos no inventariados
número de correlaciones críticas
63. Modelo de madurez OIDSEC — Digital Exposure
LEVEL 0 / UNKNOWN
La organización desconoce su exposición.
LEVEL 1 / VISIBLE
Se revisan únicamente perfiles y contenido.
LEVEL 2 / TECHNICAL
Se incluyen metadatos e infraestructura.
LEVEL 3 / CORRELATED
Se analiza cómo se relacionan los activos.
LEVEL 4 / PREDICTIVE
Se evalúa qué podría inferirse.
LEVEL 5 / MANAGED
La exposición forma parte del gobierno continuo del riesgo.
64. Pseudonimización como salvaguarda
Las directrices del EDPB de 2025 refuerzan la consideración de la pseudonimización como una salvaguarda relevante, pero no equivalente a anonimización.
Esto puede aplicarse internamente en investigación:
John Smith
puede convertirse durante fases analíticas en:
SUBJECT-017
manteniendo la tabla de correspondencia separada.
La finalidad:
reducir exposición accidental.
65. Desidentificación y utilidad
Eliminar toda información hasta hacer imposible cualquier análisis tampoco es una solución práctica.
NIST SP 800-188 plantea precisamente el equilibrio entre reducir riesgo de divulgación y conservar utilidad analítica.
Éste es el verdadero problema:
privacy–utility trade-off.
La cuestión no es conservarlo todo o eliminarlo todo.
Es conservar lo mínimo necesario para el propósito legítimo.
66. Protección de datos
Cuando el proceso implique tratamiento de datos personales dentro del ámbito del RGPD deben considerarse, entre otros, los principios de:
licitud;
limitación de finalidad;
minimización;
exactitud;
limitación de conservación;
integridad;
confidencialidad;
responsabilidad.
La pseudonimización y la protección desde el diseño pueden constituir salvaguardas relevantes según el contexto.
La accesibilidad pública de un dato no elimina automáticamente estas consideraciones.
67. Ética de la correlación
La posibilidad técnica de realizar una inferencia no implica necesariamente que sea necesario hacerla.
Un investigador responsable debe preguntarse:
¿Es relevante?
¿Es proporcional?
¿Es necesario?
¿Es verificable?
¿Qué consecuencias tendría equivocarme?
La última pregunta es crucial.
68. La asimetría del error
En atribución existen dos errores:
FALSE NEGATIVE
No identificar una relación verdadera.
FALSE POSITIVE
Atribuir una relación inexistente.
Dependiendo del contexto, el segundo puede resultar mucho más dañino.
Por ello, una investigación que afecte a reputación o derechos debe elevar extraordinariamente su umbral de atribución.
69. Criterio de publicación
OIDSEC propone que una inferencia sensible no se publique únicamente porque sea interesante.
Debe ser:
relevante
necesaria
corroborada
proporcionada
expresada con su nivel de confianza
70. Caso conceptual: el ejecutivo aparentemente invisible
Consideremos un escenario exclusivamente ilustrativo.
Un ejecutivo mantiene perfiles públicos muy reducidos.
Podría concluir que posee una huella digital mínima.
Sin embargo, una auditoría autorizada identifica:
un antiguo documento;
un repositorio corporativo;
un dominio relacionado con un proyecto;
un patrón de alias histórico;
varias fotografías profesionales.
Ningún elemento contiene por sí solo información crítica.
Pero al construir el grafo aparecen relaciones entre:
identidad;
organización;
infraestructura;
actividad.
El hallazgo fundamental no es ningún dato concreto.
Es la estructura.
Ese es precisamente el objeto del análisis de exposición digital.
71. Qué debe entregar un informe a cliente
Un informe profesional no debería entregar simplemente una colección de hallazgos.
Debería entregar:
ASSET
Qué activo se analiza.
FINDING
Qué se observó.
SOURCE
De dónde procede.
CONFIDENCE
Qué confianza merece.
EXPOSURE
Qué permite conocer.
CORRELATION
Con qué puede relacionarse.
IMPACT
Qué riesgo genera.
REMEDIATION
Qué debe hacerse.
PRIORITY
Cuándo.
72. Formato de hallazgo OIDSEC
FINDING / DE-017
Título: Dirección histórica reutilizada entre contextos.
Nivel: Alto.
Fuente: repositorio autorizado + activo corporativo.
Confianza: Alta.
Impacto: permite relacionar dos contextos previamente separados.
DEI: 16/20.
Recomendación: evitar reutilización futura y revisar histórico.
Este formato convierte OSINT en gestión de riesgo.
73. De la investigación a la gobernanza
El verdadero objetivo de un programa de exposición digital no es realizar una auditoría cada cinco años.
Debe introducir controles en:
comunicación;
recursos humanos;
desarrollo;
seguridad;
dominios;
publicaciones;
relaciones públicas;
investigación.
La privacidad de una organización es una propiedad del sistema.
No de un departamento.
74. La nueva frontera: inferencia
Durante años, la protección de la privacidad se concentró principalmente en el acceso a los datos.
El problema moderno incluye además:
qué puede inferirse a partir de datos legítimamente disponibles.
Eso obliga a cambiar de paradigma.
De:
proteger secretos
a:
gestionar capacidad de inferencia.
CLAVE DE ANÁLISIS / 04
Una organización puede no sufrir ninguna filtración de datos y, sin embargo, exponer demasiada información.
No hace falta perder una base de datos para perder privacidad. A veces basta con publicar durante años pequeñas piezas perfectamente legítimas que terminan formando una imagen completa.
75. De-identification stress test
En datasets propios o autorizados puede resultar útil realizar una prueba defensiva:
Paso conceptual 1
Eliminar identificadores directos.
Paso conceptual 2
Evaluar atributos restantes.
Paso conceptual 3
Determinar cuáles son altamente singulares.
Paso conceptual 4
Considerar información pública auxiliar.
Paso conceptual 5
Estimar riesgo residual.
NIST SP 800-188 proporciona un marco de referencia específicamente orientado a gestionar riesgos de reidentificación en procesos de desidentificación.
76. El principio de composición
La privacidad de un dato no puede evaluarse completamente fuera del ecosistema en el que existe.
Podemos formularlo:
El riesgo de un dato es función tanto de su contenido como de los datos con los que puede combinarse.
Esta es probablemente la idea más importante del presente informe.
77. OIDSEC Exposure Triangle
Todo riesgo significativo de exposición puede analizarse mediante tres variables:
VISIBILITY
¿Puede obtenerse?
LINKABILITY
¿Puede relacionarse?
CONSEQUENCE
¿Qué ocurre si se relaciona?
Una información muy visible pero no correlacionable puede generar poco riesgo.
Una información poco visible pero extremadamente correlacionable puede generar mucho.
78. Recomendaciones estratégicas para dirección
1. Tratar la exposición digital como riesgo corporativo.
No como problema exclusivo de redes sociales.
2. Auditar históricos.
La exposición heredada puede superar la actual.
3. Revisar documentos antes de publicación.
Visible + metadata.
4. Establecer políticas de identidad.
Especialmente en desarrollo y comunicación.
5. Mantener inventario de infraestructura.
Dominios, repositorios y activos.
6. Aplicar minimización.
Publicar únicamente aquello que cumple una finalidad.
7. Evaluar correlación.
No solo elementos aislados.
8. Implantar un Publication Gate.
Toda publicación importante debería pasar por revisión.
9. Medir.
Sin métricas no existe gobierno.
10. Repetir.
La exposición cambia continuamente.
79. Preguntas para un comité ejecutivo
Un consejo de dirección debería poder responder:
¿Sabemos qué información pública existe sobre nuestra organización?
¿Sabemos qué información puede inferirse?
¿Conocemos nuestros dominios y repositorios históricos?
¿Revisamos metadatos antes de publicar?
¿Nuestros desarrolladores conocen la exposición asociada a commits?
¿Conocemos qué directivos presentan mayor superficie digital?
¿Tenemos un procedimiento para reducir exposición?
¿Medimos si estamos mejorando?
Si la respuesta mayoritaria es negativa:
la organización no controla realmente su huella digital.
Solo controla una parte visible de ella.
80. Conclusión
La identidad digital del siglo XXI no se encuentra almacenada en un único lugar.
Está fragmentada.
Una parte se encuentra en nuestras publicaciones.
Otra en los documentos.
Otra en nuestros dispositivos.
Otra en los servicios que utilizamos.
Otra en los repositorios.
Otra en la infraestructura.
Otra en el tiempo.
Otra en las relaciones.
Y una última parte —quizá la más importante— no existe hasta que alguien decide correlacionar las anteriores.
Ésa es la huella invisible.
La capacidad de inteligencia de fuentes abiertas ha demostrado que información aparentemente trivial puede adquirir un significado radicalmente diferente cuando se incorpora a un contexto analítico.
Pero esa misma capacidad obliga a desarrollar una disciplina de prudencia.
La correlación puede descubrir.
También puede equivocarse.
Puede verificar.
También puede sobreinterpretar.
Puede proteger.
También puede invadir.
La diferencia entre inteligencia profesional y simple acumulación de información reside en:
método, proporcionalidad, trazabilidad y juicio analítico.
El análisis moderno de exposición debe abandonar definitivamente la pregunta:
«¿Qué información sobre nosotros aparece en Google?»
Es insuficiente.
La pregunta adecuada es:
«¿Qué conocimiento puede construir un tercero razonablemente competente cuando combina nuestra información visible, nuestros metadatos, nuestra infraestructura, nuestro histórico y nuestros patrones?»
NIST demuestra que eliminar identificadores directos no agota el problema de la reidentificación.
El EDPB diferencia claramente pseudonimización y anonimización.
El IETF reconoce la correlación y el fingerprinting como problemas fundamentales de privacidad.
El W3C continúa desarrollando en 2025 orientaciones específicas destinadas a reducir la superficie de fingerprinting de la Web.
ICANN ha transformado además el acceso a información de registro de dominios mediante la transición definitiva de WHOIS a RDAP para gTLD.
Todas estas evoluciones apuntan en la misma dirección:
la privacidad ya no puede comprenderse únicamente como control de datos individuales.
Debe comprenderse como control de relaciones entre datos.
Por eso, el activo que debe proteger una organización no es exclusivamente su información confidencial.
Debe proteger también:
su contexto;
sus asociaciones;
su histórico;
sus patrones;
su capacidad de ser inferida.
El objetivo último no consiste en eliminar toda presencia digital.
Eso sería incompatible con la actividad contemporánea.
Consiste en conseguir que esa presencia sea:
consciente, proporcional, gobernada y resistente a correlaciones innecesarias.
En definitiva:
La verdadera huella digital no es lo que dejamos en Internet.
Es lo que Internet permite reconstruir a partir de aquello que dejamos.
OIDSEC DIGITAL EXPOSURE MODEL — RESUMEN
| Nivel | Concepto | Pregunta |
| DEM-01 | Visible | ¿Qué hemos publicado? |
| DEM-02 | Metadata | ¿Qué acompaña a lo publicado? |
| DEM-03 | Correlatable | ¿Qué puede relacionarse? |
| DEM-04 | Inferred | ¿Qué puede deducirse? |
| DEM-05 | Attributable | ¿Qué puede atribuirse con suficiente confianza? |
CHECKLIST EJECUTIVO DE EXPOSICIÓN DIGITAL
- Inventario de identidades públicas.
- Inventario de dominios.
- Inventario de repositorios.
- Revisión de correo en commits.
- Auditoría de documentos.
- Auditoría de imágenes.
- Revisión de metadatos.
- Revisión de activos históricos.
- Evaluación RDAP.
- Evaluación DNS autorizada.
- Análisis de identificadores reutilizados.
- Revisión de perfiles abandonados.
- Evaluación de correlacionabilidad.
- Evaluación de inferencias posibles.
- Aplicación del índice DEI.
- Priorización de remediaciones.
- Publication Gate implantado.
- Política de minimización definida.
- Política de identidad para repositorios.
- Revisión periódica programada.
FUENTES PRIMARIAS Y DOCUMENTACIÓN TÉCNICA
National Institute of Standards and Technology — NIST
NIST SP 800-188 — De-Identifying Government Data Sets.
Referencia para procesos de desidentificación y evaluación del riesgo de divulgación y reidentificación.
European Data Protection Board — EDPB
Guidelines 01/2025 on Pseudonymisation.
Diferenciación entre pseudonimización, datos pseudonimizados y medidas destinadas a reducir vinculación con una persona.
Anonymisation / Pseudonymisation.
Referencia conceptual actual del EDPB sobre diferenciación entre ambas técnicas.
Guidelines 03/2026 — Web scraping in the context of generative AI.
Documento adoptado en julio de 2026 y sometido, en el momento de este informe, a consulta pública hasta el 30 de octubre de 2026.
Internet Engineering Task Force — IETF
RFC 6973 — Privacy Considerations for Internet Protocols.
Referencia fundamental para conceptos como correlación, fingerprinting y amenazas de privacidad.
RFC 9076 — DNS Privacy Considerations.
Análisis de implicaciones de privacidad derivadas del sistema de resolución DNS.
RFC 8942 — HTTP Client Hints.
Incluye consideraciones específicas relativas al aumento potencial de superficie de fingerprinting.
World Wide Web Consortium — W3C
Mitigating Browser Fingerprinting in Web Specifications — 2025.
Guía de la Privacy Working Group sobre fingerprinting activo, pasivo, correlación y mitigación de superficie identificable.
ICANN
Registration Data Access Protocol — RDAP.
RDAP constituye el sistema sucesor de WHOIS para el acceso a datos de registro.
Launching RDAP; Sunsetting WHOIS — 2025.
Desde el 28 de enero de 2025 RDAP constituye la fuente definitiva de información de registro de gTLD en sustitución de WHOIS.
Registration Data Policy.
Política efectiva desde el 21 de agosto de 2025 para partes contratadas.
GitHub
Setting your commit email address.
Documentación sobre asociación de direcciones de correo con commits y utilización de direcciones noreply para preservar privacidad.
ExifTool
ExifTool Technical Documentation.
Referencia técnica para lectura y tratamiento de EXIF, GPS, IPTC, XMP y numerosas familias adicionales de metadatos.
OWASP
Web Security Testing Guide — Information Leakage.
Documentación sobre filtraciones de información mediante contenido web y metadatos incorporados en ficheros generados.
NOTA METODOLÓGICA, ÉTICA Y JURÍDICA
El presente documento tiene carácter académico, técnico y defensivo.
Las técnicas de correlación e identificación digital deben emplearse exclusivamente dentro de un marco legítimo y proporcional.
La existencia pública de determinada información no elimina automáticamente las obligaciones legales relacionadas con su tratamiento, agregación, conservación o difusión.
Las evaluaciones destinadas a medir exposición o riesgo deberían realizarse preferentemente sobre:
activos propios;
infraestructura autorizada;
datasets legítimamente accesibles;
información necesaria para la finalidad definida.
Cuando una investigación pueda afectar significativamente a derechos de terceros, producir perfiles personales o generar atribuciones sensibles, deberán extremarse:
verificación;
minimización;
fundamento jurídico;
revisión humana;
proporcionalidad;
prudencia en la publicación.
OIDSEC / OBSERVATORIO DE INVESTIGACIÓN DIGITAL
OSINT · PRIVACIDAD · CIBERINTELIGENCIA · IDENTIDAD DIGITAL · MÉTODO
No protegemos únicamente aquello que sabemos que hemos publicado. Debemos proteger también aquello que otros pueden aprender cuando relacionan las piezas.

