OSINT y privacidad: investigar sin perder el control de los datos
Inteligencia de fuentes abiertas, minimización, trazabilidad y protección de la información en un ecosistema digital caracterizado por la sobreexposición de datos
FICHA DE ANÁLISIS
ÁREA / OSINT & PRIVACIDAD
TIPO / ANÁLISIS TÉCNICO
NIVEL / AVANZADO
MÉTODO / INTELIGENCIA DE FUENTES ABIERTAS Y ANÁLISIS DOCUMENTAL
ENFOQUE / MINIMIZACIÓN · TRAZABILIDAD · OPSEC · PROTECCIÓN DE DATOS
FUENTES / UE · AEPD · EDPB · NIST
OIDSEC / OBSERVATORIO DE INVESTIGACIÓN DIGITAL
Resumen ejecutivo
La inteligencia de fuentes abiertas —Open Source Intelligence, OSINT— suele asociarse a la capacidad de localizar información públicamente accesible: perfiles sociales, documentos, dominios, imágenes, infraestructuras expuestas, repositorios, publicaciones, registros técnicos o metadatos.
Esa definición resulta insuficiente.
La dificultad contemporánea del OSINT ya no consiste exclusivamente en encontrar información, sino en determinar qué información debe obtenerse, cómo debe verificarse, qué relaciones pueden establecerse legítimamente entre diferentes conjuntos de datos, durante cuánto tiempo es razonable conservarlos y qué parte de todo lo recopilado resulta realmente necesaria para responder a una necesidad de inteligencia.
El crecimiento exponencial de información disponible obliga a introducir una disciplina adicional: la minimización.
El Reglamento General de Protección de Datos europeo establece, entre sus principios fundamentales, la limitación de la finalidad, minimización, exactitud, limitación del plazo de conservación, integridad, confidencialidad y responsabilidad proactiva. Estos principios tienen una relación directa con cualquier metodología OSINT que implique tratamiento de datos personales.
La cuestión fundamental deja entonces de ser:
¿Cuánto puedo descubrir?
y pasa a ser:
¿Qué necesito realmente conocer para responder con rigor a mi pregunta de investigación?
Esta diferencia separa la simple acumulación de datos de una auténtica metodología de inteligencia.
CLAVE DE ANÁLISIS / 01
Que una información pueda encontrarse públicamente no significa que carezca de implicaciones de privacidad ni que cualquier tratamiento posterior resulte automáticamente justificable. Accesibilidad, necesidad, proporcionalidad y finalidad son conceptos distintos.
1. OSINT no es buscar: es producir inteligencia
Uno de los errores más frecuentes consiste en identificar OSINT con herramientas de búsqueda.
Los buscadores avanzados, repositorios, APIs, servicios de análisis de infraestructura, motores de búsqueda de dispositivos, consultas DNS, bases documentales, redes sociales o sistemas de análisis gráfico son instrumentos de adquisición.
La inteligencia aparece posteriormente.
Un proceso OSINT riguroso debería comprender, al menos:
Dirección → Obtención → Procesamiento → Verificación → Análisis → Correlación → Evaluación → Difusión → Retención o eliminación.
Esta distinción resulta esencial.
Una dirección IP constituye un dato.
Un nombre de dominio constituye un dato.
Una fotografía constituye un dato.
Un nombre de usuario constituye un dato.
Una localización constituye un dato.
Un certificado TLS constituye un dato.
Una publicación en una red social constituye un dato.
La inteligencia comienza cuando esos elementos son evaluados dentro de un contexto, contrastados con fuentes independientes y utilizados para responder a una pregunta previamente formulada.
Por tanto:
dato ≠ información contextualizada ≠ inteligencia.
Una investigación puede reunir cientos de miles de registros y producir muy poca inteligencia.
Otra puede trabajar con veinte evidencias correctamente seleccionadas, verificadas y contextualizadas y alcanzar conclusiones mucho más sólidas.
La calidad de una investigación OSINT no debería medirse por el tamaño de su base de datos.
Debe medirse por la calidad de su razonamiento.
2. La paradoja del dato público
Internet ha generado una falsa equivalencia:
público = libre de consecuencias.
No es así.
Una persona puede publicar voluntariamente una fotografía, una ubicación, una trayectoria profesional o determinada información biográfica. Pero la posibilidad técnica de consultar esa información no determina por sí sola todos los usos posteriores que puedan realizarse sobre ella.
El RGPD regula también situaciones en las que los datos personales no se obtienen directamente de la persona afectada, incluyendo información procedente de fuentes accesibles públicamente.
Esto introduce una distinción especialmente importante para OSINT:
visibilidad no equivale a ausencia de protección.
Una información puede ser:
- públicamente visible;
- indexada por un buscador;
- accesible sin autenticación;
- técnicamente extraíble;
- susceptible de automatización;
y seguir requiriendo una evaluación de finalidad, necesidad y proporcionalidad cuando se convierte en objeto de tratamiento sistemático.
Esta cuestión adquiere especial relevancia cuando se produce agregación.
3. El efecto mosaico: cuando datos insignificantes dejan de serlo
Uno de los mayores poderes del OSINT reside precisamente en combinar información.
Consideremos un ejemplo hipotético.
Una publicación profesional permite conocer dónde trabaja una persona.
Una fotografía revela parcialmente un edificio.
Los metadatos históricos de otra imagen permiten identificar una ciudad.
Un documento indexado contiene un correo electrónico.
Un registro de dominio relaciona ese correo con determinada infraestructura.
Una publicación social revela un horario habitual.
Una segunda plataforma utiliza el mismo alias.
Ninguno de estos elementos puede resultar especialmente sensible analizado aisladamente.
La correlación de todos ellos puede producir un perfil extraordinariamente preciso.
Este fenómeno puede describirse como efecto mosaico: fragmentos aparentemente inconexos adquieren un significado completamente distinto cuando son combinados.
Desde una perspectiva de privacidad, esto significa que el riesgo no depende exclusivamente de la sensibilidad individual de cada dato.
Depende también de lo que pueda inferirse mediante su agregación.
CLAVE DE ANÁLISIS / 02
En OSINT, el dato más sensible no siempre es el que se obtiene directamente. Con frecuencia es el dato nuevo que aparece después de correlacionar varios datos aparentemente inocuos.
4. La regla fundamental: necesidad antes que capacidad
Las herramientas actuales permiten recopilar una cantidad de información muy superior a la que normalmente necesita una investigación.
Por ello, la pregunta:
¿Puedo obtener este dato?
resulta metodológicamente secundaria.
La pregunta correcta es:
¿Necesito este dato?
El principio de minimización contenido en el artículo 5 del RGPD exige que los datos personales sean adecuados, pertinentes y limitados a lo necesario para la finalidad perseguida.
La AEPD desarrolla además la protección de datos por defecto precisamente desde esta perspectiva: configurar los tratamientos para que únicamente se procesen los datos necesarios para los fines previamente definidos.
Trasladado a inteligencia:
no debe recopilarse información simplemente porque existe la capacidad técnica para hacerlo.
Debe existir una relación clara entre el dato obtenido y el requerimiento de inteligencia.
5. El requerimiento de inteligencia
Una investigación OSINT profesional no debería comenzar escribiendo un nombre en un buscador.
Debería comenzar redactando una pregunta.
Una formulación deficiente sería:
Averiguar todo lo posible sobre la organización X.
Una formulación mucho más útil sería:
Identificar y documentar la infraestructura digital públicamente atribuible a la organización X durante el periodo comprendido entre determinadas fechas, utilizando exclusivamente fuentes abiertas verificables.
La diferencia es enorme.
La segunda formulación establece:
- objeto;
- finalidad;
- límite temporal;
- naturaleza de las fuentes;
- criterio de atribución;
- alcance.
Todo aquello que no contribuya a responder esa pregunta puede considerarse inicialmente irrelevante.
La privacidad comienza, por tanto, antes de abrir el navegador.
6. Data mapping previo a la investigación
Antes de comenzar una operación compleja resulta conveniente elaborar un pequeño mapa de datos.
Puede incluir:
Fuentes previstas
- motores de búsqueda;
- registros públicos;
- repositorios documentales;
- redes sociales;
- servicios DNS;
- certificados;
- sistemas de archivo web;
- repositorios de código;
- plataformas de análisis de infraestructura;
- imágenes;
- bases académicas;
- documentación institucional.
Categorías de datos previsibles
- nombres;
- organizaciones;
- identificadores;
- direcciones de correo;
- dominios;
- IP;
- ubicaciones;
- fechas;
- imágenes;
- relaciones;
- dispositivos;
- infraestructura.
Datos necesarios
Deben definirse en función del requerimiento.
Datos excluidos
También deben definirse.
Esta última categoría es especialmente importante.
Una metodología madura no establece únicamente qué quiere obtener.
Establece también qué no quiere obtener.
7. Separar colección e inteligencia
Una arquitectura OSINT profesional debería diferenciar claramente tres capas.
CAPA 01 / RAW DATA
Material original obtenido desde las fuentes.
Puede incluir:
- documentos;
- capturas;
- JSON;
- HTML;
- imágenes;
- registros;
- resultados de API;
- cabeceras;
- metadatos.
Esta capa debería modificarse lo mínimo posible.
Su finalidad es preservar la procedencia.
CAPA 02 / ANALYTICAL DATA
Información normalizada y seleccionada.
Aquí pueden encontrarse:
- entidades;
- relaciones;
- identificadores normalizados;
- fechas;
- indicadores;
- hipótesis;
- niveles de confianza.
CAPA 03 / INTELLIGENCE PRODUCT
Es el informe.
No debería contener automáticamente todo lo recopilado.
Debe contener exclusivamente la información necesaria para comprender y justificar las conclusiones.
Esta separación reduce el riesgo de transformar un informe público en un vertedero de información personal innecesaria.
8. Procedencia: saber de dónde salió cada dato
Uno de los pilares de una investigación reproducible es la provenance o procedencia.
Cada evidencia relevante debería poder responder a preguntas como:
¿Dónde fue obtenida?
¿Cuándo?
¿Mediante qué procedimiento?
¿Era una fuente primaria o secundaria?
¿Ha sido modificada?
¿Quién realizó la adquisición?
¿Qué nivel de confianza posee?
Un esquema elemental podría ser:
SOURCE_ID
SOURCE_URL
ACQUISITION_DATE
COLLECTOR
SOURCE_TYPE
HASH
RELIABILITY
CONFIDENCE
NOTES
No todos los campos serán necesarios en todas las investigaciones, pero el principio es esencial:
un dato sin procedencia pierde gran parte de su valor probatorio y analítico.
9. Hash e integridad
Cuando una investigación necesita preservar determinados archivos como evidencia, puede resultar útil generar una huella criptográfica.
Por ejemplo:
SHA-256(documento.pdf)
El hash no demuestra que el contenido sea verdadero.
Demuestra otra cosa:
que el fichero del que se calculó aquella huella puede compararse posteriormente para determinar si ha sufrido modificaciones.
Esta distinción es importante.
Integridad no equivale a autenticidad.
Un documento falso puede conservar perfectamente su integridad.
La autenticidad debe evaluarse mediante otros elementos.
10. Exactitud: Internet recuerda incluso lo que dejó de ser verdad
Internet contiene información:
- antigua;
- duplicada;
- descontextualizada;
- incorrecta;
- deliberadamente falsa;
- abandonada;
- reutilizada;
- atribuida a homónimos.
El RGPD incluye la exactitud entre sus principios generales.
En OSINT esto coincide plenamente con una exigencia analítica.
Una evidencia puede haber sido correctamente recogida y continuar siendo incorrecta.
Por ello conviene diferenciar siempre:
FECHA DEL HECHO
FECHA DE PUBLICACIÓN
FECHA DE ADQUISICIÓN
FECHA DE ÚLTIMA VERIFICACIÓN
Una publicación de 2017 encontrada en 2026 no describe necesariamente una realidad de 2026.
11. Identity resolution: identificar no es encontrar coincidencias
Uno de los mayores peligros del OSINT automatizado reside en la resolución de identidades.
Encontrar el mismo alias en dos plataformas no demuestra que pertenezcan a la misma persona.
Encontrar dos personas con idéntico nombre tampoco.
Del mismo modo:
una IP puede estar compartida;
un número telefónico puede cambiar de titular;
un dominio puede cambiar de propietario;
una cuenta puede ser transferida;
una imagen puede reutilizarse;
un correo puede quedar abandonado.
La atribución requiere corroboración.
Podemos expresar diferentes grados de confianza:
CONFIRMADO
Existe evidencia directa o múltiples evidencias independientes consistentes.
ALTA CONFIANZA
Las evidencias convergen fuertemente, aunque no existe confirmación absoluta.
CONFIANZA MEDIA
Existen indicadores consistentes pero permanecen explicaciones alternativas.
BAJA CONFIANZA
La relación constituye principalmente una hipótesis.
Este lenguaje es más profesional que presentar todas las conexiones como certezas.
CLAVE DE ANÁLISIS / 03
Correlación no significa causalidad y coincidencia no significa identidad.
Una herramienta puede encontrar relaciones. Corresponde al analista determinar qué significan realmente.
12. Los grafos y la ilusión de certeza
Las herramientas de análisis de relaciones permiten representar:
personas → dominios → correos → organizaciones → IP → ubicaciones → perfiles.
El resultado puede ser visualmente extraordinario.
Precisamente por eso puede resultar peligroso.
Una línea dibujada entre dos nodos produce psicológicamente una sensación de relación demostrada.
Sin embargo, cada arista debería responder a una definición concreta:
OWNS
RESOLVES_TO
REGISTERED_BY
MENTIONED_IN
USES
CLAIMS
OBSERVED_WITH
POSSIBLY_ASSOCIATED
La ontología importa.
Si todas las conexiones significan simplemente «relacionado con», el grafo pierde precisión analítica.
Y desde la perspectiva de privacidad aparece otro problema:
la expansión infinita.
Que un individuo esté relacionado con una organización investigada no significa que resulte necesario investigar también a:
su pareja,
sus hijos,
sus compañeros,
sus amigos,
sus contactos profesionales,
los contactos de esos contactos.
Debe existir un punto de detención.
13. Web scraping: cuando cambia la escala cambia el riesgo
La consulta manual y la recolección automatizada no presentan la misma escala.
El scraping introduce:
- velocidad;
- repetibilidad;
- volumen;
- persistencia;
- correlación automatizada.
Ese cambio cuantitativo puede convertirse en un cambio cualitativo.
Consultar veinte perfiles manualmente y construir automáticamente un dataset con cientos de miles de individuos no son operaciones equivalentes desde la perspectiva del riesgo.
La protección de datos desde el diseño exige considerar medidas técnicas y organizativas desde la propia concepción del tratamiento, no incorporarlas únicamente una vez construido el sistema.
Un recolector profesional debería poder implementar conceptualmente funciones como:
COLLECT
FILTER
NORMALIZE
DEDUPLICATE
REDACT
EXPIRE
DELETE
La existencia de COLLECT() sin mecanismos equivalentes para minimizar o eliminar constituye un diseño incompleto.
14. Data minimization aplicada técnicamente
La minimización no debe limitarse a una declaración ética.
Puede implementarse técnicamente.
Ejemplos:
Field filtering
Si únicamente necesitamos:
username
date
domain
no deberíamos almacenar automáticamente otros treinta campos proporcionados por una API.
Time bounding
Limitar consultas al periodo analíticamente relevante.
Domain filtering
Excluir dominios irrelevantes.
Deduplicación
Eliminar copias del mismo registro.
Identificadores internos
Sustituir temporalmente nombres directos:
SUBJECT-001
ACCOUNT-014
ORG-006
Retention TTL
Asignar determinados datos a una política de expiración.
Access control
No todos los analistas necesitan acceso a todos los campos.
Esta es la diferencia entre:
tener una política de privacidad
y
diseñar un sistema que aplique privacidad.
15. Seudonimización
En muchos procesos internos no es necesario trabajar constantemente con nombres reales.
Una persona puede ser representada como:
ENTITY-P-0017
La tabla que relaciona dicho identificador con la identidad real puede almacenarse separadamente y con controles adicionales.
Esto reduce exposición accidental.
Sin embargo, es importante no confundir:
seudonimización
con
anonimización.
Si existe una información auxiliar capaz de recuperar la identidad, seguimos trabajando con datos potencialmente reidentificables.
16. Datos especialmente sensibles
Determinadas categorías requieren una cautela especialmente elevada.
El RGPD contempla una protección reforzada para categorías como información relativa a salud, convicciones religiosas o filosóficas, opiniones políticas, afiliación sindical, determinados datos biométricos, origen racial o étnico y aspectos relativos a la vida u orientación sexual.
OSINT puede revelar esos datos incluso cuando el investigador no los busca deliberadamente.
Una fotografía puede descubrir una enfermedad.
Una publicación puede revelar una determinada creencia.
La asistencia a un evento puede permitir inferir una posición política.
Una imagen puede proporcionar material susceptible de procesamiento biométrico.
La regla debería ser:
descubrimiento incidental ≠ incorporación automática al expediente.
Antes de conservar esa información debe preguntarse:
¿Es realmente necesaria para responder al requerimiento?
17. Interés legítimo: no es una autorización universal
En determinados tratamientos puede plantearse el interés legítimo como fundamento jurídico, pero no constituye una fórmula automática.
Las directrices del Comité Europeo de Protección de Datos sobre el artículo 6.1.f señalan que deben cumplirse condiciones acumulativas: existencia de un interés legítimo, necesidad del tratamiento y ponderación frente a los intereses, derechos y libertades de las personas afectadas.
Por tanto, afirmar:
«Realizo una investigación y tengo interés legítimo»
no cierra el análisis.
Deben poder responderse preguntas como:
¿Cuál es exactamente el interés?
¿Es real y actual?
¿Por qué ese tratamiento concreto resulta necesario?
¿Podría alcanzarse el mismo objetivo utilizando menos datos?
¿Qué expectativas razonables tiene la persona afectada?
¿Cuál sería el impacto potencial?
La proporcionalidad forma parte del razonamiento.
18. Protección de datos desde el diseño
Una estrategia profesional no recopila primero y piensa en privacidad después.
El artículo 25 del RGPD y las orientaciones de la AEPD sitúan la protección desde el diseño al comienzo del ciclo de vida del tratamiento.
Aplicado a un laboratorio OSINT:
antes de seleccionar herramientas deben definirse:
- finalidad;
- arquitectura;
- categorías de información;
- almacenamiento;
- controles de acceso;
- retención;
- eliminación;
- exposición;
- logging.
Por tanto:
Privacy by Design debería preceder a Tool Selection.
19. Seguridad del repositorio OSINT
Sería contradictorio defender la privacidad de los datos investigados mientras el repositorio utilizado para almacenarlos permanece desprotegido.
El RGPD contempla medidas técnicas y organizativas apropiadas al riesgo, incluyendo aspectos como confidencialidad, integridad, disponibilidad y resiliencia.
NIST aborda igualmente la privacidad como un problema de gestión del riesgo organizativo, no únicamente como una cuestión jurídica. Su Privacy Framework está concebido como una herramienta para identificar y gestionar riesgos de privacidad.
Un entorno OSINT debería considerar:
Cifrado en reposo
Equipos y unidades cifrados.
Cifrado de backups
Una copia sin cifrar puede neutralizar la seguridad del sistema principal.
Least privilege
Cada usuario accede exclusivamente a lo que necesita.
Need to know
Incluso dentro del proyecto, no toda información tiene por qué estar disponible para todos.
Logging
Registrar determinados accesos y modificaciones.
Separación de entornos
No mezclar investigación sensible con entorno personal.
Eliminación segura
La finalización del proyecto debe contemplar qué información continúa siendo necesaria.
20. OPSEC: el investigador también deja huella
OSINT suele analizar qué información dejan expuesta otras personas.
Pero existe una cuestión simétrica:
¿qué información deja expuesta el propio investigador mientras investiga?
Una visita web puede proporcionar al servidor diversos indicadores técnicos.
Una cuenta utilizada repetidamente puede establecer patrones.
Una identidad de investigación mal compartimentada puede correlacionarse con una identidad personal.
Una fotografía utilizada como avatar puede relacionarse con otras plataformas.
Una dirección de correo puede convertirse en pivote.
Por eso resulta útil separar:
PERSONAL IDENTITY
PROFESSIONAL PUBLIC IDENTITY
RESEARCH ENVIRONMENT
RESEARCH ACCOUNTS
TECHNICAL INFRASTRUCTURE
STORAGE
PUBLICATION ENVIRONMENT
Compartimentar no significa necesariamente ocultación.
Significa reducir correlaciones innecesarias.
21. Navegador y compartimentación
Desde el punto de vista metodológico resulta aconsejable separar contextos de navegación.
Por ejemplo:
PROFILE 01 / PERSONAL
PROFILE 02 / RESEARCH
PROFILE 03 / TESTING
Cookies, sesiones, historial y extensiones pueden entonces mantenerse separados.
En investigaciones avanzadas pueden emplearse entornos virtualizados o sistemas específicamente destinados al análisis.
El objetivo no consiste únicamente en anonimizar al investigador.
También evita contaminar la investigación.
Un buscador personalizado por años de navegación personal puede ofrecer resultados distintos de un contexto limpio.
22. OPSEC no sustituye al marco jurídico
Existe un punto que merece destacarse.
VPN, Tor, máquinas virtuales, proxies, perfiles separados o sistemas operativos especializados pueden reducir exposición técnica.
Pero ninguna herramienta convierte una actividad no justificada en una actividad legítima.
Anonimato técnico y legitimidad son variables diferentes.
La OPSEC protege una investigación.
No la justifica.
23. Metadatos
Los metadatos ilustran perfectamente la diferencia entre información visible e información disponible.
Un documento puede incluir:
- autor;
- aplicación;
- versión;
- fecha;
- nombre de usuario;
- ruta;
- comentarios;
- organización.
Una imagen puede incluir:
- fecha;
- dispositivo;
- lente;
- software;
- orientación;
- localización.
Sin embargo, la capacidad de extraer todos esos campos no significa que sea necesario conservarlos todos.
La regla vuelve a ser la misma:
extracción selectiva basada en finalidad.
24. Capturas de pantalla: útiles, pero insuficientes
La captura de pantalla es probablemente una de las evidencias más utilizadas en investigación digital.
También es una de las más sobrevaloradas.
Una captura puede demostrar qué se observó visualmente.
Pero aislada puede carecer de:
- URL;
- timestamp fiable;
- contexto;
- contenido completo;
- metadata;
- relación con la fuente original.
Cuando una evidencia sea relevante conviene conservar información adicional sobre su procedencia.
La captura es una representación.
No necesariamente la fuente.
25. Verificación mediante múltiples fuentes
Una regla útil podría formularse así:
una fuente descubre; otra fuente confirma.
No siempre será posible.
Pero las conclusiones importantes deberían intentar apoyarse en fuentes independientes.
Una clasificación orientativa:
FUENTE PRIMARIA
Documento o sistema directamente relacionado con el hecho.
FUENTE SECUNDARIA
Información elaborada a partir de fuentes originales.
FUENTE DERIVADA
Agregadores, índices, cachés o reproducciones.
La distancia respecto de la fuente primaria debería formar parte del nivel de confianza.
26. Sesgo de confirmación
La herramienta más peligrosa en OSINT puede no ser un software.
Puede ser el propio analista.
Cuando una hipótesis inicial parece correcta, existe el riesgo de buscar únicamente información que la confirme.
Una metodología rigurosa debería formular también:
HIPÓTESIS ALTERNATIVAS
y buscar evidencia capaz de refutar la explicación principal.
En lugar de:
¿Qué datos demuestran que A controla B?
podemos preguntar:
¿Qué otras explicaciones pueden justificar la relación observada entre A y B?
Este pequeño cambio mejora considerablemente la calidad analítica.
27. Privacy Risk y Cybersecurity Risk no son exactamente lo mismo
Una brecha de seguridad puede generar un problema de privacidad.
Pero también puede existir riesgo de privacidad sin que exista vulneración de seguridad.
Un sistema perfectamente protegido puede realizar correlaciones excesivas, inferencias intrusivas o conservar información durante demasiado tiempo.
NIST trata precisamente la privacidad como un ámbito de gestión de riesgos con identidad propia, aunque relacionado con ciberseguridad.
Esto es especialmente importante en OSINT.
La seguridad pregunta:
¿Puede alguien acceder indebidamente a mis datos?
La privacidad añade:
¿Debería haber recopilado esos datos en primer lugar?
CLAVE DE ANÁLISIS / 04
Un repositorio puede estar perfectamente cifrado y continuar siendo excesivamente intrusivo.
La ciberseguridad protege los datos. La privacidad obliga además a justificar por qué existen.
28. Retención: cuándo terminar una investigación
Acumular datos resulta sencillo.
Eliminar datos requiere método.
Toda investigación debería disponer de un criterio de cierre.
Podemos clasificar los materiales:
ACTIVE
Necesarios para una investigación en curso.
EVIDENTIAL
Necesarios para justificar determinadas conclusiones.
REFERENCE
Información legítimamente conservada como referencia metodológica.
DISCARD
Sin relevancia.
EXPIRED
Ha dejado de existir una finalidad suficiente para su conservación.
La limitación del periodo de conservación constituye uno de los principios del RGPD.
Por tanto, una política OSINT madura debería incluir tanto un procedimiento de acquisition como uno de deletion.
29. Publicar no es lo mismo que analizar
Un dato puede resultar necesario para que el investigador confirme una hipótesis y, simultáneamente, ser innecesario para el lector final.
Antes de publicar un análisis debería existir una segunda fase de minimización.
Preguntas útiles:
¿Necesita aparecer el nombre completo?
¿Es necesaria la dirección de correo?
¿Necesito publicar la IP completa?
¿Debe aparecer la ubicación exacta?
¿Puede anonimizarse un tercero?
¿La captura revela información incidental?
¿La conclusión puede demostrarse publicando menos datos?
El informe público debería proporcionar evidencia suficiente para justificar su razonamiento sin transformarse innecesariamente en un repositorio de datos personales.
30. Metodología MNI: Minimum Necessary Intelligence
Como síntesis de este análisis puede proponerse un principio operativo:
MINIMUM NECESSARY INTELLIGENCE — MNI
Una investigación OSINT debe adquirir, conservar, correlacionar y difundir únicamente la cantidad de información necesaria para responder de manera verificable al requerimiento de inteligencia establecido.
El modelo puede aplicarse mediante cuatro preguntas:
01 / ACQUISITION
¿Necesito obtener este dato?
02 / RETENTION
¿Necesito conservar este dato?
03 / CORRELATION
¿Necesito relacionarlo con esta otra entidad?
04 / DISSEMINATION
¿Necesita conocerlo quien recibirá el análisis?
Si cualquiera de estas respuestas es negativa, debe reconsiderarse el tratamiento.
MNI no pretende limitar OSINT.
Pretende eliminar aquello que no genera inteligencia.
31. Modelo operativo OIDSEC
Una metodología orientada simultáneamente a inteligencia, privacidad y reproducibilidad podría estructurarse así:
01 / REQUIREMENT
Definir la pregunta.
↓
02 / SCOPE
Delimitar personas, organizaciones, infraestructura, periodo y jurisdicción.
↓
03 / SOURCE MAP
Determinar fuentes necesarias.
↓
04 / RISK ASSESSMENT
Evaluar privacidad, sensibilidad y exposición.
↓
05 / COLLECTION
Obtener únicamente los datos necesarios.
↓
06 / PROVENANCE
Registrar origen y contexto.
↓
07 / NORMALIZATION
Estandarizar formatos.
↓
08 / MINIMIZATION
Eliminar información innecesaria.
↓
09 / VERIFICATION
Contrastar fuentes.
↓
10 / CORRELATION
Relacionar entidades justificadamente.
↓
11 / ANALYSIS
Construir y refutar hipótesis.
↓
12 / CONFIDENCE
Asignar nivel de confianza.
↓
13 / REPORTING
Producir inteligencia.
↓
14 / PUBLICATION REVIEW
Aplicar segunda minimización.
↓
15 / RETENTION / DELETION
Conservar únicamente aquello que continúe siendo necesario.
Este modelo convierte la privacidad en parte integral de la metodología de inteligencia.
No en una comprobación administrativa realizada al final.
32. Lista de comprobación antes de iniciar una investigación OSINT
Antes de comenzar:
□ ¿Existe una pregunta claramente definida?
□ ¿Está delimitado el alcance?
□ ¿He definido el periodo temporal?
□ ¿Sé qué categorías de datos necesito?
□ ¿He definido qué información no necesito?
□ ¿Existe una finalidad legítima y proporcionada?
□ ¿Puedo utilizar fuentes menos intrusivas?
□ ¿He establecido cómo registraré la procedencia?
□ ¿Dispongo de almacenamiento protegido?
□ ¿Existe una política de retención?
33. Lista de comprobación antes de publicar
Antes de difundir:
□ ¿Todas las afirmaciones relevantes están respaldadas por evidencia?
□ ¿He separado hechos de inferencias?
□ ¿He indicado incertidumbres?
□ ¿Existen explicaciones alternativas?
□ ¿Hay información personal innecesaria?
□ ¿Las capturas revelan datos incidentales?
□ ¿Puedo anonimizar terceros?
□ ¿He revisado fechas y vigencia?
□ ¿Puedo justificar el método empleado?
□ ¿Un investigador independiente podría reproducir razonablemente mi conclusión?
34. El objetivo no es saberlo todo
La cultura digital contemporánea favorece una mentalidad de acumulación.
Más resultados.
Más fuentes.
Más datasets.
Más conexiones.
Más perfiles.
Más herramientas.
Pero una investigación profesional no tiene como finalidad demostrar cuánto puede descubrir el investigador.
Su finalidad consiste en responder correctamente a una pregunta.
Esto implica desarrollar una capacidad que las herramientas no proporcionan:
saber detenerse.
Existe un momento en el que una nueva búsqueda deja de aumentar significativamente la confianza de la conclusión.
A partir de ese punto puede comenzar simplemente a aumentar:
el ruido,
la exposición,
el coste,
el riesgo,
la cantidad de información irrelevante.
El buen analista debe reconocer ese momento.
Conclusión
La expansión de Internet, las redes sociales, los registros públicos digitalizados, las APIs, los motores especializados, los repositorios documentales y las técnicas de correlación han proporcionado a OSINT una capacidad extraordinaria.
Pero la verdadera sofisticación de la disciplina no reside en disponer de una colección interminable de herramientas.
Reside en el método.
El investigador debe ser capaz de determinar:
qué busca;
por qué lo busca;
qué fuentes resultan adecuadas;
qué puede considerar evidencia;
qué debe verificar;
qué relaciones son significativas;
qué información debe descartar;
qué nivel de confianza merece cada conclusión;
qué puede conservar;
qué debería eliminar;
y qué resulta necesario publicar.
El RGPD sitúa la minimización, finalidad, exactitud, limitación de conservación, seguridad y responsabilidad entre los principios esenciales del tratamiento de datos personales. La AEPD insiste además en integrar la protección desde el diseño y por defecto, mientras NIST aborda la privacidad como un proceso de gestión sistemática del riesgo.
Estos principios no deben entenderse únicamente como restricciones externas impuestas al investigador.
Pueden convertirse en principios de calidad analítica.
Recopilar menos obliga a definir mejor la pregunta.
Verificar la procedencia mejora la evidencia.
Limitar la correlación reduce falsos positivos.
Establecer niveles de confianza obliga a reconocer incertidumbres.
Eliminar información innecesaria reduce ruido.
Separar hechos de inferencias mejora el razonamiento.
Proteger el repositorio mejora la integridad del proyecto.
Y revisar qué información debe publicarse diferencia la inteligencia responsable de la simple exposición de datos.
En última instancia, OSINT no consiste en descubrir todo aquello que Internet permite descubrir.
Consiste en localizar, verificar y contextualizar la información necesaria para comprender una realidad determinada.
Investigar sin perder el control de los datos significa saber qué buscar.
Pero, sobre todo, significa saber qué no necesitamos buscar, qué no necesitamos conservar y qué no necesitamos revelar.
Ahí comienza una inteligencia de fuentes abiertas verdaderamente profesional.
FUENTES Y REFERENCIAS
Unión Europea
Reglamento (UE) 2016/679 — Reglamento General de Protección de Datos (RGPD).
Especialmente relevantes para este análisis: principios del tratamiento, bases jurídicas, categorías especiales de datos, protección desde el diseño y por defecto, seguridad del tratamiento y evaluación de impacto. Fuente oficial: EUR-Lex.
Agencia Española de Protección de Datos — AEPD
Protección de datos desde el diseño.
La AEPD desarrolla la incorporación de medidas de protección desde la definición inicial y durante todo el ciclo de vida del tratamiento.
Protección de datos por defecto.
Desarrolla específicamente la aplicación práctica del principio de minimización mediante medidas destinadas a que únicamente sean tratados los datos necesarios para la finalidad definida.
Comité Europeo de Protección de Datos — EDPB
Guidelines 1/2024 on processing of personal data based on Article 6(1)(f) GDPR.
Referencia para la evaluación del interés legítimo, necesidad del tratamiento y ponderación de derechos e intereses.
National Institute of Standards and Technology — NIST
NIST Privacy Framework.
Marco voluntario destinado a ayudar a organizaciones a identificar y gestionar riesgos asociados a la privacidad.
NIST Privacy Framework 1.1.
Evolución del marco orientada a integrar la gestión de riesgos de privacidad con otros modelos organizativos y de ciberseguridad.
NOTA METODOLÓGICA
Este análisis tiene finalidad académica, técnica y divulgativa. Las operaciones OSINT pueden estar sometidas a diferentes obligaciones dependiendo de la naturaleza de la investigación, categorías de información tratadas, jurisdicción, finalidad, escala, responsable y contexto concreto.
La accesibilidad pública de una fuente no debe interpretarse automáticamente como autorización universal para cualquier forma posterior de tratamiento.
Cuando una investigación pueda afectar significativamente a derechos de terceros o implique tratamiento sistemático de datos personales, deberá evaluarse el marco jurídico aplicable al caso concreto.
OIDSEC / OBSERVATORIO DE INVESTIGACIÓN DIGITAL
OSINT · PRIVACIDAD · CIBERINTELIGENCIA · SEGURIDAD · MÉTODO
Investigación independiente basada en fuentes abiertas, documentación técnica y análisis verificable.

