OSINT y privacidad: investigar sin perder el control de los datos

Inteligencia de fuentes abiertas, minimización, trazabilidad y protección de la información en un ecosistema digital caracterizado por la sobreexposición de datos


FICHA DE ANÁLISIS

ÁREA / OSINT & PRIVACIDAD
TIPO / ANÁLISIS TÉCNICO
NIVEL / AVANZADO
MÉTODO / INTELIGENCIA DE FUENTES ABIERTAS Y ANÁLISIS DOCUMENTAL
ENFOQUE / MINIMIZACIÓN · TRAZABILIDAD · OPSEC · PROTECCIÓN DE DATOS
FUENTES / UE · AEPD · EDPB · NIST
OIDSEC / OBSERVATORIO DE INVESTIGACIÓN DIGITAL


Resumen ejecutivo

La inteligencia de fuentes abiertas —Open Source Intelligence, OSINT— suele asociarse a la capacidad de localizar información públicamente accesible: perfiles sociales, documentos, dominios, imágenes, infraestructuras expuestas, repositorios, publicaciones, registros técnicos o metadatos.

Esa definición resulta insuficiente.

La dificultad contemporánea del OSINT ya no consiste exclusivamente en encontrar información, sino en determinar qué información debe obtenerse, cómo debe verificarse, qué relaciones pueden establecerse legítimamente entre diferentes conjuntos de datos, durante cuánto tiempo es razonable conservarlos y qué parte de todo lo recopilado resulta realmente necesaria para responder a una necesidad de inteligencia.

El crecimiento exponencial de información disponible obliga a introducir una disciplina adicional: la minimización.

El Reglamento General de Protección de Datos europeo establece, entre sus principios fundamentales, la limitación de la finalidad, minimización, exactitud, limitación del plazo de conservación, integridad, confidencialidad y responsabilidad proactiva. Estos principios tienen una relación directa con cualquier metodología OSINT que implique tratamiento de datos personales.

La cuestión fundamental deja entonces de ser:

¿Cuánto puedo descubrir?

y pasa a ser:

¿Qué necesito realmente conocer para responder con rigor a mi pregunta de investigación?

Esta diferencia separa la simple acumulación de datos de una auténtica metodología de inteligencia.


CLAVE DE ANÁLISIS / 01

Que una información pueda encontrarse públicamente no significa que carezca de implicaciones de privacidad ni que cualquier tratamiento posterior resulte automáticamente justificable. Accesibilidad, necesidad, proporcionalidad y finalidad son conceptos distintos.


1. OSINT no es buscar: es producir inteligencia

Uno de los errores más frecuentes consiste en identificar OSINT con herramientas de búsqueda.

Los buscadores avanzados, repositorios, APIs, servicios de análisis de infraestructura, motores de búsqueda de dispositivos, consultas DNS, bases documentales, redes sociales o sistemas de análisis gráfico son instrumentos de adquisición.

La inteligencia aparece posteriormente.

Un proceso OSINT riguroso debería comprender, al menos:

Dirección → Obtención → Procesamiento → Verificación → Análisis → Correlación → Evaluación → Difusión → Retención o eliminación.

Esta distinción resulta esencial.

Una dirección IP constituye un dato.

Un nombre de dominio constituye un dato.

Una fotografía constituye un dato.

Un nombre de usuario constituye un dato.

Una localización constituye un dato.

Un certificado TLS constituye un dato.

Una publicación en una red social constituye un dato.

La inteligencia comienza cuando esos elementos son evaluados dentro de un contexto, contrastados con fuentes independientes y utilizados para responder a una pregunta previamente formulada.

Por tanto:

dato ≠ información contextualizada ≠ inteligencia.

Una investigación puede reunir cientos de miles de registros y producir muy poca inteligencia.

Otra puede trabajar con veinte evidencias correctamente seleccionadas, verificadas y contextualizadas y alcanzar conclusiones mucho más sólidas.

La calidad de una investigación OSINT no debería medirse por el tamaño de su base de datos.

Debe medirse por la calidad de su razonamiento.


2. La paradoja del dato público

Internet ha generado una falsa equivalencia:

público = libre de consecuencias.

No es así.

Una persona puede publicar voluntariamente una fotografía, una ubicación, una trayectoria profesional o determinada información biográfica. Pero la posibilidad técnica de consultar esa información no determina por sí sola todos los usos posteriores que puedan realizarse sobre ella.

El RGPD regula también situaciones en las que los datos personales no se obtienen directamente de la persona afectada, incluyendo información procedente de fuentes accesibles públicamente.

Esto introduce una distinción especialmente importante para OSINT:

visibilidad no equivale a ausencia de protección.

Una información puede ser:

  • públicamente visible;
  • indexada por un buscador;
  • accesible sin autenticación;
  • técnicamente extraíble;
  • susceptible de automatización;

y seguir requiriendo una evaluación de finalidad, necesidad y proporcionalidad cuando se convierte en objeto de tratamiento sistemático.

Esta cuestión adquiere especial relevancia cuando se produce agregación.


3. El efecto mosaico: cuando datos insignificantes dejan de serlo

Uno de los mayores poderes del OSINT reside precisamente en combinar información.

Consideremos un ejemplo hipotético.

Una publicación profesional permite conocer dónde trabaja una persona.

Una fotografía revela parcialmente un edificio.

Los metadatos históricos de otra imagen permiten identificar una ciudad.

Un documento indexado contiene un correo electrónico.

Un registro de dominio relaciona ese correo con determinada infraestructura.

Una publicación social revela un horario habitual.

Una segunda plataforma utiliza el mismo alias.

Ninguno de estos elementos puede resultar especialmente sensible analizado aisladamente.

La correlación de todos ellos puede producir un perfil extraordinariamente preciso.

Este fenómeno puede describirse como efecto mosaico: fragmentos aparentemente inconexos adquieren un significado completamente distinto cuando son combinados.

Desde una perspectiva de privacidad, esto significa que el riesgo no depende exclusivamente de la sensibilidad individual de cada dato.

Depende también de lo que pueda inferirse mediante su agregación.


CLAVE DE ANÁLISIS / 02

En OSINT, el dato más sensible no siempre es el que se obtiene directamente. Con frecuencia es el dato nuevo que aparece después de correlacionar varios datos aparentemente inocuos.


4. La regla fundamental: necesidad antes que capacidad

Las herramientas actuales permiten recopilar una cantidad de información muy superior a la que normalmente necesita una investigación.

Por ello, la pregunta:

¿Puedo obtener este dato?

resulta metodológicamente secundaria.

La pregunta correcta es:

¿Necesito este dato?

El principio de minimización contenido en el artículo 5 del RGPD exige que los datos personales sean adecuados, pertinentes y limitados a lo necesario para la finalidad perseguida.

La AEPD desarrolla además la protección de datos por defecto precisamente desde esta perspectiva: configurar los tratamientos para que únicamente se procesen los datos necesarios para los fines previamente definidos.

Trasladado a inteligencia:

no debe recopilarse información simplemente porque existe la capacidad técnica para hacerlo.

Debe existir una relación clara entre el dato obtenido y el requerimiento de inteligencia.


5. El requerimiento de inteligencia

Una investigación OSINT profesional no debería comenzar escribiendo un nombre en un buscador.

Debería comenzar redactando una pregunta.

Una formulación deficiente sería:

Averiguar todo lo posible sobre la organización X.

Una formulación mucho más útil sería:

Identificar y documentar la infraestructura digital públicamente atribuible a la organización X durante el periodo comprendido entre determinadas fechas, utilizando exclusivamente fuentes abiertas verificables.

La diferencia es enorme.

La segunda formulación establece:

  • objeto;
  • finalidad;
  • límite temporal;
  • naturaleza de las fuentes;
  • criterio de atribución;
  • alcance.

Todo aquello que no contribuya a responder esa pregunta puede considerarse inicialmente irrelevante.

La privacidad comienza, por tanto, antes de abrir el navegador.


6. Data mapping previo a la investigación

Antes de comenzar una operación compleja resulta conveniente elaborar un pequeño mapa de datos.

Puede incluir:

Fuentes previstas

  • motores de búsqueda;
  • registros públicos;
  • repositorios documentales;
  • redes sociales;
  • servicios DNS;
  • certificados;
  • sistemas de archivo web;
  • repositorios de código;
  • plataformas de análisis de infraestructura;
  • imágenes;
  • bases académicas;
  • documentación institucional.

Categorías de datos previsibles

  • nombres;
  • organizaciones;
  • identificadores;
  • direcciones de correo;
  • dominios;
  • IP;
  • ubicaciones;
  • fechas;
  • imágenes;
  • relaciones;
  • dispositivos;
  • infraestructura.

Datos necesarios

Deben definirse en función del requerimiento.

Datos excluidos

También deben definirse.

Esta última categoría es especialmente importante.

Una metodología madura no establece únicamente qué quiere obtener.

Establece también qué no quiere obtener.


7. Separar colección e inteligencia

Una arquitectura OSINT profesional debería diferenciar claramente tres capas.

CAPA 01 / RAW DATA

Material original obtenido desde las fuentes.

Puede incluir:

  • documentos;
  • capturas;
  • JSON;
  • HTML;
  • imágenes;
  • registros;
  • resultados de API;
  • cabeceras;
  • metadatos.

Esta capa debería modificarse lo mínimo posible.

Su finalidad es preservar la procedencia.

CAPA 02 / ANALYTICAL DATA

Información normalizada y seleccionada.

Aquí pueden encontrarse:

  • entidades;
  • relaciones;
  • identificadores normalizados;
  • fechas;
  • indicadores;
  • hipótesis;
  • niveles de confianza.

CAPA 03 / INTELLIGENCE PRODUCT

Es el informe.

No debería contener automáticamente todo lo recopilado.

Debe contener exclusivamente la información necesaria para comprender y justificar las conclusiones.

Esta separación reduce el riesgo de transformar un informe público en un vertedero de información personal innecesaria.


8. Procedencia: saber de dónde salió cada dato

Uno de los pilares de una investigación reproducible es la provenance o procedencia.

Cada evidencia relevante debería poder responder a preguntas como:

¿Dónde fue obtenida?

¿Cuándo?

¿Mediante qué procedimiento?

¿Era una fuente primaria o secundaria?

¿Ha sido modificada?

¿Quién realizó la adquisición?

¿Qué nivel de confianza posee?

Un esquema elemental podría ser:

SOURCE_ID

SOURCE_URL

ACQUISITION_DATE

COLLECTOR

SOURCE_TYPE

HASH

RELIABILITY

CONFIDENCE

NOTES

No todos los campos serán necesarios en todas las investigaciones, pero el principio es esencial:

un dato sin procedencia pierde gran parte de su valor probatorio y analítico.


9. Hash e integridad

Cuando una investigación necesita preservar determinados archivos como evidencia, puede resultar útil generar una huella criptográfica.

Por ejemplo:

SHA-256(documento.pdf)

El hash no demuestra que el contenido sea verdadero.

Demuestra otra cosa:

que el fichero del que se calculó aquella huella puede compararse posteriormente para determinar si ha sufrido modificaciones.

Esta distinción es importante.

Integridad no equivale a autenticidad.

Un documento falso puede conservar perfectamente su integridad.

La autenticidad debe evaluarse mediante otros elementos.


10. Exactitud: Internet recuerda incluso lo que dejó de ser verdad

Internet contiene información:

  • antigua;
  • duplicada;
  • descontextualizada;
  • incorrecta;
  • deliberadamente falsa;
  • abandonada;
  • reutilizada;
  • atribuida a homónimos.

El RGPD incluye la exactitud entre sus principios generales.

En OSINT esto coincide plenamente con una exigencia analítica.

Una evidencia puede haber sido correctamente recogida y continuar siendo incorrecta.

Por ello conviene diferenciar siempre:

FECHA DEL HECHO

FECHA DE PUBLICACIÓN

FECHA DE ADQUISICIÓN

FECHA DE ÚLTIMA VERIFICACIÓN

Una publicación de 2017 encontrada en 2026 no describe necesariamente una realidad de 2026.


11. Identity resolution: identificar no es encontrar coincidencias

Uno de los mayores peligros del OSINT automatizado reside en la resolución de identidades.

Encontrar el mismo alias en dos plataformas no demuestra que pertenezcan a la misma persona.

Encontrar dos personas con idéntico nombre tampoco.

Del mismo modo:

una IP puede estar compartida;

un número telefónico puede cambiar de titular;

un dominio puede cambiar de propietario;

una cuenta puede ser transferida;

una imagen puede reutilizarse;

un correo puede quedar abandonado.

La atribución requiere corroboración.

Podemos expresar diferentes grados de confianza:

CONFIRMADO

Existe evidencia directa o múltiples evidencias independientes consistentes.

ALTA CONFIANZA

Las evidencias convergen fuertemente, aunque no existe confirmación absoluta.

CONFIANZA MEDIA

Existen indicadores consistentes pero permanecen explicaciones alternativas.

BAJA CONFIANZA

La relación constituye principalmente una hipótesis.

Este lenguaje es más profesional que presentar todas las conexiones como certezas.


CLAVE DE ANÁLISIS / 03

Correlación no significa causalidad y coincidencia no significa identidad.

Una herramienta puede encontrar relaciones. Corresponde al analista determinar qué significan realmente.


12. Los grafos y la ilusión de certeza

Las herramientas de análisis de relaciones permiten representar:

personas → dominios → correos → organizaciones → IP → ubicaciones → perfiles.

El resultado puede ser visualmente extraordinario.

Precisamente por eso puede resultar peligroso.

Una línea dibujada entre dos nodos produce psicológicamente una sensación de relación demostrada.

Sin embargo, cada arista debería responder a una definición concreta:

OWNS

RESOLVES_TO

REGISTERED_BY

MENTIONED_IN

USES

CLAIMS

OBSERVED_WITH

POSSIBLY_ASSOCIATED

La ontología importa.

Si todas las conexiones significan simplemente «relacionado con», el grafo pierde precisión analítica.

Y desde la perspectiva de privacidad aparece otro problema:

la expansión infinita.

Que un individuo esté relacionado con una organización investigada no significa que resulte necesario investigar también a:

su pareja,

sus hijos,

sus compañeros,

sus amigos,

sus contactos profesionales,

los contactos de esos contactos.

Debe existir un punto de detención.


13. Web scraping: cuando cambia la escala cambia el riesgo

La consulta manual y la recolección automatizada no presentan la misma escala.

El scraping introduce:

  • velocidad;
  • repetibilidad;
  • volumen;
  • persistencia;
  • correlación automatizada.

Ese cambio cuantitativo puede convertirse en un cambio cualitativo.

Consultar veinte perfiles manualmente y construir automáticamente un dataset con cientos de miles de individuos no son operaciones equivalentes desde la perspectiva del riesgo.

La protección de datos desde el diseño exige considerar medidas técnicas y organizativas desde la propia concepción del tratamiento, no incorporarlas únicamente una vez construido el sistema.

Un recolector profesional debería poder implementar conceptualmente funciones como:

COLLECT

FILTER

NORMALIZE

DEDUPLICATE

REDACT

EXPIRE

DELETE

La existencia de COLLECT() sin mecanismos equivalentes para minimizar o eliminar constituye un diseño incompleto.


14. Data minimization aplicada técnicamente

La minimización no debe limitarse a una declaración ética.

Puede implementarse técnicamente.

Ejemplos:

Field filtering

Si únicamente necesitamos:

username

date

domain

no deberíamos almacenar automáticamente otros treinta campos proporcionados por una API.

Time bounding

Limitar consultas al periodo analíticamente relevante.

Domain filtering

Excluir dominios irrelevantes.

Deduplicación

Eliminar copias del mismo registro.

Identificadores internos

Sustituir temporalmente nombres directos:

SUBJECT-001

ACCOUNT-014

ORG-006

Retention TTL

Asignar determinados datos a una política de expiración.

Access control

No todos los analistas necesitan acceso a todos los campos.

Esta es la diferencia entre:

tener una política de privacidad

y

diseñar un sistema que aplique privacidad.


15. Seudonimización

En muchos procesos internos no es necesario trabajar constantemente con nombres reales.

Una persona puede ser representada como:

ENTITY-P-0017

La tabla que relaciona dicho identificador con la identidad real puede almacenarse separadamente y con controles adicionales.

Esto reduce exposición accidental.

Sin embargo, es importante no confundir:

seudonimización

con

anonimización.

Si existe una información auxiliar capaz de recuperar la identidad, seguimos trabajando con datos potencialmente reidentificables.


16. Datos especialmente sensibles

Determinadas categorías requieren una cautela especialmente elevada.

El RGPD contempla una protección reforzada para categorías como información relativa a salud, convicciones religiosas o filosóficas, opiniones políticas, afiliación sindical, determinados datos biométricos, origen racial o étnico y aspectos relativos a la vida u orientación sexual.

OSINT puede revelar esos datos incluso cuando el investigador no los busca deliberadamente.

Una fotografía puede descubrir una enfermedad.

Una publicación puede revelar una determinada creencia.

La asistencia a un evento puede permitir inferir una posición política.

Una imagen puede proporcionar material susceptible de procesamiento biométrico.

La regla debería ser:

descubrimiento incidental ≠ incorporación automática al expediente.

Antes de conservar esa información debe preguntarse:

¿Es realmente necesaria para responder al requerimiento?


17. Interés legítimo: no es una autorización universal

En determinados tratamientos puede plantearse el interés legítimo como fundamento jurídico, pero no constituye una fórmula automática.

Las directrices del Comité Europeo de Protección de Datos sobre el artículo 6.1.f señalan que deben cumplirse condiciones acumulativas: existencia de un interés legítimo, necesidad del tratamiento y ponderación frente a los intereses, derechos y libertades de las personas afectadas.

Por tanto, afirmar:

«Realizo una investigación y tengo interés legítimo»

no cierra el análisis.

Deben poder responderse preguntas como:

¿Cuál es exactamente el interés?

¿Es real y actual?

¿Por qué ese tratamiento concreto resulta necesario?

¿Podría alcanzarse el mismo objetivo utilizando menos datos?

¿Qué expectativas razonables tiene la persona afectada?

¿Cuál sería el impacto potencial?

La proporcionalidad forma parte del razonamiento.


18. Protección de datos desde el diseño

Una estrategia profesional no recopila primero y piensa en privacidad después.

El artículo 25 del RGPD y las orientaciones de la AEPD sitúan la protección desde el diseño al comienzo del ciclo de vida del tratamiento.

Aplicado a un laboratorio OSINT:

antes de seleccionar herramientas deben definirse:

  • finalidad;
  • arquitectura;
  • categorías de información;
  • almacenamiento;
  • controles de acceso;
  • retención;
  • eliminación;
  • exposición;
  • logging.

Por tanto:

Privacy by Design debería preceder a Tool Selection.


19. Seguridad del repositorio OSINT

Sería contradictorio defender la privacidad de los datos investigados mientras el repositorio utilizado para almacenarlos permanece desprotegido.

El RGPD contempla medidas técnicas y organizativas apropiadas al riesgo, incluyendo aspectos como confidencialidad, integridad, disponibilidad y resiliencia.

NIST aborda igualmente la privacidad como un problema de gestión del riesgo organizativo, no únicamente como una cuestión jurídica. Su Privacy Framework está concebido como una herramienta para identificar y gestionar riesgos de privacidad.

Un entorno OSINT debería considerar:

Cifrado en reposo

Equipos y unidades cifrados.

Cifrado de backups

Una copia sin cifrar puede neutralizar la seguridad del sistema principal.

Least privilege

Cada usuario accede exclusivamente a lo que necesita.

Need to know

Incluso dentro del proyecto, no toda información tiene por qué estar disponible para todos.

Logging

Registrar determinados accesos y modificaciones.

Separación de entornos

No mezclar investigación sensible con entorno personal.

Eliminación segura

La finalización del proyecto debe contemplar qué información continúa siendo necesaria.


20. OPSEC: el investigador también deja huella

OSINT suele analizar qué información dejan expuesta otras personas.

Pero existe una cuestión simétrica:

¿qué información deja expuesta el propio investigador mientras investiga?

Una visita web puede proporcionar al servidor diversos indicadores técnicos.

Una cuenta utilizada repetidamente puede establecer patrones.

Una identidad de investigación mal compartimentada puede correlacionarse con una identidad personal.

Una fotografía utilizada como avatar puede relacionarse con otras plataformas.

Una dirección de correo puede convertirse en pivote.

Por eso resulta útil separar:

PERSONAL IDENTITY

PROFESSIONAL PUBLIC IDENTITY

RESEARCH ENVIRONMENT

RESEARCH ACCOUNTS

TECHNICAL INFRASTRUCTURE

STORAGE

PUBLICATION ENVIRONMENT

Compartimentar no significa necesariamente ocultación.

Significa reducir correlaciones innecesarias.


21. Navegador y compartimentación

Desde el punto de vista metodológico resulta aconsejable separar contextos de navegación.

Por ejemplo:

PROFILE 01 / PERSONAL

PROFILE 02 / RESEARCH

PROFILE 03 / TESTING

Cookies, sesiones, historial y extensiones pueden entonces mantenerse separados.

En investigaciones avanzadas pueden emplearse entornos virtualizados o sistemas específicamente destinados al análisis.

El objetivo no consiste únicamente en anonimizar al investigador.

También evita contaminar la investigación.

Un buscador personalizado por años de navegación personal puede ofrecer resultados distintos de un contexto limpio.


22. OPSEC no sustituye al marco jurídico

Existe un punto que merece destacarse.

VPN, Tor, máquinas virtuales, proxies, perfiles separados o sistemas operativos especializados pueden reducir exposición técnica.

Pero ninguna herramienta convierte una actividad no justificada en una actividad legítima.

Anonimato técnico y legitimidad son variables diferentes.

La OPSEC protege una investigación.

No la justifica.


23. Metadatos

Los metadatos ilustran perfectamente la diferencia entre información visible e información disponible.

Un documento puede incluir:

  • autor;
  • aplicación;
  • versión;
  • fecha;
  • nombre de usuario;
  • ruta;
  • comentarios;
  • organización.

Una imagen puede incluir:

  • fecha;
  • dispositivo;
  • lente;
  • software;
  • orientación;
  • localización.

Sin embargo, la capacidad de extraer todos esos campos no significa que sea necesario conservarlos todos.

La regla vuelve a ser la misma:

extracción selectiva basada en finalidad.


24. Capturas de pantalla: útiles, pero insuficientes

La captura de pantalla es probablemente una de las evidencias más utilizadas en investigación digital.

También es una de las más sobrevaloradas.

Una captura puede demostrar qué se observó visualmente.

Pero aislada puede carecer de:

  • URL;
  • timestamp fiable;
  • contexto;
  • contenido completo;
  • metadata;
  • relación con la fuente original.

Cuando una evidencia sea relevante conviene conservar información adicional sobre su procedencia.

La captura es una representación.

No necesariamente la fuente.


25. Verificación mediante múltiples fuentes

Una regla útil podría formularse así:

una fuente descubre; otra fuente confirma.

No siempre será posible.

Pero las conclusiones importantes deberían intentar apoyarse en fuentes independientes.

Una clasificación orientativa:

FUENTE PRIMARIA

Documento o sistema directamente relacionado con el hecho.

FUENTE SECUNDARIA

Información elaborada a partir de fuentes originales.

FUENTE DERIVADA

Agregadores, índices, cachés o reproducciones.

La distancia respecto de la fuente primaria debería formar parte del nivel de confianza.


26. Sesgo de confirmación

La herramienta más peligrosa en OSINT puede no ser un software.

Puede ser el propio analista.

Cuando una hipótesis inicial parece correcta, existe el riesgo de buscar únicamente información que la confirme.

Una metodología rigurosa debería formular también:

HIPÓTESIS ALTERNATIVAS

y buscar evidencia capaz de refutar la explicación principal.

En lugar de:

¿Qué datos demuestran que A controla B?

podemos preguntar:

¿Qué otras explicaciones pueden justificar la relación observada entre A y B?

Este pequeño cambio mejora considerablemente la calidad analítica.


27. Privacy Risk y Cybersecurity Risk no son exactamente lo mismo

Una brecha de seguridad puede generar un problema de privacidad.

Pero también puede existir riesgo de privacidad sin que exista vulneración de seguridad.

Un sistema perfectamente protegido puede realizar correlaciones excesivas, inferencias intrusivas o conservar información durante demasiado tiempo.

NIST trata precisamente la privacidad como un ámbito de gestión de riesgos con identidad propia, aunque relacionado con ciberseguridad.

Esto es especialmente importante en OSINT.

La seguridad pregunta:

¿Puede alguien acceder indebidamente a mis datos?

La privacidad añade:

¿Debería haber recopilado esos datos en primer lugar?


CLAVE DE ANÁLISIS / 04

Un repositorio puede estar perfectamente cifrado y continuar siendo excesivamente intrusivo.

La ciberseguridad protege los datos. La privacidad obliga además a justificar por qué existen.


28. Retención: cuándo terminar una investigación

Acumular datos resulta sencillo.

Eliminar datos requiere método.

Toda investigación debería disponer de un criterio de cierre.

Podemos clasificar los materiales:

ACTIVE

Necesarios para una investigación en curso.

EVIDENTIAL

Necesarios para justificar determinadas conclusiones.

REFERENCE

Información legítimamente conservada como referencia metodológica.

DISCARD

Sin relevancia.

EXPIRED

Ha dejado de existir una finalidad suficiente para su conservación.

La limitación del periodo de conservación constituye uno de los principios del RGPD.

Por tanto, una política OSINT madura debería incluir tanto un procedimiento de acquisition como uno de deletion.


29. Publicar no es lo mismo que analizar

Un dato puede resultar necesario para que el investigador confirme una hipótesis y, simultáneamente, ser innecesario para el lector final.

Antes de publicar un análisis debería existir una segunda fase de minimización.

Preguntas útiles:

¿Necesita aparecer el nombre completo?

¿Es necesaria la dirección de correo?

¿Necesito publicar la IP completa?

¿Debe aparecer la ubicación exacta?

¿Puede anonimizarse un tercero?

¿La captura revela información incidental?

¿La conclusión puede demostrarse publicando menos datos?

El informe público debería proporcionar evidencia suficiente para justificar su razonamiento sin transformarse innecesariamente en un repositorio de datos personales.


30. Metodología MNI: Minimum Necessary Intelligence

Como síntesis de este análisis puede proponerse un principio operativo:

MINIMUM NECESSARY INTELLIGENCE — MNI

Una investigación OSINT debe adquirir, conservar, correlacionar y difundir únicamente la cantidad de información necesaria para responder de manera verificable al requerimiento de inteligencia establecido.

El modelo puede aplicarse mediante cuatro preguntas:

01 / ACQUISITION

¿Necesito obtener este dato?

02 / RETENTION

¿Necesito conservar este dato?

03 / CORRELATION

¿Necesito relacionarlo con esta otra entidad?

04 / DISSEMINATION

¿Necesita conocerlo quien recibirá el análisis?

Si cualquiera de estas respuestas es negativa, debe reconsiderarse el tratamiento.

MNI no pretende limitar OSINT.

Pretende eliminar aquello que no genera inteligencia.


31. Modelo operativo OIDSEC

Una metodología orientada simultáneamente a inteligencia, privacidad y reproducibilidad podría estructurarse así:

01 / REQUIREMENT

Definir la pregunta.

02 / SCOPE

Delimitar personas, organizaciones, infraestructura, periodo y jurisdicción.

03 / SOURCE MAP

Determinar fuentes necesarias.

04 / RISK ASSESSMENT

Evaluar privacidad, sensibilidad y exposición.

05 / COLLECTION

Obtener únicamente los datos necesarios.

06 / PROVENANCE

Registrar origen y contexto.

07 / NORMALIZATION

Estandarizar formatos.

08 / MINIMIZATION

Eliminar información innecesaria.

09 / VERIFICATION

Contrastar fuentes.

10 / CORRELATION

Relacionar entidades justificadamente.

11 / ANALYSIS

Construir y refutar hipótesis.

12 / CONFIDENCE

Asignar nivel de confianza.

13 / REPORTING

Producir inteligencia.

14 / PUBLICATION REVIEW

Aplicar segunda minimización.

15 / RETENTION / DELETION

Conservar únicamente aquello que continúe siendo necesario.

Este modelo convierte la privacidad en parte integral de la metodología de inteligencia.

No en una comprobación administrativa realizada al final.


32. Lista de comprobación antes de iniciar una investigación OSINT

Antes de comenzar:

□ ¿Existe una pregunta claramente definida?

□ ¿Está delimitado el alcance?

□ ¿He definido el periodo temporal?

□ ¿Sé qué categorías de datos necesito?

□ ¿He definido qué información no necesito?

□ ¿Existe una finalidad legítima y proporcionada?

□ ¿Puedo utilizar fuentes menos intrusivas?

□ ¿He establecido cómo registraré la procedencia?

□ ¿Dispongo de almacenamiento protegido?

□ ¿Existe una política de retención?


33. Lista de comprobación antes de publicar

Antes de difundir:

□ ¿Todas las afirmaciones relevantes están respaldadas por evidencia?

□ ¿He separado hechos de inferencias?

□ ¿He indicado incertidumbres?

□ ¿Existen explicaciones alternativas?

□ ¿Hay información personal innecesaria?

□ ¿Las capturas revelan datos incidentales?

□ ¿Puedo anonimizar terceros?

□ ¿He revisado fechas y vigencia?

□ ¿Puedo justificar el método empleado?

□ ¿Un investigador independiente podría reproducir razonablemente mi conclusión?


34. El objetivo no es saberlo todo

La cultura digital contemporánea favorece una mentalidad de acumulación.

Más resultados.

Más fuentes.

Más datasets.

Más conexiones.

Más perfiles.

Más herramientas.

Pero una investigación profesional no tiene como finalidad demostrar cuánto puede descubrir el investigador.

Su finalidad consiste en responder correctamente a una pregunta.

Esto implica desarrollar una capacidad que las herramientas no proporcionan:

saber detenerse.

Existe un momento en el que una nueva búsqueda deja de aumentar significativamente la confianza de la conclusión.

A partir de ese punto puede comenzar simplemente a aumentar:

el ruido,

la exposición,

el coste,

el riesgo,

la cantidad de información irrelevante.

El buen analista debe reconocer ese momento.


Conclusión

La expansión de Internet, las redes sociales, los registros públicos digitalizados, las APIs, los motores especializados, los repositorios documentales y las técnicas de correlación han proporcionado a OSINT una capacidad extraordinaria.

Pero la verdadera sofisticación de la disciplina no reside en disponer de una colección interminable de herramientas.

Reside en el método.

El investigador debe ser capaz de determinar:

qué busca;

por qué lo busca;

qué fuentes resultan adecuadas;

qué puede considerar evidencia;

qué debe verificar;

qué relaciones son significativas;

qué información debe descartar;

qué nivel de confianza merece cada conclusión;

qué puede conservar;

qué debería eliminar;

y qué resulta necesario publicar.

El RGPD sitúa la minimización, finalidad, exactitud, limitación de conservación, seguridad y responsabilidad entre los principios esenciales del tratamiento de datos personales. La AEPD insiste además en integrar la protección desde el diseño y por defecto, mientras NIST aborda la privacidad como un proceso de gestión sistemática del riesgo.

Estos principios no deben entenderse únicamente como restricciones externas impuestas al investigador.

Pueden convertirse en principios de calidad analítica.

Recopilar menos obliga a definir mejor la pregunta.

Verificar la procedencia mejora la evidencia.

Limitar la correlación reduce falsos positivos.

Establecer niveles de confianza obliga a reconocer incertidumbres.

Eliminar información innecesaria reduce ruido.

Separar hechos de inferencias mejora el razonamiento.

Proteger el repositorio mejora la integridad del proyecto.

Y revisar qué información debe publicarse diferencia la inteligencia responsable de la simple exposición de datos.

En última instancia, OSINT no consiste en descubrir todo aquello que Internet permite descubrir.

Consiste en localizar, verificar y contextualizar la información necesaria para comprender una realidad determinada.

Investigar sin perder el control de los datos significa saber qué buscar.

Pero, sobre todo, significa saber qué no necesitamos buscar, qué no necesitamos conservar y qué no necesitamos revelar.

Ahí comienza una inteligencia de fuentes abiertas verdaderamente profesional.


FUENTES Y REFERENCIAS

Unión Europea

Reglamento (UE) 2016/679 — Reglamento General de Protección de Datos (RGPD).
Especialmente relevantes para este análisis: principios del tratamiento, bases jurídicas, categorías especiales de datos, protección desde el diseño y por defecto, seguridad del tratamiento y evaluación de impacto. Fuente oficial: EUR-Lex.

Agencia Española de Protección de Datos — AEPD

Protección de datos desde el diseño.
La AEPD desarrolla la incorporación de medidas de protección desde la definición inicial y durante todo el ciclo de vida del tratamiento.

Protección de datos por defecto.
Desarrolla específicamente la aplicación práctica del principio de minimización mediante medidas destinadas a que únicamente sean tratados los datos necesarios para la finalidad definida.

Comité Europeo de Protección de Datos — EDPB

Guidelines 1/2024 on processing of personal data based on Article 6(1)(f) GDPR.
Referencia para la evaluación del interés legítimo, necesidad del tratamiento y ponderación de derechos e intereses.

National Institute of Standards and Technology — NIST

NIST Privacy Framework.
Marco voluntario destinado a ayudar a organizaciones a identificar y gestionar riesgos asociados a la privacidad.

NIST Privacy Framework 1.1.
Evolución del marco orientada a integrar la gestión de riesgos de privacidad con otros modelos organizativos y de ciberseguridad.


NOTA METODOLÓGICA

Este análisis tiene finalidad académica, técnica y divulgativa. Las operaciones OSINT pueden estar sometidas a diferentes obligaciones dependiendo de la naturaleza de la investigación, categorías de información tratadas, jurisdicción, finalidad, escala, responsable y contexto concreto.

La accesibilidad pública de una fuente no debe interpretarse automáticamente como autorización universal para cualquier forma posterior de tratamiento.

Cuando una investigación pueda afectar significativamente a derechos de terceros o implique tratamiento sistemático de datos personales, deberá evaluarse el marco jurídico aplicable al caso concreto.


OIDSEC / OBSERVATORIO DE INVESTIGACIÓN DIGITAL

OSINT · PRIVACIDAD · CIBERINTELIGENCIA · SEGURIDAD · MÉTODO

Investigación independiente basada en fuentes abiertas, documentación técnica y análisis verificable.

Publicaciones Similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *