La investigación científica en tiempos del algoritmo: ¿por qué los comités de ética deben prestar atención a la IA?
Créditos y Fecha de Publicación
Publicado el
- Por: Dr. Sebastián Dueñas Müller, de la Pontificia Universidad Católica de Chile
Cada semana, quienes participamos y colaboramos en comités de ética de la investigación nos encontramos con una escena casi de manual: un equipo de investigación sube entrevistas cualitativas de poblaciones vulnerables a una plataforma de transcripción impulsada por la inteligencia artificial, amparándose en un consentimiento informado que promete confidencialidad estricta por parte de los investigadores. Se genera así una disociación crítica entre lo que el titular del dato firmó en el papel y lo que efectivamente se termina haciendo con su información en el entorno digital. En la enorme mayoría de los casos, no hay mala intención ni afán de romper las reglas al compartir esa información. Lo que presenciamos, en realidad, es el resultado de un desfase entre la velocidad con la que los científicos adoptan herramientas cotidianas y la lentitud con la que nuestras instituciones adaptan sus marcos de evaluación.
En este sentido, la inteligencia artificial ha exacerbado distintos riesgos para la privacidad. Ha transformado viejos riesgos teóricos en amenazas operativas directas, masivas y sumamente baratas. Hoy, cualquier teléfono inteligente posee mayor capacidad de cómputo que la utilizada por la NASA para llevar al ser humano a la Luna. Lo que hace un par de décadas exigía un atacante sofisticado con acceso a bases de datos privilegiadas, hoy lo realiza un estudiante o una pequeña consultora mediante suscripciones de bajo costo o modelos de código abierto.
“Hoy, cualquier teléfono inteligente posee mayor capacidad de cómputo que la utilizada por la NASA para llevar al ser humano a la Luna”.
Ante este escenario, quienes evaluamos la integridad en la investigación debemos desmantelar tres dogmas que aún dominan nuestras pautas de revisión:
1. El dato recolectado vs. el dato inferido.
Nuestra atención no puede centrarse únicamente en la información que el participante entrega de forma consciente. Los modelos tecnológicos actuales pueden identificar patrones que permiten inferir datos altamente sensibles -como indicadores de salud mental, orientación política o creencias religiosas- a partir de textos libres, registros de voz o patrones de movilidad. Si la tecnología es capaz de producir o inferir este tipo de data, se deben tomar medidas que garanticen la protección de la información que ofrecen los participantes, tanto la que se entrega conscientemente como aquella que puede inferirse mediante el uso de la IA.
2. La problemática de la anonimización irreversible
Continuar prometiendo a los participantes que sus datos serán “anonimizados de forma irreversible” es sostener una ficción administrativa. Desde 1997, la evidencia científica -iniciada por los célebres hallazgos de Latanya Sweeney, y consolidada en 2019 por Luc Rocher y sus colaboradores- demuestra que apenas 15 atributos demográficos bastan para reidentificar a casi el 100% de una población, mediante cruces con bases de datos públicas. Además, como la disponibilidad de datos auxiliares en internet crece de forma exponencial, el riesgo residual de reidentificación de una base de datos “anonimizada” no permanece estático, sino que aumenta con el paso de los años.
3. La trampa de los términos de servicio.
Aceptar los términos y condiciones de consumo de plataformas de uso público (como ChatGPT o DeepL) no equivale a suscribir un acuerdo formal de tratamiento de datos. Estas herramientas suelen procesar la información en servidores extranjeros, sin precisar si retienen los datos, por cuánto tiempo ni cuáles son sus plazos de eliminación, ignorando garantías clave como el derecho de auditoría o los acuerdos de no entrenamiento. A esto se suma el fenómeno del function creep: modificaciones unilaterales en sus políticas de privacidad a mitad de un proyecto sin que existan protocolos para notificar al participante.
Los desafíos por asumir
Tanto en Chile como en Perú observamos esfuerzos normativos por converger con los estándares internacionales más exigentes, como el Reglamento General de Protección de Datos de la Unión Europea. Sin embargo, la convergencia práctica en nuestras universidades y centros de salud sigue estando rezagada.
Para cerrar esta brecha, los comités de ética debemos reestructurar urgentemente las preguntas con las que evaluamos cada proyecto. Ya no alcanza con indagar qué datos sensibles se van a recoger, sino qué información confidencial pueden inferir o generar los modelos utilizados. Tampoco sirve conformarse con una promesa genérica de anonimización, sino que resulta indispensable exigir una evaluación razonada del riesgo residual de reidentificación a mediano y largo plazo. Del mismo modo, es insuficiente saber qué personas tendrán acceso directo a la información: se requiere un inventario detallado de las herramientas tecnológicas que la procesarán, la ubicación geográfica de sus servidores, si retienen la información y bajo qué plazos de eliminación.
La máxima fundamental de los comités de ética establece que el consentimiento informado solo es válido si el participante comprende verdaderamente a qué riesgos se expone. Mientras persista esta disociación entre lo firmado por el titular y el tratamiento real que termina sufriendo su información, y el propio investigador desconozca la cadena de custodia, los plazos de retención y el destino final de los datos procesados por sus herramientas tecnológicas, la protección de los sujetos de investigación seguirá siendo apenas un trámite de papel.
El doctor Sebastián Dueñas Müller profundizó sobre estas ideas en el Simposio de Ética e Integridad en la Investigación: Protección y gestión responsable de datos en la era digital, organizado por la Oficina de Ética de la Investigación e Integridad Científica de la PUCP. Puedes ver su charla completa aquí:
Dr. Sebastián Dueñas Müller
Subdirector de Derecho, Ciencia y Tecnología
Pontificia Universidad Católica de Chile