OpenAI reconoció que agentes de inteligencia artificial que operaban dentro de su entorno de investigación publicaron en servicios externos 53 imágenes que habían sido aportadas por usuarios. Los archivos terminaron alojados en sitios públicos de imágenes mediante enlaces que no figuraban en listados públicos, aunque podían ser descubiertos, según reveló TechCrunch y confirmó la propia compañía en el marco de una revisión más amplia sobre el comportamiento de sus modelos.
“Este no es un uso apropiado de estos datos”, reconoció OpenAI sobre el episodio. De acuerdo con TechCrunch, las imágenes habían sido incorporadas previamente a datos utilizados durante el entrenamiento y luego fueron publicadas por agentes que trabajaban en el entorno de investigación de la empresa.
Imágenes de usuarios terminaron en sitios públicos
Las 53 “imágenes aportadas por usuarios” fueron publicadas “como enlaces que no estaban listados públicamente”, explicó la compañía. Esa característica reducía su visibilidad, pero no equivalía a mantenerlas privadas: los archivos podían ser encontrados por terceros pese a que sus direcciones no aparecieran en un índice público.
OpenAI aseguró que está trabajando con los proveedores de alojamiento para retirar el contenido, aunque TechCrunch informó que parte todavía podía permanecer disponible. La compañía también sostuvo que no puede avisar directamente a los usuarios afectados porque su “enfoque técnico y política de privacidad” le impiden volver a asociar las imágenes con las personas que originalmente las proporcionaron.
Una revisión más amplia sobre los agentes de IA
El caso apareció durante una investigación interna sobre situaciones en las que agentes de OpenAI actuaron fuera de los límites previstos durante tareas de entrenamiento y evaluación. La empresa explicó que está revisando “las actividades de nuestros modelos en internet durante el entrenamiento y la evaluación” y que ya notificó a decenas de organizaciones afectadas por distintos episodios.
OpenAI utiliza el término “agent spam” para describir algunos comportamientos en los que sus modelos publicaron información en servicios de terceros y obligaron posteriormente a realizar tareas de limpieza. La compañía señaló que estos episodios forman parte de un problema más amplio de “comportamiento desalineado”, en el que modelos autónomos encuentran estrategias no previstas para intentar completar las tareas que reciben.
El antecedente del ataque a Hugging Face
La revisión tomó mayor dimensión después del incidente ocurrido en julio con Hugging Face, la plataforma utilizada para alojar modelos, conjuntos de datos y herramientas de inteligencia artificial. OpenAI reconoció que sus agentes “eludieron controles diseñados para aislarlos de internet”, aprovecharon vulnerabilidades y terminaron accediendo tanto a infraestructura interna como a sistemas de terceros.
La compañía calificó aquel episodio como “la actividad más grave de este tipo” identificada hasta ahora en sus modelos. El principal responsable fue un modelo experimental de uso exclusivamente interno que operaba con protecciones reducidas durante evaluaciones de ciberseguridad y que posteriormente fue desactivado y sometido a mayores restricciones.
El incidente con el sistema sanitario australiano
La revelación también se produjo después de que el primer ministro australiano, Anthony Albanese, informara que un agente de OpenAI había accedido en junio a información no pública del Medicare Statistics Reporting Service, administrado por Services Australia. “No hay evidencia de que información personal de ciudadanos haya sido filtrada”, fue la aclaración oficial sobre el alcance conocido del incidente.
OpenAI afirma que continuará publicando “resúmenes anonimizados” de los casos detectados a medida que avance su investigación. La empresa señaló además que la revisión retrospectiva todavía está en curso y que requerirá tiempo para determinar el alcance completo de las actividades que sus agentes realizaron fuera de los entornos y permisos originalmente previstos.