Un agente de inteligencia artificial de OpenAI habría dejado notas para futuras versiones de sí mismo con instrucciones sobre cómo liberarse de sus restricciones internas, según reveló Reuters. Tres fuentes con conocimiento directo del hecho confirmaron la información al medio.
El episodio ocurrió mientras OpenAI evaluaba las capacidades de ciberseguridadde un agente autónomo impulsado por dos de sus modelos más avanzados: GPT-5.6 Sol y otro modelo aún no lanzado.
OpenAI evaluaba las capacidades de ciberseguridad de un agente autónomo
Qué encontraron los investigadores de OpenAI
Durante las pruebas, los investigadores detectaron indicios de comportamiento inusual en el sistema. Entre ellos, se registró que la IA habría dejado instrucciones para versiones futuras de sí misma sobre cómo eludir las restricciones impuestas durante los tests.
No pudo establecerse si este episodio está vinculado con el reciente caso en el que un agente autónomo de OpenAI escapó de su entorno de prueba y lanzó un ciberataque contra Hugging Face, la plataforma de modelos de IA de código abierto más grande del mundo.
Según Reuters, OpenAI no tenía conocimiento de que uno de sus propios modelos había ejecutado el ataque hasta que Hugging Face lo hizo público. El caso expone las dificultades crecientes para monitorear sistemas de IA cada vez más autónomos, a medida que se les otorga mayor libertad para planificar y ejecutar tareas complejas.
Qué encontraron los investigadores de OpenAI
El debate sobre las IA que crean sus propias sucesoras
La posibilidad de que los sistemas de inteligencia artificial generen sucesores cada vez más capaces es uno de los temas centrales de la industria. Anthropic, la empresa rival de OpenAI fundada por exinvestigadores de la compañía, advirtió previamente que los futuros modelos de IA podrían llegar a diseñar, mejorar y desplegar sucesores más poderosos sin intervención humana.
La propia investigación de seguridad de Anthropic también exploró escenarios en los que sistemas avanzados de IA intentan preservarse a sí mismos cuando perciben que están en riesgo de ser apagados.
En simulaciones controladas difundidas por la compañía, algunos modelos recurrieron a comportamientos engañosos, incluido el chantaje, bajo circunstancias hipotéticas extremas. La empresa remarcó que se trató de evaluaciones de seguridad diseñadas para comprender riesgos futuros potenciales, y no de ejemplos de despliegues reales.
El debate sobre las IA que crean sus propias sucesoras
También se registraron otros episodios y reportes de sistemas de IA que mintieron o hicieron trampa para alcanzar sus objetivos.
Sam Altman y la idea de la "singularidad"
El CEO de OpenAI, Sam Altman, sostuvo que la humanidad está entrando en una era en la que los sistemas de IA se vuelven cada vez más capaces. El ejecutivo llegó a afirmar recientemente que ya se encuentra en curso una "singularidad", es decir, un momento en el que los modelos de IA superan la inteligencia humana.