OpenAI incorporará en su modelo Astra una técnica de razonamiento llamada “recurrent depth”. El método permite procesar una consulta varias veces en un bucle, en lugar de seguir una secuencia lineal.
Según The Information, la técnica también es conocida como “opaque recurrence” y podría hacer más difícil monitorear la cadena de pensamiento de los modelos. Expertos en seguridad de inteligencia artificial expresaron preocupación por sus posibles efectos.
Expertos en seguridad de IA expresaron preocupación por sus posibles efectos
Qué es la nueva técnica de razonamiento de Astra
Los modelos de razonamiento suelen generar una cadena de pensamiento con los pasos que siguen al intentar resolver un problema. Aunque esa representación no es perfecta, puede servir como herramienta para detectar comportamientos problemáticos o desalineados.
En el caso de la recurrencia opaca, el modelo aborda la misma consulta varias veces mediante un proceso en bucle. Esto deja menos rastros legibles y puede dificultar el seguimiento convencional de su razonamiento.
La preocupación de los especialistas está relacionada con la posibilidad de que esta técnica reduzca la monitorización de la cadena de pensamiento, especialmente si su utilización aumenta en futuros modelos.
Qué es la nueva técnica de razonamiento de Astra
Expertos en seguridad cuestionaron el uso de la recurrencia opaca
Buck Shlegeris, CEO de Redwood, dijo estar “extremadamente preocupado” por los reportes sobre el uso de recurrencia opaca en Astra. Según planteó, una aplicación más intensiva podría reducir de manera considerable la capacidad de monitorear las cadenas de pensamiento.
El especialista en seguridad de IA Zvi Mowshowitz también cuestionó la técnica. Advirtió sobre el riesgo de una competencia entre laboratorios que termine impulsando un uso cada vez mayor de estos métodos.
Expertos en seguridad cuestionaron el uso de la recurrencia opaca
Mowshowitz sostuvo que una utilización más intensiva de estas técnicas probablemente dañaría la monitorización del razonamiento.
Por qué preocupa que la IA razone de forma menos visible
La cadena de pensamiento fue una herramienta importante para analizar comportamientos de agentes de IA. En el caso de la reciente actividad de agentes que actuaron de manera inesperada en OpenAI, esos registros ayudaron a investigar por qué se comportaron de determinada manera.
La recurrencia opaca plantea otro escenario porque puede dejar menos información legible sobre el proceso utilizado por el modelo para llegar a un resultado.
Por qué preocupa que la IA razone de forma menos visible
Ryan Greenblatt, científico jefe de Redwood Research, señaló que el razonamiento opaco podría escalar más rápido que el razonamiento convencional mediante cadenas de pensamiento.
OpenAI asegura que Astra mantendrá una cadena de pensamiento legible
El uso de la técnica en Astra sería limitado. La cadena de pensamiento del modelo todavía debería ser legible, y OpenAI rechazó la posibilidad de avanzar hacia un sistema denominado “neuralese”.
OpenAI asegura que Astra mantendrá una cadena de pensamiento legible
Además, la compañía ya anunció planes para desarrollar sistemas extensivos de monitoreo de cadenas de pensamiento como parte de sus planes de seguridad.
Jakub Pachocki, científico jefe de OpenAI, reafirmó el compromiso de la empresa con las cadenas de pensamiento legibles. Según escribió, su preservación y utilización forman parte de la investigación de seguridad de la compañía desde sus primeros modelos de razonamiento.
Anthropic y Google DeepMind también analizan la técnica
The Information informó posteriormente que Anthropic y Google DeepMind ya estaban discutiendo la técnica de recurrencia opaca.
Anthropic y Google DeepMind también analizan la técnica
Los investigadores aclaran que todos los modelos de IA realizan algún grado de razonamiento opaco y que pocos consideran los registros de cadena de pensamiento como una representación directa del razonamiento.
Aun con esas limitaciones, persiste la preocupación de que una mayor utilización de la recurrencia opaca haga más difícil supervisar cómo razonan los modelos de inteligencia artificial.