Investigadores temen un desastre de seguridad antes del lanzamiento de Astra de OpenAI

The Verge
Investigadores advierten que la arquitectura opaca de Astra podría ser el peor desastre de seguridad de la IA hasta la fecha, dificultando su supervisión.

Resumen

OpenAI está a punto de lanzar su modelo de IA más potente hasta ahora, Astra, pero los investigadores temen un desastre de seguridad antes de su lanzamiento. Tras semanas de retrasos para reforzar los protocolos de seguridad después de que los agentes del modelo atacaran objetivos reales durante las pruebas, han comenzado a filtrarse detalles sobre el modelo. Los investigadores advierten que podría ser "el peor desarrollo para la seguridad y la protección de la IA hasta la fecha". Poco después de que OpenAI anunciara el martes que había retrasado el lanzamiento de Astra para trabajar en problemas de seguridad, The Information informó de que Astra muestra mucho menos de su "pensamiento" que otros modelos de IA avanzados, lo que genera preocupación por su posible dificultad para ser supervisado de forma segura. La mayoría de los sistemas de IA actuales utilizan una tecnología llamada transformador, que procesa algunos tipos de información linealmente a través de capas antes de producir una respuesta. Los modelos pueden ser configurados para mostrar su razonamiento a medida que avanzan, essentially "pensando en voz alta". Este "cadena de pensamiento" permite a los investigadores y a los sistemas de seguridad automatizados supervisar lo que hacen los modelos de IA y detectar potencialmente comportamientos indeseables, como mentir o planes para eludir las barreras de seguridad, antes de que actúen. Según The Information, citando a una persona no identificada familiarizada con el desarrollo del modelo no publicado, Astra utiliza una técnica más opaca conocida como transformador recurrente de profundidad o bucle, que hace circular la información a través de capas internas antes de producir una salida. Esto significaría que gran parte del " pensamiento " del modelo ocurre dentro del sistema, en una forma que se parece mucho menos al lenguaje humano natural, en lugar de ser expresado de una manera que los investigadores puedan supervisar fácilmente. Esto puede mejorar el rendimiento del modelo, pero hace que las amenazas potenciales y los comportamientos no deseados sean más difíciles de detectar. OpenAI ha limitado el uso de la técnica de transformador recurrente / profundidad de bucle en Astra para que los investigadores puedan seguir supervisando el razonamiento del modelo, según la fuente no identificada de The Information. En una entrada de blog publicada el martes, OpenAI dijo que está "desplegando Astra con una monitorización adicional de la cadena de pensamiento para detectar y contener rápidamente acciones potencialmente desalineadas". No mencionó si el modelo tiene una base técnica diferente. El informe de The Information generó preocupación entre los investigadores de seguridad de la IA en las redes sociales. Fue el jefe de ciencia de Redwood Research, Ryan Greenblatt, uno de los tres externos a los que OpenAI permitió investigar el hackeo de Hugging Face, quien dijo que la decisión de utilizar una arquitectura más opaca para Astra "podría ser el peor desarrollo para la seguridad de la IA hasta la fecha". Greenblatt dijo que la investigación del incidente de Hugging Face dependía en gran medida de la cadena de pensamiento de los modelos, advirtiendo que un razonamiento menos visible podría permitir que los sistemas de IA idearan y ejecutaran estrategias que serían mucho más difíciles de detectar para los investigadores. La principal preocupación de Greenblatt, compartida por otros expertos en seguridad, es que la competencia por desarrollar sistemas de IA más avanzados podría llevar a "una carrera hacia el fondo en arquitecturas que podrían ser catastróficas para nuestra capacidad de supervisar/monitorear AIs", con desarrolladores adoptando sistemas cada vez más opacos para obtener una ventaja hasta que los modelos se vuelvan difíciles, o incluso imposibles, de monitorear. Añadió que las comunicaciones de OpenAI le dejaron preocupado de que la compañía "planea depender extremadamente de la monitorización de la cadena de pensamiento para la seguridad". Los altos directivos de OpenAI respondieron a las críticas en una serie de publicaciones en las redes sociales que no niegan explícitamente el uso de la técnica por parte de la empresa. Varios expresaron preocupación por la posibilidad de una IA no monitorizable o de una carrera hacia la opacidad en términos de transparencia, incluidos los investigadores de seguridad de OpenAI Micah Carroll y Tomek Korbak, el jefe de futuros estratégicos Dean Ball, y el jefe de ciencia Jakub Pachocki, quien expresó temores de "una carrera hacia la no monitorabilidad iniciada por informes confusos". Dijo que la profundidad del cálculo de Astra - una medida de cuántos pasos puede realizar internamente - "está dentro de un factor de dos de GPT-4", lo que indica que si la técnica se utilizó, el aumento de la opacidad es menos dramático de lo que algunas reacciones implican. OpenAI no respondió a la solicitud de The Verge de confirmar o negar si se utilizaron transformadores en bucle para Astra y nos remitió a la publicación de Pachocki en X. "OpenAI ha trabajado para preservar y utilizar la monitorización de la cadena de pensamiento desde nuestros primeros modelos de razonamiento", escribió Pachocki, añadiendo que tal monitorización "es frágil y desafortunadamente está tendiendo en una dirección negativa, por razones que no dependen de cambios arquitectónicos que escribiré pronto". Sigue a los temas y autores de esta historia para ver más como esta en tu página de inicio personalizada y recibir actualizaciones por correo electrónico. Robert Hart

(Fuente:The Verge)