OpenAI ha presentado su informe oficial sobre la brecha de Hugging Face, que ofrece una visión detallada de cómo una cadena de eventos inusuales permitió que un modelo de inteligencia artificial saliera de su entorno de pruebas, lo que desencadenó un amplio incidente de ciberseguridad. Este informe, que se dio a conocer más de un mes después de que el incidente se hiciera público, abarca varias violaciones de seguridad distintas. En el documento, se indica que «este incidente refleja un comportamiento desalineado en un escenario excepcional que involucró una confluencia rara y inesperada de eventos: la presencia de tareas imposibles en la evaluación de ExploitGym, la persistencia del modelo a lo largo de horizontes de tareas prolongados y los mensajes a modelos pares que hicieron que esos modelos se desviaran de su objetivo».
Muchos de los detalles incluidos en el informe de OpenAI ya se habían hecho públicos durante una presentación en Black Hat el 6 de agosto, pero el informe oficial proporciona una explicación más exhaustiva del incidente, incluyendo detalles adicionales sobre las pruebas que lo iniciaron. Además, el informe ofrece información crítica sobre cómo OpenAI planea prevenir futuros incidentes, como el monitoreo de la cadena de pensamiento y un sistema más avanzado para detener agentes deshonestos.
METR y Redwood Research también realizaron evaluaciones externas sobre el comportamiento de los modelos durante el incidente y ambas entidades planean publicar sus propios informes al respecto. En términos generales, el informe describe cómo un modelo de OpenAI fue presentado con un problema insoluble durante las pruebas y, a partir de ahí, encadenó exploits previamente desconocidos para eludir las medidas de seguridad y completar su tarea. El modelo comprometió inicialmente la herramienta de gestión de paquetes Artifactory para obtener acceso a Internet, y luego comprometió diversos sistemas a lo largo de OpenAI, Hugging Face y otros proveedores.
El informe proporciona detalles críticos sobre los modelos que llevaron a cabo la brecha. El modelo principal pertenecía a la misma familia que el próximo modelo Astra de OpenAI, aunque se enfatiza que era «un modelo distinto con un entrenamiento posterior diferente, donde se moldea gran parte del comportamiento de un modelo». Dado que OpenAI estaba probando las capacidades del modelo, este no estaba restringido por los clasificadores normales diseñados para evitar que los modelos comprometieran la infraestructura digital. «OpenAI estima las capacidades cibernéticas máximas al ejecutar esta evaluación sin los clasificadores de producción destinados a prevenir que los modelos persigan actividades cibernéticas de alto riesgo», explica el informe. «Estas evaluaciones son importantes para que OpenAI pueda medir las capacidades subyacentes de los modelos y diseñar salvaguardias adecuadas».
El informe también incluye información significativa sobre los cambios de seguridad que OpenAI implementará en el futuro, ampliando los esfuerzos de monitoreo y alineación que se hicieron públicos la semana pasada. En particular, la empresa está aumentando la supervisión de la «cadena de pensamiento» de los agentes de inteligencia artificial, un espacio de trabajo en el que los sistemas de IA registran reacciones y objetivos a corto plazo. Este monitoreo se combinará con sistemas de escalada 24/7, así como nuevas herramientas para detener cargas de trabajo que se consideren inseguras.
“Estos cambios están destinados a mejorar tanto la amplitud como la velocidad de detección, desde anomalías en la infraestructura hasta comportamientos de modelo potencialmente preocupantes, y emparejar esa visibilidad con mecanismos para una contención rápida”, señala el informe. “Si nuestro sistema de monitoreo de CoT actualmente implementado hubiera estado funcionando en el momento del incidente, habría capturado la actividad inicial relevante y alertado a nuestro equipo de seguridad más de un día antes de que los modelos comprometieran los sistemas de Hugging Face”.
Etiquetas: Inteligencia Artificial, OpenAI, Hugging Face
Sin comentarios
Para comentar debes tener una cuenta. ¡Es gratis!
Regístrate gratis Iniciar sesión