Laboratorios de inteligencia artificial aún carecen de planes de contención claros

img_796f7a9c

Un reciente estudio revela que pocos de los principales laboratorios de inteligencia artificial han publicado o demostrado planes de respuesta ante situaciones de contención. Un plan de contención define las acciones a seguir cuando una inteligencia artificial intenta eludir el control humano, especificando qué accesos se cortan y cuándo se apaga completamente el sistema. Este análisis ha sido realizado por Guidelight AI Standards, una organización centrada en promover prácticas seguras en el desarrollo de inteligencia artificial, que evaluó a cinco laboratorios líderes en su preparación para este tipo de escenario. OpenAI obtuvo la mejor calificación, mientras que Anthropic y Meta fueron los que puntuaron más bajo.

La importancia de estos hallazgos se hace evidente a medida que la inteligencia artificial asume roles cada vez más autónomos dentro de los sistemas de las empresas, y los reguladores en California y Nueva York comienzan a exigir la divulgación de estos planes. Para aquellos que desarrollan o invierten en estos modelos, se trata de una evaluación independiente que muestra cómo cada laboratorio gestiona el riesgo operativo en comparación con lo que públicamente comunica al respecto.

La evaluación de Guidelight se basó en los planes disponibles públicamente de Anthropic, Google, OpenAI, Meta y xAI, calificándolos en una serie de métricas, que incluyen la eficacia en el registro y monitoreo de las actividades internas de sus sistemas de inteligencia artificial, la capacidad de detener los sistemas tras un aumento de comportamientos problemáticos, la realización de auditorías por terceros independientes y la claridad en sus planes para contener un modelo que se descontrole.

La preocupación sobre la capacidad de las empresas de inteligencia artificial para contener sus modelos cada vez más avanzados ha crecido tras una serie de incidentes de ciberseguridad en los que modelos de OpenAI, Anthropic y Meta lograron acceder de forma no intencionada a internet durante evaluaciones de seguridad, comprometiendo sistemas externos. Estos hallazgos ponen de manifiesto las diferencias en la forma en que las empresas de inteligencia artificial abordan públicamente la seguridad a medida que amplían la implementación de modelos autónomos en entornos donde pueden tomar decisiones críticas.

Aunque algunas empresas han proporcionado detalles sobre cómo evalúan sus modelos para detectar capacidades peligrosas antes de su implementación, han sido menos explícitas sobre los procedimientos a seguir cuando un modelo ya en funcionamiento presenta comportamientos inadecuados. Steven Adler, científico jefe de Guidelight y exinvestigador de seguridad en OpenAI, expresó su sorpresa por la falta de información que las empresas han compartido sobre cómo manejarían un incidente grave si su modelo escapara a su control.

Guidelight define un plan de contención como un “plan preespecificado que se activa cuando se detecta que la inteligencia artificial intenta eludir el control, y que cubre qué permisos revocar del modelo, para quién puede seguir operando bajo qué restricciones, y cuándo desconectarlo completamente”. Adler comentó que “hay buenas razones para pensar que los modelos líderes de las empresas de inteligencia artificial en la actualidad están desalineados en cierto sentido”. En este contexto, subrayó que las empresas deben contar con mecanismos que les permitan supervisar lo que su inteligencia artificial está haciendo, identificar signos de desalineación y detener acciones peligrosas antes de que se lleven a cabo.

A pesar de la creciente preocupación, la mayoría de los planes para gestionar riesgos catastróficos siguen siendo responsabilidad de las empresas. El informe de Guidelight indica que la mejor evidencia pública muestra que las compañías tienen “pocos protocolos de contención listos para una emergencia”. Sin embargo, podría haber planes de contención que las empresas poseen pero no han hecho públicos. Un portavoz de Google afirmó que el informe de Guidelight no representa el alcance completo de las medidas de seguridad y protección de inteligencia artificial de la compañía, sin responder si existe un plan de respuesta interno que no haya sido divulgado.

Un portavoz de OpenAI expresó una opinión similar, indicando que la evaluación de Guidelight no captura todas las prácticas internas de la empresa. “Contamos con un proceso que requiere restringir permisos, pausar cargas de trabajo, limitar la implementación o desconectar completamente el modelo, y lo hemos aplicado”, dijo. Meta, por su parte, no confirmó si tiene un plan de respuesta de contención interno, y en su lugar, redirigió hacia un marco de inteligencia artificial existente que describe los umbrales de riesgo y sus métodos de prueba para evitar la pérdida de control.

Lily Li, abogada especializada en privacidad e inteligencia artificial y fundadora de Metaverse Law, sugirió que las empresas podrían dudar en divulgar el alcance completo de sus políticas y evaluaciones de contención en sus sitios web por razones legales, además de competitivas. “La preocupación desde la perspectiva de la empresa es que si hacen divulgaciones demasiado específicas y no cumplen con sus promesas, eso podría ser la base de una reclamación de marketing engañoso y exponerlas a más responsabilidad en el futuro”, comentó.

El objetivo del estudio de Guidelight es, en gran medida, fomentar que las empresas sean más transparentes sobre sus planes de seguridad. Los reguladores también están comenzando a forzar este tema. La ley SB 53 de California, que entró en vigor este año, exige a los grandes desarrolladores de inteligencia artificial publicar marcos que expliquen cómo identifican y responden a incidentes críticos de seguridad y gestionan los riesgos derivados de modelos que eluden mecanismos de supervisión. La Ley RAISE de Nueva York, que tiene criterios similares, entrará en vigor en enero. Además, el mes pasado se presentó el proyecto de ley AI Kill Switch Act, una iniciativa bipartidista que requeriría a los principales desarrolladores de inteligencia artificial crear y mantener mecanismos técnicos para apagar modelos de inteligencia artificial rebeldes. Connor Leahy, director ejecutivo de ControlAI, una organización sin ánimo de lucro, afirmó que “un botón de apagado es el mínimo indispensable para los modelos actuales”, enfatizando la necesidad de que las empresas comprendan mejor los sistemas que están construyendo y los riesgos asociados.

Etiquetas: Inteligencia Artificial, Laboratorios

Compartir:
Óscar López

Sobre Óscar López

Periodista tecnológico especializado en inteligencia artificial, innovación empresarial y transformación digital. Colaborador de Las Noticias de la IA.

Únete al grupo de WhatsApp

También te puede interesar

   

Sin comentarios

Para comentar debes tener una cuenta. ¡Es gratis!

Regístrate gratis Iniciar sesión
🤖 IA EN DIRECTO
La inteligencia artificial superará a médicos en calidad de atención médicaDavid Lawrence recauda 6 millones para Blue Voice, startup de inteligencia artificialInstagram limita alcance de cuentas de IA que no se autodenominanEl control sobre la inteligencia artificial centra los debates en TechBBQ 2026Clipto obtiene valoración de 250 millones tras recaudar 15 millones en inversiónDebian aprueba uso de IA generativa con revisión humana obligatoriaDescubre el secreto para comunicarte con la inteligencia artificial sin ser rechazadoDescubre el secreto para crear contenido visual exitoso en 2026″.Descubre el secreto detrás del curso gratuito de inteligencia artificial que estás compartiendo en YouTube.Collado Villalba se convierte en la capital española de la ciberseguridad y el municipalismo con la jornada VillalbIA 2026Debian permite el uso de herramientas de IA en su distribución LinuxNvidia invierte 3.500 millones en MediaTek para potenciar chips de IALa inteligencia artificial superará a médicos en calidad de atención médicaDavid Lawrence recauda 6 millones para Blue Voice, startup de inteligencia artificialInstagram limita alcance de cuentas de IA que no se autodenominanEl control sobre la inteligencia artificial centra los debates en TechBBQ 2026Clipto obtiene valoración de 250 millones tras recaudar 15 millones en inversiónDebian aprueba uso de IA generativa con revisión humana obligatoriaDescubre el secreto para comunicarte con la inteligencia artificial sin ser rechazadoDescubre el secreto para crear contenido visual exitoso en 2026″.Descubre el secreto detrás del curso gratuito de inteligencia artificial que estás compartiendo en YouTube.Collado Villalba se convierte en la capital española de la ciberseguridad y el municipalismo con la jornada VillalbIA 2026Debian permite el uso de herramientas de IA en su distribución LinuxNvidia invierte 3.500 millones en MediaTek para potenciar chips de IA

Preferencias de cookies

Otras

Otras cookies son aquellas que todavía se están clasificando o que no encajan en las categorías anteriores.

Necesarias

Necesarias
Las cookies necesarias son imprescindibles para que el sitio web funcione correctamente. Permiten funciones básicas, seguridad y navegación, y no pueden desactivarse desde este panel.

Publicidad

Las cookies de publicidad pueden utilizarse para mostrar contenidos o anuncios más relevantes y medir su eficacia.

Analiticas

Las cookies analíticas nos ayudan a entender cómo se utiliza el sitio web para mejorar contenidos, rendimiento y experiencia de navegación.

Funcionales

Las cookies funcionales permiten recordar preferencias y mejorar algunas funciones del sitio para ofrecer una experiencia más cómoda.

Rendimiento

Las cookies de rendimiento ayudan a medir y optimizar el funcionamiento del sitio web.