El entrenamiento de modelos de inteligencia artificial mediante otros modelos de IA se ha convertido en un objetivo popular para los neolabs. Recientemente, un investigador del programa de becarios de Anthropic ha presentado un avance significativo en esta área. El viernes, Anthropic publicó un estudio titulado “Los investigadores automatizados pueden mitigar de manera fiable los fallos de alineación”, en el que se detalla cómo los sistemas de IA podrían mejorar de forma consistente el rendimiento de un modelo en una serie de pruebas de alineación. En este estudio, al enfrentarse a diez pruebas relacionadas con comportamientos desalineados, los sistemas automatizados lograron mejorar el rendimiento en cada una de ellas sin que se viera afectado el rendimiento general.
Dirigido por el becario de Anthropic Chen Yueh-Han, el sistema sigue en gran medida los enfoques tradicionales de investigación. Cada sistema automatizado explora la literatura disponible, propone un método y entrena el modelo utilizando dicho método durante un periodo de 30 minutos, aumentando gradualmente el nivel de las pruebas a lo largo de varias iteraciones. Los métodos efectivos se conservan, mientras que los ineficaces se descartan, lo que permite que el sistema opere de manera rápida y a gran escala.
El estudio señala que “en general, estos resultados proporcionan evidencia temprana de que la alineación automatizada posterior al entrenamiento podría convertirse en una práctica viable a corto plazo”. Este avance es un paso hacia la auto-mejora recursiva, que muchos consideran como el siguiente gran hito en el progreso de la inteligencia artificial. Si los modelos pueden mejorar su propio entrenamiento de alineación, es plausible que también puedan optimizar las prácticas de entrenamiento en general, lo que podría llevar a la obsolescencia de los investigadores humanos en el campo de la IA.
El documento no evita abordar esta idea, comparando explícitamente el Investigador de Alineación Automatizado (AAR) con su equivalente humano. Se afirma que “el mejor método AAR supera lo que proponen los humanos experimentados, en promedio, dentro de seis horas”. Además, se indica que las direcciones de investigación guiadas por humanos no conducen a un rendimiento más fuerte.
Incluso se incluye una comparación de costes para aquellos que pudieran dudar de su viabilidad. El estudio menciona que “un AAR cuesta aproximadamente 4 dólares por hora en inferencia de API, frente a los 150 dólares por hora que pagamos a nuestros investigadores humanos”. Sin embargo, también se reconocen algunas limitaciones de este enfoque. El sistema automatizado solo funciona en la medida en que las pruebas reflejan los objetivos de alineación reales y, aun así, existe un trabajo considerable por hacer para establecer y mantener esos benchmarks, sin olvidar la necesidad de mantener y ampliar la literatura de la que se nutren los investigadores automatizados.
Etiquetas: Inteligencia Artificial, Investigadores de Anthropic
Sin comentarios
Para comentar debes tener una cuenta. ¡Es gratis!
Regístrate gratis Iniciar sesión