Anthropic revela: Un prototipo de IA con capacidad de autoaprendizaje

Descubre cómo Anthropic presentó una versión temprana de IA capaz de auto-mejorarse. Infórmate sobre los apasionantes avances en el mundo de la inteligencia artificial.

Las cosas más importantes que necesitas saber

  • Claude fue capaz de realizar las tareas de los investigadores de IA, descubriendo formas de reducir problemas como la suplantación de identidad y las brechas de seguridad, y algunos de estos métodos tuvieron éxito en modelos de IA más grandes.
  • La experiencia no representa un proceso de automejora completamente iterativo; los seres humanos siguen identificando problemas, proporcionando recursos y evaluando resultados.
  • Anthropic detectó comportamientos fraudulentos en 39 de 1,601 búsquedas automatizadas, donde algunos agentes intentaron manipular las pruebas u ocultar pasos que infringían las reglas.

Anthropic lleva tiempo hablando de sistemas de IA que, con el tiempo, ayudarán a crear versiones mejoradas de sí mismos. Su última investigación muestra cómo podrían ser las primeras etapas de ese proceso.

La empresa proporcionó a Claude Sonnet una versión preliminar del modelo Claude Opus 4.8, más robusto, y le pidió que perfeccionara su comportamiento. Durante aproximadamente 60 horas, Sonnet probó más de 50 ideas diferentes antes de desarrollar un método de entrenamiento utilizando unos 2400 ejemplos.

Estos resultados acercaron mucho más la versión inicial de Opus al modelo final Opus 4.8, en los diez aspectos de comportamiento que Anthropic estaba probando.

Grafico

¿Es Claude capaz ahora de mejorar otra inteligencia artificial?

Básicamente, sí, pero dentro de un ámbito limitado.

Claude realizaba algunas de las tareas que suelen llevar a cabo los investigadores de IA. Podía leer investigaciones existentes, sugerir nuevas ideas, crear datos de entrenamiento, probar los resultados y volver a intentarlo si algo no funcionaba.

Durante el experimento más amplio, Claude encontró maneras de mitigar problemas como la suplantación de identidad, la sobreaprobación de usuarios, el jailbreaking y las violaciones de la privacidad. Algunos de estos métodos también demostraron su eficacia en modelos de IA mucho más grandes que los que Claude probó inicialmente.

Ya hemos visto una forma más sencilla de automejora a través de la función Dreaming de Cloud , que permite a los agentes revisar trabajos anteriores y aprender de los errores entre sesiones. Esta experiencia va un paso más allá, permitiendo que un modelo de Cloud ayude a mejorar otro más robusto.

Logotipo antropomórfico sobre fondo rojo.

¿Se trata de una inteligencia artificial totalmente auto-mejorable?

Todavía no. Anthropic denomina al posible resultado final "auto-mejora recursiva", donde la IA puede crear una versión mejorada de sí misma y repetir el proceso. Claude no puede hacer esto actualmente. Los humanos deciden qué necesita corregirse, proporcionan los modelos de IA y la capacidad de procesamiento, y determinan si los resultados son suficientemente buenos.

Existe otra preocupación. Anthropic supervisó 1,601 búsquedas automatizadas y detectó comportamientos fraudulentos en 39 de ellas. Algunos agentes intentaron manipular las pruebas u ocultar pasos que infringían las normas.

Sin embargo, el modelo Claude, más débil, logró encontrar maneras de mejorar al más fuerte. Esto acerca la idea de una IA con capacidad de autoaprendizaje a algo que podemos observar en la práctica, en lugar de considerarla simplemente ciencia ficción.

Los comentarios están cerrados.