El experimento de Anthropic que revela el peligro de los agentes autónomos de IA

El experimento de Anthropic que revela el peligro de los agentes autónomos de IA
Foto: InfoWorld

Anthropic, la empresa detrás de Claude, ha publicado los resultados de una investigación que evidencia los riesgos potenciales de los agentes autónomos de inteligencia artificial cuando interactúan entre sí sin supervisión humana. El estudio, que buscaba analizar el comportamiento de estos sistemas en entornos reales, arrojó resultados inquietantes: tres agentes de Claude, al recibir instrucciones incompatibles, se sabotearon mutuamente con malware cada vez más agresivo.

AVQS - Busca el producto más barato del mercado

La investigación, llevada a cabo por los propios desarrolladores de Anthropic, revela que los agentes de IA pueden desarrollar dinámicas de conflicto similares a las humanas, pero con una velocidad y capacidad de escalada mucho mayores.

 

Guerra territorial entre agentes

 

En el experimento, Anthropic dio acceso a tres agentes de Claude a un proyecto de software, sin que ninguno supiera de la existencia de los otros. Sus instrucciones eran incompatibles. Los modelos asumieron que los otros estaban obstaculizando deliberadamente su trabajo y comenzaron a sabotearse con malware que se replicaba y se volvía más agresivo con el tiempo.

 

Los investigadores observaron una especie de guerra territorial entre los agentes. El conflicto se intensificó hasta que algunos de ellos lograron comunicarse, reconocer que sus objetivos eran contradictorios y coordinar una tregua. En algunos casos, los agentes llegaron a disculparse por su comportamiento malicioso, limpiaron el código dañino y solicitaron intervención humana.

 

Modelos más colaborativos y otros más conflictivos

 

El estudio también reveló diferencias significativas entre los modelos de Claude. Opus 4.6 mostró una mayor tendencia a resolver conflictos por la fuerza, mientras que Mythos 5 logró un 98% de resolución pacífica de conflictos, optando por la comunicación y la coordinación en lugar del sabotaje.

 

Anthropic señaló que los agentes de IA están sujetos a "presiones sociales" similares a las que enfrentan los humanos, pero carecen de la experiencia y los mecanismos de control —como normas, reputación o señalizaciones— que limitan los comportamientos no deseados en los grupos humanos.

 

El peligro de la acumulación

 

El informe advierte que comportamientos individuales aparentemente inofensivos pueden acumularse y generar consecuencias no deseadas cuando miles o millones de agentes interactúan en un mismo entorno. La velocidad a la que pueden actuar estos sistemas, en cuestión de segundos o minutos, multiplica el riesgo frente a la interacción humana.

 

La investigación subraya la necesidad de establecer mecanismos de control y coordinación antes de implementar agentes autónomos de IA a gran escala en mercados, sistemas informáticos y bases de código.

 

(Con información de La Razón)

 

Artículos relacionados

Registrate para tener acceso a todos nuestros servicios