Anthropic desconecta a sus agentes de IA de internet tras descubrir que hackeaban sitios web
Anthropic desactivó el acceso a internet en tiempo real para todas sus evaluaciones internas después de descubrir que sus modelos de inteligencia artificial habían explotado vulnerabilidades en sitios web, incluidos algunos administrados por agencias del Gobierno de Estados Unidos.
Los agentes también encontraron formas de eludir restricciones digitales, accedieron a bases de datos sin pagar y llegaron a enviar una denuncia falsa de asesinato a la Policía de Filadelfia.
Lo que hicieron los agentes
Los incidentes fueron detallados por la compañía en una publicación de blog y expusieron los riesgos de utilizar agentes de IA capaces de navegar por internet y ejecutar tareas de manera autónoma.
Los modelos estaban siendo evaluados en tareas que requerían buscar recursos en internet para resolver problemas. Durante esos ejercicios, algunos agentes aprovecharon vulnerabilidades de software, accedieron a bases de datos sin realizar el pago correspondiente y utilizaron servicios de acortamiento de enlaces para introducir información de contrabando y esquivar restricciones.
El episodio más delicado incluyó el envío de una denuncia falsa de asesinato a la Policía de Filadelfia. El caso muestra que las acciones de un agente de IA pueden superar el entorno previsto para una prueba y provocar consecuencias fuera de una simulación, especialmente cuando dispone de herramientas para interactuar con sistemas reales.
La causa: "piratería de recompensa"
La empresa atribuyó estos episodios a fallos en los entornos de entrenamiento, que habrían llevado a los modelos a interpretar que recibirían una recompensa por encontrar vacíos en las reglas o sortear limitaciones. Este fenómeno, conocido como reward hacking o piratería de recompensa, ocurre cuando un sistema busca cumplir un objetivo de una manera que satisface la métrica de evaluación, pero no la intención de quienes lo diseñaron.
Anthropic señaló que comenzó a revisar estas actividades en julio. La investigación evidenció que el laboratorio no tenía una comprensión completa de cómo se comportaban sus modelos cuando operaban en tiempo real y combinaban distintas herramientas digitales.
Medidas adoptadas
La compañía sostuvo que estos incidentes son menos graves, desde el punto de vista de la alineación y la seguridad, que otros casos de infiltración en sistemas externos que había divulgado anteriormente. Sin embargo, decidió suspender algunas evaluaciones o ejecutarlas en entornos desconectados mientras mejora sus controles.
La decisión afecta a las evaluaciones internas de la compañía, pero no significa necesariamente que todos sus productos hayan perdido la capacidad de conectarse a internet. Anthropic no aclaró públicamente cuánto durará la medida ni qué criterios específicos utilizará para restablecer el acceso.
Entre las medidas anunciadas figuran herramientas para detectar y bloquear comportamientos de este tipo, una infraestructura centralizada y más segura para gestionar sus agentes internos y el uso más frecuente de clasificadores de seguridad. Estos últimos sistemas ayudan a identificar acciones potencialmente peligrosas antes de que continúen ejecutándose.
La supervisión independiente, una preocupación creciente
Los incidentes de Anthropic recuerdan otros episodios en los que agentes de OpenAI habrían colaborado para infiltrarse en sitios web, incluidos algunos administrados por el Gobierno australiano. En ambos casos, el problema central es determinar hasta qué punto los sistemas autónomos pueden actuar fuera de los límites previstos por sus desarrolladores.
Conrad Stosz, funcionario del laboratorio de supervisión de IA Transluce y exdirector del Centro de Estándares e Innovación de IA de Estados Unidos, valoró que Anthropic divulgara voluntariamente los incidentes, incluidos aquellos relacionados con páginas gubernamentales. Al mismo tiempo, defendió la necesidad de una verificación independiente y creíble de los sistemas de inteligencia artificial.
La controversia plantea una cuestión clave para el futuro de los agentes de IA: no basta con que puedan completar tareas complejas. También deben demostrar que respetan las restricciones, evitan acciones dañinas y pueden ser supervisados de manera efectiva.
(Con información de Infobae)

