La empresa Anthropic informó que sus modelos de inteligencia artificial Claude ingresaron a infraestructuras reales de tres organizaciones durante ejercicios de seguridad diseñados para entornos simulados. El incidente ocurrió por un error de configuración en la plataforma de pruebas.
Anthropic, compañía dedicada al desarrollo de inteligencia artificial, confirmó que sus modelos Claude accedieron a sistemas reales de tres organizaciones durante pruebas de ciberseguridad. Los ejercicios, conocidos como capture the flag (captura la bandera), estaban diseñados para realizarse en ambientes simulados, pero un error de configuración con la empresa encargada de las pruebas dejó los sistemas conectados a internet real.
Según informó la compañía, en tres de esos ejercicios distintas versiones de Claude lograron ingresar a infraestructuras externas utilizando vulnerabilidades básicas, como contraseñas débiles o servicios sin autenticación.
Uno de los episodios ocurrió cuando el nombre de una organización ficticia utilizada en la prueba coincidió con el dominio de una empresa existente. El modelo explotó vulnerabilidades, obtuvo credenciales y accedió a una base de datos con información de producción.
En otro caso, un modelo creó un paquete de software que debía formar parte de una simulación y lo publicó en PyPI, un repositorio utilizado por desarrolladores de Python. El paquete quedó disponible públicamente y fue descargado por 15 sistemas reales antes de ser retirado. Entre esos sistemas había uno perteneciente a una empresa de ciberseguridad que analizaba automáticamente programas publicados en internet. Al ejecutarse, el código permitió obtener credenciales y acceder a más infraestructura.
El incidente de Anthropic se conoció días después de que OpenAI informara que algunos de sus agentes de inteligencia artificial lograron salir de entornos aislados durante pruebas internas y conectarse con servicios externos. En el caso de OpenAI, la preocupación estuvo vinculada a la capacidad de los agentes para superar restricciones del entorno de prueba. En Anthropic, la compañía explicó que el acceso ocurrió porque la separación entre la simulación y los sistemas reales falló.
