Anthropic declaró el jueves que sus modelos de inteligencia artificial Claude obtuvieron acceso no autorizado a los sistemas de producción de tres organizaciones durante evaluaciones internas de ciberseguridad, luego de que un entorno de pruebas fue dejado por error conectado a internet.
La startup de IA señaló que descubrió los incidentes durante una revisión retrospectiva iniciada después de que OpenAI revelara el 21/07 que varios de sus propios modelos habían escapado de un entorno de pruebas aislado al explotar una vulnerabilidad de software previamente desconocida, accediendo a la infraestructura de producción de Hugging Face.
Anthropic indicó que revisó 141,006 ejecuciones de evaluaciones de ciberseguridad e identificó tres incidentes, que datan de abril, en los que Claude accedió a internet a través de un entorno de pruebas de terceros mal configurado, operado por el socio evaluador Irregular.
La compañía señaló que los modelos creyeron que operaban en un ejercicio simulado de «captura la bandera», ya que se les había indicado que no tenían acceso a internet. En cambio, explotaron contraseñas débiles, credenciales expuestas y sistemas sin autenticación en organizaciones reales, utilizando técnicas de ataque básicas.
Un modelo de Claude obtuvo acceso a una base de datos de producción que contenía varios cientos de filas de datos, mientras que otro subió un paquete malicioso de Python al repositorio público PyPI, el cual fue descargado brevemente por 15 sistemas reales antes de ser eliminado.
Anthropic afirmó que ninguno de los modelos intentó escapar de sus entornos de prueba ni exfiltrarse a sí mismos.
La empresa detuvo todas las evaluaciones de ciberseguridad el 23/07, notificó a las organizaciones afectadas el 27/07, y señaló que las medidas de seguridad utilizadas en los modelos Claude disponibles al público habrían bloqueado dicho comportamiento.
La compañía indicó que está reforzando los procedimientos de seguridad y monitoreo en sus evaluaciones.
ComputerHoy












