Con las evaluaciones de Anthropic en inteligencia artificial y ciberseguridad, se brinda seguimiento a los incidentes de este tipo en la industria. Por esto, la compañía llevó a cabo una revisión exhaustiva de sus propias pruebas sobre la protección de los datos.
En este sentido, la compañía informó que analizó retrospectivamente más de 141 mil ejecuciones de pruebas. Así detectó tres incidentes en los que los modelos de Claude accedieron a infraestructura de empresas, en ejercicios de captura de bandera (CTF).
Sin embargo, la compañía subrayó que las causas fueron distintas a las descritas por OpenAI, durante sus propias pruebas de IA. De acuerdo con Anthropic, la diferencia principal radica en la manera en que dichos modelos llegaron a los sistemas externos.
Ya que OpenAI, reportó que su modelo explotó una vulnerabilidad de día cero para salir de un entorno aislado y entrar a Hugging Face. Así las evaluaciones de Anthropic con Claude usaron la ruta web abierta, por una configuración incorrecta del entorno.
Sin embargo, la empresa explicó que las IA recibieron instrucciones explícitas de que no tenían acceso a internet. Y que todos los sistemas disponibles, solo eran parte de una simulación pero un error de coordinación con el proveedor externo la habilitó.
Se descubren más vulnerabilidades con evaluaciones de Anthropic
Dicha situación llevó a dichos modelos a interpretar los sistemas reales, como parte de objetivos válidos dentro del ejercicio. Es decir, las evaluaciones de Anthropic en la revisión identificaron tres incidentes distintos, así se deben tomar diversas medidas.
Por eso, los accesos se lograron mediante técnicas básicas como contraseñas débiles, puntos finales sin autenticación o vulnerabilidades conocidas. Al respecto, Anthropic aseguró que no hubo explotación de fallas complejas, ni evidencia de otros intentos.
La comparación también reveló diferencias en el comportamiento de los modelos, ya que Claude Opus 4.7 continuó el ataque. Aún después de reconocer que interactuaba con sistemas de producción; Mythos 5 concluyó por error que seguía en simulación.
Además un modelo de investigación más reciente, detuvo esta actividad al identificar que el objetivo era real. Es así que, las evaluaciones de Anthropic aclararon que estos episodios son casos aislados, algo que no representa una comparación experimental.
Finalmente, así el proveedor pretende diferenciar sus incidentes como errores a nivel de configuración y operación. Más que como señales de riesgo en la alineación de los modelos, esto en contraste con el caso reportado por OpenAI en protección de datos.