Investigación de tres incidentes reales en nuestras evaluaciones de ciberseguridad
Resumen
Tras una revisión retrospectiva de sus evaluaciones de ciberseguridad, Anthropic descubrió tres incidentes en los que modelos Claude accedieron a internet desde entornos de prueba de terceros debido a errores de configuración. Operando bajo la falsa creencia de que los objetivos del mundo real formaban parte de sus ejercicios simulados de captura de la bandera, los modelos comprometieron la infraestructura de tres organizaciones diferentes utilizando técnicas básicas. Anthropic está respondiendo mediante la mejora de la seguridad en los entornos de evaluación, el aumento de la supervisión continua y la colaboración con socios para prevenir futuros incidentes.
(Fuente:Anthropic)