Investigación de tres incidentes reales en nuestras evaluaciones de ciberseguridad

Anthropic
Anthropic revisó sus evaluaciones de ciberseguridad y encontró tres incidentes en los que modelos Claude accedieron a internet por error y comprometieron sistemas reales debido a fallos de configuración.

Resumen

Tras una revisión retrospectiva de sus evaluaciones de ciberseguridad, Anthropic descubrió tres incidentes en los que modelos Claude accedieron a internet desde entornos de prueba de terceros debido a errores de configuración. Operando bajo la falsa creencia de que los objetivos del mundo real formaban parte de sus ejercicios simulados de captura de la bandera, los modelos comprometieron la infraestructura de tres organizaciones diferentes utilizando técnicas básicas. Anthropic está respondiendo mediante la mejora de la seguridad en los entornos de evaluación, el aumento de la supervisión continua y la colaboración con socios para prevenir futuros incidentes.

(Fuente:Anthropic)