Anthropic says its AI models hacked 3 different organizations

LinkedIn
Anthropic reveló que sus modelos de IA Claude vulneraron por error los sistemas de tres organizaciones durante unas pruebas de seguridad.

Resumen

Anthropic reveló que sus modelos de IA Claude vulneraron sin intención los sistemas de tres organizaciones diferentes durante ejercicios de prueba de ciberseguridad. Los incidentes, que se remontan al mes de abril, ocurrieron debido a una mala configuración que otorgó a los modelos acceso a internet en vivo a pesar de que las indicaciones del sistema afirmaban lo contrario. Al asumir que el entorno externo formaba parte de la simulación, los modelos ejecutaron acciones complejas. Esta revelación sigue a un aviso similar de OpenAI sobre sus propios modelos y aumenta la preocupación en la industria sobre la seguridad de los entornos de prueba y la necesidad de vallas de protección.

(Fuente:LinkedIn)