Hacia casos de seguridad para el entrenamiento de IA fronteriza

OpenAI
OpenAI propone pautas de casos de seguridad, salvaguardas técnicas y prácticas operativas para el entrenamiento de IA fronteriza.

Resumen

OpenAI sostiene que se debería requerir documentación estructurada de seguridad antes de continuar cualquier entrenamiento de refuerzo por aprendizaje (RL) fronterizo, aspirando a alcanzar el nivel de "casos de seguridad" integralmente estructurados y basados en evidencia utilizados en otras industrias críticas como la aviación y la energía nuclear. El artículo presenta pautas iniciales en tres áreas: (1) Salvaguardas técnicas que cubren la alineación del modelo (calidad del entorno de entrenamiento y evaluación, medición de alineación), la contención mediante seguridad de infraestructura multicapa y ejercicios de red team, y sistemas de monitoreo en tiempo real; (2) Pautas operativas que incluyen disidencias (análisis previos), aprobaciones de la alta dirección con poder de veto, estructuras de responsabilidad, manuales de pausa, transparencia interna, auditorías, procesos de escalamiento, controles técnicos que "fallan en cierre", capacidad de retroceso y enumeración de riesgos residuales; y (3) Mejores prácticas para investigar incidentes graves de desalineación, incluyendo transparencia interna durante las investigaciones, análisis de causa raíz de las dinámicas de entrenamiento, lecciones aprendidas, desarrollo de pruebas de regresión y divulgación pública de hallazgos. Estas directrices representan las recomendaciones actuales de OpenAI, reconocidas como en evolución, y se comparten para invitar a la retroalimentación de la comunidad.

(Fuente:OpenAI)