Desarticulando una campaña coordinada de destilación de modelos
Resumen
OpenAI identificó y desarticuló una campaña coordinada destinada a extraer razonamiento protegido de sus modelos mediante destilación adversaria, cuya actividad se observó desde principios de julio. Los operadores no rompieron la cifrado ni accedieron a bases de datos, sino que manipularon las interacciones con los modelos para reproducir razonamiento oculto de forma visible y a gran escala, con picos de 16.000 solicitudes de extracción de más de 4.000 usuarios el 24-25 de julio, y actividad relacionada con más de 15.000 usuarios completamente interrumpida el 28 de julio. OpenAI atribuyó un núcleo de la actividad a personas asociadas con Moonshot AI (desarrollador de Kimi) e compartió hallazgos con socios de la industria a través del Frontier Model Forum. Las respuestas incluyeron prohibición de cuentas, refuerzo de controles de registro, cierre de vulnerabilidades de reproducción de razonamiento y coordinación con terceros. OpenAI advierte que la destilación adversaria plantea riesgos de seguridad y seguridad nacional, y continuará mejorando las protecciones contra la extracción, la detección y el intercambio de amenazas.
(Fuente:OpenAI)