打击一次协同的模型蒸馏活动

OpenAI
OpenAI发现并打击了一场从其模型中提取受保护推理的协同蒸馏攻击活动。

内容摘要

OpenAI近日发现并打击了一场旨在从其模型中提取受保护推理的协同攻击活动,最早观测到的活动始于7月初。攻击者未破解加密或入侵数据库,而是通过操纵模型交互,在可见形式中大规模复制隐藏推理内容。7月24日至25日出现高峰,超过4,000名用户发起16,000次提取请求;相关活动波及超过15,000名用户,已于7月28日被完全阻断。OpenAI将核心活动归因于与Moonshot AI(Kimi开发者)相关的个人,并通过Frontier Model Forum与行业伙伴共享情报。防御措施包括账户封禁、加强注册控制、修复推理回放漏洞,以及与第三方协调。OpenAI强调,对抗性蒸馏存在安全和国家安全风险,将持续强化提取防护、检测能力和威胁信息共享。

(来源:OpenAI)