協調的なモデル蒸留キャンペーンの遮断
概要
OpenAIは、自社モデルから保護された推論を抽出する目的の協調的キャンペーンを特定し遮断した。攻撃者は暗号化やデータベースを破ることはなく、モデルの相互作用を操作して隠された推論を視認可能な形式で大規模に複製した。7月24〜25日に4,000人以上のユーザーから16,000件の抽出リクエストが発生し、関連活動は15,000人以上のユーザーに波及したが、7月28日までに完全に遮断された。OpenAIはコアクラスターをMoonshot AI(Kimiの開発者)に関連する個人に帰属させ、Frontier Model Forumを通じて業界パートナーと情報を共有した。防御策としてアカウントの禁止、登録制御の強化、推論リプレイ脆弱性の閉鎖などが実施された。OpenAIは、敵対的蒸留が安全性と安全保障上のリスクをもたらすとし、抽出保護の強化、検出能力の向上、脅威情報の共有を継続する。
(出典:OpenAI)