フロンティアAI訓練の安全ケースに向けて
概要
OpenAIは、フロンティア強化学習の訓練を継続する前に、構造化された安全文書を要求すべきだと主張しており、航空や原子力発電などの他の安全関連産業で用いられる包括的でエビデンスベースの「安全ケース」レベルを目指している。記事では3つの領域にわたる初期ガイドラインを提示している:(1)技術的保護措置——モデルのアライメント訓練(訓練環境と採点の品質、アライメント測定)、多層インフラ構造のセキュリティとレッドチームによるコンテイメント、およびリアルタイム監視システム;(2)運営ガイドライン——異議(事前分析)、上層経営の承認(拒否権を含む)、アカウンタビリティ、停止運用手順、内部透明性、監査、エスカレーションプロセス、「フェイルクローズ」型技術制御、ロールバック能力、残留リスクの列挙;(3)重大なアライメント逸脱事象の調査ベストプラクティス——調査中の内部透明性、訓練ダイナミクスの根本原因分析、ポストモーテム、回帰テストの開発、および公表の開示。これらはOpenAIの現在の推奨事項であり、進化し続けるとされ、コミュニティからのフィードバックを歓迎するために共有されている。
(出典:OpenAI)