面向前沿AI训练的安全案例
内容摘要
OpenAI认为应要求在继续任何前沿强化学习训练前提供结构化安全文档,目标是达到其他安全关键行业(如航空和核电)所使用的全面、基于证据的"安全案例"标准。文章提出了三个方面的初始指南:(1)技术保障,包括模型对齐训练(训练环境和评分质量、对齐测量)、通过多层基础设施安全和红队测试实现的隔离,以及实时监控系统;(2)操作规范,包括异议/事前分析、高级领导审批(拥有否决权)、问责机制、暂停运行手册、内部透明度、审计、升级流程、"故障关闭"型技术控制、回滚能力和残余风险清单;(3)严重未对齐事件调查最佳实践,包括调查期间的内部透明、训练动态的根因分析、事后复盘、回归测试开发和公众披露。这些建议代表OpenAI当前的实践,正在不断演进,并公开分享以邀请社区反馈。
(来源:OpenAI)