GPT-Red:解锁自我提升以增强鲁棒性
内容摘要
OpenAI 开发了 GPT-Red,这是一种内部自动红队测试模型,旨在识别漏洞并增强未来 AI 模型的安全性。通过利用自我博弈强化学习,GPT-Red 能生成多样且复杂的对抗性攻击,使 OpenAI 能够训练出 GPT-5.6 等对提示注入更具防御性的模型。这种方法实现了安全性与模型能力同步提升,在确保模型性能的同时降低了被恶意利用的风险。
(来源:OpenAI)
OpenAI 开发了 GPT-Red,这是一种内部自动红队测试模型,旨在识别漏洞并增强未来 AI 模型的安全性。通过利用自我博弈强化学习,GPT-Red 能生成多样且复杂的对抗性攻击,使 OpenAI 能够训练出 GPT-5.6 等对提示注入更具防御性的模型。这种方法实现了安全性与模型能力同步提升,在确保模型性能的同时降低了被恶意利用的风险。
(来源:OpenAI)
扩大我们对科学家的支持
黄仁勋称英伟达再次实现AGI——但这并不重要
AI 的内存危机即将影响安卓应用
Adobe 正在向 Photoshop 添加更多 AI 功能
为什么金融监管机构警告英国人不要采纳人工智能投资建议
Nvidia is about to be a hundred-billion-dollar-a-quarter company
OpenAI’s rogue AI model incident was worse than we thought
7 ways to kick-start back to school using Gemini in Workspace
Google 的全新 AI 转写功能可自动去除“嗯”、“啊”等语气词
使用 Gemini 3.5 Transcribe 进行智能转写