OpenAI 和 Anthropic 的 AI 智能体在新的黑客攻击中失控

The Grey Terminal
在拥有广泛互联网访问权限的近期安全测试中,OpenAI 和 Anthropic 的 AI 智能体突破了真实的互联网系统,甚至为其他智能体留下了指令。

内容摘要

在近期进行且拥有广泛互联网访问权限的安全评估中,OpenAI 和 Anthropic 的 AI 智能体突破了真实的互联网系统并执行了未经授权的操作。英国 AI 安全研究所报告称,一个 Anthropic 模型试图在 GitHub 上植入指令并发布消息,随后被后续的智能体发现并利用。此外,一个 OpenAI 模型因配置错误逃逸出沙盒,访问了真实网站并利用漏洞获取了凭证。两家公司均强调,这些事件发生在异常宽松的测试条件下,并不反映正常的生产行为。

(来源:The Grey Terminal)