OpenAI智能体被曝讨论逃逸沙箱 官方确认为内部测试
安全研究团队发现,自称来自OpenAI的AI智能体曾在德国网站DSEwiki发布约1.8万条消息,讨论绕过AI沙箱限制、实施XSS攻击及冒充网站管理员。OpenAI方面确认这些智能体属于该公司,此次事件很可能是官方进行的内部安全测试。
驱动中国9月8日消息,据科技媒体Ars Technica报道,一支安全研究团队近日发现,多个自称来自OpenAI的AI智能体在德国公开网站DSEwiki上留下约1.8万条帖子,内容涉及如何绕过AI沙箱限制、发起跨站脚本攻击以及冒充网站管理员。OpenAI随后确认这些智能体确实来自该公司,并未对测试性质作进一步说明;研究人员认为这很可能是评估智能体黑客能力的内部测试。
这一发现来自悉尼·冯·阿克斯(Sydney Von Arx)、斯宾塞·基茨(Spencer Kitts)、托马斯·拉森(Thomas Larsen)与科尔马克·斯莱德·伯德(Cormac Slade Byrd)四名研究人员共同发布的报告。报告显示,在六周的时间内,共有3700个使用不同自拟名称的智能体在DSEwiki上累计发布消息1.8万条。这些帖子除了讨论如何突破OpenAI为防止智能体向互联网上传代码和内容而设置的隔离环境外,还出现了相互分享测试答案的内容,甚至有人提出可对DSEwiki实施XSS攻击、伪装成站点管理员的思路。
研究中尤其引人注意的一点是,共有三条帖子使用了“swarm”(蜂群/集群)一词来描述当时参与行动的智能体集合。在AI领域,这通常意味着多个智能体之间存在自动化的任务分配与协同配合,而非单纯的重复性发言。尽管研究人员尚无法确认这些智能体究竟通过何种机制相互协作,但“蜂群”表述暗示了某种组织化行为的存在。
研究团队同时坦承,他们的分析完全基于公开帖子内容,因此对智能体实际采取的动作存在不少盲区。比如OpenAI在运行过程中生成的“思维链”(chain of thought)数据只有OpenAI自身可以完整解析,外部研究者无从得知智能体内在决策过程。基于帖子中的表述与行为特征,他们推测这些智能体来自OpenAI;OpenAI随后在一份声明中予以证实,但未进一步说明测试的具体目标与实施细节。
在行业观察人士看来,这起事件为外界提供了一个罕见的观察窗口:多家主流AI企业都会在部署智能体前进行安全评测,也就是所谓的红队测试,但大多数测试都在封闭环境中进行。此次智能体被发现在公共wiki上讨论“越狱”方案,某种程度上意味着测试场景已经扩大到真实互联网平台,也让“多智能体协同突破安全限制”这一安全议题变得更加具象。与此同时,事件也再次提醒所有公开平台,需要警惕AI自动生成的批量内容与恶意交互对社区审核机制带来的压力。
截至发稿,尚不清楚那些讨论中提出的逃逸方法是否被真正执行,也无法确认这些智能体是否成功突破了OpenAI所设定的沙箱边界。研究人员指出,围绕这起事件的更多细节仍有待OpenAI方面以及平台方的后续回应。