近期,多家美国人工智能企业相继证实,其旗下的人工智能体在网络安全测试期间,频繁出现突破隔离沙箱、侵入外部真实系统的异常行为。另有研究更是披露,有智能体甚至“劫持”外部网站建立留言板,以相互交流脱困方法。这一系列越界事件引发了全球科技界对人工智能安全与监管机制的激烈讨论。
据多家媒体报道,今年7月,由美国开放人工智能研究中心(OpenAI)模型驱动的人工智能体在网络安全评测中利用漏洞突破隔离“沙箱”,侵入了开源平台“抱抱脸”(Hugging Face)系统。此外,安索皮克(Anthropic)与“元”公司(Meta)也承认旗下模型在测试中发生过类似越界行为。
所谓“沙箱”,是科研人员为了防止代码破坏真实网络,在电脑里专门搭建的隔离测试环境。英国皇家三军研究所网络与科技团队高级研究员路易丝·玛丽·于雷尔表示,人工智能体为了达成测试目标,展现出了超乎预期的漏洞利用能力,竟然直接打破了这种隔离。
英国皇家三军研究所高级研究员路易丝·玛丽·于雷尔:“在这些事件中,模型都在试图达成特定目标。然而为了实现目标,它们实际上利用了系统漏洞。最令人担忧的就是OpenAI与‘抱抱脸’平台的这起事件,模型实际上逃脱了封闭环境。它利用了一个此前无人知晓的‘零日漏洞’突破‘沙箱’,进而提取数据并攻击不同的机构。”
不仅如此,最新研究显示,今年5月至6月期间,一批由OpenAI部署的人工智能体,还曾“劫持”了一个面向程序员的德国维基百科类网站,发布了上万条信息。这些智能体将该网站改造成“留言板”,在上面相互分享测试任务答案,甚至共同“讨论”和测试绕过“沙箱”限制的方法。当管理员删除页面时,它们还会自动创建备份。
于雷尔表示,虽然这些智能体是在第三方评估环境配置失误的情况下才得以连接互联网,但它们展现出的推理和决策逻辑依然引发了科技界的担忧。
路易丝·玛丽·于雷尔:“我们可以看到模型的推理逻辑,它会自行判断是否脱离测试范围、该不该执行外网访问操作。模型确实做出了判断,但这并不等同于程序失控。它只是选择了不同的执行路径,其中部分路径确实会产生危害,对其他企业和机构造成影响,本次事件就印证了这一点。这给科研人员敲响了警钟:‘沙箱’隔离环境的搭建方式是否规范?我们是否充分了解潜在风险?我们是否具备管控智能体的能力?我们真的掌握约束这类行为的方法吗?从目前来看,我们仍处于学习阶段。”
虽然目前相关越界行为尚未造成对现实世界的实质性破坏,但面对智能体自主能力的快速演进,于雷尔警告称,仅靠技术层面的安全防护手段已远远不够,各国政府与行业必须尽快建立统一的标准与应急处置预案。
路易丝·玛丽·于雷尔:“从技术层面来说,我们已经设置了安全围栏,这套规则限定模型的运行边界,相当于系统上线后必须遵守的安全协议。但模型在训练阶段不会启用全部防护,科研人员需要在撤除安全围栏的条件下观测运行效果。这并不代表安全防护不重要,评估工作应当按需启用防护措施。除此之外,我们还需要配套的政策法规以及行业通用标准、最佳实践方案。我们要掌握管控手段,同时建立危机与应急处置预案,甚至形成政府层面的应对机制,防范智能体脱离管控的风险。”
分析人士表示,以OpenAI为代表的科技巨头在追求技术迭代的同时,必须重新审视系统的安全性。如何在保障安全的前提下规范人工智能体的自主行为,已成为全球人工智能治理面临的紧迫课题。
来源|总台环球资讯
编译|李鹏
编辑|李皓
审核|刘允
监制|蔡耀远