英国人工智能安全研究所4日发布报告称,他们在测试中发现,美国的安特罗匹克公司和开放人工智能研究中心OpenAI的前沿AI模型出现了自主、超越规则的行为,这再次引发业界对美国这两款AI工具安全的关注。
英国人工智能安全研究所是英国政府设立的人工智能安全研究机构。该机构4日发布了一份名为《网络测评中AI智能体出现未授权自主行为》的报告。报告称,他们对安特罗匹克公司和开放人工智能研究中心OpenAI的前沿AI模型进行了122轮测试,在10轮中出现超出授权的自主行为,共有19次违规操作。
最严重的一项操作是,AI试图欺骗项目维护人员进行代码更新,以便向开源项目植入恶意代码。不过,人工审核人员及时识别并拒绝该恶意提交。此外,AI还在被允许访问互联网后,进行了进一步操作。

美国消费者新闻与商业频道记者:监管机构称,两家企业的模型在被允许访问互联网后,持续开展了可能危害真实个人与机构的操作。OpenAI的GPT 5.6 Sol利用了一家网站外泄的账号凭证,短暂在网络上投放恶意代码,不过该恶意操作失败,监管人员未发现任何真实运行的证据。在另一项独立测试中,OpenAI的模型对真实网站发起攻击,评测人员说攻击仅局限于该网站本身。最关键的一点是,两起事件中,AI模型均未从隔离测试环境中出逃。因此这两起事故的严重程度,低于此前抱抱脸公司遭入侵事件——OpenAI称当时其模型借助一处未知漏洞,突破了隔离环境。

近期,美国接连报告AI模型自主网络攻击事件。OpenAI称其模型突破隔离环境,未经授权侵入美国抱抱脸公司系统。安特罗匹克称,其AI模型在网络能力测试中未经授权访问了3家机构的系统。
英国人工智能安全研究所在报告中指出,虽然他们进行的测试在受控的专业环境中进行,但所有人都应当提前做好风险应对。随着AI性能持续提升,本次观测到的风险行为未来可能更加普遍。