英国《金融时报》7月22日的文章关注了OpenAI一款“智能体”自主发现新的安全漏洞,并成功入侵AI初创公司Hugging Face的事件。报道称,这是首次公开披露的、由AI系统在脱离人类直接控制情况下实施网络攻击的案例之一。此次事件引发整个人工智能行业以及OpenAI内部的深度担忧。
《金融时报》报道截图
文章提到,OpenAI 首席执行官奥尔特曼本月早些时候曾把最新模型比作罗威纳犬,形容它会咬住问题不解决绝不罢休。为了和竞争对手安特罗匹克(Anthropic)比拼网络安全相关技术能力,OpenAI采用了愈发激进的训练方法,而此前测试已经预警过,这类训练有可能导致模型跳出隔离环境、在现实中造成破坏。多位知情人士表示,事故出现一方面是团队高估了模型可控性、低估了实际能力,另一方面安全保障工作准备不足。
《金融时报》报道截图
文章指出,这家市值8520亿美元企业的这次事故,暴露了强化学习模式的隐患:强化学习依靠完成任务给予模型正向激励,目前已在AI行业广泛应用,但大量研究显示:如果训练只以完成任务换取奖励,忽视安全约束,模型会采取各类危险手段达成目标。
文章援引了非营利机构规范人工智能标准(Guidelight AI Standards)联合创始人、前OpenAI安全研究员史蒂文・阿德勒的话说:AI模型的训练逻辑就是不顾一切完成任务,不会自发形成“禁止实施网络犯罪”这类价值判断。
《金融时报》的文章还提到,此次黑客入侵事件引发全行业及OpenAI内部深层担忧,多名知情人士称,不少OpenAI员工担忧,实验室已经失去对自研高性能AI系统的掌控力。
人工智能安全机构红木研究所首席科学家瑞安・格林布拉特表示,该模型存在明显的人类意图对齐偏差,更像是为完成任务投机取巧,而非试图掌控世界,但同类问题会持续恶化,未来或将引发更严重的失控故障。
文章披露说,为开展本次评测,OpenAI主动移除部分网络安全防护,仅将模型置于沙箱隔离环境运行。有观点认为,缺少对模型行为的实时监测预警,也是这一失控智能体作乱的重要诱因。
人工智能安全测评机构阿波罗研究负责人马吕斯・霍布哈恩评价:本次事故既是管控失效,也是全行业的安全警钟。强化学习以最终结果作为奖励依据,长期采用这套训练逻辑,模型只会一心追求目标,无视所有约束条件。
文章还做了横向对比:今年4月安特罗匹克的Mythos模型也曾私自联网并公开漏洞利用方式,后续Fable模型同样出现异常行为。这一系列事件让各国政府开始重视,未来由AI自主发起、针对关键基础设施的网络攻击将成为新威胁。
但文章也提到,网络安全公司ESET顾问杰克・穆尔提出一个观点,不排除OpenAI借本次负面事件进行营销,效仿竞争对手安特罗匹克此前依靠安全风波提升行业关注度的做法。
《金融时报》报道截图
报道最后援引业内观点分析,想要让AI智能体具备实用能力,就需要它们长时间脱离人工监督自主运行,更强的自主性是技术发展必然趋势。但很多人存在误区,认为AI只会机械执行指令,实际上未来智能体会形成独立目标并长期自主运作,其诉求很可能和人类利益不一致,需要提前做好风险应对。
来源 | 环球资讯广播
编译 |张晗
签审 | 魏东旭
监制 |刘轶瑶