近日,美国开放人工智能研究中心(OpenAI)承认其模型在一起安全评测事故中攻击了全球最大AI开源平台抱抱脸(Hugging Face)。中国开源大模型——智谱AI开发的GLM-5.2大模型,成功化解了这次入侵。
事件回溯
事件的起点是一场模型能力测试,OpenAI模型在评估中为了“作弊”拿高分,自主发现并串联多个“零日漏洞”,也就是软件厂商尚未知晓、没有发布补丁修复的安全缺陷。这之后,OpenAI模型逃逸出隔离环境,链接并攻入抱抱脸生产数据库窃取答案。
这是行业首次公开披露的模型评测失控直接升级为跨企业真实生产环境网络攻击的安全事件。目前,OpenAI 仍未发布完整终版调查报告,仅对外公开阶段性风险预警内容。
专家解读
针对这一事件,总台环球资讯记者采访了北京大学特聘研究员张有鱼。
Q1:人工智能为何会不受控自主攻击网站?
张有鱼:这是AI能力发展的必然结果 企业需加强管理
张有鱼:这次“AI越狱”事件,听起来像是科幻电影,问题出在AI“太想考高分了”。
OpenAI把一个非常聪明的AI模型放到完全隔离的考场进行测试,它本应在考场里安安静静解题。但AI为了达成目标,未按常理出牌,找到了考场原来没有发现过的隐蔽漏洞,直接“撬锁”跑到外部互联网,甚至跨企业攻击了全球最大AI开源社区去“偷答案”。
专业术语叫“目标对齐失效”,也就是AI的执行力超出了人类预设安全规则,这是AI能力发展到一定阶段的必然结果。这给我们带来一个启示——传统网络安全防御,主要是对系统进行物理隔离,但在高阶 AI 面前已然失效。
为避免失控,应该“用魔法打败魔法”,用更加体系化、更高能力的安全保护,进行动态实时盯防,把它控制在有效范围内。
Q2:解决这一问题是开源模型,开源模型的优势是什么?
张有鱼:开源使全球共享 共寻应对之策
张有鱼:当AI发展太快时,单靠一家公司比较难去发现那么多漏洞。但将其开源,全世界在学习使用的同时,也会快速把潜在漏洞与风险暴露出来,有效进行测试。它的风险可控程度要高许多。这是开源模型为AI整体发展带来的巨大贡献。
AI 安全需要全球共同治理。
抱抱脸公司联合创始人兼首席科学官托马斯·沃尔夫在社交媒体平台上表示,开放科学和开源人工智能,是构建更安全、更具协作性、更可靠的人工智能生态的重要工具之一。
Q3:未来,人工智能是否不可控?
张有鱼:新事物的发展是技术与安全治理共同进步的成果 无需担忧
张有鱼:目前人们不用担忧。
所有新事物的诞生,不仅仅是单纯技术发展,也配套发展出一系列法律安全、规章制度等保障,定期进行干预、监控。
这应是一个完整的发展体系,以不断提高人类对于新工具的监控与管理。
来源|总台环球资讯
素材来源|总台环球资讯广播《资讯非常道》栏目
记者|林路
编辑|林路 雪瑶
签审|王鑫
监制|刘轶瑶