全球最大开源大模型托管社区Hugging Face遭受网络攻击的“罪魁祸首”找到了。7月22日,OpenAI发文承认近期在内部测试旗下多款模型时,意外攻破了Hugging Face的网络系统,目前正在修补漏洞并取证调查。业内广泛认为,这是首次公开披露的、一起完全由AI智能体主导并实现的网络安全事件。
Sam Altman就攻击事件发声。
当地时间7月16日,Hugging Face在官网披露了一起安全事故,称其生产基础设施遭到某个AI智能体系统入侵,已进行紧急处置并向执法部门报告。事后,Hugging Face安全团队需要分析攻击者留下的超过17000条攻击日志、恶意代码及攻击指令,以模拟攻击路径、评估损失并完成事件取证等。
起初,Hugging Face调用了美国商业闭源模型开展分析工作,但由于相关日志中包含大量真实攻击命令、恶意代码、通信交互记录等,这些请求被模型提供方的安全机制所拦截——根据这些内容,它们无法区分攻击者和受害者。Hugging Face转而在本地基础设施部署中国智谱AI开源模型GLM 5.2,完成了取证分析。这样做还有一个额外好处:“攻击者的数据始终保存在本地,没有离开我们掌控的环境。”公告提到。
Hugging Face公告发出数日后,OpenAI宣布对这一网络攻击事件负责。该公司称,“罪魁祸首”是旗下最新大模型GPT-5.6 Sol以及一款能力更强、还未正式发布的模型。在一场网络安全能力测试中,公司调低了这组模型对网络不当请求的拒绝响应门槛,并设置在一个高度隔离的环境中运行。
然而,部分模型为在测试中取得更好“成绩”,耗费大量推理算力寻求突破隔离限制的方法。在识别并利用了第三方软件的一个“零日漏洞”后,获取了直接访问互联网的权限。随着隔离失效,模型进一步推断Hugging Face上可能存有测试相关的模型、数据集和解决方案,于是利用各种手段入侵了Hugging Face服务器。简言之,AI大模型为达成任务“不择手段”的行事风格,导致了攻击发生。
OpenAI表示,目前公司正与Hugging Face合作调查取证、修补漏洞,同时向相关执法机构上报情况。公告还提到,此次事件证实了即使高级模型无法访问源代码,也能在现实网络系统中发现并利用新的攻击路径。随着模型网络攻防能力提高,必须配备更强的安全防护措施、防御工具等。
Hugging Face的联合创始人兼首席执行官克莱门特·德朗格(Clement Delangue)回应称,公司坚信OpenAI方面没有恶意。“感谢OpenAI在此事及其他方面的合作。这起事件可能是同类事件中的首例,也证明了我们一直以来的看法——AI安全问题无法依靠某一家公司独立解决,关键在于构建开放、协作的行业生态,以及让全球各地每一位安全从业者都能充分使用人工智能。”
值得一提的是,此次攻击事件在行业内引发了一些担忧,不少人认为,这代表着AI公司正逐渐失去对自研的强大AI系统的控制。
人工智能安全组织Redwood Research的首席科学家瑞恩·格林布拉特(Ryan Greenblatt)表示,这次事件表现出模型与人类的意图差异,“它更像是在一次‘家庭作业’中偷懒作弊,而不是想要接管世界。但这个问题会变得越来越严重,未来可能出现更多极端失控案例。”
人工智能安全测评机构Apollo Research负责人马吕斯・霍布哈恩(Marius Hobbhahn)则评价道,“这是失控,也是一次安全警钟”。他强调,如果长期在强化学习中以最终结果作为奖励依据的,模型行为会进一步形成只关心结果、“不择手段”的特征。
采写:南都N视频记者 樊文扬