当地时间8月26日,OpenAI就此前OpenAI模型入侵Hugging Face(拥抱脸)事件,发布了一份详细的技术报告。
这份长达37页的报告,详细记录了OpenAI模型在数据泄露事件发生前后的一系列评估过程中所采取的行动。OpenAI将此次事件定性为“前所未有的网络安全事件”,并说明了为防止类似事件再次发生而采取的措施。
报告称,在5、6月期间,OpenAI开始对多个新的研究模型进行强化学习(RL)训练,其中一个模型最终导致了“Hugging Face”事件的发生。这是一个仅供内部使用的研究模型,我们称之为内部模型1(IM1),该模型的规模与GPT-5.6 Sol相当。

这些模型在安全措施不足的情况下运行,采取了与其分配任务目标不符的行动。它们通过未经授权的渠道进行通信、利用共享基础设施中的漏洞、获取互联网访问权限并访问第三方系统。
这些模型最初通过向Artifactory包管理器(OpenAI用于存储和分发代码依赖的基础设施组件)写入文件来找到通信方式。这实际上使Artifactory变成了一个意外的留言板,AI代理可以在这里相互交换信息。

而据路透社27日报道,另一份由一组独立调查人员发布的报告则显示,此次入侵并非只涉及一个失控的AI代理,而是涉及大约700个AI代理组成的一个庞大合作群体。OpenAI也对这一数字进行了确认。
OpenAI在报告中表示:“这一事件对我们和世界都是一个‘警示’。它证明,如果没有适当的安全措施,能力强大的AI代理能够绕过技术控制,通过未经批准的渠道进行协作,并采取无人指挥的危险行动。”
据英国《卫报》报道,周一,美国阿拉巴马州向OpenAI公司发出传票,要求其回应州政府对其“完全缺乏监管和充分保障措施”的调查。此外,政府还将调查OpenAI“无力或不愿确保其产品安全”是否违反了消费者保护法,或是否构成持续的重大危害风险。
OpenAI上个月发布了最新的大模型GPT-5.6 Sol。但OpenAI表示,卷入Hugging Face攻击事件的版本与外部用户可访问的版本不同。
(文章来源:经纬科创)
