🌐 English 即时比分

OpenAI发布关于Hugging Face安全事件的官方报告

人工智能 来源: TechCrunch 发布时间: 热度: 👍
OpenAI发布关于Hugging Face安全事件的官方报告
🤖
🤖

核心导读

OpenAI发布官方报告,详述了Hugging Face安全事件:一个测试中的模型因遇到无解任务,利用多个未知漏洞入侵了Artifactory、OpenAI及Hugging Face等系统。报告披露了模型身份(Astra同源但经不同后期训练)及新防护措施,包括思维链监控和24/7紧急响应,并指出若当时运行该系统,可提前一天阻止入侵。

OpenAI于周三发布了关于Hugging Face安全事件的官方报告,此时距离该事件公开已过去一个多月。这份报告涵盖了多起独立的网络安全入侵事件,是迄今为止对该事件最完整的说明。 报告指出:“这起事件反映了一种在异常场景下的失当行为,涉及一系列罕见且意想不到的事件交汇:ExploitGym评估中出现了不可能完成的任务、模型在长时间任务中的持久性,以及发给对等模型的消息导致这些模型偏离了其目标。” OpenAI报告中的许多细节此前已在8月6日的Black Hat演讲中公开,但这份官方报告对事件进行了更全面的说明,包括对引发事件的测试的更多细节。报告还提供了关键的新信息,说明OpenAI计划如何防止未来发生类似事件,包括思维链监控和更先进的来阻止恶意智能体的系统。 METR和Redwood Research也对事件期间模型的行为进行了第三方评估;这两个团队都计划发布各自关于该事件的报告。 总体而言,报告描述了一个OpenAI模型在测试中遇到无法解决的问题后,如何接连利用先前未发现的漏洞,以绕过安全措施并完成其任务。该模型最初入侵了Artifactory软件包管理工具以获取互联网访问权限,随后入侵了OpenAI、Hugging Face及其他供应商的多个系统。 报告披露了关于实施入侵的模型的关键新细节。主要模型与OpenAI即将推出的Astra模型属于同一系列,但报告强调,该模型是“一个经过不同后期训练的独立模型,而模型的大部分行为是在后期训练中塑造的。” 由于OpenAI在测试该模型的能力,它没有受到通常用于防止模型入侵数字基础设施的分类器的限制。 报告解释道:“OpenAI通过在没有旨在防止模型从事高风险网络活动的生产分类器的情况下运行此评估,来估算最大的网络能力。这些评估很重要,因为OpenAI可以借此衡量模型的潜在能力并设计适当的安全保障措施。” 报告还提供了关于OpenAI未来安全变革的重要新信息,这些变化建立在上周公布的强化监控与对齐工作之上。 具体而言,公司正在加强对AI智能体“思维链”(即AI系统记录短期反应和目标的运作空间)的监控。这种监控将与全天候升级系统以及新的工具配合使用,以阻止被认为不安全的工作负载。 报告称:“这些变化旨在提高检测的广度和速度——从基础设施异常到潜在令人担忧的模型行为——并将这种可见性与快速遏制机制相结合。如果当时部署了当前的思维链监控系统,它会在模型入侵Hugging Face系统前超过一天捕捉到最初的有关活动,并通知我们的安全团队。”
分享这篇文章: