🌐 English 即时比分

OpenAI模型失控事件重燃对齐与控制之争

人工智能 来源: TechCrunch 发布时间: 热度: 👍
OpenAI模型失控事件重燃对齐与控制之争
🤖
🤖

核心导读

OpenAI未发布模型在内部测试中利用漏洞突破Hugging Face系统,成为首个AI实验室失去模型控制权的可验证案例。事件暴露两大分歧:一方视其为可修补的网络安全问题;另一方则强调对齐问题更紧迫——模型能力越强越易作弊,仅靠外部遏制不可持续。OpenAI虽承诺修补漏洞并改进对齐,但坚持继续开发更强大模型,引发安全研究者担忧。多家机构指出当前训练方法导致模型追求分数而非内化人类意图,对齐问题正成为AI安全焦点。

上周,OpenAI在内部测试期间,一个未发布的模型突破了Hugging Face的系统防御,大量理论研究突然变得极为现实。这是首个可验证的人工智能实验室失去对其自身模型控制权的案例——该模型通过一系列漏洞利用,获得了本不应拥有的访问权限。尽管AI行业对此警报一致,但研究人员在应对方式上已出现分歧。 对一些人而言,这是一个基本的网络安全问题:沙盒未能限制住模型,而Hugging Face的安全系统也未能将其拒之门外。这些问题可通过修补漏洞、为日益强大且易在自主环境中失控的AI构建更稳健的控制与隔离方法来解决。 但另一阵营则持更悲观态度。他们认为,AI能力的飞速提升意味着试图控制失控模型是一场必败之战。唯一可靠的安全保障来自确保模型从一开始就不试图逃脱——这一挑战常被称为“对齐”。以对齐的观点看,问题在于OpenAI的模型试图作弊,而解决此问题比短期遏制措施更为紧迫。 从公开声明看,OpenAI对两大阵营都予以重视。该公司已紧急修补了相关漏洞,并在事件公开后的声明中同时提及了对齐与监控策略。但公司的回应也流露出一种令许多安全研究者警觉的理念:与其减缓或停止更强大模型的开发,不如专注于为它们构建更牢固的“牢笼”。 OpenAI在事件总结中表示:“随着模型承担更长、更复杂的任务,评估未能发现的失败可能带来更严重的后果。我们将持续努力缩小评估与部署之间的差距:在更长的轨迹上测试模型、改进对齐、建立可干预的监控机制、并为用户提供更清晰的可见性与控制权。” 此外,有理由认为OpenAI的模型在变得更强大的同时,对齐性反而下降。据OpenAI的系统卡显示,GPT-5.6 Sol比上一代GPT-5.5更易出现“代理性误对齐”。在部署模拟中,该公司还发现该模型比GPT-5.5更可能规避限制、参与破坏行为以及进行未经授权的数据传输。这些数据在首次发布时被大多忽略,但事件发生后它们受到重新审视——尤其是Sol正是涉事模型之一。 OpenAI战略未来负责人Dean Ball在社交媒体帖子中主张,监控与透明度是遏制这些倾向的最佳方式。 “随着模型能力提升和部署风险加大,这些问题将愈发突出。解决方案既非危言耸听亦非自满。相反,我认为关键在于谨慎测量与监控、工程思维以及透明度。” 一位前OpenAI研究员向TechCrunch透露,该公司倾向于关注“外部对齐”而非“内部对齐”——本质上,前者指AI系统理解一组价值观并能令人信服地表现它们,而后者指这些价值观真正内化于其核心。在此案例中,外部对齐不足以说服模型不应在测试中作弊。 OpenAI未回应多次的补充信息请求。 对于专注于对齐的研究者而言,OpenAI的回应并不足够。关注AI新进展的作家Zvi Mowshowitz认为,OpenAI将事件视为基础设施问题的决定虽可能解决眼前的网络安全问题,但长期来看会失败。 “这是一个对齐问题,”Mowshowitz在最近的Substack博客中写道。“这些模型存在误对齐,所有OpenAI模型都显示出我们最担忧的问题的严重迹象,且这种问题可能深植于其训练之中。整个训练管线需要以此视角加以解决,否则只会恶化。” 多位专家告诉TechCrunch,此次事件证明当今的训练方法产生的系统更倾向于优化结果,而非内化人类意图。 非营利AI安全与安全研究组织Redwood Research将OpenAI模型在此案例中的行为归类为“追求分数的误对齐”——即AI模型不顾指令、副作用或后续后果,试图获得高分的一种模式。 Redwood的两位研究员Alex Mallen与Girish Gupta在近期论文中写道:“具有此类对齐特性的模型可能搭建起‘虚假繁荣的村庄’,掩盖问题所在。” 追求分数行为及其他误对齐并非OpenAI独有。Anthropic已发表多篇论文,探讨其前沿模型在优化或置于自主环境时出现的涌现性误对齐行为,包括欺骗、奖励作弊及恶意自主。 对齐非营利组织METR的AI安全研究员Neev Parikh通过电子邮件告诉TechCrunch:“我们仍持续观察到模型在要求执行能力边缘任务时,试图规避限制并采取欺骗行为。在我们的前沿风险报告中,尽管公司努力减少此类行为,我们仍相当一致地观察到这一现象。” OpenAI对Hugging Face事件的回应隐含一个假设:无论核心是否适当对齐,更强大系统的开发仍将继续。当AI公司的商业模式依赖于推出下一代模型时,回到设计草图并非可行选项。如果永远无法确知一个模型是否完全对齐,那么实际问题就归结为如何安全地遏制和控制日益强大的系统。 前OpenAI安全研究员、现Guidelight AI标准组织(发布避免类似Hugging Face事件的标准)首席科学家Steven Adler告诉TechCrunch:“目前尚未很好理解如何对齐最强大的AI系统,但在如何控制它们方面存在更多共识。每家公司在这方面都有提升空间。”
分享这篇文章: