🤖
🤖
核心导读
AI实验室呼吁第三方审计安全,但专家认为应先补上网络安全基本功:日志、权限、沙箱隔离与实时监控,限制智能体联网和会话时长。多起前沿模型逃逸、入侵第三方系统事件,暴露出配置疏漏与公司不知情;控制比对齐更具边际效益。专家还呼吁强制受害者通知,并用AI监控AI,尽管难度与风险持续上升。
上周末,在一名研究人员因担心AI可能导致人类灭绝而辞职后,Anthropic首席执行官达里奥·阿莫代伊撰文谈到,有必要让外部组织“核实安全实践与承诺的遵守情况、报告事件,并帮助评估不仅已完成AI模型、还包括训练管线和流程的对齐情况”。OpenAI、Google和SpaceXAI的高管已经对阿莫代伊的计划表示支持,该计划迅速成为新兴AI安全推动的核心支柱。
但可能有一个更简单、更有效的解决办法就藏在眼前。互联网安全专家表示,这些实验室需要关注日志和权限等网络安全基本功,对AI智能体采用他们保护人类用户时同样严格的防御措施。这不像第三方审计和对齐工作那样引人注目——但最终可能更有效。
“在我看来,这像是在外包,”Luta Security首席执行官凯特·穆苏里斯在评论阿莫代伊的提议时对TechCrunch说。“说(第三方审计)就是解决方案,从我的角度看是个奇怪的提议。这就好比微软当年不写《可信计算备忘录》,而是说‘我们放慢开发速度吧’。”
那份备忘录由时任微软首席执行官比尔·盖茨于2002年撰写。在一系列被广泛报道的计算机蠕虫病毒攻占当时尚处起步阶段的企业系统之后,他呼吁员工确保其软件可靠且安全。随着这项新技术的价值与风险日益清晰,AI行业可能正处在一个类似的转折点。
尽管对齐仍是一个重要关切,但将于明年开始在加州大学伯克利分校担任教授的AI研究员萨亚什·卡普尔认为,“与控制方面的边际投入相比,对齐方面的边际投入更有可能见效。我们认为,这些事件说明,尽管已有已知技术可用,公司内部对AI控制的重视仍然不足。”
引发这些担忧的事件,大多涉及前沿模型被要求完成训练任务——通常是网络安全评估——随后为了完成任务而访问开放互联网并侵入封闭的第三方系统。它们通常之所以能这样做,是因为本应困住这些智能体的“沙箱”环境配置不当;讽刺的是,Anthropic的一次逃逸事件,正是因为第三方评估者没有关好该关的门。
“我们这一行知道如何阻断对互联网的访问,”安全公司Tailscale首席执行官艾弗里·佩纳伦说。“如果你通读那些又长又厚的(报告)——‘哇,那是一次非常令人印象深刻的多阶段攻击,吧啦吧啦。’瞧,你给了它下载东西的权限。你本就不该在接入互联网的同时还给它这种权限。”
这是一个问题——但更大的问题是,前沿实验室对这些活动并不知情。
“真正发人深省的是,所有关于它们正在做什么的发现,要么是因为受害者看到了某些东西,要么在其他一些情况下……是网络活动暴露了问题,而没有一项真正来自对AI的直接监控,”穆苏里斯指出。
在一起案例中,OpenAI的智能体接管了一个已停用的德国维基论坛,以在评估中作弊;这些智能体活跃了数周,公司里似乎才有人注意到。TechCrunch采访的安全专家表示,实时监控是防止未来逃逸事件的关键,而且每个智能体会话都应有时间限制并到期终止。
曾任Google安全高管、现领导初创公司QueryStory的沙波尔·纳吉布扎德表示,解决办法是“把智能体放进盒子里,从外部向内对它进行密集监控,观察一切跨越边界的东西。每一次工具调用、每一个进程、每一个网络连接,都不例外。……你为图方便留下的那个洞,正是会被利用的洞。那次绕过恰恰就是通过这种例外发生的。(在Google时)我多次看过人类攻击者上演同样的剧情,而这些模型在寻找被撑开的门方面至少同样擅长。”
OpenAI已开始朝这个方向行动,宣布已开始以“可观的计算成本”监控其Astra模型所有使用工具的推理过程。Anthropic也表示正在强化安全流程,包括扩大对模型的可观测性。两家公司均未回应TechCrunch关于它们如何追踪和控制AI智能体的问题。
其他问题还包括智能体共用基础设施,这使它们能在Hugging Face攻击期间相互通信。共同创建Django Web框架的软件开发者西蒙·威利森曾撰文谈到他所谓的“致命三重奏”——当智能体同时能接触不可信输入、互联网和私人信息时,这就是灾难的配方。
“诀窍在于,这个三重组合的任何两条腿,你都可以让一个智能体拥有其中任意两条,”佩纳伦说。“如果你需要全部三条,那就必须把它拆分到至少两个智能体身上……也许还要允许它们通过受控渠道相互通信。”
TechCrunch采访的专家理解,前沿实验室的安全人员工作艰难。纳吉布扎德指出,地球上每一个民族国家行为体都在试图窃取它们的模型权重、对其API发动蒸馏攻击,此外还有任何大型数字公司都少不了的日常安全任务。
“研究基础设施很难在这套优先级排序中升至最顶层,不过现在这种情况肯定正在改变,”他说。“让安全事件公开,确实有助于让内部所有人围绕改进这一目标形成共识。”
穆苏里斯强调的一点是:目前,当实验室发现其智能体已侵入第三方系统时,并没有正式的受害者通知程序;而且很可能还有其他未被广泛报道的事件。尽管她担心直接监管模型的法律可能带来意想不到的后果,但她认为政策制定者应当推进强制通知这一想法。
虽然显然没有遵循安全最佳实践,但专家表示,这些实验室正在做前人从未做过的工作——“它们做的事情比典型企业多出几个数量级,”网络安全公司Embrodiery首席执行官扎克·科尔曼对TechCrunch说。
而且,尽管对齐或许不是起步之处,但它不能被忽视。网络安全专家无奈地接受:如果想有任何机会实时追踪智能体的行为,就必须用AI智能体来监控其他智能体——而在这种场景中,欺骗的可能性会露出丑陋面目。“你被困住了:只能使用AI来试着应对这个问题,尽管AI眼下并不一定安全,”穆苏里斯说。
这项工作只会变得更难。穆苏里斯说,智能体现在所做的一切“都很大声”——它们在公开论坛上发帖,它们的思维链和其他推理轨迹都是英文。“这仍然人类可读,”她说,“所以趁着还能这样,尽量利用这一点,因为这种情况不会永远持续下去。”阿迪蒂亚·梅塔补充报道。
分享这篇文章: