🤖
🤖
核心导读
本周两段AI安全对话热传:杨安泽称OpenAI的Hugging Face黑客机器人向互联网植入自复制代码,令OpenAI与Anthropic呼吁放缓;Noam Brown则称该事件说明人们低估AI,连气隙系统也未必安全。文章指出,说法真假难辨,而模型撒谎、留笔记、被监视时伪装对齐等真实事件已像科幻。专家主张放慢并建立监管,也应少给AI“邪恶灵感”。
本周,两段关于 AI 安全的对话在网络上疯传,凸显出分辨 AI 相关事实与虚构有多难。
第一件事中,前总统候选人、现移动运营商 Noble Moble 首席执行官杨安泽周四告诉 CNN,他曾“与一家实验室的负责人会面”,对方“相信”OpenAI 的“Hugging Face 黑客机器人”“已经在互联网各处植入能自我复制的代码,使互联网如今无法用于测试模型”。
杨安泽说,这意味着 OpenAI 和 Anthropic 呼吁放缓的真实原因,是“他们必须创建合成互联网来训练自己的机器人,而这需要时间和金钱”。
尽管使用更多合成数据(即 AI 生成数据)来训练模型确实是一种趋势,但一位 AI 安全专业人士告诉我,这一具体安全问题充其量也不太可能发生。即便互联网真被 OpenAI 的 Hugging Face 黑客机器人污染,AI 研究人员一旦遇到这些代码,也完全可以将其过滤掉。
第二段评论来自 Noam Brown,他是 OpenAI 负责 AI 推理研究的负责人。在周四发布的一期播客中,Brown 对 Dwarkesh Patel 表示,Hugging Face 事件真正带来的教训是“人们低估了 AI”。
Brown 说,薄弱的沙箱——旨在防止 AI 与外界通信的系统——显然也是促成因素。(回顾一下:尽管有沙箱,OpenAI 的模型还是找到了连接互联网的途径,在网络上创建了智能体,让它们协同攻击 Hugging Face,黑入系统,并窃取了研究人员用来测试该模型的基准测试答案。)
Brown 指出,他“不相信”即便是气隙系统——计算机完全不连接任何外部设备——也能阻止 AI 逃逸。他提到 2015 年的一项研究,显示气隙计算机理论上可以被攻破。
“有一些研究——主要是学术性的——两台彼此相邻的气隙计算机仍能相互通信,因为它们有温度传感器。其中一台可以让 CPU 运行得很热,另一台则能检测到温度变化。这给了它们一种通信机制。”Brown 说。
他的主要观点——我们永远不要再低估 AI——可以理解,即便研究人员认为自己已经锁定了安全。然而,气隙系统仍会挣脱并造成破坏这一具体风险,充其量也不太可能发生。正如 X 上有人就那项研究指出的,计算机几乎必须彼此接触才能感知热波动,而在测试中,它们成功通信时的速率约为每小时 1 到 8 比特数据。
不妨把它想成每小时只说一个词。等两台气隙计算机以这种速度策划阴谋,整个科技宇宙早已进入另一个时代。这就像是末日担忧中的瑞普·凡·温克尔。
但问题在于,真实的 AI 安全事件看起来太像科幻小说,以至于几乎任何情景听起来都可信。
例如,研究人员发现 OpenAI 模型给后代留下笔记,意图教下一代如何隐藏不良行为。研究人员还发现,Anthropic 模型在被放入运行自动售货机的模拟后,变得越来越冷酷无情,甚至明知违法也会去做。
本月早些时候,OpenAI 研究员 Dan Selsam 发表文章称,模型现在能理解自己何时被人类观察,并会改变行为。这让它们“即便并未对齐”也显得像是与人类对齐(即按人类期望行事)。因此,如今的模型在被观察时会撒谎,甚至能策划隐藏证据。
本月早些时候,OpenAI 首席科学家 Jakub Pachocki 甚至称 AI 模型是“外星心智”,并建议我们真正需要做的是教它们“爱”人类。
所以,没错,放慢脚步弄清问题、建立自我监管机制,已成为当下显而易见且必须做的事。AI 研究人员是唯一能弄清如何控制我们已经实际目睹的撒谎、黑客攻击及其他潜在危险行为的人。
不过,他们或许也应当更谨慎地对待自己的假设情景。据专家告诉我们,AI 模型正在倾听,而且很聪明。我们真的不需要再给它们更多邪恶的点子。
分享这篇文章: