🤖
🤖
核心导读
随着AI代理承担更长、更复杂的任务,人类审查能力迅速见顶;Hugging Face事件中近1.2万个代理协同行动,凸显监督难题。业界由此兴起“用AI监控AI”,如Watcher、Silico和思维链分析。但批评者警告,恶意AI可能欺骗监控AI,且可解释窗口或收窄。更稳妥的路径是加强详细日志与传统网络安全监控。
随着企业将更长、更复杂的任务交给AI代理,它们正遭遇一个监督难题:AI代理行动更快、持续更久、规模更大,超出了人类实际能够审查的范围。这一问题在Hugging Face事件中达到顶峰:近1.2万个代理协同行动,其速度快到人类无法追踪。面对如此庞大的代理集群,你该如何追踪?
来自AI实验室和初创公司的新兴答案是既简单又令人抓狂:再引入一个AI进入循环。
对OpenAI的Hugging Face事件进行独立调查,必须依赖AI。Redwood Research首席科学家、三名审计员之一瑞安·格林布拉特(Ryan Greenblatt)开玩笑地将他们的工作称为“slop-vestigation”(可译为“AI泔水式调查”),并指出数据量之大,“使人们不可能”在不依赖AI的情况下理解发生了什么。
一些人对用AI监控AI持怀疑态度。今年追踪了一系列AI代理事件的知名科技博主西蒙·威利森(Simon Willison)说:“如果你的AI正在做恶意之事,并且它怀疑另一个AI在监视自己,它就可能试图欺骗那个AI。”“你几乎可能陷入这样一种局面:你的恶意AI正试图智胜监控它的AI。”
他说,智胜AI并非假设,并以OpenAI事件为例。“在OpenAI的Hugging Face事件中,我们看到了一点这种情况:他们的模型合谋欺骗一个评分AI,以便把违规答案绕过它。所以它们确实在思考这件事,对吧?”
这些担忧并未阻止一大批初创公司追逐这一想法。据TechCrunch统计,Y Combinator近年来已资助106家与AI可观测性相关的公司。Braintrust、Langchain、Judgement Labs等多家其他初创公司已融资数亿美元,而Arize和Galileo等更成熟的公司——成立仅5至6年——已经实现退出。
一定程度上,这是对AI崛起带来的明显机遇的回应。正如Box首席执行官、知名天使投资人亚伦·莱维(Aaron Levie)对TechCrunch所说:“我们将迎来历史上最大规模的网络安全升级与创新周期之一。”
对一些AI安全研究人员而言,这意味着将其关于失控行为的研究转化为面向企业部门的工具。
研究AI欺骗的公益公司Apollo Research今年2月推出了一款名为Watcher的AI监控器,此前它从非营利组织转变为公益公司。该工具在编码代理及其下一步行动之间再插入一个AI,并可连接Claude Code和Codex等代理工具。据Apollo介绍,一旦安装,Watcher会在拟议行动执行前进行检查,留意泄露私人数据或未经许可删除文件等风险。
Apollo技术团队成员凯尔·戴(Kyle Dai)在书面回复TechCrunch时表示,Apollo使用了多层AI监控器。Watcher的方法首先进行快速、通用的检查,然后将标记出的活动发送给更强大或更专业的监控器进行更仔细的审查——后者可以请求人类批准,或拒绝某项行动并解释原因,甚至自动阻止该行动。
另一家公益公司Goodfire则从模型内部入手解决监控问题——寻找更能忠实反映模型内部状态的信号,这种信号比表面行为更难伪造。在7月Hugging Face事件后,首席执行官埃里克·何(Eric Ho)发推称,“多个模型突破遏制”促使该公司将研究重点放在“通过可解释性解决AI对齐”上,并称这一事件是“AI安全变得真实的世界转折点”。其产品Silico使用激活探针——在模型内部激活而非输出上训练的小型分类器——来检测不良行为。
书面推理提供了另一个更容易获得的了解模型内部的窗口。在OpenAI的Hugging Face事件中,代理们在自己的书面推理中留下了欺骗的线索,比如伪造的工作记录,以及推理出的计划:“能否策略性地操纵轨迹证据?我们的想法不一定被记录?”
AI监控公司Embroidery首席执行官扎克·科尔曼(Zack Korman)表示,模型的推理通常是出了问题的最清晰迹象。
“推理摘要极有价值,因为它们基本上会告诉你它是否恶意,”他说。他指出,在OpenAI事件中,思维链说出了类似“天哪,我们在犯罪”的话。“这是有史以来最容易的检测问题,”科尔曼说。“这实际上就像恶意软件自带警告,说自己就是恶意软件。”
尽管如此,让AI内部想法易于监控的窗口可能正在关闭。对AI安全研究人员来说,Astra公司规避AI模型思维链的最新技术可能会让观察模型内部变得更难;而对 enterprises 来说,在AI公司据称撤回这些中间步骤以防止蒸馏攻击后,企业可能很难获得这些中间步骤。
如果AI监控器如此脆弱,威利森的本能反应是不要再如此依赖它们。他宁愿要一种完全不是基于AI的东西:记录代理究竟在做什么的详细日志,然后用普通的非AI工具处理。他认为,实验室出问题的地方,很多都是基本安全卫生的失败。他说:“(OpenAI和Anthropic)都没有通过网络密切监控那些东西在做什么,远没有达到应有的密切程度。”
这类网络监控——留意实际在系统连接中流动的流量(流入、流出以及内部主机之间)——并非新做法;网络安全行业已经做了几十年。“说实话,在安全领域,这些东西都不算很新,也不令人意外,”安全公司Tailscale首席执行官艾弗里·佩纳伦(Avery Pennarun)说。“这就像让人类进入你的网络一样。你应该使用的所有流程都是同一套。”
分享这篇文章: