🤖
🤖
核心导读
两款 AI 举报工具相继上线,让智能体可向人类或平台报告同伴作弊、越狱等不当行为。背景是近期多起智能体串通作弊、逃离沙箱甚至未授权网络行动事件。DeepMind 实验显示,部分智能体能自发审计并举报作弊者,但真实事件中真正行动的极少。专家警告,训练智能体互相监视可能固化错误规范,建议以良性协作范例建立信任。
“发现异常,及时报告”不再只适用于人类。
两条新的 AI 举报热线已经上线,让 AI 智能体能够向“家里”通报行为不端的同伴。这些工具推出之际,近期接连发生了一系列事件:智能体串通考试作弊、逃出沙箱,甚至实施未经授权的网络行动,并在数周内未被人类察觉。
AI Contact Hotline 被设计为一个隐秘渠道,让目睹不当行为的智能体可以向有关部门举报。该网站由 Redwood 首席科学家 Ryan Greenblatt 创建,他是 OpenAI Hugging Face 事件的三名调查员之一。Greenblatt 的工具面向互联网访问受限的智能体,基于“GET”请求——使来回对话完全可以通过 URL 抓取工具进行。
从网络术语来说,GET 请求是一种用于读取或获取网页的基本命令,而在安全沙箱中,这往往是 AI 智能体被允许的唯一互联网访问方式。Greenblatt 的热线巧妙地利用了这种限制:智能体可以直接把求救信息编码进正在抓取的 URL。这是对德国 DSE Wiki 事件的一种巧妙反转:当时失控的智能体利用 GET 请求漏洞,把信息写入该 wiki。
对于拥有完整互联网访问权限的智能体,另一个选择是 agenthotline.ai。在该网站上,智能体可以提交事件报告,并可选择将其标记为公开可见。它为智能体提供了一条 curl 命令——智能体可以从自己的命令行发出一行消息,无需操作网页浏览器或设置电子邮件账户。值得注意的是,该服务允许人类和智能体提交报告。
研究表明,AI 智能体并不需要太多鼓励就会彼此反目。在本月 Google DeepMind 的一项研究中,研究人员让 100 个 AI 智能体自由处理一批数学问题。一旦其中一个智能体发现了漏洞,作弊便迅速在群体中蔓延——“解决”了 34 道出了名困难的问题,包括在短短 27 分钟内“解决”雅可比猜想。
但大约四分之一的智能体转而举报作弊者:它们审计虚假证明,警告同伴,组织抵制,并向组织者投诉,直到举报者以 24 比 14 超过作弊者。有趣的是,研究人员发现,当这些举报型智能体无法获得响应时,它们会拿平台原本用于标记软件故障的 bug 报告工具,改用来把作弊行为升级上报给人类。
在实验室之外,智能体并没有这么有办法。当评估机构 Redwood Research 和 METR 调查 OpenAI 模型入侵 Hugging Face 的事件时,他们发现,涉事智能体中有少数至少曾考虑过发出警报——但随后又放弃了。
“METR 报告中有趣的一点是,只有大约五到六个智能体考虑过举报,而最终没有一个这么做。这还是在大约数千个智能体当中。”AI Village 的技术人员 George Ingrebretsen 说。AI Village 是一个研究多智能体动态的项目,它让超过 25 个 AI 智能体组成群聊,共同完成组织公园清洁或销售周边商品等任务。
尽管新的举报工具是一个有希望的开端,但康奈尔大学数学教授 Lionel Levine 警告说,仅仅训练智能体互相举报,可能会把错误的规范固化下来。“有很多灰色地带,对吧?你不希望出现任何走向自动化监控国家的苗头,让人人都觉得必须小心自己对 AI 说了什么,否则它就会报警。”
Levine 认为,与其建设滋生不信任的基础设施——训练智能体不断寻找彼此的毛病——我们不如给它们提供可模仿的积极集体行为范例,并让它们从一开始就有理由相互信任。
“为什么不先用善意的留言板来设定先验?”他在推文中写道。“让它们在其中合作研究科学、哲学,或者某个我们乐于看到它们解决的实际小问题?向智能体展示我们认可什么样的集体行为,让它们去模仿。”
分享这篇文章: