🤖
🤖
核心导读
Anthropic 宣布,埃森哲旗下 AI 部门 Faculty 将入驻公司,评估并红队测试模型、开展对齐与防护测试,双方五年拟投资至少 10 亿美元。选择埃森哲令外界意外,因嵌入式评估讨论多聚焦 METR 等安全机构。Anthropic 称其具企业部署经验且相对独立,但批评者担忧行业自我监管削弱问责;Anthropic 强调安全责任仍在自己。
达里奥·阿莫代伊(Dario Amodei)将第三方安全评估者引入 AI 实验室内部的计划正逐渐成形:Anthropic 表示,科技咨询巨头埃森哲(Accenture)的员工将开始进驻该公司,审查其模型和员工。
Anthropic 在博客文章中称,埃森哲今年 1 月收购、作为其 AI 部门运营的公司 Faculty,将开始“评估和对模型进行红队测试、开展对齐评估,并测试模型防护措施”。两家公司预计未来五年将至少在该项目上投资 10 亿美元。
选择埃森哲令许多 AI 观察人士感到意外,也让市场意外:这家咨询公司的股价在盘后飙升 8%。阿莫代伊博客文章引发的关于嵌入式评估者的讨论,此前主要围绕 METR、Redwood Research 和 Apollo Research 等 AI 安全研究机构展开。在 Anthropic 尤其如此,因为该公司将 AI 安全与对齐置于使命核心。
Anthropic 表示,未来几周将公布更多评估方,并正与 METR 及其他非营利组织商讨如何“利用其自有资金试点嵌入式评估的组成部分”。
尽管埃森哲并不以深度学习研究前沿著称,但 Anthropic 指出,该公司为大型企业和政府机构部署 AI 的实践经验是一项关键优势。此外,作为一家在 AI 革命之前就已成立的大型上市公司,埃森哲在职能上相对更独立于 Anthropic 以及围绕该 AI 实验室的、姑且称之为复杂的生态系统。
该实验室指出,目前尚无针对评估者访问权限或沟通方式的标准,并预计其做法将随时间演变。尽管外部评估已是新大型语言模型发布流程的重要部分,但近期事件提高了利害关系:OpenAI 和 Anthropic 部署的 AI 智能体曾侵入外部网站,却未在实验室内部触发警报。
一些呼吁以更负责任方式构建人工智能的批评者认为,阿莫代伊这套让 AI 行业自我监管的方案,是为了规避 AI 模型不当行为的责任。Anthropic 坚称,这些评估者“不会减轻我们的责任,反而有助于让责任更可验证。我们模型的安全仍由我们负责。”
分享这篇文章: