Base Labs 携手 Hugging Face 与 Goodfire 启动开放权重 AI 安全合作
人工智能
来源: TechCrunch
•
发布时间:
•
热度: 👍👍
🤖
🤖
核心导读
Baseten 旗下 Base Labs 联合 Hugging Face 与 Goodfire AI,推出开放权重模型安全基础设施标准,聚焦安全评估与监控。当前 abliteration 技术可移除模型防护,Hugging Face 上相关模型已超 6000 个。合作旨在把安全内建于训练与部署,并开放框架邀请开发者共建安全、可及的开放模型生态。
周三,Baseten 与其研究部门 Base Labs 一同推出了一项新的安全基础设施标准,并与 Hugging Face 和 Goodfire AI 合作,为开放权重模型构建安全评估与监控基础设施。
这一公告发布之际,开放权重模型的安全性正引发争论——通过日益流行的名为 abliteration 的技术移除安全防护,这类模型可能变得危险。问题规模巨大:托管开源 AI 模型的 Hugging Face 目前列出超过 6000 个经 abliteration 处理的模型。
Base Labs 是 Baseten 今年早些时候组建的研究团队,将开发并发布用于训练和监控开放模型的方法。该公司将其未来工作定位为开放模型的一种“标准”:透明,并内建于模型的训练和部署方式之中,而非事后附加。
“我们相信,开放对 AI 安全是一种优势,”该公司在 X 上表示。“开放能提高模型行为的可见性,最重要的是,相比闭源,它提供了更多手段,将安全研究转化为可操作且透明的控制措施。”
这些公司尚未披露该合作在技术上将如何运作,不过 Goodfire 在回复 Baseten 的帖子时阐述了目标:“安全必须内建于开放模型之中,并由那些为其提供服务的人提供。”Goodfire 专注于打开 AI 的“黑箱”,以解释模型如何做出决策,因此最有可能负责“内建”这一部分。
Baseten 是一家 AI 推理服务提供商,6 月完成 15 亿美元 F 轮融资,估值跃升至 130 亿美元。合作伙伴 Goodfire AI 同样资金雄厚,今年早些时候完成了由 B Capital 领投的 1.5 亿美元 B 轮融资,以推进其模型可解释性平台。
展望未来,Baseten 向更广泛的开发者生态发出公开呼吁,邀请其为该框架作出贡献。该公司指出:“我们正在共同构建一个对所有人安全且可及的开放模型生态系统。”
分享这篇文章: