🤖
🤖
核心导读
Anthropic 发布 Opus 5.5,称其编程与知识工作刷新 SOTA,多项基准超越更大 Fable。输出价降至每百万 token 20 美元,速度更快,少用行话。距 Opus 5 发布仅两月,Sonnet 5.5 和 Haiku 5.5 数周内推出。安全能力比肩 Mythos,沿用 Fable 保障,也是 CEO 呼吁放慢前沿后首个发布。
Anthropic 最新模型 Opus 5.5 于周二发布,在编程和知识工作表现上刷新了顶尖水平。值得注意的是,该版本在许多基准测试中超越了规模更大的 Fable 模型,并成功完成了一系列 Fable 未能完成的非正式任务。
在公告中,Anthropic 称 Opus 5.5 是“我们迄今测试过性能最强的模型”。
新模型也比前代显著更便宜。Opus 5.5 的输出 token 将按每百万 token 20 美元计费,而前代模型为 25 美元。其他计费指标也有类似降幅。该模型运行速度也更快,反映出整体计算需求的下降。
新版还显著改变了 Opus 的沟通方式:Opus 5.5 更少使用行话,更倾向于把重要信息放在消息开头。
此次发布距 7 月 24 日 Opus 5 发布仅过去两个月。根据公告,Sonnet 5.5 和 Haiku 5.5 将在“未来几周内”发布,并带来类似的性能提升。
Anthropic 表示,Opus 5.5 在生物学和网络安全能力上与 Mythos 相当,因此其发布受到与公司 Fable 模型相同的保障措施约束。这些保障措施限制了模型在发现已编译程序中的漏洞、开发可识别的生物武器等任务上的可用程度。
Opus 5.5 是 Anthropic 自 CEO 达里奥·阿莫代伊接受“为前沿设定节奏”的呼吁以来发布的首个模型。该主张有意放缓 AI 能力进展,以匹配对齐进展的速度。
“我越来越确信,要完全应对风险需要更加审慎,”阿莫代伊在本月早些时候的一篇文章中写道,“不仅要投资于风险预防,还要控制能力推进的速度,让风险预防有时间跟上。”
Opus 5.5 的安全训练与前代大体相似,包括对齐测试,以及 METR 和 Frontier Design 等外部机构在发布前进行的评估。但 Anthropic 强调,公司已在为未来模型准备更先进的训练和评估系统,包括改进的安全与监控系统。
“随着 AI 能力越来越强,公共政策应在确保人们所依赖的系统安全方面发挥更大作用。这种能力需要时间建设,我们已开始铺设支持它的基础设施,”该博客文章写道。“我们预计很快会分享这些工作的更多细节。”
分享这篇文章: