获 Andreessen Horowitz 投资的 Vals 力图成为 AI 基准测试的黄金标准
人工智能
来源: TechCrunch
•
发布时间:
•
热度: 👍👍
🤖
🤖
核心导读
Vals 成立于2024年,获 Andreessen Horowitz 领投4000万美元A轮。其 AI 基准测试不公开考题,聚焦法律、金融、编程、心理健康、生物安全等真实任务,并评估模型负面影响,帮助企业改进,正成为 AI 模型采购与上市披露的重要参考。公司收入同比增至8倍,团队扩至25人,并拓展联邦机构评估业务。
基准测试已成为人工智能公司验证模型能力、并在指标有利时从竞争者中脱颖而出、宣传自身优势的行业惯例。换言之,好的基准测试几乎总意味着好的公关。
不幸的是,公司也学会了如何智胜传统基准测试系统——其中许多系统较为陈旧,并非为衡量现代模型的能力而构建。
成立于2024年的初创公司Vals表示,其使命是修复这一极不完善的体系。在不到两年时间里,该公司已在科技行业建立起显著影响力;去年,它获得了由8VC和Bloomberg Beta领投的种子轮。上个月,在经历一段快速增长后,它又完成了由Andreessen Horowitz领投的4000万美元A轮融资。
该公司25岁的联合创始人Rayan Krishnan曾在Palantir实习,在斯坦福大学读本科时曾任职于微软和该校备受赞誉的人工智能实验室。Krishnan说,Vals源于他自己的观察:基准测试正落后于它所旨在衡量的行业进步。
“我们看到一批新的、非常强大的模型迅速进入市场,而学术基准(却)没有跟上这种前沿进展,”Krishnan分享道。Krishnan说,随着AI融入社会每个部分,基准测试的真正意义应是验证模型能否做到公司所宣传的事情。
上周,这位年轻创始人在公司位于旧金山Folsom Street的两层办公室带我参观——这是一栋旧砖建筑,一个世纪前曾是一家大型啤酒厂的所在地。如今,这座历史建筑不再是工业化啤酒产出的场所,而是容纳了多家希望交付科技行业未来的初创公司。
“从历史上看,我认为评估一直是以非常抽象的方式评估智能,”Krishnan告诉我。“比如,模型是否知道足够多信息,能够参加律师资格考试类型的测试?”
在这里,Vals寻求差异化。虽然许多基准测试系统提供公开可用的测试(这可能使公司针对这些测试训练模型,从而可以说在考试中作弊),但Vals不公开披露其具体测试材料。除了衡量AI模型的通用知识,Vals还评估模型完成法律、金融和编程等特定行业相关的复杂任务的能力。
“我们实际上是在看模型的真实影响,”Krishnan说。“它们能否在每个领域内完成与人类同等质量的成果?”
他说,这个想法不仅要检查积极结果,还要检查消极结果。希望分析“如果这些模型在世界上失控运行,会有什么负面影响”。
Vals衡量的能力范围在扩大。除了更传统的行业,这家初创公司还继续进入更独特的领域。“我们有一个关于递归自我改进的基准。我们正在心理健康、网络安全、生物安全,甚至武装冲突法方面做一些工作,让模型理解如何应用《日内瓦公约》,”Krishnan分享道。
公司付费给Vals测试其模型,这可能是一个令人费解的概念。为什么一家公司要付费得知其模型表现不佳?但有效的衡量有助于公司排查问题并随时间改进。Krishnan将他们的收入模式比作学生可能付费给College Board参加SAT考试。
反过来,这些评估正成为寻求收购新AI模型的公司的重要决策因素。
这家初创公司最近披露,其收入目前是去年的八倍。员工也在增长。Vals今年年初只有8人,如今已增至25人,规模扩大了两倍。Krishnan说,随着公司发展,计划搬到更大的办公室,并再招聘10到15人。该公司最近还启动了一个项目,重点是为联邦机构提供模型评估。
Krishnan认为,他公司的基准测试系统将代表AI公司思考如何发展业务和建立公众信任的未来。
“AI公司开始上市。SpaceX已经上市。Anthropic预计今年晚些时候上市。我猜OpenAI很快也会上市。我认为,随着AI模型成为经济核心部分并更广泛扩散,我们所做的这类基准测试和评估将推动它们的使用,并成为这些公司提交公开文件或谈论其计划在AI领域进行潜在投资时的核心部分,”他说。
分享这篇文章: