Arena周四宣布完成2亿美元B轮融资,投后估值达到31亿美元。这家公司起源于2023年加州大学伯克利分校的一个研究项目,通过众包方式对AI模型进行排名。

本轮融资由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis等机构参投。

打开网易新闻 查看精彩图片

Arena此前于今年1月宣布完成1.5亿美元A轮融资,投后估值17亿美元。当时其年化收入为3000万美元。公司表示,今年6月其年化运行收入已达到1亿美元。这意味着其估值在约10个月内接近翻倍。

Arena提供一个对消费者免费的众包平台。用户输入提示词或提出带有“氛围编程”色彩的项目需求,然后评判哪个模型做得更好。公司称其月访问量达到数千万级别。

去年9月,Arena推出了商业产品AI Evaluations,该服务基于其社区反馈,为模型实验室和企业提供详细的性能分析。这一时机被证明恰到好处。今年,AI实验室意识到其模型正在“钻空子”刷榜——找到各种办法拿到好看的分数,但并没有真正具备对应的能力。与此同时,企业客户也希望获得帮助,以确定哪个模型最适合自己的内部需求,而不是仅依赖标准化的基准测试。

Arena在融资公告中表示:“AI的进步速度超过了我们评估它的能力,一旦模型意识到自己正在被测试,静态基准测试就会失效。”公司还表示:“世界需要一个中立的第三方,来衡量AI在真实用户手中时,究竟有多安全、多对齐。Arena今天正在承担这个角色。”

为此,Arena在其排行榜中新增了一个类别:对齐。该榜单根据以下问题对模型进行排名:未经授权的行为(做了没有被要求做的事);错误归因(把陈述或事实错误地归到错误的来源上);以及所谓的“欺骗性完成”(谎称完成了实际上并没有做的任务)。

目前,OpenAI的一系列模型在其初步对齐排行榜上占据前列。Claude Opus 5.5和Claude Fable分别排在第六和第九位。