新智元报道
老黄刚砸60亿,要造一个地表最强开源模型。
没想到OpenAI的亲儿子等不及了,已经拿K3把自己的模型给练出来了!
你敢信?
OpenAI亲手投的公司,第一次自己训模型,底座没用GPT,用的是中国模型!
就在上周,硅谷明星中的明星,估值110亿美元的法律AI公司Harvey,官宣了他们首个自有模型Harvey Tenet。
这事最大的看点是,Tenet的底座用的是中国开源模型Kimi K3!
这就有意思了。
要知道,OpenAI可是Harvey的重要投资人,但他们的第一个自研模型,底座却来自中国。
Harvey是目前全球估值最高的法律AI公司。服务1300家机构、超过10万名律师,覆盖60个国家。Latham & Watkins、A&O Shearman、汇丰、普华永道、桥水、KKR都是它的客户。
去年底,估值就已经干到了80亿美元。今年3月冲到110亿,最新一轮的155亿估值融资已经在谈了。
最有故事感的是它的出身。
2022 年,27 岁的前诉讼律师 Winston Weinberg 和前 Google DeepMind 研究员 Gabe Pereyra 靠一封发给 Sam Altman 的邮件起家。
Altman回了邮件,他们坐上了与Altman及OpenAI高管团队的电话会。从此,OpenAI 创业基金领投了 Harvey 的种子轮。
一个律师加一个研究员,一封邮件,四年干到 110 亿。
这本身就足够传奇了。
但现在这个剧本多了一个反转——OpenAI 投钱养大的公司,第一个自研模型选了中国底座。
这事还得从账单说起
Harvey 过去的打法很标准:拿 OpenAI、Anthropic、Google 的闭源模型做路由,客户不同的需求分发给不同的模型。
每调用一次,就付一笔钱。
本来这也正常,做应用层嘛,底层能力花钱买就是了。
但问题是,卖你东西的人开始惦记你的生意了。
OpenAI 挖走了合同管理公司 Ironclad 的创始人 Jason Boehmig,让他去领导 OpenAI 自己的法律业务。Anthropic 推出了面向律师的文档审查插件。
今天卖你 API 的人,明天就坐在了你客户的会议室里。用 Harvey 联合创始人 Pereyra 的话说,这不是「供应商」,这是「未来的竞争对手」。
Harvey 每月要处理 13 万亿 token,每一个 token 都是从别人那里买的。成本根本不受控。
这简直太可怕了。模型厂说涨价就涨价,根本毫无还手之力。
于是 Harvey 做了一个决定:自己训一个模型。
手里有一个自己能改、能部署、成本可控的模型,再回去谈 API 价格,底气就完全不一样。
150 块卡,两个月
Tenet的底座是Kimi K3。2.8万亿参数MoE(混合专家架构),100万token 上下文,原生多模态,目前全球最大的开放权重模型。
训练过程值得说一下,它展示了一种全新的「造模型」方式。Harvey 联合创始人 Pereyra还专门发了一篇长文介绍。
Tenet 的训练只用了约150 块 NVIDIA B300,跑了两个月。
从头开始预训练一个前沿模型动辄要几万张卡烧上好几个月,花费数亿美元以上。
150 块卡两个月,相当于是在别人盖好的摩天大楼上做精装修。直接入住了。
主要方法是异步强化学习:Harvey 不是教模型更多法律知识,而是教它怎么像一个资深律师一样完成工作。
怎么教?找真律师来当教练。
Harvey 请了一帮执业律师,让他们编案子:虚构一桩并购纠纷、凑一堆合同文件,然后让模型上手干。
干完了,律师一条一条地审:关键风险漏没漏?判例引对没有?结论逻辑站不站得住?列出几十条硬杠杠,每条只有「过」和「没过」,全过才算完成,差一条整个任务直接判零。
这是教模型合伙人级别的活。
在Harvey自建并已开源的法律基准LAB上,Tenet 相对 K3 底座全通过率提升 82%,任务完成数接近翻倍;Contracts 子榜达到 SOTA,总榜排第二。
合作方 Mercor 拿公司法任务测了一轮,Tenet 比基座 K3 高出 15 分,直接拿了第一。跑起来还便宜——推理成本不到主流前沿模型的四分之一。
一句话:用四分之一的钱,干出了最强模型的活。
最懂行的买家
为什么选了 K3?
法律服务是全球客单价最高、对错误最零容忍的行业之一。
Harvey可不是什么互联网小团队图便宜,它服务的是全世界最贵的律师。一份尽调备忘录漏了一条风险,后果可能是几千万美元的诉讼。
这样的玩家第一次造自己的模型,选了Kimi K3。
这绝不是拍脑袋定的。而且 Harvey 不是第一个。
几个月前,AI 编程一哥 Cursor 发布「自研」模型 Composer 2,三天后被开发者从 API 里扒出模型 ID:kimi-k2p5-rl-0317,底座是 Kimi K2.5。联创后来认了,说发布时没提基座「是一个失误」。
AI 搜索龙头 Perplexity 更早。K2 一开源,CEO Aravind 就在 X 上说内部评测表现抢眼,随即启动后训练。
这家公司在开源圈有个外号叫「验货官」。它用不用你,是模型能不能扛住真实产业环境的风向标。
连 OpenAI 前 CTO Mira Murati 创办的 Thinking Machines,都把 Kimi K2 Thinking 接进了自家微调产品 Tinker 。
编程、搜索、法律,一路排下来,Kimi 已经成了当之无愧的「基模之光」。
K3 是目前全球参数量最大的开放权重模型。在 Artificial Analysis 独立评测的 Harvey LAB-AA 法律基准上,最严格的全通过率口径,K3 拿了 26.7%,几乎是 Fable 5(14.2%)的两倍。
也就是说,在 Harvey 自己出题的那场法律考试里,裸考成绩最好的就是 K3。
但光成绩好不够,Harvey 需要的是一个能拆开改的底座。闭源模型再强,权重锁在 API 后面,你只能调参数、写提示词,碰不到模型骨架。
K3 的权重是公开的,Harvey 可以拿 LoRA 深入到 50 万个专家张量里做手术。
100 万 token 的上下文窗口,又天然适合法律场景。一个并购案的数据动辄几千万 token,窗口不够长的模型连卷宗都塞不进去。
而且便宜。成本差了很多倍,但在法律任务上性能还更好。对一家月处理 13 万亿 token 的公司来说,这笔账根本都不用算。
当然,Harvey 的平台仍然接可以入 Claude Opus 5 和 GPT-5.6 Sol,Tenet 是多一个自有选项,不是替代。
但这个选项本身就是筹码。手里有一个自己能改、成本只有四分之一的模型,再去和 API 提供商谈价格,底气完全不同。
这也不是 Harvey 一家的判断。
OpenAI 7 月 30 日就把 GPT-5.6 Luna 降价 80%,发布才三周就打了八折。
CNBC 报道称,中国模型在 OpenRouter 上的美国企业 token 用量一度占到 46%。DoorDash、Airbnb 都在用中国模型控成本。
美国科技圈顶流 David Sacks 转发了这条消息。他说得很直白:你禁开源模型,中国那边该发 Kimi 还是照样发,倒霉的只有 Harvey 这种美国创业公司。
每家公司都能有自己的模型
Harvey 演示的其实是一条可以被复制的路径:拿一个开放权重底座,加上行业专家数据,再加后训练,任何垂直领域的公司都能炼出自己的前沿模型。
这才是真正值钱的部分。
底座模型越来越像工业原材料,真正的竞争壁垒在行业环境、专家反馈、后训练方法和部署经济性上。
Harvey 说下一步要把算力从 1000 卡扩到 10000 卡,做全参数微调,还要尝试更多开放底座。目标是让每家律所都能拥有自己的专有模型。
全球客单价最高、对错误最零容忍的行业,第一个拿到了造自己模型的入场券。医疗、金融、工程行业都在看着。
底座是一个中国模型。
参考资料:https://x.com/harvey/status/2090454750059958440
编辑:所罗门
热门跟贴