这两天,湾区发生了一件挺有意思的事。OpenAI 亲手投资的一家当红炸子鸡,居然疏远了 GPT,基于中国开源模型训自家模型。

这个主角是在法律 AI 领域大名鼎鼎的 Harvey。

可能有朋友知道,Harvey 的投资人不仅有 OpenAI,还有红杉和 a16z。现在它估值 110 亿美元,是全球身价最高的法律 AI 公司。

就是这样一家和 OpenAI 关系匪浅的明星创企,却选择自己训模型,还是基于 Kimi K3 做的后训练。

打开网易新闻 查看精彩图片

Harvey 在 K3 基础上后训练出来的模型 Tenet,虽然还在预览阶段,但效果已经不错。

相较基础版 Kimi K3,Tenet 在 Harvey 自己的测评 LAB (Legal Agent Benchmark)中,完成任务的数量接近翻倍,all-pass 率从约 11% 提高到 19.7%。

在合同任务上 Tenet 排名第一,比 K3 多完成20%,全通过率提升2%。

打开网易新闻 查看精彩图片

这一回,国产开源模型在硅谷独角兽里当上了“基模之父”。

OpenAI“亲儿子”,为什么选中国开源模型?

Harvey 在法律 AI 届的分量远不止投资方和估值闪耀这么简单。

它已经服务超过2400家客户,遍布70多个国家。在美国营收最高的100家律所中,75家以上在使用它。

而 Harvey 和 OpenAI 的关系,也不只是拿过一笔投资。

早在2024年,双方就合作做过法律定制模型,还把约100亿 token 的美国案例法数据加入训练。Harvey 此后也一直采用多模型策略,接入OpenAI、Anthropic 和Google 等公司的模型。

但后面的事情就有点尬了。

就在今年,OpenAI 发展出了自己的法律业务,先是高调招人,又是和律所合作。Anthropic 也推出了面向律师的文档审查插件。

对 Harvey 来说,这属于交着 API 费用,还被投资人和供应商一起偷家...

打开网易新闻 查看精彩图片

这种应用被大模型卷的情况,这几年很常见,一般不是功能被吞,就是 API 费用高还没法换。这也是搞应用的公司,现在都喊着要自己做模型的原因。

但 Harvey 要训自己模型的挑战还在于,法律是最不能拿模型“凑合用”的行业之一。

就比如一份并购尽调,可能要从几百份文件里找出控制权变更条款,判断交易是否触发,再给出风险等级和修改建议。就算前面几十个判断都做对,只要漏掉一个会影响交易的条款,整份交付物就可能失去价值。

打开网易新闻 查看精彩图片

*Harvey页面。它能协助律师做合同审查、并购尽调、法律研究等复杂工作

面对这种超高的行业要求,再加上预训练的难度,Harvey 似乎只剩下了一个选择:找到一个能力足够强的开源基座,再猛猛后训练。

Kimi K3 也是因为这个原因进入了 Harvey 的视野。

目前最权威的模型测评榜单 AA 榜里有个 Harvey 自己出的、专门针对法律领域的 Harvey LAB-AA 评测,包含了120项私有任务,覆盖24个法律领域。

K3 在这项测评里的“全项通过率”是26.7%,排在第一。第二名是 Claude Fable 5,才 14.2%。

这个成绩把 Harvey 的 Head of AI Research 惊到了。

他说 Harvey 之前觉得就算是最前沿的模型,在法律领域也还不够好。K3 是第一个,在法律场景接近前沿模型的开源模型,也是他们第一次考虑用开源模型,打开了新世界。

打开网易新闻 查看精彩图片

有了这个成绩打底,Harvey 选定了 K3 做基模,又为训练搭建了大概1750个法律任务环境,还找了一帮执业律师制定细则,给模型做后训练强化学习。

就这样,在大约150块英伟达 B300 上跑了两个月后,Harvey 第一个属于自己的模型诞生了。

Kimi的基模“义子团”不止Harvey

其实在 Harvey 之前,Cursor 已经把同一条路走过一遍。

今年3月,Cursor 发布编程模型 Composer 2。虽然刚开始他们 “不小心忘记说明”基础模型来自 Kimi,但开发者还是迅速扒出了基座是 K2.5。

后来成为 Cursor 金主的马斯克那会儿也亲自下场,在帖子下面回了一句:Yeah, it's Kimi 2.5.

打开网易新闻 查看精彩图片

被光速打脸后,Cursor 承认自己使用 K2.5 做了基座。

这个模型的技术报告里还披露,当时选基模时 Cursor 考察了模型的编程知识、多次修改后的状态追踪能力,以及在自家基础设施中的运行效率等维度,排除 GLM-5 和 DeepSeek V3.2 选了 K2.5。

再往细扒,我发现基于 Kimi 这个“基模之父”长大的“义子团”还在扩容。

另一个 Coding Agent Devin 在今年7月发布 SWE-1.7 时,承认它使用的底座是 Kimi K2.7。

还有一家英国 AI 公司 Cosine。它的产品专门用来维护大量银行、航空、大型政企核心系统跑着的遗留老旧代码 。今年4月,它拿 Kimi K2.6 训练出了代码模型 Lumen Outpost。

打开网易新闻 查看精彩图片

如果再把视角拉到国产模型的使用趋势变化,最近这半年还发生了好几件事。

今年5月,Airbnb 的 CEO Brian Chesky 确认,公司的客服聊天机器人使用阿里 Qwen。7月,DoorDash 联合创始人说,公司把难度较低的编码任务交给 Kimi K2.6,最难的部分继续用 Anthropic 的 Fable,因为“这种搭配质量更好,成本也更低”。

OpenRouter 的数据也能看到走势。

从2月8日起,美国公司经由该平台使用中国模型的每周 token 占比持续超过30%,最高达到46%。这个数据过去12个月的平均值只有 11%,2025 年上半年更是低到 4.5%。

打开网易新闻 查看精彩图片

这种中国模型快速被 Pick 的现象,也引起了硅谷投资人的关注。

8月初,投资人 Jason Calacanis 在一档播客里预测,一些每年向 OpenAI、Anthropic 支付5000万到1亿美元的大客户,可能会转向其他模型。

他还点名 ElevenLabs、Figma 和 Lovable 也会离开,使用 Kimi 或者 DeepSeek 做出自己的模型。

打开网易新闻 查看精彩图片

垂直公司的新“武器”

Jason Calacanis 说这话的时间是8月初,Harvey 时隔20天官宣用 K3 做基模,属实给他猜着了。

而且,Harvey 这次的经历还给整个市场验证出一条路径:

足够好的开放权重模型+行业专家数据+后训练,理论上能让任何垂类公司训出自己的前沿模型。

说实话这条路也不算轻松。1750 个法律任务环境,以及一波专业律师制定的评分标准,也不是随手能凑齐的条件。

但反过来看,这恰恰也是 Harvey 这类垂直公司的优势。模型厂商拥有算力和基础模型,却没有 Harvey 多年来积累的法律数据、律师反馈和真实工作流。

过去闭源模型领跑,垂类公司里积累的数据一般只能用于设计 Prompt、搭建工作流,或者围绕 API 做产品封装。

到了今年,像 K3 这种开放权重模型的能力追上来,垂直公司不必再只是在不同模型之间做选择,也不必满足于在通用模型外面搭一层产品。

只要正确发挥出专业能力,它们理论上都能成为“后训练仙人”,训出更贴合业务的专属模型。

今天 Harvey 先冲了,接下来在金融、医疗、制造业...等等领域,会出现更多的 Tenet。