汤森路透最近发布了自己的第一个自研法律大模型,名字就叫“Thomson”。这个模型不是从零开始训练的,而是站在阿里巴巴开源模型Qwen的肩膀上。公司为此投入了约4000万美元,耗时超过两年,主要用于人员成本和算力开销。

不过,这4000万美元并不是全部成本。公司对外宣传时经常提到一个更吸引眼球的数字——45万美元,但这只是当前版本最后一次训练运行的费用。真正的“家底”在于汤森路透几十年积累的内容资产:Westlaw、Practical Law、Checkpoint以及路透社的庞大资料库,还有数百名领域专家投入的工作时间。这些都无法用金钱简单衡量。

打开网易新闻 查看精彩图片

从Qwen到Thomson:一次“换血”式改造

汤森路透的技术路线很清晰:以阿里巴巴开源的Qwen为基础,目前用的是Qwen3.5-397B版本。他们与帝国理工学院合作,先对模型进行了安全、伦理和政治中立性方面的再训练,这个中间版本被命名为“Snowdon”,取自威尔士的一座山名。

随后,团队用公司自有内容对模型进行预训练,再让领域专家参与后训练,最后在内部工具环境中进行智能体强化学习。到目前为止,训练用到的内容还不到公司全部可用内容的10%。这意味着模型还有很大的成长空间。

CTO Joel Hron透露,团队已经“更换了开源起点模型大概五六次”。研究负责人Jonathan Schwartz则强调,更大的收获“不在于某个具体模型,而在于我们建立的模型工厂”——也就是一套可持续迭代的自研模型生产线。

性能实测:法律领域领先,推理和编码是短板

汤森路透在官方博客中称Thomson跻身全球最佳模型之列,但公司自己公布的数据其实更冷静。在斯坦福大学的LegalBench基准测试中,Thomson得分0.823,落后于Gemini 3.1 Pro和GPT-5.5。在Harvey Legal Agent Benchmark上,它排在Opus 4.8之后。

Thomson的优势在于指令跟随和难度较高的PrBench Legal测试。但在推理能力,尤其是编码任务上,它的表现明显下滑。而且这种对比在方法上并不完全公平:Thomson使用了测试时扩展(test-time scaling)技术,而GPT-5.5是在未开启推理模式的情况下运行的。

在公司内部的Deep Research基准测试中,仅使用网络访问权限时,Thomson的事实准确率得分为0.53,而GPT 5.4达到0.65。只有当Thomson接入公司自有内容时,它才能以0.83对0.82的微弱优势反超GPT 5.4。评估负责人Andrew Bean坦言,仅凭网络访问时,Thomson“处于其他模型的范围内,但肯定还不是领先者”。

数据壁垒比技术本身更值钱

Bean认为,“能够用自己的工具进行训练和实践带来了巨大的提升”,这是外部模型提供商无法做到的。但一个有趣的发现是:GPT 5.4在接入同样内容后,性能提升幅度几乎一样大。这说明数据访问本身的作用,几乎等同于专门的领域训练。

汤森路透没有测试更新的外部模型。不过,如果公司未来换用更强的底座模型(比如Qwen3.8),并把训练内容占比从目前的不到10%大幅提高,Thomson的微弱领先优势还有可能继续扩大。

为什么不直接用OpenAI或Anthropic的模型微调?

这是很多人会问的问题:既然外部前沿模型性能更强,为什么还要花4000万美元自研?汤森路透给出了三个理由。首先是经济账:标准的微调方案在长期使用中,成本并不比自研低,尤其是当使用量达到一定规模之后。

其次是控制力。自研模型可以深度集成到公司自己的工具生态中,训练数据、推理过程、更新节奏都由自己掌控,不受外部供应商的路线变化影响。最后是差异化:只有用自己的内容训练出来的模型,才能真正理解法律领域的深层语境和客户的具体需求。

汤森路透的这次尝试,本质上是在赌一个方向:在专业垂直领域,深度定制的内容和工具集成,比通用模型的参数规模更重要。目前的数据虽然