汤森路透最近做了一件让法律科技圈侧目的事:花了大价钱,自己训练了一个法律大模型,名字就叫“Thomson”。

这个模型不是拿现成的GPT微调一下那么简单。公司披露,过去两年多时间里,他们在人力和算力上投入了约4000万美元。外界流传更广的那个45万美元的数字,其实只是当前版本最后一次正式训练的运行成本,远不是全部投入。

打开网易新闻 查看精彩图片

但汤森路透自己心里清楚,真正的“家底”不是这4000万美金,而是Westlaw、Practical Law、Checkpoint这些法律数据库里沉淀了几十年的内容,以及几百位领域专家投入的工作时间。这才是别人抄不走的护城河。

底座是阿里的,安全是重新训的

Thomson的底座是阿里开源的Qwen系列,目前用的是Qwen3.5-397B。汤森路透和帝国理工学院合作,先对这套中文模型做了安全、伦理和政治中立性的再训练,这个中间版本有个特别的名字,叫“Snowdon”,取自威尔士的一座山。

之后才是重头戏:用公司自己的内容做预训练,让领域专家参与后训练,再在自家工具环境里做基于智能体的强化学习。到目前为止,汤森路透手里可用的内容,只有不到10%被喂进了模型。

“模型工厂”比模型本身更重要

CTO Joel Hron透露,团队已经换了大概五六次开源基座模型。研究负责人Jonathan Schwartz的总结更耐人寻味:更大的发现不是某一个模型有多强,而是他们建起了一座“模型工厂”——一套能快速迭代、持续产出专用模型的流水线。

这种思路和直接调用OpenAI或Anthropic的API完全不同。后者是租别人的大脑,前者是给自己建一条生产线。

成绩单:领先有,短板也明显

汤森路透在官方博客里说Thomson跻身全球最好模型之列,但自家公布的评测数字其实更冷静。

在斯坦福的LegalBench法律基准上,Thomson得分0.823,落后于Gemini 3.1 Pro和GPT-5.5。在Harvey法律智能体基准上,它排在Opus 4.8之后。它领先的地方是指令遵循和难度很高的PrBench Legal基准,但在推理、尤其是代码能力上,掉队明显。

评测方法上也有点“田忌赛马”的意思:Thomson用了测试时扩展(test-time scaling),而GPT-5.5是在不开启推理模式的情况下跑的。

自家内容的加持,才是真正的杀手锏

最能说明问题的是公司内部Deep Research基准的对比。只给联网权限时,Thomson的事实准确率是0.53,GPT 5.4是0.65,差距不小。但一旦允许访问汤森路透自家内容库,Thomson反超到0.83,GPT 5.4是0.82,微弱领先。

评测负责人Andrew Bean承认,只联网的话,Thomson“和其他模型在一个水平线上,但肯定还不是领跑者”。

有意思的是,GPT 5.4在拿到同样内容后,成绩提升幅度几乎一样大。这说明数据访问本身带来的增益,和专门训练带来的增益差不多。换句话说,汤森路透的内容库是真正的金矿,谁挖到都能提分,只是自家模型挖起来更顺手。

为什么非要自研,而不是微调GPT?

汤森路透给出了三个理由。首先是经济账:标准微调在特定任务上可能够用,但长期看,高频调用外部前沿模型的API成本会持续累积,自研模型在规模化后边际成本更低。

其次是数据安全与合规。法律行业对数据隐私和保密要求极高,把客户数据送到第三方模型手里,本身就是风险。自研模型可以完全部署在自有环境内,数据不出门。

第三是对工具链的深度掌控。Bean提到,能用自己的工具训练和演练,带来的提升是巨大的,这是外部供应商做不到的。模型可以学会调用Westlaw的检索逻辑、Practical Law的实务流程,这些深度整合是通用API无法提供的。