打开网易新闻 查看精彩图片

2025年,由OpenAI 前CTO Mira Murati创立的Thinking Machines Lab成为AI行业最受关注的新公司之一。它的核心叙事,是把AI带向更可定制、更贴近组织真实工作流的方向。公司的推出产品Tinker,可以理解为一个面向企业和研究者的模型训练API,利用Tinker用户不用自建复杂GPU集群,也不必处理分布式训练中的繁重工程细节,只需通过API控制训练逻辑、损失函数和数据流程,就能对Qwen、Llama等开源模型进行微调。

这家公司本身也站在资本和产业关注的中心,在2025年下半年市场质疑AI泡沫严重的阶段,Thinking Machines就被人拿来当负面例子,在融资路演时,有人抱怨说, “这是最荒唐的路演。她就说,我们要做一家有最好AI人才的AI公司,但我们不能回答任何问题。”

即便如此,Thinking Machines在去年7月还是完成了20亿美元种子轮融资,这一规模在种子轮十分罕见,由Andreessen Horowitz领投,Nvidia、AMD、Jane Street、Google Ventures等知名公司和机构跟投,投后估值120亿美元。

Semi Analysis的创始人Dylan Patel在6月30日上线的红杉的播客中称,Thinking Machines可能已实现数亿美元级别ARR,不过该数据尚未有官方完整披露。无论数字是否准确,市场对它的期待已经很明确:下一阶段AI的商业价值,可能来自帮助企业把内部数据、专家经验和专有流程转化为可复用、可规模化的“专属智能”。

最新的一个方向可能是在金融和投资场景中的应用。

近日,桥水与Thinking Machines合作发布了文章《Learning to Replicate Expert Judgmentin Financial Tasks》,抛开市场认为AI应该在算法或直接做量化交易等方面的判断,Tinker这一案例是更基础、更真实的金融场景——在海量金融文档中,判断哪些信息真正值得投资者阅读。

研究结果显示,在桥水设计的六项金融信息筛选任务上,多个前沿大模型经过提示工程后,最高准确率仍不到80%;而通过Tinker微调千问Qwen3-235B后,定制模型准确率提升至84.7%,错误率较最佳前沿模型减少近30%,推理成本约降至原来的十四分之一

这可能意味着另一种“企业级AI的解决方案”,能使企业内部的专家判断,成为可训练、可产品化、可货币化的新型数据资产。

#01 让AI学会投资者的「信息判断力」

文章开宗明义,指出在金融市场中,信息从来不稀缺。新闻、研报、公司公告、央行文件、邮件、内部纪要,每天都在不断涌向投资者。真正稀缺的,是判断哪些信息重要、哪些只是噪音的能力。

对投资机构来说,阅读本身并不难。难点在于阅读过程中的一系列微判断,比如,这篇文章是否会影响市场?这份央行文件是否暗示未来利率方向?这份研报是否真正回答了投资问题?一封邮件中哪些是有价值内容,哪些只是模板化表述?等等

这些判断对资深投资者而言,往往是“扫一眼就知道”,但很难用明确规则表达出来

比如一条关于“特朗普称格陵兰岛属于他”的新闻,和一条“特朗普威胁新关税导致美股大跌”的新闻,都同时涉及地缘政治与金融市场。但对宏观投资者来说,后者明显更重要,因为它直接影响贸易政策、市场风险偏好和资产价格;前者则更像政治噱头,对市场定价的实际意义有限。

问题在于,AI是否能稳定理解这种差别?

桥水与Thinking Machines的实验正是围绕这一点展开。他们选取了六项来自投资者日常工作流的信息过滤任务:

1. 金融文章相关性判断:给定一篇金融文章,判断它是否值得高管级投资专业人士关注;

2. 央行文件相关性判断:判断央行文件是否暗示未来利率变化方向;

3. 通用文档相关性判断:给定投资者问题和研究文档,判断文档是否有助于回答问题;

4. 临时内容标注:区分报告是重复模板内容,还是包含一次性、议题相关分析,并找到特定内容的最后一页;

5. 文档截断:识别文档中模板内容从哪里开始;

6. 邮件截断:识别邮件中模板内容从哪里开始。

打开网易新闻 查看精彩图片

这些任务看似简单,却高度贴近金融机构的日常运营。它们不要求模型做复杂预测,而是要求模型具备投资者式的信息判断能力。相比于直接做决策,这是让AI帮助投资者先完成信息分诊,把值得注意的材料从海量噪音中筛出来。

这类任务的价值很现实。若系统能稳定完成信息筛选,投资者就可以减少在低价值内容上的时间消耗,把注意力留给更高层次的综合分析、风险判断和资产配置。

#02 前沿大模型为什么不够用:通用能力不等于专家判断

实验最初测试了Gemini、Claude、GPT等多个前沿模型。研究人员先给模型简单提示,让它们执行六项金融任务。结果显示,这些模型平均准确率只有约50%,接近抛硬币。

随后,研究团队尝试加强提示工程。桥水专家根据真实任务描述撰写更细的指令,并重新设计部分任务表达。

例如,对新闻文章相关性的判断,不再简单分成“相关”和“不相关”,而是让模型分成三类:相关且有趣、相关但不有趣、不相关。这样可以更符合宏观投资者的真实需求——一篇关于小型IPO的文章可能在金融意义上“相关”,但对桥水这类宏观投资机构而言,未必具有足够广泛的重要性。

经过专家提示词优化后,模型准确率从约50%提升到70%多。但即使用上最佳提示词,前沿模型仍未稳定突破80%。在桥水的实际工作标准中,80%是一个关键门槛:低于这个水平,投资者很难把系统纳入日常可信工作流。

打开网易新闻 查看精彩图片

这一结果揭示了大模型在专业场景中的一个结构性问题:提示词只能表达专家能够说清楚的部分,而真正有价值的判断,往往恰恰是专家难以完整表述的部分。

金融判断中有大量隐性经验。例如,哪些央行表述只是惯常措辞,哪些意味着政策立场变化;哪些地缘政治新闻会影响资产定价,哪些只会短暂吸引眼球;一份几十页的研究报告中,哪几页才是真正有新增信息的部分。这些能力来自长期训练、市场复盘和组织内部投资文化,并不容易被压缩成几段提示词。

因此,桥水和ThinkingMachines转向了另一条路径,通过高质量标注数据,把专家判断直接训练进模型,而非继续依赖更复杂的提示词。

#03 核心方法:用专家数据微调模型,让AI学会“桥水式判断”

这篇文章最有价值的部分,不只是结果,也包括它展示了如何把组织内部专家判断转化为模型能力。

第一步是构建高质量训练数据。研究团队最初尝试使用非专家标注供应商提供的数据,但训练效果仍然不理想。后来他们检查模型推理轨迹后发现,问题并不完全在模型,标签本身也存在明显噪声:很多非专家标注是错误的。

这并不意外。金融文档筛选不是普通阅读理解题。没有投资经验的人,即使能读懂文字,也未必知道哪些内容对市场重要。

于是团队设计了一套更高效的数据清洗机制:先用非专家标注数据训练一个模型,再让模型回头评估同一批训练数据。当模型预测与原标注不一致时,这些样本被视为“有争议样本”,再交给专家投资者重新审核。

这个机制很巧妙。它没有把所有样本都交给昂贵的专家标注,而是只把最可能困难或错误的样本路由给专家。这样既控制了标注成本,又显著提高了数据质量。

第二步是使用Tinker(即Thinking Machines的产品)进行模型训练。如果简单理解,Tinker的作用类似于“训练基础设施外包”,但并非简单黑盒外包。用户仍然可以控制训练循环、损失函数和强化学习方法,平台则负责GPU调度、分布式训练、资源管理、容错和状态保存。这使得桥水团队可以更快尝试不同训练方案,而不用把主要精力消耗在底层基础设施上。

模型方面,团队选择Qwen3-235B作为基础模型。训练方法上,他们从标准GRPO和重要性采样损失开始。仅这一基线方法,就让模型平均准确率从Qwen Base的44.8%提升到73.48%。但这仍未达到80%的实际应用门槛。

打开网易新闻 查看精彩图片

随后,团队进一步引入了三项关键改进:

交错批处理:在多任务训练中,不是按任务顺序训练,也不是完全混合,而是以轮询方式每个任务交错一个batch。该方法较完全混合batch提高了12.1%准确率。

带非对称裁剪的CISPO损失:替代标准重要性采样损失,在尝试过的损失函数和裁剪方式中表现最好,较基线提升10.1%。

使用强教师的在线策略蒸馏OPD:当学生模型偏离教师模型分布时进行惩罚,使模型在学习任务的同时保持稳定。每20步,如果当前检查点验证准确率创新高,就把它升级为新的教师模型,避免向更弱模型蒸馏。

最终,定制模型平均准确率达到84.66%至84.7%,平均正类F1达到92.99%。相比最佳前沿模型78.2%的准确率,错误减少29.8%。同时,由于模型更小、推理成本更低,每项任务推理成本下降约13.8倍。

打开网易新闻 查看精彩图片

研究团队还做了消融实验,以验证每个训练组件对最终结果的贡献。结果显示,交错批处理、CISPO非对称裁剪、OPD以及“最佳验证准确率教师”机制,都会明显影响模型表现。也就是说,最终效果并非单纯来自换了一个基础模型,而是来自数据质量、训练方法和基础设施迭代效率的共同作用。

#04 一种猜测:未来优势来自「差异化智能」

这项实验的结论非常清晰:在金融这类高专业度场景中,通用前沿模型并不总是最优解。

前沿模型具备强大的通用语言能力,但它们缺少机构特定的偏好、语境和判断标准。对于桥水这样的宏观投资机构而言,它关心的并不只是“一篇文章是否金融相关”,更关心它是否对宏观投资判断有足够意义。这个差别微妙但重要。

通过专家标注数据进行微调后,模型不只是学会了任务格式,更学会了某种组织特定的判断风格。

文章将这种方向称为“差异化智能”:未来的AI不再只是面向所有人的通用助手,也会成为能够根据不同组织需求、数据资产和业务流程进行定制的专属模型。

这对企业AI的商业逻辑有重要启发。过去,很多公司把AI应用理解为调用最强通用模型。但如果通用模型在关键业务场景中准确率不够、成本过高、难以体现组织知识,那么企业自然会转向微调开源模型,构建自己的专属AI。

这也解释了Tinker这类训练API的价值。它解决的核心问题,是企业如何低成本、高效率地把自己的数据和专家经验转化为模型能力。在这个框架下,企业多年积累的文档、判断记录、专家标注、审批流程、会议纪要和决策档案,都可能变成新的AI训练资产。

此外,桥水与Thinking Machines的实验说明,AI在企业中的下一轮竞争,可能是专业数据、专家判断和训练基础设施的综合竞争。通用前沿模型仍然重要,它们提供了强大的基础能力。但在金融、法律、医疗等高价值垂直场景中,真正决定落地效果的,往往是模型能否理解具体组织的工作方式和判断标准。

Tinker的价值也在这里,它让企业更容易把内部专家经验训练进模型,把原本依赖少数人的判断力,变成可扩展的组织能力。

对金融机构而言,过去难以表达、难以复制的专家判断,正在被转化为可训练的模型资产。谁拥有更高质量的数据,谁能更有效地组织专家反馈,谁就可能在下一阶段的AI应用中建立新的壁垒。

在信息人人可得的时代,真正稀缺的仍然是判断力。只不过现在,判断力开始可以被训练、部署和规模化。