文 | Sleepy
AI 时代催生了一条新产业链,专门收购死去公司留下的内部数据。
邮件、聊天记录、项目文档、工单,过去只是公司关停后等待清理的数字遗产。现在,它们开始被重新估价,打包,出售,送进 AI 公司的训练管线。
入殓师替死人保住最后的体面。企业死后的体面,则是证明自己留下的东西还有价值。
8 月 17 日,一场破产资产拍卖上,Google 出价 1000 万美元,买下 Spirit Airlines 的全部企业数据。竞标的还有一家,叫 Mercor,出价 750 万,差 250 万输掉了。
拍品分三块。第一块,约 1 亿封员工电子邮件。第二块,5 亿条 Microsoft Teams 消息。两块合计 6 亿条。第三块,日历、表格、财务数据库、项目文件、运营记录,加一批内部软件。乘客档案、常旅客信息等不包含在内。
6 亿条,一个人一天说 100 句话,要不停地说 16000 多年。
算下来一条消息卖了 1.67 美分。美国人把 1 美分硬币叫 penny,掉地上都懒得捡。也就是说,Spirit 员工在 Teams 里说的一句话,值一个半 penny。
时间回到1980 年,Spirit Airlines出生在底特律,前身是家卡车公司,叫 Charter One,后来改行开飞机。1992 年改名 Spirit,灵魂的意思。此后 34 年,它把美国超低成本航空的模式做到全行业模仿的标杆。
它的底子曾经不薄,205 架清一色的空客,一天约 300 个航班,2024 年营收约 50 亿美元。但是同年净亏约 12 亿,申请破产时背着约 90 亿债务。
2026 年 5 月的一个深夜,公司宣布停飞。第二天,约 17000 名员工从新闻里知道自己失业了。
事情还在走程序,交易要等破产法官批准。Spirit 走的是 Chapter 11 下的清算式关停,没有破产托管人接手,公司仍在法院监督下,自己把剩下的资产一件件卖掉。涉及员工邮件、Teams 消息等敏感数据,还要先交给独立机构处理,删掉姓名、邮箱等能够识别个人身份的信息;这家机构由 Google 挑选,费用也由 Google 承担。
另外,翻遍公开报道,破产公司把内部数据卖给 AI 公司,此前找不到先例。这一单,很可能就是历史第一例。
美国老牌科技媒体 Gizmodo 给这桩交易起的标题是,Spirit 死了,但它的数据会在 Google 的服务器里阴魂不散,飘荡几代人。
一门新生意
给死公司收尸的人一直都有。律师、清算人、拍卖行,干了几十年。飞机、桌椅、商标、专利,能卖的早就卖了。
真正新的是从今年开始,连公司的内部员工数据也被摆上了货架。
这门生意冒出来,背后有两个原因。
第一件事,死掉的公司变多了。
2024 年第一季度,美国初创公司的失败率同比涨了 58%,活跃的风险投资机构数量比高峰期少了 62%。
钱其实没有变少,只是越来越集中地流向 AI。2024 年,美国 AI 初创公司拿走了 970 亿美元融资,创下历史纪录。资本市场依然有钱,只是越来越不愿意把钱花在 AI 之外。
结果就是,一批原本还能继续靠融资活下去的公司,开始更早撞上墙。2024 年 8 月,a16z 投资的金融科技公司 Tally 宣布关停。它累计融资 1.72 亿美元,最高估值 8.55 亿美元,已经走到 D 轮,最后还是没能拿到下一笔钱。
第二件事,数据变贵了。
大模型训练对数据的消耗已经到了非常夸张的量级。GPT-4 的训练数据约为 13 万亿个 token。作为参照,Google Books 四十多年扫描了约 4000 万本书,折算下来大约 4 万亿个 token。也就是说,GPT-4 一次训练使用的数据量,相当于三个多 Google Books。
Epoch AI 算了笔账,高质量的语言数据,书、新闻、维基,2026 年前后就会耗尽。公开互联网里能够用于训练的高质量文本正在迅速见底,合成数据的占比越来越高。接下来,AI 公司要找的新数据,只能更多地往公开互联网之外走。企业内部积累了多年的邮件、聊天记录和工作文档,就这样进入了视野。
而 AI 训练数据集这个市场,研究机构预测 2030 年能做到 97 亿美元。算上各类授权,盘子的总规模估计能达到 675 亿美元。
一边是越来越多的公司进入关停和清算,留下大量过去没有被定价的内部数据;另一边,AI 公司对公开互联网之外的数据需求越来越大。两边同时出现,这才让企业内部数据第一次具备了被规模化交易的条件。
真正让这类数据变得更有价值的,是企业 Agent 的发展。Gartner 预测,到 2026 年,40% 的企业应用将内置任务型 AI Agent,而前一年这一比例还不到 5%。
企业 Agent 需要的训练材料,和普通大模型并不完全一样。公开网页可以提供知识、语言和成品内容,但很难还原一家公司真实的工作过程。沟通与合作,落实到具体有很多真实的细节,比如一个需求怎样被提出,几个人怎么讨论,任务如何分配,出了问题怎样修改,最后又是怎么交付的。
这些过程,大量保存在企业内部的邮件、聊天记录、工单和项目文档里。
当这类数据开始有明确的买家和用途,原本在公司关停时被直接删除的东西,也就有了单独拿出来交易的价值。
收尸人
以前干这活的是清算律师,现在多了三种人。
第一种叫解散服务商,代表是 SimpleClosure。
这家公司只做一件事,帮创业公司体面地死。2023 年公司刚起步,pre-seed 轮拿了 150 万美元,2025 年 5 月又拿了 1500 万美元 A 轮,领投的是 TTV Capital。连给大量美国初创公司管理股权和公司事务的 Carta,也停掉了自己的关停服务,转而投资 SimpleClosure,并把这部分客户需求交给它。
到 2025 年 10 月,SimpleClosure 已经办完了一千多家公司的葬礼。Crunchbase 给它起了个名字,「A Better Way To Fail」,一种更好的失败方式。美国创业者爱说 fail fast,快速失败。SimpleClosure 说,快速失败不够,还得体面。官网上甚至挂着一个定价计算器,输入公司情况,就能算出死一次要花多少钱。
葬礼都不白办。2026 年 4 月,SimpleClosure 上线了 Asset Hub,专门处理公司关停后留下的无形资产。品牌、软件、客户名单之外,第一次被明确摆上货架的还有 Slack 记录、邮件、Jira 工单这类内部工作数据。
这说明在 Spirit 之前,市场已经开始尝试给死公司的内部数据定价,只不过当时还是创业公司、小额交易和私下撮合。
有一个现成的案例。转录和字幕公司 cielo24 关停的时候,通过 SimpleClosure 出售了过去 13 年积累下来的 Slack 消息、内部邮件和 Jira 工单。CEO Shanna Johnson 后来告诉 Forbes,这批数据最终卖出了数十万美元。
对一家已经决定关门的公司来说,这原本是一批需要清理的数据,最后却成了清算时能够回收的一笔资产。
卖数据这个环节,SimpleClosure 交给了 Protege。这是一家数据交易市场,专做 AI 训练数据授权,2026 年 1 月刚拿了 a16z 领投的 3000 万美元,创始人叫 Bobby Samuels。Protege 最早的切入点是医疗影像,30 天时间里给买方凑齐了数百万张影像做预训练。
现在,Protege 开始把这套数据授权和交易能力用到关停公司的内部通信数据上。SimpleClosure 负责公司关停和资产整理,Protege 负责寻找买家、完成数据授权和交易。
第二类参与者,是破产法庭和清算律师。几十年来,他们清点的是飞机、桌椅、商标和专利。现在,清单里开始多出邮箱、Slack 记录和其他内部数据。
按照美国破产法,这些数据可以作为无形资产纳入破产财产,并在法院监督下出售。相关律所也开始设立专门团队,处理破产案件里的数据保存、取证和整理。Redgrave LLP 就有这样的重组与取证业务。
第三类,是负责技术执行的 e-discovery 服务商。KLDiscovery、Epiq、Consilio 这类公司,平时就在做企业数据的采集、整理、托管和审阅。邮箱、Teams、SharePoint 里的内容,需要先由他们导出、归档,再整理成可以进入交易流程的数据包。
这个行业本身已经有一套成熟的收费方式。EDRM 会定期发布定价调查,常见的计费单位包括数据采集每 GB、托管每 GB 每月,以及文档审阅费用。
Spirit 的 6 亿条消息最后能变成一件拍品,中间靠的就是这类基础工作。只是和法庭文件、拍卖报价相比,这部分很少出现在公开报道里,具体由谁处理、怎么处理,外界通常看不见。
尸检清单
对企业 Agent 来说,它需要学习的不只是知识和标准答案,还包括真实工作环境里的判断、协作、纠错和执行过程。
成品告诉模型最后做成了什么,内部记录告诉它这件事到底是怎么做成的。
这种变化已经反映在 Agent 训练数据上。过去一条代码训练样本可能只是几百个 token,内容是修改几行代码;现在,一条 Agent 训练样本往往要包含需求理解、文件定位、代码修改和测试验证的完整过程。
训练数据开始从单一的答案,转向完整的任务执行记录。对 Agent 来说,最终结果当然重要,但更有训练价值的,是完成任务过程中留下的判断、操作和反馈。
相比正常经营的公司,关停企业的数据更容易进入交易流程。公司还在运营时,出售内部通信会牵涉商业机密、员工隐私、竞业风险和客户关系,法务和管理层通常都会非常谨慎。进入清算以后,公司的主要目标变成尽可能回收剩余资产,为债权人争取更多价值。
这也是为什么,同样一批内部数据,在公司活着的时候很难出售,到了关停阶段,却可能被重新当作资产评估。
企业内部数据的价值,行业其实早就意识到了。Salesforce 一直把 Slack 中积累的企业通信视作重要的数据资产,微软 CEO Satya Nadella 也多次强调,企业使用 AI 时,真正有价值的一部分正是自己的专有数据和工作上下文。
过去,这些数据主要服务于公司自己。现在,随着 AI 公司开始主动寻找企业内部数据,它们第一次有了更明确的外部买家。
定价的艺术
这门生意虽然刚开始形成,但市场上已经出现了一些可以参考的价格。
SimpleClosure 和 Protege 处理的关停创业公司数据,单笔交易通常在 1 万到 10 万美元之间。Mercor 给被收购初创公司的员工聊天记录和邮件开出的报价,最高可以到 30 万美元。
Spirit 把价格一下推到了千万美元级。Mercor 出价 750 万美元,Google 最后出到 1000 万美元,争的是约 6 亿条内部通信和其他企业数据。只按这 6 亿条消息计算,平均每条大约 1.67 美分。
这个单价并不高。路透社 2024 年报道,Photobucket 曾拿着约 130 亿张照片和视频与 AI 公司谈授权,照片报价大约每张 5 美分到 1 美元,视频则在每条 1 美元以上。B2B 数据市场里,一条联系人信息根据完整度和准确度不同,也可以卖几美分到几美元。
但这些价格还不足以形成一套统一的标准。关停企业的内部数据到底值多少钱,目前主要还是一单一议。数据量、行业、时间跨度、完整度、独特性,以及买家准备用它做什么,都会影响最终报价。Spirit 的 1000 万美元,更像是目前少数公开可见的大型样本。
如果再和成熟的数据授权市场相比,差距更明显。Reddit 把用户帖子和评论授权给 Google,合同金额约为每年 6000 万美元;News Corp 与 OpenAI 的内容授权协议五年约 2.5 亿美元;xAI 与 Telegram 的合作金额达到 3 亿美元;苹果购买 Shutterstock 图片授权,报价则在 2500 万到 5000 万美元之间。
这些市场已经有稳定的买家、授权方式和定价经验。关停企业内部数据的交易才刚起步,什么数据最值钱、该按条、按容量还是按整包估值,目前都没有明确规则。
Spirit 的 1000 万美元放到公司自己的体量里看,又是另一回事。2024 年 Spirit 全年营收接近 50 亿美元,平均每天约 1370 万美元。Google 买下这批数据花的钱,还不到它正常经营时一天的收入。
对破产清算来说,这只是剩余资产里的一笔回收;对 AI 公司来说,买到的却是一批长期没有公开、包含真实企业运转过程的数据。
清理与移交
数据成交之后,还不能直接交给买方。正式移交之前,通常要经过导出、去身份化、整理打包、法院批准和最终交割几个步骤。
第一步是导出。Slack 的企业数据通常以 ZIP 文件导出,包括按频道整理的 JSON 文件、成员信息和附件。
Microsoft 365 则可以通过取证工具导出邮件和 Teams 消息。Spirit 涉及约 6 亿条内部通信,数据量很大,实际操作中需要分批处理。具体由 e-discovery 服务商还是买方工程团队执行,公开文件目前没有披露。
接下来是去身份化,也就是尽可能删除能够指向具体员工的信息。常见方法包括识别并遮盖姓名、电话、地址等个人信息,或者将敏感字段替换成无法直接对应个人的编号。在部分统计和训练场景中,还会通过增加随机扰动进一步降低重新识别个人的可能性。
但去身份化并不等于绝对匿名。即使姓名和邮箱已经删除,只要文本中保留了足够多的职业、时间、地点或行为特征,仍然存在通过其他信息重新锁定个人的可能。
所以 Spirit 这笔交易里,谁负责这一步很重要。按照目前的交易安排,数据将由一家独立第三方负责去身份化,但这家机构由 Google 选择,费用也由 Google 承担。Google 同时承诺,不会利用这批数据重新识别个人。
破产公司出售数据并没有那么新。过去二十多年里,从 Toysmart、Borders、RadioShack 到 23andMe,都出现过破产过程中处理或出售客户数据的案例。这类交易涉及消费者隐私,通常会受到法院、监管机构和州政府更严格的审查。
Spirit 的不同之处在于,这次出售的核心并不是乘客名单,而是员工邮件、Teams 消息和其他内部工作数据。现有破产程序对这类数据的处理并没有像消费者信息那样形成成熟的规则。
争议也已经出现。Spirit 的空乘工会对交易提出异议,法院因此推迟了审批。原本作为破产资产出售的一批企业数据,开始牵涉到员工权益和 AI 使用边界。
如果交易最终获得批准,数据才会进入最后的交割环节。但从整理完成的数据包到 Google 的系统之间,公开文件披露得很少。数据如何传输、是否还会继续清洗、最终以什么形式进入产品开发或模型训练,目前都无法确认。
程序走到这里,数据才真正完成从破产资产到 AI 资产的转换。
买家
这类数据目前最明确的买家,是 Google 这样的模型公司,以及 Mercor 这样的训练数据服务商。
Google 对 Spirit 这笔交易给出的官方说法,是用于产品改进和 AI 开发。对 Google 来说,这批数据的价值在于,它记录了一家大型企业真实的运营过程,比如排班、协作、内部沟通、项目推进、问题处理和管理决策。
这些内容很难从公开网页获得。尤其对企业 Agent 来说,最终结果之外,更重要的是任务在真实组织里究竟怎样被推进和完成。Spirit 留下的内部记录,恰好包含了大量这样的过程数据。
另一个竞标者 Mercor,更能说明这门生意正在往哪个方向发展。
Mercor 成立于 2023 年,三个创始人 Brendan Foody、Adarsh Hiremath 和 Surya Midha 从高中起就是辩论队队友。公司最早做 AI 招聘,用模型帮助企业筛选和面试候选人。到 2024 年 9 月,Mercor 已经评估约 30 万名求职者,估值达到 2.5 亿美元。
此后,公司的重心逐渐转向 AI 训练数据。2025 年 11 月,三位创始人都只有 22 岁,随着公司估值上升,成为当时全球最年轻的一批白手起家亿万富翁。2026 年上半年,Mercor 营收超过 6.14 亿美元,其中约九成来自 OpenAI 等头部 AI 实验室。到 7 月,公司正在寻求约 200 亿美元估值,并收购了专门为 AI Agent 构建训练环境的 Deeptune。
Mercor 获取训练数据主要有两条路径。
一条是直接购买企业内部记录。它曾向被收购或关停的初创公司报价,购买员工聊天记录和电子邮件,单家公司最高报价约 30 万美元。
另一条是雇佣有实际工作经验的人。TechCrunch 2025 年 10 月报道,AI 实验室通过 Mercor 招募企业前员工,让他们把工作经验转化成训练任务和反馈,时薪大约 200 美元。Mercor CEO 曾表示,公司每天向参与 AI 训练的人支付的报酬超过 150 万美元。
一边购买公司留下的工作记录,一边购买员工掌握的工作经验。Mercor 的核心资产,本质上都是现实世界里的工作过程。
这也解释了为什么它会出现在 Spirit 的拍卖场上。对 Mercor 来说,6 亿条内部通信是另一种规模更大的训练数据来源。
这类业务同样伴随着风险。2025 年,Scale AI 曾起诉 Mercor,指控前员工带走商业秘密;此后,公司也遭遇过训练相关信息泄露和合作暂停。数据既是 Mercor 的生意,也是它最需要防守的资产。
最后有一个数字上的反差。Spirit 以这个名字经营了 34 年,而参与竞拍它内部数据的 Mercor,三个创始人当时都只有 22 岁。
碎掉的长凳
Spirit 的交易还没有完成,法院还没有签字,Google 也没有拿到那批数据。接下来还有工会异议,还有听证,还有很多程序要走。
但这场拍卖已经让一件以前很少被讨论的事情变得具体。
过去,一家公司关门以后,很多东西是真的会消失。财务报表留下来,商标留下来,专利留下来。可一家公司的日常经验通常不会留下来。一个部门怎么开会,一个经理怎么做判断,一次延误发生以后几十个人如何协调,一套流程为什么最后改成今天这样,这些东西很少被正式记录。
公司解散,人走掉,邮箱停用,聊天群关闭,它们也就跟着消失。
所以公司一直是一种很奇怪的组织。
它可以活几十年,积累几万个人的经验,但真正能被继承下来的,往往只是其中很薄的一部分。下一家公司还得重新招人,重新犯错,重新把很多事情学一遍。
AI 改变的可能就是这一点。如果邮件、会议、工单、代码修改和内部讨论真的能够被整理成训练数据,那么一家公司过去只有靠人才能带走的经验,第一次有了另一种保存方式。
这件事最后会走到哪里,现在还很难判断。也许未来企业会主动保存这些数据,也许员工合同会重新写,也许破产法会增加新的限制,也许公司在融资和并购时,连内部工作记录都会被单独估值。
Spirit 提前把这个问题摆了出来。
破产这个词有个流传很广的词源解释。中世纪意大利商人坐在长凳后做生意。资不抵债,长凳被当众砸掉。banca rotta,碎掉的长凳。
几百年来,长凳碎了,事情就结束了。
Spirit 的长凳已经碎了。它留下的 6 亿条消息,正在重新定价。
一条一个半 penny。
热门跟贴