9月29日,美国第三巡回上诉法院维持汤森路透在Westlaw诉ROSS Intelligence案中的部分胜诉判决。法院认定,涉案2243条Westlaw案件要点摘要具有独创性;ROSS将其用于训练竞争性的法律检索系统,不构成合理使用。
这是美国上诉法院首次在AI训练争议中审查合理使用。要理解这场官司,要先知道,ROSS究竟拿了Westlaw的什么,又准备用它做什么。
判决书有了,为什么还要拿判决摘要?
Westlaw收录法院判决,也请律师编辑从判决中提炼法律要点,写成简短的摘要。用户看到摘要,可以迅速判断一份判决是否相关,再跳转到对应段落。
ROSS想做一款用自然语言提问的法律搜索工具。用户输入一个问题,系统从判决库中找出相关段落。它已经可以访问大量判决,难题是如何教会系统判断“哪段判决最能回答这个问题”。
ROSS委托外部公司制作训练材料。制作人员利用Westlaw摘要拟出法律问题,再为问题匹配判决段落,标记相关程度,供系统学习。在上诉涉及的2243条摘要中,法院认为,训练材料中的问题与Westlaw摘要高度相似,却明显不同于原判决的表述。
ROSS的产品最终返回的是判决段落,并不向用户展示Westlaw摘要。但摘要已经在训练阶段发挥作用:它帮助ROSS省下了阅读判决、提炼问题、制作高质量训练材料的工作。
不把别人的文字显示给用户,并不意味着训练时复制这些文字就无需解释。
一条法律摘要,凭什么受版权保护?
ROSS的抗辩有一个很有吸引力的理由:法院判决属于公共领域,法律规则也不应被私人公司垄断。既然摘要只是概括判决,为什么不能拿来用?
法院同意前半句:Westlaw不能垄断判决和法律规则。但法院把判决原文与编辑撰写的摘要区分开来。
面对同一份判决,编辑需要决定哪些法律问题值得提炼,保留多少事实背景,再用什么文字把规则说清楚。不同编辑完全可能写出不同摘要。法院认为,涉案2243条摘要体现了最低限度的独创性,因此可以获得版权保护。法院同时明确,本案审查的摘要并非逐字照录判决;照录原文的摘要是否受保护,不在此次裁判范围内。
这条边界对法律数据行业很重要。人人都能读判决,也能依据判决自行写摘要。竞争者不能因为底层判决公开,就直接拿走另一家公司编辑好的表达。
ROSS输在“喂AI”,还是输在做竞争产品?
美国版权法的合理使用判断,要综合考察使用目的、作品性质、复制的数量与重要性,以及对现有或潜在市场的影响。
ROSS强调自己使用摘要的方式变了:Westlaw把摘要给人读,ROSS把摘要放进训练材料,让机器学习。法院承认这里存在一个技术上的中间步骤,却认为双方的最终目的十分接近。
Westlaw用摘要帮助用户发现相关判决;ROSS借这些摘要训练产品,同样帮助用户发现相关判决,并打算在商业市场上与Westlaw竞争。因此,把摘要放进AI训练流程,并没有让原本相近的商业用途变成截然不同的用途。
ROSS还提出,自己使用的摘要只占Westlaw庞大摘要库的极小部分。但法院指出,每一条摘要本身就是一件短作品;对被复制的单条摘要而言,ROSS拿走的是全文。更何况,ROSS可以根据公开判决自行制作训练材料。使用Westlaw现成摘要比较方便,不等于复制具有必要性。
市场因素则让这个判断更加明确。Westlaw摘要本来就是吸引用户订阅法律检索服务的组成部分。汤森路透还可以用摘要训练自己的产品,或者考虑向他人许可训练使用。ROSS未经授权将其用于开发替代性产品,会影响摘要在这些市场中的价值。法院最终认定,四项因素中只有作品偏重事实、已经发表这一项略有利于ROSS,整体上仍不构成合理使用。
对中国法律AI,最该核查的是哪一层数据?
这起案件与中国法律AI、知识产权数据库和专业知识库的关系,比“国外又有一家AI公司败诉”更近。
一个法律AI产品的数据,至少可以拆成三层。
第一层是原始材料,例如判决书、专利公开文本、行政决定。它们从哪里取得,能否用于特定用途,需要依据适用法律和取得方式判断。
第二层是人工加工成果,例如案件摘要、裁判要旨、翻译、评论和专题整理。要查清是谁写的,使用者取得了什么权利,许可是否覆盖模型训练及商业产品开发。
第三层是结构化判断,例如问题与案例的对应关系、相关性标注、争点分类和检索评价。它们决定系统能否从海量文书中找到真正有用的答案。其具体内容、权属和使用限制,同样需要逐项核验。
对建设数据库的企业,这也是一道资产化问题:收录大量公开文书是起点;持续提炼、校验、关联和更新,才形成用户愿意付费的专业服务。
对采购数据训练模型的企业,则应在合同里写明可以调用哪些字段、能否训练、训练后能否提供竞争性服务、模型和训练材料如何留存。一个普通的“数据库使用账号”,未必包含这些权利。
Westlaw赢了,生成式AI也会输吗?
不能这样推断。
上诉法院明确指出,ROSS的系统从既有判决中检索并返回段落,不会生成新的表达。法院还特意说明,围绕生成式大模型训练提出的部分争议,不适用于这个案件。此次裁判维持的是针对特定摘要、特定训练方式和特定竞争产品的部分简易判决,并未替所有AI版权诉讼给出统一答案。
不过,它已经回答了一个足够具体的问题:一家法律AI企业拥有公开判决,仍不能因此直接取用竞争者围绕判决写成的摘要,把它们变成自己的训练材料。
判决属于公共领域;把判决读懂、提炼成摘要、组织成可检索的知识,是持续投入形成的成果。法律AI越需要高质量数据,这两者的边界就越值得认真对待。
热门跟贴