大模型正在进入企业核心业务场景,但真正阻碍其落地的,不是模型能力本身,而是数据能否被模型准确理解和调用。大量扫描件、PDF、图片、视频以及复杂表格沉淀在业务系统中,保留着关键知识,却长期处于非结构化、难解析、难关联的状态。

企业投入大量资源做结构化治理后才发现,面向人类阅读的数据形态,并不天然适合大模型推理,只有将语义和结构尽可能无损地还原出来,才可能真正构建AI-Ready的数据底座。

EasyLink是一家链接AI、数据与场景的AI原⽣企业,创始人陈思吟是一位拥有多年金融科技投资经验的跨界创业者,她敏锐地洞察到了AI应用落地中最难啃的硬骨头——数据,便带领团队深耕非结构化数据处理,在金融资管、医疗等高精度要求的垂直行业中,将大模型应用从玩具级推向生产级。

近期,爱分析与陈思吟进行了一场深度对话,重点讨论了几个核心问题:AI的数据偏好、隐性知识萃取路径、AI原生组织的未来演进。

打开网易新闻 查看精彩图片

核心观点

  • 让AI理解数据是企业在产业侧AI落地应用的最大壁垒。

在企业自部署开源模型、模型能力趋于同质化的背景下,决定AI应用质量高低的关键,是输入给LLM的内容质量。模型决定下限,数据决定上限。

  • AI不习惯人类的结构化思维。

传统的表格和硬性结构化数据是做给人类看的,而对于AI而言,无损的语义描述和天然的网状结构才是最佳养料,把数据转化为自然语言上下文,才是真正的AI-Ready。

  • 企业级AI场景没有中庸之道。

泛办公场景可以用轻量级或开源架构,但金融、医疗等核心业务场景对精准度要求极高。90分在企业级场景只是刚及格,达不到95分以上的精准,AI就无法推向生产一线。

  • 未来的AI原生组织将扁平至极。

随着AI向各个工种深度渗透,传统的复杂汇报线将被瓦解。未来的企业可能精简到只有高管层和专家层两层,其中,专家层是少数具备丰富经验、负责管理和审计Agent的超级个体。

以下为本次访谈实录,在不改变原意基础上略有修改。

01

什么是AI-Ready data?

爱分析:行业内常讲,企业应该构建AI-Ready的数据底座,而AI-Ready的核心是Data-Ready。AI偏好的数据到底长什么样?

陈思吟:AI处理信息的优势在于理解语义关联,在对非结构化数据处理时保留充分的上下文和关系的表达方式能让AI发挥出更强的理解能力。

我们团队是2023年开始创业的,第一个客户是金融机构,当时给了我们一堆五花八门的数据,有视频、图片、扫描件和PDF,说想做一个内部员工助手,希望通过知识库的方式让大模型把这些数据用起来。

那个时候我们就发现了痛点:虽然模型很强,但它没有企业内部的私有数据,而企业知识都蕴含在大量非结构化数据里。要让大模型在推理侧把这些知识真正用起来,必须解决两个核心问题。

第一是怎么把非结构化数据里的语义无损地给到模型。这种语义不仅包括文本,还包括表格和图片的语义。AI到底喜欢什么样的形式?人类特别喜欢表格,喜欢结构化的表达,AI更擅长从包含丰富上下文的自然语言中捕捉因果与逻辑链条。

第二是要考虑结构。当面对大规模数据时,一方面要考虑数据内部语义之间的天然结构,这种结构对模型推理是有帮助的;另一方面,数据与数据之间也存在语义关系。怎么把这种关系完整地还原并表达给模型,非常重要。我们在构建底层非结构化数据能力时,一直围绕着语义和结构的完整还原展开。

爱分析:可以举个例子?

陈思吟:最典型的例子,就是把长篇的文档,转化为保留了核心层级和关联的层次结构树,这种既保留了原始文本的丰富上下文,又还原了数据节点间清晰映射的形态,对于AI 来说才是真正的 AI-Ready。

爱分析:这些工作在整个AI基础设施处于什么位置?重要程度如何?

陈思吟:这些数据预处理是整个AI应用构建链路的第一步,也是最难、最核心的一步。包括像Agent的记忆能力,背后依托的就是对数据本身的处理。如果数据解析不对,推理模型再强也是空中楼阁。至于说通用大模型也能做数据处理,通用能力在面对不同行业时,是有巨大挑战的。

比如我们接触比较多的金融行业,天然对于准确性和可靠度有非常高的要求,任何的数据处理产生的幻觉可能带来合规风险。医疗行业也一样,大量病例、论文和影像在转换为AI可用的燃料时不能出现任何解析的误差。企业在做数据预处理时,对这些复杂数据的精度要求是100%还原语义和结构,通用模型很难在所有场景都做到极致。

爱分析:数据预处理可以理解为文档解析吗?

陈思吟:只做文档解析是不够的,还要建立层次化结构。具体是指,从多种格式中提取关键信息之后,还要能识别这些信息的结构化关系,构建包含章节、段落和层级的逻辑结构树,为模型推理提供全面的上下文信息。

这是数据内部语义之间的结构,数据与数据之间也存在语义关系,更进一步,可以建立一个更庞大、完善的结构化关系,来解决企业数据散落在各处的痛点。

举个例子,你想了解某个企业在某个维度的收入情况,可能没有任何一份完整的数据直接写着收入等于多少,它散落在各个角落。这时候,如果能构建这个结构化关系,模型就可以基于关联关系进行推理,大幅提升检索能力和最终结果的精度。

爱分析:除了PDF和表单,像音频、视频文件这类非结构化数据,也能这样改造吗?

陈思吟:不管是PDF还是视频,我们都支持语义解析。基于智能视觉与语义分析,系统能够自动识别内容层级并建立上下文关联,实现高精度的信息呈现。

爱分析:解析厂商很多,还有面对来自开源解析模型的竞争,怎么建立竞争优势?

陈思吟:聚焦垂类领域的精度,构建数据飞轮。我们在客户场景会遇到具有行业特性的Corner Case,不断迭代优化,逐步就会在数据层形成自己的护城河。在某些垂直领域越做越精、越做越准,这才是最核心的数据飞轮效应。

有了这个特定任务大模型,就能破除模型性能和算力成本的限制。以金融行业为例,他们对实时性要求极高,当天上市公司发布大量年报,需要在T+0的时间内全部处理完。如果直接用一个超大参数的通用大模型或者去调公有云API,算力资源消耗和成本是天文数字,性能也根本跟不上。

我们的视觉语义模型是一个专注于数据解析这个特定任务的工业级模型,专门用来解决数据解析过程中的性能和成本问题。我们自研的多模态数据解析引擎与国产算力深度优化适配,单卡推理的效率可以达到在英伟达卡上的1.5倍,推理加速引擎比开源方案快1倍,达到约1秒一页的解析速度。

02

90分的AI,企业根本不敢用

爱分析:根植于AI-Ready数据底座之上的Agent,相对于没有这个底座的Agent,优势在哪里?

陈思吟:两者的区别,就是生产级和玩具级的区别。企业核心看重的还是精准度。像金融、医疗这些对精准度要求极高的行业,90分可能才刚及格,大家才敢开始用,核心业务至少得达到95分以上。

我们最近沟通发现,很多企业用了开源架构或者引入了一些相对轻量级的产品,结果发现底层数据处理不到位的情况下,很难从验证阶段进入核心业务场景。背后的原因就在于,底层的数据没有处理好,输入的数据质量不高,再怎么去调检索、调模型,输出的质量依然会有问题。

所以,准确率上不去,就永远别想推向企业的核心业务场景。

爱分析:谈到Agent的构建,现在很多企业会用到Harness架构,AI-Ready的数据底座在其中具体能发挥怎样的作用?

陈思吟:数据底座是企业构建完整Agent底层能力的核心基石。我们理解企业去构建Agent需要几块完整的能力:第一块是数据侧,不管结构化还是非结构化数据,都需要做AI-Ready的准备;第二块是知识或记忆侧,有了数据之后,需要沉淀成企业可用的知识。

其实企业内部的知识分为两类。一类是显性知识,就是刚刚提到的各种数据;第二类是隐性知识,也就是各个行业、各个工种的行业认知、经验以及使用过程中的反馈。比如人看到一堆数据,天然会基于过去的经验把这些数据串起来进行总结,这就是隐性知识。

知识侧的任务,就是把所有的显性知识和隐性知识融合,让大模型可以更好地进行理解和表达。在这个能力之上,结合Harness和企业内部的所有知识,才能拼装出一套完整的、生产级的Agent底层能力。

爱分析:隐性知识的萃取一直是个难题,未来AI在知识萃取上能起到多大的作用?

陈思吟:知识萃取在投研等特定垂直场景是刚需,AI在其中的核心作用是充当底层数据的导航仪。我们做过一些垂类场景,比如金融行业投研,它天然需要围绕特定的主题进行知识萃取。不同行业有不同的分析链路和分析框架,这就意味着对底层数据的调用有很强的行业特色。

这就需要在数据与推理的中间层,用一种对模型更友好、不需要死板定义Schema的方式,把数据里面的语义关系显性化地表达出来。这就像是让AI在底层数据上拥有了更好的导航能力。

至于这个过程是完全AI原生的,还是需要人机交互,取决于任务的复杂程度。如果只是撰写某个固定格式的正式报告,你直接丢个模板过去,AI自己就能理解并实现,因为它明确知道要去底层抓取哪些数据。

但如果是一些偏开放式或者偏决策的复杂场景,就需要人机交互,去捕捉人类在执行任务过程中的反馈并沉淀下来。同时,我们还需要对数据本身进行更复杂的网状结构处理,以支持模型进行深度推理。

爱分析:这种网状结构处理,和知识图谱有什么区别?过去做图谱需要先把各种元数据和Schema定义好。

陈思吟:现在完全不需要事先定义Schema了。传统的知识图谱构建需要事先定义Schema 和规则,这在大模型时代已经成为一种限制。而现在我们让模型自动理解语义之间的关联关系,不需要提前定义死板的框架。

爱分析:所以对于最终的甲方客户来说,底下的图谱架构具体长什么样,其实是一个黑盒?

陈思吟:客户更关心最终输出的质量,底层技术细节不是他们关注的重点,采取哪种底层架构,业务用户是无感的。如果是知识库,客户关心回答的质量;如果是Agent,客户只关心执行任务的质量。

爱分析:金融机构本身就一直在做数据治理。现在针对AI应用的这种数据和知识治理,需要跟传统数据治理拉通吗?

陈思吟:现阶段两者更多是并行推进,随着AI应用深入,未来可能会有对接的需求。银行该怎么做传统的底层数据治理,还怎么去做。上层围绕大模型应用去搭的这些AI基础设施或AI治理,目前是两个不同的层面。

03

AI促使企业“减肥”,未来的组织架构只剩两层

爱分析:怎么看AI对组织形态的影响?是否也能建立某种竞争优势?

陈思吟:AI已经在渗透每个工种,每个员工背后可能都在调用非常多的Agent。很有可能未来的组织架构会变成只有两层:管理层向下,是少数非常有经验的、负责管理各个职能的专业人才,他们负责管理各个Agent并检查结果,最后和管理层协同。中间那层复杂的汇报线全被Agent替代了。

我们公司现在就在往这个方向去发展,作为一家AI原生企业,我们不希望未来的组织变得特别臃肿复杂。

爱分析:目前EasyLink重点切入的垂直行业主要有哪些?

陈思吟:金融和医疗是目前我们处理数据量最大的两个行业。尤其在金融的资管行业,我们已经实现了从底层数据处理、知识沉淀、记忆层到上层Agent应用场景的全链条覆盖。

这其实是客户主动推着我们走的。基于客户反馈,我们发现底层数据做好之后,向上覆盖到Agent场景是非常自然的延伸。

爱分析:医疗行业本身的数据治理历史很长,且非结构化数据极多。你们切入医疗行业的出发点是什么?2026年有哪些核心的规划?

陈思吟:无论是金融还是医疗,其实都不是我们刻意去挑选的,而是客户带着痛点主动找上门的。这两个行业的共同特征非常明显:第一是非结构化数据量庞大,资管有大量的股债报告,医疗有大量的病例、论文和影像;第二是这两个行业都极度渴望把这些数据转化成AI能力,但却在数据底座这一关遇到了瓶颈。

关于2026年的规划,我们会紧紧围绕两条线来推广。第一条线是数据线,我们会结合已经切入的垂直行业,构建更多高质量的行业数据处理能力,帮企业打造AI-Ready的数据底座。

第二条线是Agent线,我们在7月初已经正式发布面向企业级场景的Agent产品Tiri,直接把我们最核心的数据解析能力集成在里面,帮客户交付最终的业务结果。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片