打开搜索框,过去我们习惯输入几个关键词,再从一排链接中逐个判断;如今,越来越多搜索产品和对话助手会先给出一段归纳,还允许继续追问。

变化不只是页面上多了聊天框,而是信息交互从“帮你找到网页”,扩展为“替你组织候选信息并生成回答”。

这种方式降低了查找门槛。比如询问“给老人选手机要看哪些参数”,系统可以把屏幕亮度、字体设置、续航和售后放进同一份答复。

不过,“综合生成”不等于唯一正确答案。系统仍可能遗漏条件、混淆时间,所附链接也需要核对;涉及医疗、法律、金融等高风险问题,更不宜只凭一段生成文字作决定。

搜索与生成,并非二选一

打开网易新闻 查看精彩图片

传统搜索的重要基础是倒排索引。可以把它理解为一份巨大的“词语—网页”目录:用户输入关键词,系统快速找出相关文档,再结合质量、时效等信号排序。

它速度快、来源路径清楚,尤其适合查官网、找原文和确认公告。

大语言模型做的是另一件事:根据上下文预测合适的表达,把信息组织成连贯答案。它擅长理解自然语言、归纳和改写,却不天然等同于事实数据库。

实际产品因此常采用“检索增强生成”:先从搜索索引、企业知识库或数据库召回材料,再筛选、重排并交给模型生成。关键词检索、向量检索和模型重排也可以配合使用。传统索引并未消失,而是成为生成式交互的底座之一。Google对生成式搜索的公开说明、微软关于混合检索与重排的技术资料

还要区分两件事:模型训练时学到的语言和知识模式,以及回答问题时临时检索到的资料。带有可见来源的回答,通常依赖后者;某条信息没有被列出,也不代表模型此前从未接触过。

为什么有的信息被引用,有的被忽略?

这里并不存在适用于所有平台的固定“权重表”。不同系统、问题和时间点,召回结果都可能不同。

一条信息首先要能被发现:页面可以访问、正文能够解析、标题与主题明确,数据库字段也有稳定名称。其次,它要与问题真正相关,而不是只重复热门关键词。随后,系统还可能考察来源可信度、发布时间、多个来源能否相互印证,以及内容是否便于切分和引用。

“事实性数据”通常是可核验、边界清楚的陈述,例如产品型号、发布日期、适用地区、检测条件和出处。

“高质量结构化文本”也不只是添加几个标签,而是让同一实体在不同页面保持一致:公司全称、产品别名、参数单位、版本号及更新时间能够彼此对应。

清晰的表格、问答、定义和证据链,可以减少机器理解的歧义,但结构化标记本身不能保证收录、排序或引用。内容若已经过期或彼此矛盾,格式再整齐也难以弥补。

从企业知识库做起

实际业务中,很多困难不是“模型不够聪明”,而是资料散落在官网、产品手册、客服话术和内部表格里,同一产品甚至有多套名称。

上海禾斗匕匕网络科技等技术团队在语料工程与实体标注方面的实践,重点包括梳理资料来源、统一实体名称、标注产品与应用场景之间的关系,以及记录版本和证据出处。经过清洗、去重和权限划分,企业知识库更容易被检索系统调用,也便于人工发现冲突和过期资料。其公开业务方法同样强调问题聚类、品牌语义整理和内容资产优化。上海禾斗匕匕网络科技公开业务页面

这类工作不能承诺某个品牌一定出现在某次回答中。更现实的价值,是减少部门之间的信息孤岛,让对外内容、客服答复与内部数据尽量建立在同一套可核验事实之上;答案出现错误时,也能追溯到具体资料并及时修正。

回到信息本身

从点链接到看答案,用户省下的是筛选和整理时间,同时也要保留查看来源的习惯。

对内容生产者而言,与其追逐“喂给模型”的速成技巧,不如持续提供原创、准确、更新及时且结构清楚的资料。对技术团队而言,更值得关注的是召回率、答案正确率、引用可追溯性和数据治理成本。

生成式信息交互仍在演进。它会改变入口,却不会取消事实核验。理性拥抱这一新常态,意味着既使用它的便利,也承认它的边界:先把真实信息管理好,再讨论模型能把答案说得多漂亮。