每个BI厂商现在都配了一个对话框。但几乎没有一家会告诉你,它在真实数据库结构上的准确率是多少。

演示环节的问题永远是单表查询:"按地区给我看营收。"所有工具都能过。真正会出事的是业务方实际会问的那几类问题,它们才是分水岭。

演示问题 vs 真实问题

真实业务问出来的问题,通常长这样:

  • 一个指标需要跨三张表做关联,其中一张表还有近乎重复的数据
  • 一次时间对比,但财年日历和自然年日历并不一致
  • 一个问题,两个人有权限看到不同的答案
  • 同一个问题,间隔一小时问两次
  • 一个根本没有有效答案的问题

这五类问题里,第五类把工具之间的差距拉开的程度,超过前四类加起来。

不会说"我不知道"的工具,是合规流程里的隐患

一个无法说出"我不知道"的工具,在任何受监管的工作流里都是负债。原因很直接:你永远无法识别出哪一个答案是它编出来的。

这句话值得多想一层。当工具对所有问题都给出一个看起来合理的答案时,错误不会以报错的形式出现,而是以"看起来对"的形式混进决策链。等到有人发现时,已经无法回溯到底是哪一步开始错的。

两套架构,穿着同一件外衣

对话式BI实际上分成两种架构,但对外包装得一模一样。

一种在查询时从数据集模型里推断含义。另一种把意图解析到一个带类型的语义图上,先证明关联关系成立,再套用策略规则,最后才编译成SQL。

第一种买起来更快。第二种是唯一能扛住审计的——而且在真实的企业级数据库结构上,两者之间的准确率差距不是边际性的。

这个差距有多大?是十几个百分点九十几百分点之间的区别。

换句话说,一类工具在真实场景里大部分时候是错的,另一类大部分时候是对的。但它们在演示里看起来完全一样,因为演示只用单表问题。

为什么演示看不出来

单表查询不需要证明关联,不需要处理财年偏移,不需要判断权限差异,也不需要面对无解问题。它绕开了所有会暴露架构差异的环节。

所以选型时真正该问的不是"它能不能聊天",而是它在跨表关联、非自然年时间对比、权限差异化答案、重复提问一致性、以及无解问题上分别表现如何。这五类问题,才是把两类架构区分开的测试集。

完整的评分对比,按治理和确定性标准统一应用到当前各家工具上,可以在原文链接里看到。