打开网易新闻 查看精彩图片

一、一份太漂亮的报表

做数据核查的人,心里都有一条经验:报表里的数字太整齐,先别急着高兴。

见过一份乡镇上报的材料,几个村的受灾面积占比分别是 15.2%、15.1%、15.3%、15.2%,小数点后一位都咬得很紧。乍一看是好事,说明情况一致。

但真实的灾害分布不会这么规矩。风从哪边来、哪片地势低、哪个村的作物到了什么生育期,都会让占比拉开差距——差出一倍都不稀奇。

这么整齐,只有两种解释:要么各村真的是同一片地形、同一种作物、同一场天气,要么这个数是凑出来的。

数据质量核查,第一件要学的就是分辨这两种情况。

二、"整齐"为什么可疑

打开网易新闻 查看精彩图片

先说清原理。真实世界产生的数据,分布是自然的,自然就意味着有波动、有长尾、有不规则的聚散。

人为填出来的数字,会不自觉地带上痕迹。常见的几种:

第一种是比例雷同。不同村、不同地块,按理说条件不同,结果却高度一致。农业上尤其少见,因为地里的事天生不均匀。

第二种是尾数集中。数字的末位本该是均匀分布的,如果大量出现 0、5 或者某个偏好数字,往往是凑整的结果。

第三种是完美关系。比如产量除以面积,得出的单产在各村几乎一样。真实情况下,单产受地块质量、管理水平影响,波动是常态。

第四种是填报时间扎堆。系统里通常有填报的时间戳。如果几十份表都在同一个小时内提交,内容又各不相同,那就不太自然。

第五种是逻辑矛盾。同一块地在不同表格里的面积不一致,或者上报的种植面积超过了该村耕地总量。这类问题最硬,一查一个准。

所以做质量核查,不是去找"数据够不够多",而是去找"数据里有没有不自然的地方"。

三、核查靠什么手段

打开网易新闻 查看精彩图片

在实际作业里,数据质量核查通常有五道筛子。

第一道是逻辑校验。这是最基本的,用规则就能跑:面积之和不能超过总量、地块编号不能重复、同一户的投保面积不能超过其承包面积。这类问题占差错的比例通常最高。

第二道是空间校验。这一步要用到影像和地块数据。台账说这块地种的是玉米,影像上是水稻;台账说这块是耕地,影像上是建筑——这种不一致,一比对就出来了。空间校验的价值在于它不依赖填报人,是独立证据。

第三道是分布校验。前面说的比例雷同、尾数集中,靠统计方法能自动筛出来。筛出来的不等于造假,但需要重点复核。

第四道是时间校验。填报时间、修改记录,这些元数据往往被忽略,其实是很有用的线索。一份表如果改了十几遍、每次改动都集中在某个字段上,值得看一眼。

第五道是现场抽查。抽一部分样本实地核实。抽样不是随便抽,通常两种一起用:随机抽样保证覆盖面,重点抽样盯住前面四道筛出来的疑点。

四、几个参数

抽查比例,各项目要求不同。常规质量抽查的比例从百分之几到一成左右都有,疑点集中的区域会大幅提高。

误差容忍度要提前设定。数据不可能百分之百准确,设定一个可接受的错误率,超了就返工,不超就通过。没有标准的核查,最后会变成无休止的争论。

判定的证据强度要分级。有的差错是明显的逻辑错误,直接改;有的只是可疑,需要现场确认。这两类台账要分开记,混在一起就乱了。

抽样单元的粒度要注意。是按村抽、按户抽、还是按地块抽?粒度越细,结论越精确,成本也越高。多数项目的做法是分两级:村级看整体,地块级看疑点。

五、一次质量核查的经过

打开网易新闻 查看精彩图片

说一次实际的过程,地名不写。

任务是对一个区域上报的普查数据做质量抽查,涉及几个乡镇。

第一轮跑的是逻辑校验。这一轮筛出来的问题最多,主要集中在两处:一是部分地块的作物品种在不同表里不一致,二是少数村的种植面积合计超出了耕地面积。后者一查,是村里把复种的地块算了两遍。

第二轮做空间校验。把台账和影像比对以后,筛出一批不一致的地块。这里发现一类比较典型的情况:有十几块地,台账上登记的是粮食作物,影像上看是大棚。原因是这些地这两年改了设施农业,但台账没有更新。

第三轮是分布校验。前面提到的"数字太整齐",就是这一步发现的。某个乡镇的几个村,关键指标的数值分布异常集中。这一批被列为重点。

第四轮现场抽查。抽查队伍分了两组,一组做随机抽样,一组专门去核分布异常的村。实地的结果比较有意思:分布异常的那几个村,并不全是造假,有相当一部分是因为——这几个村的自然条件确实相近。它们都在同一片河谷平原上,土壤、灌溉条件差不多,作物结构也一样。

这是个提醒:异常不等于造假,统计上的可疑只是线索,结论要靠实地。

当然也有真问题。抽查中发现有一个村的几块地,实际上早就改了用途,但为了保住"耕地不减少"的口径,没有上报变更。

整个核查下来,形成了一份差错清单,按"逻辑错误、空间不一致、疑似不实、需现场确认"分类,逐条给处置意见。

六、这笔账怎么算

打开网易新闻 查看精彩图片

数据质量核查的账,看的是三样。

一是数据能不能用。普查数据的用途是决策和研究。底数不准,后面所有的分析都建立在歪掉的基座上。这是最根本的一笔。

二是差错能早发现。在核查阶段发现的问题,改起来只是改数据;如果等到数据发布以后再被质疑,改起来是改结论,代价完全不同。

三是成本结构。核查的投入主要在现场抽查和数据处理上。用影像和逻辑规则先把疑点筛出来,现场只跑疑点,能省下大量人力。这也是这几年质量核查效率提升的主要原因。

七、一个更根本的建议

说到底,数据质量不是查出来的,是设计出来的。

如果填报端的设计就不合理——表格太长、口径不清、没有自动校验、填报人不知道该怎么填——那后期的核查再严,也只能是补救。

实际有效的做法有几条。

第一,把规则前置。填表的时候就地校验:面积超了立刻提示,编号重复立刻拦住。这一步能消除大部分低级差错。

第二,把口径写成人话。什么叫播种面积、什么叫在地面积,用一两个具体例子讲清楚,比抄一遍定义有效。

第三,给填报人一个对照。有影像底图、有地块清单,填报的时候能对着看,出错概率就低。

第四,把核查做成常态。不是等到数据汇总完才查,而是在填报过程中就滚动核查,边报边查。

八、我们在做什么

时维遥感技术服务(武汉)有限公司,做遥感加 AI 的农业与保险技术服务。在数据质量这块,我们提供影像与台账的空间比对、地块级不一致清单、可疑数据筛查辅助,以及现场抽查的记录整理与成果汇交。服务对象包括统计调查机构、农业农村部门。

我们不负责下结论,负责把"哪里可能不对"指出来,并且给出能复核的证据。

结语

数字整齐,在报表上是优点,在地里却是反常。做数据质量的人,心里要始终装着真实世界该有的那个样子。

时维遥感——遥感+AI,让农业更智慧