条数达标,不代表数据可用

数据交付最容易出现的争议,是双方对“完成”的理解不同。

交付方说采了一万条,需求方拿到手发现:一半没有联系方式、去重之后只剩六千、有几条明显对不上,想核实却找不到来源。条数确实是一万,但这份数据不能直接用。

问题不在任何一方不诚实,而在于验收标准从一开始就只写了数量。

工厂质检台的照片,台面上方悬浮着三个立体方块

应该写进验收标准的三件事

俯拍的鸡蛋托盘,部分格子空着

一、完整率

按字段分别统计,不是给一个总体百分比。

一份商家名单,名称的完整率可能是百分之百,地址百分之九十五,电话百分之六十,网站百分之四十。这四个数字分别写出来,才有意义。

更重要的是在测试阶段就确定预期完整率。目标平台上某个字段的填写率是客观事实,不会因为多花钱就提高。如果电话字段在目标平台的填写率只有六成,那么合同里写“电话完整率不低于九成”是无法实现的——正确做法是要么接受六成,要么把“必须有电话”作为筛选条件,同时下调总条数预期。

这个区分很关键:平台本身的字段缺失采集过程中的遗漏是两回事,前者需要在报价前说明,后者属于交付质量问题。

两个完全相同的白色杯子并排摆放的特写

二、去重口径

先约定按什么去重,再谈去重后的条数。

同一家公司可能因为多个分店、旧地址、用户重复标注而出现多条记录。按什么规则判定为同一实体,会让最终条数出现明显差异:

  • 按名称加地址去重:保守,可能留下少量重复
  • 按电话去重:准确,但没有电话的记录无法参与判断
  • 按网站域名去重:适合企业类名单,但小微商家覆盖不到

没有哪个规则绝对正确,关键是提前定好并写进交付说明。交付时应该同时给出去重前和去重后的条数,以及使用的规则。

档案盒排列的照片,上方悬浮着一条连接两点的立体线段

三、来源链接与采集时间

每一行数据都应该能回到它的原始页面,并且知道是哪一时刻采的。

这两个字段的价值在数据出问题的时候才体现出来。当有人质疑某条记录不对,有来源链接就能当场核对;当两批数据的价格对不上,有采集时间就能解释这是不同时刻的快照,而不是数据错误。

一份没有来源链接和采集时间的表格,出现争议时无法自证。这是我们默认在每份交付里都带上这两个字段的原因。

摊开的说明书页面特写,背景虚化

还应该附上的一份说明

除了数据文件本身,交付时应该有一份字段说明,写清楚:

  • 每个字段的具体口径(价格是原价还是现价,评论数是总数还是时段数)
  • 各字段的实际完整率
  • 使用的去重规则和去重前后条数
  • 已知的限制(哪些内容因为平台机制无法完整获取)
  • 采集参数(地区、语言、排序方式等会影响结果可复现性的设置)

最后一项对周期性项目尤其重要。如果第二次更新用了不同的采集参数,两批数据就没有可比性,而这种差异从数据本身看不出来。

工厂流水线的照片,上方悬浮着三个依次排列的立体方块

一份三步验收流程

拿到数据后,建议花点时间做这三步:

  1. 抽样核对:随机取十条,按来源链接打开原页面,逐字段对照。
  2. 完整率统计:对每个关键字段统计空值比例,和测试阶段的承诺对比。
  3. 去重复核:按约定规则跑一遍,确认没有残留重复。
三步验收流程:抽样核对、完整率统计、去重复核 1 抽样核对 随机取十条,按来源链接 打开原页面逐字段对照 查的是:数据对不对 2 完整率统计 按字段分别统计空值比例 与测试阶段的承诺对比 查的是:够不够用 3 去重复核 按约定规则跑一遍 确认没有残留重复 查的是:条数实不实 缺失来自平台本身 目标网站该字段填写率就低,属 客观情况,应在测试阶段说明并 同步下调数量预期 缺失来自采集遗漏 规则没覆盖到或页面结构变化导 致漏采,属交付质量问题,应补 采修正
三步都在数据进入业务流程之前完成。完整率不达标时,先区分是平台本身的字段缺失还是采集遗漏——这两种情况的责任归属完全不同。

这三步能发现绝大多数问题,而且都发生在数据进入业务流程之前——比用了一个月之后才发现问题要好得多。