公开可访问,只是第一个条件
很多需求沟通是从同一句话开始的:这些内容在网页上就能看到,采一下应该没问题吧。
能看到是必要条件,但不是充分条件。同样是公开页面上的内容,一份按城市整理的商家名称和营业地址,和一份把公开评论与用户名关联起来形成的人物档案,性质完全不同。前者是事实性的机构信息,后者已经进入个人信息处理的范畴。
所以我们在接需求时不看“能不能采到”,而是按四个维度判断“该不该采、能不能这样用”。

我们判断需求的四个维度
一、数据类型:是不是个人信息
机构类信息,例如公司名称、营业地址、公开的对外联系电话、商品价格、公开的评分数量,风险相对可控。
一旦涉及自然人,判断标准就要收紧。特别是三种情况:把分散在不同地方的信息拼接起来指向具体的人;对个人做画像、评级或行为推断;把已经匿名化的数据重新关联回真实身份。这三类我们不做。
二、平台规则:目标网站自己怎么规定
每个平台的使用条款不同,对自动化访问的态度也不同。我们会在评估阶段查看目标站点的公开条款和访问规则,如果存在明确限制,会在报告里指出来。
这里需要说清楚一个事实:平台条款约束的是使用方的行为,不是我们单方面能承担的责任。我们的做法是把已知情况告诉你,由你结合用途和风险承受度决定是否继续。

三、获取方式:有没有绕过访问控制
这是我们唯一没有商量余地的一条。
需要登录才能看到的内容、需要通过验证机制才能访问的页面、被平台明确设为私密或受限的范围,我们都不承接。任何以“帮忙想想办法”形式提出的绕过需求,评估阶段会直接拒绝。
我们只处理无需身份凭证即可公开访问的页面。
四、使用目的:数据拿去做什么
同一份数据,用于内部市场研究和用于批量骚扰性触达,是两件事。
我们会问用途,不是流程需要,而是因为用途直接决定了这个项目能不能做。以下用途明确不承接:批量骚扰、垃圾信息群发、伪造评价、操纵平台排名、对特定个人进行追踪或人肉,以及任何以规避平台风控为目的的数据需求。

明确不承接的范围
- 需要登录、付费会员或通过访问控制才能查看的内容
- 绕过验证机制、访问限制或账号封锁的任何方式
- 个人身份识别、跨平台身份关联、用户画像与再识别
- 私信、聊天记录及其他非公开可见的通信内容
- 用于骚扰、垃圾信息群发、伪造评价或操纵排名的数据
- 受版权保护内容的批量复制与再分发

交付时你会拿到什么
为了让数据在后续使用中经得起追问,每一份交付都包含三样东西:
- 来源链接:每一行数据都能回溯到具体的原始页面,可以逐条复核。
- 采集时间:说明这是哪一时刻的快照。互动数、价格、库存这类字段本身会变化,没有时间戳的数据无法解释差异。
- 字段说明与已知限制:哪些字段可能为空、缺失率大概是多少、哪些内容因为平台机制无法完整获取。
可追溯性是这类数据最基本的要求。一份没有来源链接和采集时间的表格,出现争议时无法自证。

需要你自己确认的事项
我们能说明的是采集范围、获取方式和已知的平台限制。以下几件事需要由使用方判断:
- 所在司法辖区的具体要求。不同国家和地区对数据处理的规定差异很大,你的公司注册地、数据存放地和业务开展地可能适用不同规则。
- 最终用途的合规性。数据交付后如何使用、是否对外发布、是否与其他数据源合并,这些环节的判断在使用方。
- 内部留存与删除策略。数据保存多久、谁有权限访问、何时删除,属于你的内部管理范畴。

一点必要的说明
这一页写的是我们的服务边界和已知风险点,不是法律意见,也不构成对任何具体项目合规性的保证。数据合规涉及具体司法辖区、具体数据类型和具体用途,情况差异很大。如果你的项目涉及大规模个人信息处理、跨境数据传输,或者数据将用于对外发布,建议就具体方案咨询专业法律人士。
我们能做的是把边界划清楚:不该做的不做,能做的说明白限制在哪里。
