数据采集项目合规红线,哪些信息不能采集

数据采集听起来是技术活——写脚本、调接口、爬网页、存库。但真正让项目出事的,往往不是技术,而是“采了不该采的”。个人信息、商业秘密、涉密信息、受版权保护的内容,每一类都可能有明确的法律约束,一旦触碰,后果从行政处罚到刑事责任不等。这篇文章把数据采集的合规边界讲清楚:哪些信息绝对不能碰、哪些需要满足条件才能采、怎么建立一整套自查机制,让采集项目既能拿到数据,又站得住脚。
一、先看一个现实判断:能采到不等于能采
技术上有能力获取的数据,和法律上允许获取的数据,是两个完全不同的集合。很多队伍踩坑,正是因为把这两者混为一谈:爬虫能打开某个页面,就以为可以把它存下来;接口返回了某个字段,就以为这个字段可以用。
判断一条数据能不能采,建议按三步走:第一步看是不是个人信息,涉及自然人就进入个保法管辖;第二步看是不是受著作权保护的作品,涉及原创内容就进入著作权法管辖;第三步看是不是国家秘密或重要数据,涉及国家安全就有更严格的限制。三步走完都通过,才谈得上技术实施。顺序不能颠倒——先动手再补救,往往已经晚了。
二、红线一:个人信息不能随便采
第一道红线是个人信息。按个保法,处理个人信息需要有合法性基础,最常见的是取得个人同意,或者属于订立履行合同所必需、履行法定义务所必需等法定情形。采集个人信息的行为本身就属于“处理”,同样受约束。
具体到采集环节,尤其要警惕以下几类:身份标识信息(身份证号、护照号、社保号)、联系方式(手机号、邮箱、微信号等账号)、生物识别信息(人脸、指纹、声纹——这类属于敏感个人信息,规则更严格)、行踪轨迹(定位数据、打卡记录)、健康医疗信息、金融账户信息、未成年人信息(不满十四周岁为敏感个人信息,需要监护人单独同意)。
最容易出问题的是“顺手带上”的字段:做商品评论采集,顺手把用户昵称、头像、所在地一起抓了,觉得一个昵称不算什么。但从合规角度看,昵称加所在地加评论内容,可能足以定位到具体个人,这就是个人信息。原则是:不需要的字段,一个都不要采。
三、红线二:敏感个人信息与特殊场景
第二道红线是敏感个人信息。它包括生物识别、宗教信仰、特定身份、医疗健康、金融账户、行踪轨迹,以及不满十四周岁未成年人的个人信息。处理这类信息有个更严格的前提:具有特定目的和充分的必要性,并取得单独同意,还要做个人信息保护影响评估。
采集场景里最典型的是人脸数据。做城市治理、门店客流、社区安防类项目时,一旦镜头抓到人脸并且留存,就触碰了生物识别这条敏感线。这不是“模糊处理一下”就能糊弄过去的——模糊处理若仍可恢复,性质不变。正确做法是:要么不采原始人脸,在设备端就只输出脱敏后的统计量;要么走完整的单独同意与评估流程。前者显然更稳妥。
同理还有语音采集。录音里不仅有说话内容,还有声纹特征,属于生物识别信息。座席录音、智能音箱语料这类项目,采集前必须想清楚这一层。
四、红线三:商业秘密与反不正当竞争
第三道红线常被忽略:商业秘密。通过技术手段获取竞争对手的客户名单、定价策略、供应链数据、内部算法参数,即便这些信息是“公开网页上能看到的”,也可能构成不正当竞争。
判断要点有两个:一是是否使用了不正当手段,比如绕过登录、破解验证码、侵入授权访问不到的系统;二是获取的数据是否具有商业价值且权利人采取了保密措施。两者叠加,风险极高。
尤其是绕过登录验证这一点,很多团队以为是“写爬虫的正常操作”,但从法律角度看,绕过身份认证访问未授权数据,性质远重于抓取公开页面。这条线一定要划清楚:公开可见的可以采(也要看条款),需要突破权限才能拿到的坚决不碰。
五、红线四:涉密信息与重要数据
第四道红线是涉密信息与重要数据。国家秘密的处理受《保守国家秘密法》约束,任何未经授权获取、持有、传递的行为都可能构成违法。重要数据则按《数据安全法》管理,一旦泄露可能危害国家安全、经济运行、社会稳定、公共健康。
对采集项目来说,涉及以下领域的数据要高度警惕:基础测绘与地理信息、人口与健康统计、能源交通水利等关键基础设施、宏观经济与金融运行数据、科研与关键技术数据。采集前应当确认:这些数据是否可以公开获取?是否有存在于行业重要数据目录?是否能通过开放平台合规渠道获得?
一个实用的原则是:优先走官方开放渠道。国家和地方公共数据开放平台、行业数据交易所、机构官方 API,这些渠道虽然有许可条款约束,但明确了合法性;相比之下自行爬取同类数据,风险高得多。
六、红线五:著作权与爬虫协议
第五道红线是著作权。网页上的文章、图片、音视频、数据库,大多受著作权保护。大规模抓取并用于商业用途,即便这些内容是公开的,也可能侵权。
这里有两个常被误解的概念:一是“公开”不等于“无版权”,作品是否受保护看的是独创性,不是访问难度;二是“注明来源”不等于“可以商用”,署名解决的是署名权,不等于获得复制权和信息网络传播权。
另外值得一提的是 robots.txt。它有明确的形态标准,规定了哪些路径不希望被自动程序访问。遵守 robots.txt 是基本的行业自律,虽然它本身不完全等同于法律许可,但在纠纷中,遵守与否会直接影响对“是否存在主观过错”的认定。同理还有网站的用户协议与服务条款——其中有反爬条款的,抓取就可能构成违约。
七、红绿分区:一张图看懂边界
把上面五条红线归纳起来,可以画成一张红绿分区图:
绿区(可采):真正的公开政府数据(按其开放许可使用)、明确标注开放许可(如 CC 协议、开放数据许可)的作品、经过授权的商业数据、匿名化处理且不可复原的统计数据、站点 robots 允许且不违反服务条款的公开信息。
黄区(满足条件才可采):个人信息(需合法性基础)、受版权保护的内容(需授权或合理使用)、会员可见但未加密的内容(需看用户协议)、需要登录才能查看的公开级数据(需账号授权且不得转授权)。
红区(不碰):涉密信息、重要数据(无合规渠道时)、突破权限才能获取的数据、人脸声纹等生物识别(无单独同意与评估)、未成年人个人信息(无监护人同意)、明确标注禁止抓取且有反爬措施的数据、商业秘密。
这张图应当作为每个采集项目启动前的检查清单。有疑问就往黄区红区靠,宁可少采,不可冒险。
八、落地:采集项目的合规四件套
把红线落到执行层,建议每个采集项目都备齐“合规四件套”:
一是数据源授权文件。 每一个数据源都要记录来源、获取方式、是否签署协议、许可条款是什么。形成一张《数据源清单》,随项目归档。来源说不清的数据,宁可不用。
二是字段必要性说明。 对每个采集字段写一句“为什么必须要它”,能回答出来的保留,回答不出来的删掉。这张表能挡掉绝大多数“顺手带上”的风险字段。
三是采集行为规范。 明确频率限制、是否遵守 robots、是否使用身份测谎、是否伪装 UA、是否并发过高影响对方服务。技术上的“温和”既是礼貌,也是降低风险的手段——把对方站点采崩了,本身就容易被投诉。
四是个人信息处理记录。 若涉及个人信息,按个保法要求记录处理目的、方式、种类、保存期限等,作为履行合规义务的证据。这些记录在监管检查时非常关键。
九、给采集团队的三条提醒
第一,遇到需要登录、验证码、付费墙的内容,先停下来问一句“该不该采”,而不是“能不能绕过”。技术问题总能解决,合规问题一旦形成,很难挽回。
第二,把合规判断前置到方案阶段。方案里有数据源清单、有字段必要性说明、有许可条款核查,后面执行就不容易跑偏。等到代码写完再回头改,成本极高。
第三,选择有合规能力的合作伙伴。
数据采集的分水岭,不在于技术能不能拿到,而在于有没有资格拿着。把五条红线画清楚,把合规四件套备齐,采集项目才既能满足业务需求,又经得起查。
关于我们
本文由 北京海天雷鹰科技有限公司 整理发布。
公司成立于 2001 年,专注档案整理与数字化、试题结构化录入、期刊校对、数据标注等一站式数据服务 20 余年。针对标准文档形近字符识别、复杂公式排版、多层级档案规整、题库结构化加工等行业难点形成成熟作业方案,适配科研院所、教育机构、企事业单位的批量数据处理需求。
累计完成数十万份专业文档数字化、题库结构化加工项目,服务过多家科研机构、院校及企事业单位。核心团队 20 年以上行业经验,建立多层级质检审核机制,数据成果准确率稳定可控;持有 ISO 9001/27001 等体系认证、多项自主软件著作权、企业信用 AAA 等级。
如果您有档案数字化、试题录入、数据标注、EPUB电子书等方面的需求,欢迎联系我们:
- 电话:010-84907553
- 邮箱:736232918@qq.com
- 官网:www.beijingocr.com
本文为原创科普内容,如需转载请注明出处。关注我们,持续分享数据服务行业的实战经验与行业洞察。
