2026年7月8日,欧洲数据保护委员会(EDPB)在布鲁塞尔的全体会议上通过了《03/2026号关于生成性人工智能背景下网络爬虫的指导意见》——这是第一份直接回应数据收集行业多年悬而未决问题的欧洲文件:如果数据是公开的,爬虫是否受GDPR的约束?EDPB的回答明确且对许多人来说令人不快:是的,受约束——“公开”不再意味着“可以随意获取”。该文件在2026年10月30日之前向公众开放咨询,但现在已经为欧洲监管机构评估任何个人数据收集设定了框架。
EDPB究竟决定了什么
该指导意见的主要论点很简单。GDPR在每次网络爬虫涉及个人数据时适用——即任何可以直接或间接识别个人的收集、存储、组织和提取信息的操作。而且——关键点——无论这些信息是否公开可见,都是无关紧要的。EDPB明确拒绝了行业内流行的假设,即“如果数据在公开的个人资料中,那么它就不受监管”。组织不应指望欧洲机构会认为这些数据不受GDPR的约束。
这颠覆了以往的逻辑。多年来,数据收集者依赖于“公开可用 + 居民代理 = 技术上可行,法律上可容忍”的组合。EDPB将以前合并为一个的问题分开:数据的技术可获取性与其处理的法律基础并不是一回事。前者由基础设施决定,后者仅由法律决定。
合法利益测试:不再是默认选项
大多数个人数据爬虫以“合法利益”(legitimate interest,GDPR第6(1)(f)条)为依据来证明其处理的合理性。EDPB确认,这一依据原则上适用于用于训练人工智能的爬虫,但附加了严格的条件。不能进行“批量”评估——测试必须针对每个具体案例进行,并由三个步骤组成:
- 真实利益。需要明确具体、合法且相关的利益,而不是抽象的“我们需要数据”。
- 必要性。证明目标无法通过比大规模收集个人数据更不具侵扰性的方式实现。
- 平衡。权衡自身利益与被收集数据的人的基本权利和合理期望,并证明自身利益并未超出这些权利。
而且,文件必须事先存在,而不是事后产生。正如贝克·麦肯齐的全球数据与网络实践负责人布莱恩·亨格斯博所指出的,在调查投诉时,监管机构首先会要求合法利益的评估和相关文档。没有文件就没有保护。
数据最小化:在收集前进行过滤,而不是之后
EDPB要求在设计阶段就嵌入保护措施,甚至在第一次请求之前。控制者必须:
- 设定准确的收集标准,而不是随意收集;
- 应用过滤器,排除敏感数据类别;
- 排除特定网站——特别是面向未成年人的资源和设有反爬虫保护的网站;
- 在收集后进行后处理:语法过滤和匿名化。
关于“具有反爬虫保护的网站”的条款值得仔细阅读两遍。EDPB实际上表示:如果资源明确设置了反机器人屏障,绕过这些屏障就是一个信号,表明您在违背所有者的意愿和用户的合理期望。这不是关于CFAA或黑客,而是关于GDPR内部利益的平衡。
特殊数据类别——几乎是禁忌
健康、政治观点、宗教、性取向的数据(GDPR第9条)在爬虫中原则上是禁止收集的——甚至无意中捕获这些数据(例如,从社交媒体的公开帖子中)也会触发严格的禁止。合法处理需要同时满足第6条的依据和第9(2)条的例外,而大规模爬虫通常没有这些条件。EDPB要求在整个生命周期内进行控制——直到模型输出的过滤器和部署后对提示的限制。
为什么这一统一文件现在才出现
到目前为止,欧洲对人工智能爬虫的反应是分散的,由国家机构进行——结果相互矛盾。意大利Garante在2024年12月对OpenAI处以1500万欧元的罚款,原因是未经适当法律依据和违反透明度要求训练ChatGPT。但在2026年3月,罗马法院撤销了这一制裁——这清楚地说明了法律基础的脆弱。爱尔兰DPC在2024年通过向高等法院提出请求,成功使X永久停止在2024年5月7日至8月1日期间对欧洲用户的公开帖子进行Grok聊天机器人的训练。此外,还有荷兰和法国监管机构的单独行动。
如此拼凑的格局为公司和公民创造了不确定性。《03/2026号指导意见》发展了早期的《28/2024号意见》关于人工智能的内容,并首次为所有27个国家设定了统一标准。同一天,EDPB还通过了关于匿名化的配套指导,确立了三个条件的标准:数据只有在无法提取特定记录、无法将记录相互关联或无法得出关于个人的新信息时,才被视为匿名。正如EDPB主席阿努·塔卢斯所说,这些文件“建立了明确的标准,既便利数据使用,同时保护人们的基本权利”。
这对数据收集者意味着什么
首先也是最重要的是:GDPR的地域适用范围。如果您的样本中包含欧盟居民的个人数据——该规定适用于您所在的位置。并且这不仅仅涉及LLM实验室:任何直接或通过承包商收集数据的组织——无论是为了模型的再训练,还是为了情感分析——都受到要求的约束。
第二个——实际的分水岭在于数据类型,而不是访问方式:
- 非个人数据——价格、商品可用性、特征、与个人无关的公开文本、市场分析——仍然处于低风险区域。价格监控、目录解析、根据个人数据收集SERP结构不受GDPR的限制。
- 个人数据——个人资料、联系方式、特定个人的行为——现在完全受GDPR的约束,即使这些数据是公开可用的。在这里需要法律依据、记录的合法利益测试、最小化和尽早匿名化。
第三个——数据收集的卫生,EDPB实际上使其成为强制性的:狭窄的选择标准、输入时过滤个人和敏感数据、尽早匿名化、尊重反爬虫屏障和面向未成年人的网站、公开的隐私政策以及对爬虫的描述。
代理在哪里——又在哪里没有
值得诚实地区分EDPB首先区分的两个层面。基础设施的选择——居民代理、移动代理或数据中心代理——决定了可靠性、地理位置和成功请求的比例,即数据收集的技术方面。但这并不改变您的法律基础。居民IP并不能将非法处理个人数据转变为合法——合规性取决于您收集的是什么和为什么,而不是请求来自哪个地址。顺便说一句,这对诚实的项目来说是个好消息:如果您解析非个人数据或合理过滤和匿名化个人数据,高质量的代理基础设施解决了技术问题,而您在实质上仍然处于法律框架内。
同样的逻辑也适用于代理爬虫,其中人工智能代理自己编写解析器:工具变得更智能,但数据处理的规则并没有因此而放松——相反,EDPB明确将要求扩展到类似的管道。
结论
《03/2026号指导意见》并不禁止网络爬虫——它揭示了一个便利的幻觉,即数据的开放性消除了对其处理的质疑。在欧盟,关于个人数据的“公开即免费”时代于2026年7月8日结束。对于数据收集者来说,这不是判决,而是学科的转变:区分个人和非个人数据,输入时进行过滤,尽早匿名化,在监管请求之前记录合法利益,而不是之后。技术仍然由代理和反检测决定;合法性现在取决于您究竟将什么放入您的数据库。
