2026년 7월 8일 브뤼셀에서 열린 전체 회의에서 유럽 데이터 보호 위원회(EDPB)는 "생성적 AI 맥락에서의 웹 스크래핑에 대한 가이드라인 03/2026"을 채택했습니다. 이는 데이터 수집 산업에서 수년간 제기된 질문에 직접적으로 답하는 첫 번째 유럽 전역 문서입니다: 공개적으로 접근 가능한 데이터라도 스크래핑이 GDPR에 해당하는가? EDPB의 답변은 명확하고 많은 이들에게 불쾌한 내용입니다: 예, 해당됩니다 — 그리고 "공공"은 더 이상 "자유롭게 가져갈 수 있다"는 의미가 아닙니다. 이 문서는 2026년 10월 30일까지 공개 상담을 위해 열려 있지만, 지금 이미 유럽 규제 기관들이 개인 데이터를 평가할 기준을 제시하고 있습니다.
EDPB가 결정한 사항
가이드라인의 주요 요지는 간단합니다. 웹 스크래핑이 개인 데이터를 포함할 때마다 GDPR이 적용됩니다. 즉, 사람을 직접 또는 간접적으로 식별할 수 있는 정보를 수집, 저장, 조직 및 추출하는 모든 작업에 해당합니다. 그리고 — 핵심 사항 — 이 정보가 공개적으로 보였는지는 중요하지 않습니다. EDPB는 "데이터가 공개 프로필에 있다면 규제에서 벗어난다"는 업계의 일반적인 가정을 명확히 거부합니다. 조직들은 유럽 기관들이 이러한 데이터를 GDPR에서 제외할 것이라고 기대해서는 안 됩니다.
이는 기존의 논리를 뒤집습니다. 수년간 데이터 수집자들은 "공개적으로 접근 가능 + 거주자 프록시 = 기술적으로 가능하고 법적으로 용인된다"는 조합에 의존해왔습니다. EDPB는 이전에 하나로 묶였던 두 가지 질문을 분리합니다: 데이터의 기술적 접근성과 처리의 법적 근거는 동일하지 않습니다. 첫 번째는 인프라로 해결됩니다. 두 번째는 오직 법으로만 해결됩니다.
“합법적 이익” 테스트: 더 이상 기본값이 아님
대부분의 개인 데이터 스크래퍼는 "합법적 이익" (legitimate interest, GDPR 제6조 제1항 (f))을 근거로 처리를 정당화합니다. EDPB는 이 근거가 원칙적으로 AI 학습을 위한 스크래핑에 적용될 수 있음을 확인하지만, 엄격한 조건을 부과합니다. "도매" 평가가 있을 수 없으며 — 테스트는 각 특정 사례에 대해 수행되어야 합니다 — 세 가지 단계로 구성됩니다:
- 실제 이익. 구체적이고 합법적이며 현재의 이익을 명확히 해야 하며, 추상적인 "우리는 데이터가 필요하다"는 말은 안 됩니다.
- 필요성. 목표를 달성하기 위해 대량의 개인 데이터를 수집하는 것보다 덜 침해적인 방법이 없음을 입증해야 합니다.
- 균형. 자신의 이익을 데이터가 수집되는 사람들의 기본 권리와 합리적인 기대와 비교하여, 자신의 이익이 그들을 초과하지 않음을 보여줘야 합니다.
문서는 사전에 존재해야 하며, 사후에 작성되어서는 안 됩니다. 브라이언 헨게스보(Brian Hengesbo)는 Baker McKenzie의 데이터 및 사이버 관행 글로벌 리더로서, 규제 기관이 불만을 조사할 때 가장 먼저 합법적 이익 평가 및 이를 뒷받침하는 문서를 요청할 것이라고 언급합니다. 문서가 없으면 보호도 없습니다.
데이터 최소화: 수집 전 필터링, 후가 아님
EDPB는 첫 요청 전에 설계 단계에서 보호를 통합할 것을 요구합니다. 데이터 통제자는:
- 정확한 수집 기준을 설정해야 하며, 모든 것을 무작위로 수집해서는 안 됩니다;
- 민감한 데이터 카테고리를 제외하는 필터를 적용해야 합니다;
- 특정 사이트를 제외해야 합니다 — 특히 미성년자를 대상으로 하는 리소스와 스크래핑 방지 조치가 있는 사이트;
- 수집 후에는 후처리를 적용해야 합니다: 구문 필터링 및 익명화.
"스크래핑 방지 조치가 있는 사이트"에 대한 항목은 두 번 읽어야 합니다. EDPB는 사실상 이렇게 말합니다: 리소스가 명백히 안티봇 장벽을 설정했다면 이를 우회하는 것은 소유자의 의사와 사용자들의 합리적인 기대에 반하는 행위라는 신호입니다. 이는 CFAA나 해킹에 관한 것이 아니라, GDPR 내에서의 이해관계의 균형에 관한 것입니다.
특별 데이터 카테고리 — 거의 금지
건강, 정치적 견해, 종교, 성적 지향에 관한 데이터 (GDPR 제9조)는 스크래핑 시 수집이 원칙적으로 금지됩니다 — 심지어 우발적인 수집 (예: 소셜 미디어의 공개 게시물에서)도 엄격한 금지를 촉발합니다. 합법적인 처리를 위해서는 제6조에 따른 근거와 제9조 제2항에 따른 예외가 동시에 필요하며, 대량 스크래퍼에게는 일반적으로 없습니다. EDPB는 전체 생애 주기 동안의 통제를 요구하며 — 모델의 출력 필터와 배포 후 프롬프트에 대한 제한까지 포함됩니다.
왜 지금 통합 문서가 등장했는가
지금까지 유럽은 AI를 위한 스크래핑에 대해 분산적으로 반응해왔으며, 국가 기관들이 개별적으로 대응해왔고 그 결과는 상충되었습니다. 이탈리아의 Garante는 2024년 12월 OpenAI에 대해 적절한 법적 근거 없이 ChatGPT를 학습시켰다는 이유로 1500만 유로의 벌금을 부과했습니다. 그러나 2026년 3월 로마 법원은 이 제재를 취소했습니다 — 법적 기반이 얼마나 불안정했는지를 보여주는 명확한 사례입니다. 아일랜드 DPC는 2024년 고등 법원에 요청하여 X가 2024년 5월 7일부터 8월 1일까지 유럽 사용자들의 공개 게시물을 기반으로 Grok 챗봇을 학습하는 것을 영구적으로 중단하도록 했습니다. 또한 네덜란드와 프랑스 규제 기관의 개별적인 조치도 있었습니다.
이러한 조각난 풍경은 기업과 시민 모두에게 불확실성을 초래했습니다. 가이드라인 03/2026은 이전의 "의견 28/2024"를 발전시켜 AI에 대한 통합 기준을 모든 27개 국가에 처음으로 제시합니다. 같은 날 EDPB는 익명화에 대한 쌍둥이 가이드라인을 채택하여 세 가지 조건의 기준을 확립했습니다: 데이터는 특정 기록을 식별할 수 없거나 기록 간의 연결을 할 수 없거나 개인에 대한 새로운 정보를 도출할 수 없는 경우에만 익명으로 간주됩니다. EDPB 의장인 아누 탈루스(Anu Talus)는 이 문서들이 "데이터 사용을 용이하게 하면서도 개인의 기본 권리를 보호하는 명확한 기준을 설정한다"고 표현했습니다.
데이터 수집자에게 의미하는 바
첫 번째이자 가장 중요한 점: GDPR의 적용 범위에 관한 것입니다. 귀하의 샘플에 EU 거주자의 개인 데이터가 포함되어 있다면, 규정은 귀하가 어디에 있든 관계없이 적용됩니다. 이는 LLM 실험실뿐만 아니라, 데이터를 직접 또는 계약자를 통해 스크래핑하는 모든 조직에 해당합니다 — 모델 재학습을 위해서든 감성 분석을 위해서든 마찬가지입니다.
두 번째 — 실질적인 경계는 데이터 유형에 따라 나뉘며, 접근 방식에 따라 나뉘지 않습니다:
- 비개인 데이터 — 가격, 재고, 특성, 개인과 관련 없는 공개 텍스트, 시장 분석 — 여전히 저위험 영역에 남아 있습니다. 가격 모니터링, 카탈로그 파싱, 개인 데이터에 대한 GDPR 적용 없이 SERP 구조 수집은 문제가 되지 않습니다.
- 개인 데이터 — 프로필, 연락처, 특정 개인의 행동 — 이제 공개적으로 접근 가능하더라도 완전한 GDPR의 적용을 받습니다. 여기에는 법적 근거, 문서화된 합법적 이익 테스트, 최소화 및 조기 익명화가 필요합니다.
세 번째 — EDPB가 사실상 의무화한 데이터 수집의 위생: 좁은 샘플링 기준, 개인 및 민감한 데이터의 필터링, 가능한 한 조기에 익명화, 스크래핑 방지 장벽 및 미성년자 사이트에 대한 존중, 스크래핑을 설명하는 공개 개인정보 보호 정책.
여기서 프록시는 어디에 있으며, 어디에 없는가
EDPB가 처음으로 구분한 두 가지 차원을 솔직하게 나누는 것이 중요합니다. 인프라 선택 — 거주자, 모바일 또는 데이터 센터 프록시 — 는 신뢰성, 지리적 위치 및 성공적인 요청 비율을 결정하며, 즉 데이터 수집의 기술적 측면을 정의합니다. 그러나 이는 귀하의 법적 근거를 변경하지 않습니다. 거주자 IP는 불법적인 개인 데이터 처리를 합법적으로 바꾸지 않습니다 — 컴플라이언스는 무엇을 수집하고 왜 수집하는지에 달려 있으며, 요청이 어떤 주소에서 발생하는지와는 관계가 없습니다. 이는 정직한 프로젝트에 대한 좋은 소식입니다: 비개인 데이터를 스크래핑하거나 개인 데이터를 적절하게 필터링하고 익명화하는 경우, 품질 높은 프록시 인프라는 기술적 문제를 해결하며, 귀하는 본질적으로 법적 영역에 남아 있습니다.
같은 논리는 AI 에이전트가 스크래퍼를 스스로 작성하는 에이전트 스크래핑에도 적용됩니다: 도구는 더 똑똑해졌지만 데이터 처리 규칙은 완화되지 않았습니다 — 오히려 EDPB는 이러한 파이프라인에도 요구 사항을 직접적으로 확장합니다.
결론
가이드라인 03/2026은 웹 스크래핑을 금지하지 않습니다 — 데이터의 개방성이 그 처리에 대한 질문을 제거한다는 편리한 환상을 없애는 것입니다. EU에서 "공공은 무료"라는 시대는 2026년 7월 8일에 끝났습니다. 데이터 수집자에게 이는 유죄 판결이 아니라 규율의 변화입니다: 개인 데이터와 비개인 데이터를 구분하고, 수집 전에 필터링하며, 조기에 익명화하고, 규제 기관의 요청 전에 합법적 이익을 문서화해야 합니다. 기술은 여전히 프록시와 안티디텍트에 의해 결정되며; 합법성은 이제 귀하가 데이터베이스에 무엇을 넣는지에 따라 결정됩니다.
