Ngày 8 tháng 7 năm 2026, Hội đồng Châu Âu về Bảo vệ Dữ liệu (EDPB) đã thông qua "Hướng dẫn 03/2026 về việc thu thập dữ liệu web trong bối cảnh trí tuệ nhân tạo sinh tạo" tại phiên họp toàn thể ở Brussels - tài liệu đầu tiên trên toàn châu Âu trực tiếp trả lời câu hỏi đã tồn tại nhiều năm trong ngành thu thập dữ liệu: liệu việc thu thập dữ liệu có thuộc phạm vi GDPR nếu dữ liệu đó có sẵn công khai không? Câu trả lời của EDPB là rõ ràng và không dễ chịu cho nhiều người: có, nó thuộc phạm vi - và "công khai" không còn có nghĩa là "có thể lấy tự do". Tài liệu này mở cửa cho các cuộc tham vấn công khai đến ngày 30 tháng 10 năm 2026, nhưng ngay bây giờ nó đã đặt ra khung mà các cơ quan quản lý châu Âu sẽ sử dụng để đánh giá bất kỳ việc thu thập dữ liệu cá nhân nào.
EDPB đã quyết định điều gì
Điểm chính của hướng dẫn rất đơn giản. GDPR áp dụng mỗi khi việc thu thập dữ liệu web liên quan đến dữ liệu cá nhân - tức là bất kỳ hoạt động nào liên quan đến thu thập, lưu trữ, tổ chức và trích xuất thông tin mà từ đó một người có thể được xác định trực tiếp hoặc gián tiếp. Và - điểm mấu chốt - không quan trọng thông tin đó có được công khai hay không. EDPB thẳng thừng bác bỏ giả định phổ biến trong ngành rằng "nếu dữ liệu nằm trong hồ sơ công khai, thì chúng nằm ngoài sự điều chỉnh". Các tổ chức không nên mong đợi rằng các cơ quan châu Âu sẽ coi những dữ liệu như vậy là không thuộc phạm vi GDPR.
Điều này đảo ngược logic thông thường. Trong nhiều năm, những người thu thập dữ liệu đã dựa vào sự kết hợp "công khai + proxy cư trú = khả thi về mặt kỹ thuật, hợp pháp về mặt pháp lý". EDPB tách rời hai câu hỏi mà trước đây thường bị trộn lẫn: khả năng tiếp cận dữ liệu về mặt kỹ thuật và cơ sở pháp lý cho việc xử lý chúng - không phải là một điều giống nhau. Điều đầu tiên được giải quyết bằng cơ sở hạ tầng. Điều thứ hai - chỉ bằng luật pháp.
Bài kiểm tra "lợi ích hợp pháp": không còn mặc định
Phần lớn những người thu thập dữ liệu cá nhân biện minh cho việc xử lý bằng "lợi ích hợp pháp" (legitimate interest, điều 6(1)(f) GDPR). EDPB xác nhận rằng cơ sở này về nguyên tắc có thể áp dụng cho việc thu thập dữ liệu để đào tạo AI, nhưng đặt ra các điều kiện nghiêm ngặt. Không thể có bất kỳ đánh giá "đại trà" nào - bài kiểm tra được thực hiện cho từng trường hợp cụ thể và bao gồm ba bước:
- Quan tâm thực sự. Cần phải xác định một lợi ích cụ thể, hợp pháp và hiện tại - không phải là "chúng tôi cần dữ liệu" một cách trừu tượng.
- Cần thiết. Chứng minh rằng mục tiêu không thể đạt được bằng cách ít xâm phạm hơn, ngoài việc thu thập dữ liệu cá nhân hàng loạt.
- Cân bằng. Đánh giá lợi ích của mình so với các quyền cơ bản và mong đợi hợp lý của những người có dữ liệu được thu thập - và chứng minh rằng nó không vượt trội hơn.
Hơn nữa, tài liệu phải tồn tại trước đó, chứ không phải được tạo ra sau khi sự việc xảy ra. Như Brian Hengesbo, người đứng đầu toàn cầu về thực hành Dữ liệu & Cyber tại Baker McKenzie, lưu ý, khi điều tra một khiếu nại, cơ quan quản lý sẽ yêu cầu trước tiên là đánh giá lợi ích hợp pháp và tài liệu xác nhận. Không có giấy tờ - không có bảo vệ.
Giảm thiểu dữ liệu: lọc trước khi thu thập, không phải sau
EDPB yêu cầu tích hợp bảo vệ ngay từ giai đoạn thiết kế, trước khi có yêu cầu đầu tiên. Người kiểm soát phải:
- đặt ra các tiêu chí thu thập chính xác, không phải thu gom tất cả;
- áp dụng các bộ lọc loại trừ các loại dữ liệu nhạy cảm;
- loại trừ một số trang web nhất định - đặc biệt là các tài nguyên nhắm đến trẻ vị thành niên và các trang web có bảo vệ chống thu thập dữ liệu;
- sau khi thu thập, áp dụng xử lý hậu kỳ: lọc cú pháp và ẩn danh.
Điểm về "các trang web có bảo vệ chống thu thập dữ liệu" cần được đọc lại hai lần. EDPB thực sự nói: nếu một tài nguyên rõ ràng đã thiết lập các rào cản chống bot, việc vượt qua chúng là tín hiệu rằng bạn đang hành động trái với ý muốn của chủ sở hữu và mong đợi hợp lý của người dùng. Điều này không liên quan đến CFAA hoặc hack, mà là về sự cân bằng lợi ích trong GDPR.
Các loại dữ liệu đặc biệt - gần như là điều cấm kỵ
Dữ liệu về sức khỏe, quan điểm chính trị, tôn giáo, xu hướng tình dục (điều 9 GDPR) về cơ bản bị cấm thu thập - và ngay cả việc không cố ý thu thập chúng (ví dụ, từ một bài đăng công khai trên mạng xã hội) cũng kích hoạt lệnh cấm nghiêm ngặt. Để xử lý hợp pháp, cần có đồng thời cơ sở theo điều 6 và ngoại lệ theo điều 9(2), mà thường thì những người thu thập dữ liệu hàng loạt không có. EDPB yêu cầu kiểm soát trong toàn bộ vòng đời - cho đến các bộ lọc ở đầu ra của mô hình và các hạn chế đối với các prompt sau khi triển khai.
Tại sao tài liệu duy nhất lại xuất hiện ngay bây giờ
Cho đến nay, châu Âu đã phản ứng với việc thu thập dữ liệu cho AI một cách rời rạc, bởi các cơ quan quốc gia - và kết quả là mâu thuẫn. Garante của Ý đã phạt OpenAI 15 triệu euro vào tháng 12 năm 2024 vì đã đào tạo ChatGPT mà không có cơ sở pháp lý thích hợp và vi phạm yêu cầu về tính minh bạch. Nhưng vào tháng 3 năm 2026, tòa án Rome đã hủy bỏ lệnh phạt này - một minh họa rõ ràng cho thấy nền tảng pháp lý không ổn định như thế nào. DPC của Ireland vào năm 2024 đã thông qua một yêu cầu lên Tòa án Tối cao để X chấm dứt vĩnh viễn việc đào tạo chatbot Grok trên các bài đăng công khai của người dùng châu Âu trong khoảng thời gian từ ngày 7 tháng 5 đến ngày 1 tháng 8 năm 2024. Thêm vào đó là các hành động riêng biệt của các cơ quan quản lý Hà Lan và Pháp.
Cảnh quan lộn xộn như vậy đã tạo ra sự không chắc chắn cho cả các công ty và công dân. Hướng dẫn 03/2026 phát triển từ "Ý kiến 28/2024" trước đó về AI và lần đầu tiên đặt ra một tiêu chuẩn thống nhất cho tất cả 27 quốc gia. Cùng ngày, EDPB cũng thông qua hướng dẫn song song về ẩn danh, trong đó xác định tiêu chí từ ba điều kiện: dữ liệu được coi là ẩn danh chỉ khi không thể tách biệt một bản ghi cụ thể, không thể liên kết các bản ghi với nhau, và không thể rút ra thông tin mới về một người. Như Chủ tịch EDPB, Anu Talus, đã phát biểu, các tài liệu "thiết lập các tiêu chuẩn rõ ràng, tạo điều kiện cho việc sử dụng dữ liệu, đồng thời bảo vệ các quyền cơ bản của con người".
Điều này có nghĩa là gì đối với những người thu thập dữ liệu
Điều đầu tiên và quan trọng nhất: đây là về phạm vi lãnh thổ của GDPR. Nếu trong mẫu của bạn có dữ liệu cá nhân của cư dân EU - quy định này áp dụng bất kể bạn đang ở đâu. Điều này không chỉ áp dụng cho các phòng thí nghiệm LLM: bất kỳ tổ chức nào thu thập dữ liệu trực tiếp hoặc thông qua nhà thầu - dù là để đào tạo lại mô hình hay phân tích cảm xúc - đều phải tuân thủ.
Thứ hai - ranh giới thực tế được xác định bởi loại dữ liệu, không phải bởi cách truy cập:
- Dữ liệu không phải cá nhân - giá cả, tình trạng hàng hóa, đặc điểm, văn bản công khai không gắn với cá nhân, phân tích thị trường - vẫn nằm trong khu vực rủi ro thấp. Giám sát giá cả, phân tích danh mục, thu thập cấu trúc SERP theo GDPR về dữ liệu cá nhân không vi phạm.
- Dữ liệu cá nhân - hồ sơ, liên hệ, hành vi của các cá nhân cụ thể - giờ đây hoàn toàn thuộc về GDPR, ngay cả khi chúng có sẵn công khai. Ở đây cần có cơ sở pháp lý, bài kiểm tra lợi ích hợp pháp được tài liệu hóa, giảm thiểu và ẩn danh sớm.
Thứ ba - vệ sinh thu thập, mà EDPB thực sự đã làm cho bắt buộc: tiêu chí lựa chọn hẹp, lọc dữ liệu cá nhân và nhạy cảm ở đầu vào, ẩn danh càng sớm càng tốt, tôn trọng các rào cản chống thu thập dữ liệu và các trang web dành cho trẻ vị thành niên, chính sách bảo mật công khai mô tả việc thu thập dữ liệu.
Proxy ở đâu - và ở đâu không có
Cần phân biệt rõ ràng hai lĩnh vực mà EDPB đã phân tách đầu tiên. Việc lựa chọn cơ sở hạ tầng - proxy cư trú, di động hoặc proxy trung tâm dữ liệu - xác định độ tin cậy, định vị địa lý và tỷ lệ yêu cầu thành công, tức là khía cạnh kỹ thuật của việc thu thập. Nhưng nó không thay đổi cơ sở pháp lý của bạn. IP cư trú không biến việc xử lý dữ liệu cá nhân trái phép thành hợp pháp - sự tuân thủ phụ thuộc vào những gì bạn thu thập và tại sao, chứ không phải từ địa chỉ nào yêu cầu được gửi đi. Đây, nhân tiện, là tin tốt cho các dự án trung thực: nếu bạn thu thập dữ liệu không phải cá nhân hoặc lọc và ẩn danh dữ liệu cá nhân một cách hợp lý, cơ sở hạ tầng proxy chất lượng sẽ giải quyết vấn đề kỹ thuật, và bạn vẫn nằm trong khuôn khổ pháp lý về bản chất.
Logic tương tự cũng áp dụng cho việc thu thập dữ liệu bằng đại lý, nơi các đại lý AI tự viết các trình thu thập dữ liệu: công cụ đã trở nên thông minh hơn, nhưng các quy tắc xử lý dữ liệu không vì thế mà lỏng lẻo hơn - ngược lại, EDPB trực tiếp mở rộng các yêu cầu cho các quy trình như vậy.
Kết luận
Hướng dẫn 03/2026 không cấm việc thu thập dữ liệu web - nó đóng lại ảo tưởng thuận tiện rằng tính công khai của dữ liệu loại bỏ câu hỏi về việc xử lý chúng. Tại EU, thời đại "công khai có nghĩa là miễn phí" đối với dữ liệu cá nhân đã kết thúc vào ngày 8 tháng 7 năm 2026. Đối với những người thu thập dữ liệu, đây không phải là một bản án, mà là một sự thay đổi kỷ luật: phân biệt giữa dữ liệu cá nhân và không cá nhân, lọc ở đầu vào, ẩn danh sớm, tài liệu hóa lợi ích hợp pháp trước, không phải sau yêu cầu của cơ quan quản lý. Kỹ thuật vẫn được quyết định bởi proxy và chống phát hiện; tính hợp pháp giờ đây phụ thuộc vào việc bạn thực sự đặt gì vào cơ sở dữ liệu của mình.
