8 تیر 1405 شورای اروپایی حفاظت از دادهها (EDPB) در جلسه عمومی خود در بروکسل «راهنمای 03/2026 درباره وباسکرپینگ در زمینه هوش مصنوعی تولیدی» را تصویب کرد — نخستین سند عمومی اروپایی که به صراحت به سوالی پاسخ میدهد که سالها بر سر صنعت جمعآوری دادهها معلق بوده است: آیا وباسکرپینگ تحت GDPR قرار میگیرد اگر دادهها در دسترس عمومی باشند؟ پاسخ EDPB روشن و برای بسیاری ناخوشایند است: بله، تحت پوشش قرار میگیرد — و «عمومی» دیگر به معنای «میتوان به راحتی برداشت» نیست. این سند تا 30 مهر 1405 برای مشاوره عمومی باز است، اما هماکنون چارچوبی را تعیین میکند که بر اساس آن نهادهای نظارتی اروپایی هرگونه جمعآوری دادههای شخصی را ارزیابی خواهند کرد.
EDPB چه تصمیمی گرفت
اصلیترین نکته راهنما ساده است. GDPR هر بار که وباسکرپینگ به دادههای شخصی مربوط میشود، اعمال میشود — یعنی هرگونه عملیات جمعآوری، ذخیرهسازی، سازماندهی و استخراج اطلاعاتی که میتوان بهطور مستقیم یا غیرمستقیم به یک فرد نسبت داد. و — نکته کلیدی — اهمیتی ندارد که آیا این اطلاعات بهطور عمومی قابل مشاهده بوده است یا خیر. EDPB بهصراحت فرضیه رایج در صنعت را رد میکند که «چون دادهها در پروفایل عمومی قرار دارند، بنابراین از نظارت خارج هستند». سازمانها نباید انتظار داشته باشند که نهادهای اروپایی چنین دادههایی را از شمول GDPR خارج بدانند.
این موضوع منطق معمول را تغییر میدهد. سالها جمعآورندگان دادهها به ترکیب «دسترسی عمومی + پروکسی مقیم = از نظر فنی ممکن، از نظر قانونی قابل تحمل» تکیه میکردند. EDPB دو سوال را که قبلاً به یکدیگر مرتبط بودند، تفکیک میکند: دسترسپذیری فنی دادهها و مبنای قانونی برای پردازش آنها — این دو یکی نیستند. اولی با زیرساخت حل میشود. دومی — تنها با قانون.
آزمون «منافع قانونی»: دیگر بهطور پیشفرض نیست
بیشتر وباسکرپرهای دادههای شخصی پردازش را با «منافع قانونی» (legitimate interest، ماده 6(1)(f) GDPR) توجیه میکنند. EDPB تأیید میکند که این مبنا بهطور کلی به وباسکرپینگ برای آموزش هوش مصنوعی قابل اعمال است، اما با شرایط سختی همراه است. هیچ ارزیابی «کلان» نمیتواند وجود داشته باشد — آزمون برای هر مورد خاص انجام میشود و شامل سه مرحله است:
- منافع واقعی. باید یک علاقه خاص، قانونی و فعلی را بیان کرد — نه یک «ما به دادهها نیاز داریم» انتزاعی.
- ضرورت. باید ثابت کرد که هدف نمیتواند به روشی کمتر مزاحم از جمعآوری انبوه دادههای شخصی دستیابی شود.
- تعادل. باید منافع خود را در برابر حقوق اساسی و انتظارات معقول افرادی که دادههایشان جمعآوری میشود، بسنجید — و نشان دهید که این منافع بر آنها غلبه نمیکند.
علاوه بر این، سند باید قبل از جمعآوری وجود داشته باشد، نه اینکه پس از آن ایجاد شود. همانطور که برایان هنجسبو، مدیر جهانی بخش داده و سایبر در بیکر مککنزی اشاره میکند، در هنگام بررسی شکایت، نهاد نظارتی در ابتدا ارزیابی منافع قانونی و مستندات تأییدکننده را درخواست خواهد کرد. بدون مدارک — بدون حفاظت.
حداقلسازی دادهها: فیلتر کردن قبل از جمعآوری، نه بعد از آن
EDPB خواستار گنجاندن حفاظت در مرحله طراحی، حتی قبل از اولین درخواست است. کنترلکننده موظف است:
- معیارهای دقیق جمعآوری را تعیین کند، نه اینکه همه چیز را جمعآوری کند;
- فیلترهایی را اعمال کند که دستههای حساس دادهها را مستثنی کنند;
- برخی وبسایتها را مستثنی کند — بهویژه منابعی که به نوجوانان مربوط میشوند و وبسایتهایی که دارای حفاظت در برابر وباسکرپینگ هستند;
- پس از جمعآوری، پردازشهای پسزمینه را انجام دهد: فیلتر کردن نحوی و ناشناسسازی.
نکته مربوط به «وبسایتهای دارای حفاظت در برابر وباسکرپینگ» باید دوباره خوانده شود. EDPB در واقع میگوید: اگر منبع بهوضوح موانع ضد ربات را قرار داده است، دور زدن آنها نشانهای است که شما بر خلاف اراده مالک و انتظارات معقول کاربران عمل میکنید. این موضوع به CFAA یا هک مربوط نمیشود، بلکه به تعادل منافع درون GDPR مربوط است.
دستههای خاص دادهها — تقریباً تابو
دادههای مربوط به سلامت، دیدگاههای سیاسی، مذهب، گرایش جنسی (ماده 9 GDPR) بهطور کلی در وباسکرپینگ ممنوع است — و حتی گرفتن ناخواسته آنها (بهعنوان مثال، از یک پست عمومی در شبکههای اجتماعی) ممنوعیت سختی را به همراه دارد. برای پردازش قانونی، همزمان به مبنای ماده 6 و استثنای ماده 9(2) نیاز است که معمولاً برای وباسکرپرهای انبوه وجود ندارد. EDPB خواستار کنترل در تمام چرخه حیات است — حتی تا فیلترها در خروجی مدل و محدودیتها در درخواستها پس از استقرار.
چرا سند واحد اکنون منتشر شد
تا کنون اروپا به وباسکرپینگ برای هوش مصنوعی بهصورت پراکنده و توسط نهادهای ملی واکنش نشان داده است — و نتایج متناقض بوده است. نهاد ایتالیایی Garante در دسامبر 1403 OpenAI را بهخاطر آموزش ChatGPT بدون مبنای قانونی مناسب و با نقض الزامات شفافیت به 15 میلیون یورو جریمه کرد. اما در مارس 1405، دادگاه رم این جریمه را لغو کرد — نمونهای واضح از اینکه چقدر پایه قانونی ناپایدار بوده است. DPC ایرلند در سال 1403 از طریق درخواست به دیوان عالی موفق شد که X برای همیشه آموزش چتبات Grok را بر روی پستهای عمومی کاربران اروپایی برای دوره 7 مه تا 1 اوت 1403 متوقف کند. به علاوه، اقداماتی جداگانه از نهادهای نظارتی هلند و فرانسه.
این چشمانداز پارهپاره عدم قطعیت را برای شرکتها و شهروندان ایجاد میکرد. راهنمای 03/2026 بهطور خاص «نظر 28/2024» درباره هوش مصنوعی را گسترش میدهد و برای نخستین بار یک استاندارد واحد برای تمام 27 کشور تعیین میکند. در همان روز EDPB همچنین راهنمایی جفتی درباره ناشناسسازی تصویب کرد که معیار سه شرط را تثبیت کرد: دادهها تنها زمانی ناشناس محسوب میشوند که نتوان از آنها یک رکورد خاص را استخراج کرد، رکوردها را به یکدیگر مرتبط کرد یا اطلاعات جدیدی درباره یک فرد استخراج کرد. همانطور که آنا تالوس، رئیس EDPB بیان کرد، این اسناد «استانداردهای روشنی را تعیین میکنند که استفاده از دادهها را تسهیل میکند و در عین حال حقوق اساسی افراد را محافظت میکند».
این موضوع برای جمعآورندگان دادهها چه معنایی دارد
نخستین و مهمترین نکته: این موضوع به پوشش جغرافیایی GDPR مربوط میشود. اگر در نمونه شما دادههای شخصی ساکنان اتحادیه اروپا وجود دارد — این مقررات بهطور مستقل از اینکه شما کجا هستید، اعمال میشود. و این فقط به آزمایشگاههای LLM مربوط نمیشود: هر سازمانی که دادهها را بهطور مستقیم یا از طریق پیمانکاران وباسکرپ میکند — چه برای آموزش مجدد مدل، چه برای تحلیل احساسات — تحت این الزامات قرار میگیرد.
دوم — مرز عملی بر اساس نوع دادهها است، نه بر اساس روش دسترسی:
- دادههای غیرشخصی — قیمتها، موجودی کالا، ویژگیها، متون عمومی بدون ارتباط با هویت، تحلیل بازار — همچنان در منطقه کمخطر باقی میمانند. نظارت بر قیمتها، پارس کردن کاتالوگها، جمعآوری ساختار SERP تحت GDPR برای دادههای شخصی مشکلساز نیست.
- دادههای شخصی — پروفایلها، مخاطبین، رفتار افراد خاص — اکنون تحت پوشش کامل GDPR قرار دارند، حتی اگر در دسترس عمومی باشند. در اینجا به مبنای قانونی، آزمون مستند شده برای منافع قانونی، حداقلسازی و ناشناسسازی زودهنگام نیاز است.
سوم — بهداشت جمعآوری که EDPB عملاً آن را اجباری کرده است: معیارهای باریک انتخاب، فیلتر کردن دادههای شخصی و حساس در ورودی، ناشناسسازی هر چه زودتر، احترام به موانع ضد وباسکرپینگ و وبسایتهای مربوط به نوجوانان، سیاست عمومی حریم خصوصی با توصیف وباسکرپینگ.
پروکسیها کجا هستند — و کجا نیستند
شایسته است که دو سطح را که EDPB نخستین بار تفکیک کرد، بهطور صادقانه تفکیک کنیم. انتخاب زیرساخت — پروکسیهای مقیم، موبایل یا پروکسیهای دیتاسنتر — قابلیت اطمینان، موقعیت جغرافیایی و درصد درخواستهای موفق را تعیین میکند، یعنی جنبه فنی جمعآوری. اما این مبنای قانونی شما را تغییر نمیدهد. IP مقیم پردازش غیرقانونی دادههای شخصی را به قانونی تبدیل نمیکند — تطابق در آن است که چه جمعآوری میکنید و چرا، نه اینکه از کدام آدرس درخواست ارسال میشود. این، بهطور اتفاقی، خبر خوبی برای پروژههای صادق است: اگر شما دادههای غیرشخصی را پارس میکنید یا بهطور منطقی دادههای شخصی را فیلتر و ناشناس میکنید، زیرساخت پروکسی باکیفیت مشکل فنی را حل میکند و شما در زمینه قانونی بهطور اساسی باقی میمانید.
همین منطق به وباسکرپینگ مبتنی بر عامل نیز مربوط میشود، جایی که عوامل هوش مصنوعی خود پارسرها را مینویسند: ابزار هوشمندتر شده است، اما قوانین پردازش دادهها از این بابت نرمتر نشدهاند — برعکس، EDPB بهصراحت الزامات را به چنین پایپلاینهایی گسترش میدهد.
نتیجهگیری
راهنمای 03/2026 وباسکرپینگ را ممنوع نمیکند — بلکه توهم راحتی را میبندد که باز بودن دادهها سوالی درباره پردازش آنها را برطرف میکند. در اتحادیه اروپا عصر «عمومی — یعنی رایگان» برای دادههای شخصی در 8 تیر 1405 به پایان رسید. برای جمعآورندگان دادهها این یک حکم نیست، بلکه تغییر رویکرد است: تفکیک دادههای شخصی و غیرشخصی، فیلتر کردن در ورودی، ناشناسسازی زودهنگام، مستندسازی منافع قانونی قبل از درخواست نهاد نظارتی، نه بعد از آن. تکنیک همچنان با پروکسیها و ضد شناسایی حل میشود؛ قانونی بودن اکنون به این بستگی دارد که شما دقیقاً چه چیزی را در پایگاه داده خود قرار میدهید.
