8 Temmuz 2026 tarihinde, Brüksel'deki genel kurulda Avrupa Veri Koruma Konseyi (EDPB), "Üretken Yapay Zeka Bağlamında Web Scraping için Rehber 03/2026"yı kabul etti. Bu, veri toplama endüstrisinin yıllardır üzerinde durduğu bir soruya doğrudan yanıt veren ilk Avrupa genel belgesidir: Açık erişimde bulunan veriler için scraping GDPR kapsamına girer mi? EDPB'nin yanıtı kesin ve birçok kişi için hoş değil: evet, girer — ve "kamusal" artık "serbestçe alınabilir" anlamına gelmiyor. Belge, 30 Ekim 2026'ya kadar kamuya açık danışmalara açıktır, ancak şimdiden Avrupa düzenleyicilerinin kişisel veri toplama işlemlerini değerlendireceği çerçeveyi belirlemektedir.
EDPB'nin Ne Karar Verdiği
Rehberin ana tezi basittir. GDPR, web scraping kişisel verileri etkilediğinde her zaman geçerlidir — yani, bir kişinin doğrudan veya dolaylı olarak tanımlanabileceği bilgilerin toplanması, saklanması, düzenlenmesi ve çıkarılması gibi herhangi bir işlemde. Ve — bu kritik bir nokta — bu bilginin kamuya açık olup olmaması önemli değildir. EDPB, endüstride yaygın olan "veriler açık bir profildeyse, düzenlemenin dışındadır" varsayımını açıkça reddetmektedir. Kuruluşlar, Avrupa makamlarının bu tür verileri GDPR'dan muaf sayacağını ummamalıdır.
Bu, alışılmış mantığı tersine çeviriyor. Uzun yıllar veri toplayıcıları, "kamusal olarak erişilebilir + yerel proxy = teknik olarak mümkün, yasal olarak tolere edilebilir" bağlantısına dayanıyordu. EDPB, daha önce bir araya getirilen iki sorunu ayırıyor: verilerin teknik erişilebilirliği ve işlenmesi için yasal dayanak — bu aynı şey değildir. İlk sorun altyapı ile çözülür. İkincisi ise yalnızca yasayla ilgilidir.
"Yasal çıkar" testi: artık varsayılan değil
Çoğu kişisel veri scraper'ı, işleme için "yasal çıkar" (legitimate interest, GDPR md. 6(1)(f)) ile gerekçelendirmektedir. EDPB, bu dayanağın yapay zeka eğitimi için scraping'e uygulanabilir olduğunu onaylamakta, ancak bunu katı şartlarla sınırlamaktadır. Hiçbir "toplu" değerlendirme olamaz — test her bir spesifik durum için gerçekleştirilir ve üç aşamadan oluşur:
- Gerçek çıkar. Somut, yasal ve güncel bir çıkarı formüle etmek gerekir — soyut "verilere ihtiyacımız var" ifadesi değil.
- Gerekli olma. Amacın, kişisel verilerin toplu olarak toplanmasından daha az müdahaleci bir şekilde ulaşılamayacağını kanıtlamak gerekir.
- Dengeleme. Kendi çıkarınızı, toplanan verilerin sahiplerinin temel hakları ve makul beklentileri ile tartmak — ve bunun onları aşmadığını göstermek gerekir.
Ayrıca, belgenin önceden var olması gerektiği, sonradan oluşturulmaması gerektiği belirtilmektedir. Baker McKenzie'de Veri ve Siber Pratik Küresel Lideri olan Brian Hengesbo'nun belirttiği gibi, bir şikayet soruşturması sırasında düzenleyici öncelikle yasal çıkar değerlendirmesini ve bunu destekleyen belgeleri talep edecektir. Kağıt yoksa — koruma yok.
Veri minimizasyonu: toplama öncesinde filtreleme, sonrasında değil
EDPB, korumayı tasarım aşamasında, ilk talep öncesinde entegre etmeyi talep etmektedir. Kontrolör, aşağıdakileri yapmak zorundadır:
- Kesin toplama kriterleri belirlemek, her şeyi toplamak yerine;
- Hassas veri kategorilerini hariç tutan filtreler uygulamak;
- Belirli web sitelerini hariç tutmak — özellikle reşit olmayanlara yönelik kaynaklar ve scraping koruması olan siteler;
- Toplamadan sonra post-processing uygulamak: sözdizimsel filtreleme ve anonimleştirme.
"Scraping koruması olan siteler" maddesini iki kez okumak gerekir. EDPB aslında şunu söylüyor: Eğer bir kaynak açıkça anti-bot engelleri koymuşsa, bunları aşmak, sahibinin iradesine ve kullanıcıların makul beklentilerine karşı hareket ettiğinizin bir işareti olarak kabul edilir. Bu, CFAA veya hackleme ile ilgili değil, GDPR içindeki çıkarların dengesi ile ilgilidir.
Özel veri kategorileri — neredeyse tabu
Sağlık, siyasi görüşler, din, cinsel yönelim gibi veriler (GDPR md. 9) scraping sırasında toplama açısından yasaktır — ve hatta isteksizce elde edilmesi (örneğin, sosyal medyadaki açık bir gönderiden) sıkı bir yasağı tetikler. Yasal işleme için hem md. 6'ya dayanak hem de md. 9(2) için bir istisna gereklidir; bunlar genellikle toplu scraper'da yoktur. EDPB, tüm yaşam döngüsü boyunca kontrol talep etmektedir — modelin çıkışındaki filtrelerden, dağıtım sonrası kısıtlamalara kadar.
Neden tek belge şimdi ortaya çıktı
Şimdiye kadar Avrupa, yapay zeka için scraping'e dağınık bir şekilde, ulusal otoriteler aracılığıyla yanıt vermekteydi — ve sonuçlar çelişkiliydi. İtalyan Garante, Aralık 2024'te OpenAI'yi 15 milyon euro para cezasına çarptırdı; bu, ChatGPT'nin uygun yasal dayanak olmaksızın ve şeffaflık gerekliliklerini ihlal ederek eğitilmesi nedeniyleydi. Ancak Mart 2026'da Roma mahkemesi bu cezayı iptal etti — yasal zemin ne kadar sarsak olduğunu gösteren bir örnek. İrlanda DPC, 2024'te Yüksek Mahkeme'ye başvurarak X'in daima Grok sohbet botunu 7 Mayıs ile 1 Ağustos 2024 tarihleri arasında Avrupa kullanıcılarının kamuya açık gönderileri üzerinde eğitmesini durdurmasını sağladı. Ayrıca Hollanda ve Fransa düzenleyicilerinin ayrı eylemleri de vardı.
Böyle bir yaman manzara, hem şirketler hem de vatandaşlar için belirsizlik yaratıyordu. Rehber 03/2026, daha önceki "Görüş 28/2024"ü geliştirerek, tüm 27 ülke için tek bir standart belirlemektedir. Aynı gün EDPB, anonimleştirme üzerine eş zamanlı bir rehber de kabul etti ve üç koşuldan oluşan bir kriter belirledi: Veriler, ne belirli bir kaydı ayırmanın ne de kayıtları birbirine bağlamanın mümkün olmadığı durumlarda anonim kabul edilir. EDPB Başkanı Anu Talus'un ifadesiyle, belgeler "verilerin kullanımını kolaylaştıran, aynı zamanda insanların temel haklarını koruyan net standartlar belirlemektedir."
Bu, veri toplayanlar için ne anlama geliyor
İlk ve en önemlisi: GDPR'nın coğrafi kapsamı hakkında. Eğer örnekleminizde AB vatandaşlarının kişisel verileri varsa — düzenleme, nerede bulunduğunuzdan bağımsız olarak geçerlidir. Bu, yalnızca LLM laboratuvarları için değil: Verileri doğrudan veya yükleniciler aracılığıyla toplayan herhangi bir kuruluş — ister modeli yeniden eğitmek, ister duygu analizi yapmak için olsun — bu gereklere tabidir.
İkincisi — pratik bir ayrım, veri türü üzerinden geçmektedir, erişim yöntemi üzerinden değil:
- Kişisel olmayan veriler — fiyatlar, ürün mevcudiyeti, özellikler, kişilikle ilişkilendirilmemiş kamuya açık metinler, piyasa analizi — düşük riskli bir alan olarak kalmaktadır. Fiyat izleme, katalog tarama, kişisel verilere tabi olmayan GDPR gereklilikleri altında SERP yapısını toplamak sorun yaratmaz.
- Kişisel veriler — profiller, iletişim bilgileri, belirli kişilerin davranışları — artık tam GDPR kapsamındadır, açık erişimde bulunsalar bile. Burada yasal dayanak, belgelenmiş yasal çıkar testi, minimizasyon ve erken anonimleştirme gereklidir.
Üçüncüsü — EDPB'nin fiilen zorunlu hale getirdiği veri toplama hijyeni: dar seçim kriterleri, girişte kişisel ve hassas verilerin filtrelenmesi, mümkün olan en erken anonimleştirme, anti-scraping engellerine ve reşit olmayanlar için sitelere saygı, scraping'i tanımlayan bir gizlilik politikası.
Burada proxy nerede — ve nerede yok
EDPB'nin ilk olarak ayırdığı iki düzlemi dürüstçe ayırmak önemlidir. Altyapı seçimi — yerel, mobil veya veri merkezi proxy'leri — güvenilirlik, coğrafi konum ve başarılı istek yüzdesini belirler, yani toplamanın teknik yönünü. Ancak bu, yasal dayanağınızı değiştirmez. Yerel IP, kişisel verilerin yasadışı işlenmesini yasal hale getirmez — uyumluluk, ne topladığınız ve neden topladığınız ile ilgilidir, hangi adresten isteğin gittiği ile değil. Bu, dürüst projeler için iyi bir haber: Eğer kişisel olmayan verileri topluyorsanız veya kişisel verileri düzgün bir şekilde filtreleyip anonimleştiriyorsanız, kaliteli bir proxy altyapısı teknik sorunu çözerken, siz de esasen yasal alanda kalırsınız.
Aynı mantık, AI ajanlarının kendilerinin parser yazdığı ajans scraping'i için de geçerlidir: araç daha akıllı hale geldi, ancak veri işleme kuralları bundan yumuşamadı — aksine, EDPB bu gereklilikleri benzer pipeline'lara da yaymaktadır.
Sonuç
Rehber 03/2026, web scraping'i yasaklamaz — verilerin açıklığı, işlenmesiyle ilgili sorunu ortadan kaldırdığına dair rahat bir yanılsamayı kapatır. AB'de "kamusal — yani ücretsiz" dönemi, 8 Temmuz 2026'da kişisel veriler için sona ermiştir. Veri toplayıcıları için bu bir mahkumiyet değil, bir disiplin değişikliğidir: kişisel ve kişisel olmayanı ayırmak, girişte filtrelemek, erken anonimleştirmek, düzenleyicinin talebinden önce yasal çıkarı belgelemek. Teknik hala proxy'ler ve anti-detect ile çözülmektedir; yasallık artık neyi veritabanınıza koyduğunuzla ilgilidir.
