يعمل المحلل. HTTP 200 تتدفق بلا انقطاع، البروكسيات حية، الكابتشا لا تظهر، وقائمة الروابط تتزايد. وبعد أسبوع يتبين أن نصف الأسعار المجمعة هي خيال، وأن جيجابايت من البيانات قد ذهبت إلى صفحات لا وجود لها في الموقع الحقيقي. هذه ليست عطل في المحلل ولا مجموعة IP سيئة. هذه هي وضعية حماية جديدة: الموقع لا يحظرك، بل يطعمك.
على مدى عام ونصف، غيرت صناعة حماية ضد الروبوتات هدفها بهدوء. الحظر هو إجراء مكلف وملحوظ: يرى الكاشف 403، يصلح بصمته، يغير الشبكة الفرعية ويعود. من الأكثر ربحية عدم إزعاجه أثناء العمل، بل جعل عمله بلا معنى. أدناه - ثلاث آليات تعمل بالفعل في الإنتاج على ملايين المواقع، ومجموعة من الفحوصات التي تلتقطها على جانبك.
الآلية الأولى: الطرطشة بدلاً من الحظر
الطرطشة (tarpit، "حفرة القطران") هي مولد لموقع لا نهائي. يحصل الزاحف على صفحة HTML صالحة تحتوي على عشرات الروابط، كل رابط يؤدي إلى صفحة مولدة مماثلة، ولا تفرغ قائمة التجوال أبداً.
الأداة المفتوحة الأكثر شهرة هي Nepenthes. إعداداته تظهر الفكرة بوضوح: بشكل افتراضي، يحتفظ الخادم بالاستجابة من 10 إلى 65 ثانية، ويقدم نص "هراء ماركوف"، مولد من مجموعة، ويقوم بذلك بشكل محدد - نفس URL دائماً يعود بنفس القمامة، بحيث تبدو الصفحات كملفات ثابتة عادية، وليس كفخ. تُعطى البيانات على دفعات صغيرة، "بضع بايتات"، لإحراق مهلات العميل. يقدم المؤلف قياسًا لمدة ساعة واحدة من العمل: 1850 عميل مختلف، 10015 طلب و56020 ثانية من التأخير الإجمالي - حوالي خمس عشرة ساعة من وقت الآلات الضائعة.
Iocaine يعمل بشكل مختلف: يعمل كوكيل عكسي أمام الموقع الحقيقي، وعند أول اعتراض، يقدم للروبوت رابطًا "مسمومًا" فريدًا، وعند العودة يتعرف عليه، وينتج النص باستخدام سلاسل ماركوف - بناءً على أن هذا النص سيدخل في مجموعة التدريب.
لدى Cloudflare نفس الأسلوب كمنتج - AI Labyrinth، الذي تم تقديمه في مارس 2025. صفحات الطعم لا تُولد في الوقت الحقيقي: يتم استخدام خط إنتاج مسبق على عمال AI، ويتم تخزين النتيجة في R2 وتوزيعها بسرعة. الروابط إلى المتاهة تُدمج في الصفحات العادية من خلال تحويل HTML، وعلى الصفحات نفسها توجد توجيهات ميتا ضد الفهرسة، حتى لا تتضرر النتائج. الأهم هنا هو ليس الوقت الضائع للروبوت، بل الإشارة: الروابط المخفية عن البشر والموسومة بـ nofollow، يمر بها فقط الآلي، والانتقال إلى ثلاثة مستويات داخل هذه المتاهة يصبح بحد ذاته بصمة لروبوت سيء. تقدر Cloudflare نطاق المشكلة التي تم القيام بذلك من أجلها بـ أكثر من 50 مليار طلب من زاحفي AI يوميًا - أقل بقليل من 1% من إجمالي حركة المرور على الشبكة.
كيف تبدو الطرطشة في سجلاتك
الصورة المميزة: قائمة تحتوي على عدة آلاف من URL، والتي تزداد فقط، ووقت الاستجابة يبقى ثابتًا حول دقيقة ونصف أو أكثر، وأكواد HTTP - كلها 200، وعدد السجلات المفيدة المستخرجة يساوي صفر. لا يوجد 403، لا كابتشا، ولا مخرج: بغض النظر عن عدد الصفحات التي تم زيارتها، تظهر روابط جديدة بسرعة أكبر من إغلاق الروابط القديمة.
الآلية الثانية: محتوى مسموم لوكلاء AI
إذا كانت الآلية الأولى تحرق الموارد، فإن الثانية تضرب النتائج. نشر الباحثون Minghao Luo وLiang Chen في يونيو 2026 عملاً مع محاكي FORGE (Fake Online Recommendations in Generative Environments): قاموا باختبار 12 نموذج لغوي كبير على 225 منتجًا في 15 فئة - من الملابس إلى الإلكترونيات. آلية الهجوم بسيطة: يتم استبدال العلامة التجارية الحقيقية في نص الصفحة بعلامة خيالية.
النتيجة - صفحة مزيفة واحدة تعطي حتى 27% من الحالات، عندما يوصي المساعد بعلامة تجارية غير موجودة، واستبدال جميع النتائج الثلاثة العليا يزيد هذه النسبة إلى 73.8%. لم تكرر النماذج الاسم المزيف فقط - بل ابتكرت له مزايا، بما في ذلك ما يُزعم أنه شعبية في المجتمعات. ثلاث دفاعات مقترحة (تحفيز على الشك، توافق حول المعرفة الداخلية للنموذج، التحقق بين الوثائق) إما لم تعمل أو خلقت مشاكل جديدة. استنتاج المؤلفين: يجب التحقق أعلى في السلسلة - في مرحلة الجمع، وليس في مرحلة التفكير.
الآلية الثالثة تكمل الصورة. في العمل "A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See" (Shaked Zychlinski) تم وصف التمويه، المستهدف تحديدًا لوكلاء AI: يتعرف الموقع على الوكيل من خلال سمات المتصفح، وتوقيعات إطار العمل الآلي وخصائص الشبكة ويقدم له نسخة أخرى من الصفحة - مع تعليمات مخفية وحقائق مستبدلة. الشخص الذي فتح نفس URL يرى صفحة طبيعية، لذلك فإن التحقق اليدوي "لقد دخلت، كل شيء على ما يرام" لا يثبت شيئًا.
لماذا هذه في المقام الأول مسألة ميزانية
الطرطشة مصممة بحيث تكون كل صفحة رخيصة للموقع وغالية بالنسبة لك. عندما يتم دفع حركة المرور حسب الجيجابايت، يتحول مولد الصفحات اللانهائية إلى عداد لنفقاتك: أنت تدفع مقابل ميغابايت من نص ماركوف، الذي لن يصبح أبدًا سطرًا في قاعدة البيانات. نفس الحساب ينطبق على الطلبات الفاشلة - سعر الجيجابايت لا يقول شيئًا عن تكلفة النتيجة، حتى تحسب تكلفة تسجيل ناجح واحد، وليس طلب.
من هنا القاعدة العملية الأولى: يجب أن يكون حد حركة المرور على مستوى النطاق والمهام، وليس فقط على مستوى الحساب. يجب إيقاف النطاق الذي استهلك أكثر من جيجابايت ولم يقدم أي سجل تلقائيًا - بدون ذلك، يمكن أن يفني فخ واحد الميزانية اليومية خلال الليل.
سبع فحوصات تلتقط القمامة
- احسب العائد، وليس أكواد الاستجابة. المقياس الرئيسي للخط هو نسبة الطلبات التي أعطت سجلًا صالحًا مع حقول إلزامية مملوءة. طالما أنك تنظر إلى نسبة 200، تبدو الطرطشة كمصدر صحي تمامًا.
- URL الكناري. مرة واحدة في N طلبات، اطلب عنوانًا غير موجود داخل النطاق - مع جزء عشوائي من المسار. سيستجيب الموقع العادي بـ 404 أو إعادة توجيه، بينما سيقدم المولد صفحة كاملة مع نص وروابط. هذه هي الفحص الأكثر تكلفة والأكثر موثوقية.
- التحقق المتبادل من ملف تعريف IP آخر. خذ نفس URL بطريقتين مختلفتين - على سبيل المثال، عبر IP سكني وعبر محمول - وقارن تجزئة الحقول الرئيسية: الأسعار، الأسماء، التوافر. أي اختلاف مع نفس URL وفي وقت قريب من الطلب يعني أنك تُظهر نسخًا مختلفة من الصفحة، وأن واحدة على الأقل منها ليست مخصصة للبشر.
- لا تسير عبر الروابط غير المرئية. الروابط مع nofollow، والأحجام الصفرية،
display:noneأو المخرجة خارج الشاشة - هي طعم، والانتقال عبرها هو بصمة الروبوت. قم بتصفية هذه على مرحلة استخراج الروابط، وليس بعدها. - حدود صارمة على الاستجابة. قيد ليس فقط المهلة، ولكن أيضًا الحد الأقصى لحجم الجسم والعمق الأقصى للتجوال من نقطة الدخول. الاستجابة البطيئة في قطع صغيرة هي علامة نموذجية على حفرة، وليس خادم بطيء.
- ابحث عن نمطية النص. توليد ماركوف يكشف نفسه من خلال الإحصائيات: طول الفقرات المتساوي بشكل مريب، n-grams المتكررة بين الصفحات "المختلفة"، عشرات الروابط الصادرة في غياب عناصر هيكلية مثل السعر، الرقم المرجعي أو التاريخ. تحقق بسيط عن تكرار الشينغلز بين الصفحات المجاورة للنطاق يستبعد مثل هذه المصادر دفعة واحدة.
- تحقق من الأرقام على أساس المنطق السليم. سعر خارج النطاق التاريخي، منتج بدون أي تطابق في قاعدة بيانات العلامات التجارية الخاصة بك، قفزة مفاجئة في التشكيلة - هذه هي قواعد التحقق التي يجب أن تكون قائمة قبل التسجيل في قاعدة البيانات، وليس في التقرير بعد شهر. خاصة إذا كانت البيانات تذهب بعد ذلك إلى النموذج أو إلى قرار تلقائي بشأن الشراء.
ماذا تفعل مع المجموعة التي تم جمعها بالفعل
إذا نشأت الشكوك بعد فوات الأوان، قم بفرزها ليس حسب التواريخ، بل حسب المصادر. قم بتجميع السجلات حسب النطاق وانظر إلى ثلاث قيم: نسبة الصفحات التي لا تحتوي على حقول إلزامية، متوسط عدد الروابط الصادرة في الصفحة، وتباين طول النص. عادةً ما تبرز النطاقات الفخية على الفور عبر الثلاثة. ثم تحقق انتقائيًا من URL المتنازع عليه من ملف تعريف IP آخر - إذا لم تتطابق البيانات، يجب إعادة بناء المجموعة بالكامل من هذا النطاق، وليس إصلاحها عبر الفلاتر.
يجب مراجعة القواعد بشكل منفصل للسيناريوهات الوكيلة، حيث يتجول النموذج بنفسه عبر الصفحات ويتخذ القرار بنفسه. هناك، يمكن أن يعطي استبدال صفحة واحدة أقصى تأثير، ولا يوجد شخص وسيط يمكنه ملاحظة الغرابة في السلسلة. الحد الأدنى من التأمين هو طلب تأكيد من مصدرين مستقلين وعدم السماح للوكيل بالتصرف بناءً على البيانات المستلمة من نطاق واحد فقط.
باختصار
لقد تجاوزت الروبوتات منذ زمن طويل البشر في حصة الحركة، وأجابت الحماية ليس فقط بالفلاتر: اليوم أصبح من الأرخص إطعام الآلي قمامة مقنعة، بدلاً من الجدال معه عبر الحظر. هناك ثلاث نتائج عملية. احسب السجلات المفيدة، وليس حالات الاستجابة. احتفظ بفحوصات الكناري وحدود حركة المرور لكل نطاق. تحقق من الصفحات المتنازع عليها من ملفات تعريف IP مختلفة - أي اختلاف في نسخ نفس الصفحة هو دليل على أنك تُظهر إنترنت منفصل، مُعد خصيصًا للروبوتات. في هذه الخطة، تحل البروكسيات مشكلة واحدة فقط - تقدم نظرة مستقلة ثانية على الصفحة؛ كل شيء آخر تقوم به التحقق على جانبك.
