العودة إلى المدونة

كيفية استخراج نتائج جوجل في 2026، بما في ذلك نظرات الذكاء الاصطناعي: دليل وما هي البروكسيات المطلوبة

جوجل أوقف الوصول بدون JavaScript، ألغى num=100 وأضاف AI Overviews، التي تظهر بشكل رئيسي من عناوين IP المحمولة. نناقش كيفية جمع نتائج البحث في عام 2026: ما الذي تغير، دليل خطوة بخطوة لبرمجة SERP وكتل AI، العقبات وما هو نوع البروكسي الذي يجب اختياره للعضوية وAI Overviews.

📅٢٩ محرم ١٤٤٨ هـ
كيفية استخراج نتائج جوجل في 2026، بما في ذلك نظرات الذكاء الاصطناعي: دليل وما هي البروكسيات المطلوبة
```html

قبل عام، كان من الممكن استخراج نتائج Google باستخدام طلب GET مع المعامل num=100 - حيث كانت مئة نتيجة تأتي كـ HTML نظيف. في عام 2026، لم يعد هذا يعمل: قتلت Google الوصول بدون JavaScript، وقطعت مئة نتيجة في الصفحة وأضفت إلى النتائج كتلة AI Overviews، التي يتم عرضها بشكل غير متزامن ولا يمكن رؤيتها من كل IP. دعونا نفهم كيفية جمع SERP في الظروف الجديدة، حيث توجد الفخاخ المخفية ولماذا أصبح اختيار نوع البروكسي أكثر أهمية من أداة الاستخراج نفسها.

لمن هذا الدليل

استخراج نتائج البحث (SERP scraping) ليس فقط عن مواقع SEO. اليوم يستخدمه:

  • أخصائيو SEO والوكالات - يتتبعون النتائج العضوية، مقتطفات مميزة، "الناس يسألون أيضًا"، النتائج المحلية وما إذا كان الموقع قد ظهر في AI Overviews.
  • محللو السوق - يراقبون من تقتبسهم Google في الكتل الذكية الخاصة بالاستفسارات التجارية، وكيف تتغير الصفحة الأولى لدى المنافسين.
  • فرق الذكاء الاصطناعي والبيانات - تجمع SERP كمصدر بيانات لأنظمة RAG، تدريب النماذج والتحقق من الحقائق.

تجمعهم مشكلة واحدة: في عام 2026، تميز Google بنشاط بين حركة المرور الآلية والحقيقية، وبدون بنية تحتية صحيحة، يتعطل جمع البيانات بعد العشرات الأولى من الاستفسارات.

ما الذي تغير: ثلاث ضربات من Google للسكرابرز

لكي يكون الدليل صادقًا، دعونا نبدأ بما يجعل التعليمات القديمة غير فعالة.

يناير 2025 - SearchGuard. أطلقت Google نظام تحديات JavaScript: طلب HTTP العادي عبر requests أو httpx الآن يحصل على صفحة تحدي وليس HTML. بدون تنفيذ JavaScript، لا يمكن رؤية النتائج - الاستخراج المباشر "وجهًا لوجه" يسقط على الفور.

سبتمبر 2025 - نهاية num=100. أزالت Google المعامل الذي كان يعطي 100 نتيجة في طلب واحد. الآن، الـ top-100 هو عشرة طلبات منفصلة مع ترقيم الصفحات. بالنسبة للمراقبة العميقة، هذا يعني زيادة عشرة أضعاف في عدد الطلبات (وبالتالي، الضغط على البروكسي والميزانية).

ديسمبر 2025 - الضغط القانوني. في 19 ديسمبر 2025، قدمت Google شكوى DMCA ضد SerpApi، مدعية أن SearchGuard هو "وسيلة حماية تقنية" (technological protection measure)، وأن تجاوزها يقع تحت القوانين المناهضة للتجاوز. لم يتم حل السابقة بعد، لكنها تحدد النغمة: أصبح الاستخراج الرمادي من Google أكثر تكلفة من الناحية التقنية والقانونية.

نلاحظ بشكل منفصل: يتم إيقاف واجهة برمجة التطبيقات الرسمية للبحث المخصص من Google - تم إبلاغ العملاء الحاليين بموعد نهائي للانتقال بحلول 1 يناير 2027. وهذا يعني أن البديل "القانوني" أيضًا يتقلص.

الابتكار الرئيسي في النتائج - AI Overviews

AI Overviews (في السابق SGE) - هي ملخصات تم إنشاؤها بواسطة الذكاء الاصطناعي في أعلى النتائج مع روابط للمصادر. بالنسبة للاستخراج، هذه هي العنصر الأكثر تعقيدًا في عام 2026 لثلاثة أسباب.

هناك الكثير منها. وفقًا لبيانات Ahrefs، تظهر AI Overviews في حوالي 30% من الاستفسارات؛ التقديرات اللاحقة (Olostep) تعطي ما يصل إلى 48% من جميع الاستفسارات وما يصل إلى 80% من المعلومات. تجاهل هذه الكتلة يعني جمع صورة غير مكتملة عن النتائج.

يتم عرضها بشكل غير متزامن. الكتلة موجودة في ثلاث حالات: تأتي مباشرة في HTML (نادراً ما يحدث ذلك)، يتم تحميلها عبر JavaScript بعد ثوانٍ من الصفحة الرئيسية (الحالة الأكثر شيوعًا) أو لا تظهر على الإطلاق. عند التحميل المؤجل، تحتوي استجابة HTTP الخام على حاوية فارغة - يتم سحب المحتوى لاحقًا، ويجب على أداة الاستخراج الانتظار (في الممارسة العملية - حوالي 8 ثوانٍ في أتمتة المتصفح).

لا يمكن رؤيتها من كل IP. هذه هي النقطة الرئيسية التي تتجاهلها الأدلة القديمة: تعتبر Google مستخدمي الهواتف المحمولة جمهورًا ذا أولوية للبحث الذكي. في الممارسة العملية، هذا يعني أن AI Overview غالبًا لا يتم تسليمه من IP مركز البيانات، بينما نفس الاستفسار عبر مشغل الهاتف المحمول يعيد الكتلة الكاملة. حتى أفضل المجمعات تعترف بعدم الاكتمال: في بداية عام 2026، أعلنت SerpApi عن حوالي 68% من النجاح في اكتشاف AI Overviews.

خطوات تفصيلية: كيفية جمع SERP في 2026

  1. حدد الحجم. حتى ~100 استفسار في اليوم يمكن إدارته على أتمتة المتصفح الخاصة بك. من 100 إلى 10,000 - تحتاج بالفعل إلى أداة استخراج مُدارة أو SERP-API. أكثر من 10,000 في اليوم بدون بنية تحتية مؤسسية مع دفعات وويب هوكس لا يمكن التغلب عليها. هذا يحدد كل مجموعة الأدوات التالية.
  2. اجمع عنوان URL الصحيح. نقطة النهاية الأساسية - /search، المعامل الرئيسية: q (الاستفسار، ترميز URL)، hl (لغة الواجهة)، gl (دولة النتائج)، start (ترقيم الصفحات: start=10 - الصفحة الثانية، start=20 - الصفحة الثالثة وهكذا). تذكر: num=100 لم يعد يعمل، العمق يتم جمعه فقط من خلال ترقيم الصفحات.
  3. استخدم عرض المتصفح. نظرًا لأنه لا توجد نتائج بدون JavaScript، فإن المجموعة الأساسية هي Playwright أو Selenium مع Chromium بدون رأس. تأكد من إزالة علامات الأتمتة (علامة --disable-blink-features=AutomationControlled)، وإلا فإن مكافحة الروبوت ستكتشف المتصفح المدعوم من خلال خصائص navigator.
  4. انتظر AI Overview. بعد تحميل الصفحة، لا تلتقط DOM على الفور: انتظر حتى تستقر networkidle وانتظر تحميل الكتلة (المرجع - حتى 8 ثوانٍ). من الأفضل تحديد وجود الكتلة من خلال نص عنوان "AI Overview"، وليس من خلال فئات CSS - فهي ديناميكية في Google وتتغير (أسماء Kevs9، Y3BBE اليوم واحدة، وغدًا أخرى).
  5. استخراج حسب الهيكل، وليس حسب الفئات. خذ النتائج العضوية من خلال علامات العناوين (h3) والدلالة، وليس من خلال أسماء الفئات الهشة. من النتائج المتاحة في 2026: النتائج العضوية، مقتطفات مميزة، "الناس يسألون أيضًا"، الاستفسارات ذات الصلة، المعرفة الرسومية، الحزمة المحلية، الإعلانات والاقتباسات داخل AI Overview.
  6. قم بتدوير IP وتباطؤ. ضع فترات واقعية بين الطلبات (4-12 ثانية) وغيّر IP كل 5 دقائق تقريبًا، متنوعًا بين المدينة/المشغل. إيقاع ثابت جدًا وIP واحد - هو أسرع طريق إلى CAPTCHA.

الفخاخ

  • AI Overview "فارغ". إذا كنت تأخذ DOM مباشرة بعد التحميل، ستكون الكتلة المؤجلة فارغة - وستعتقد أنه لا توجد. دائمًا ضع في اعتبارك الانتظار وإعادة التحقق.
  • جلسات لمرة واحدة للتحميل. لدى بعض واجهات برمجة التطبيقات، مفتاح الجلسة لتحميل AI Overview المؤجل يكون لمرة واحدة ويعيش حوالي 60 ثانية - لا تتوقع إعادة استخدامه لاحقًا.
  • توفير زائف على مركز البيانات. IP مركز البيانات الرخيصة تصطاد CAPTCHA بالفعل بعد 5-10 استفسارات، بالإضافة إلى أنها لا تعرض AI Overviews. يوفر التوفير بيانات غير مكتملة ووقت ضائع.
  • محددات هشة. إذا ارتبطت بأسماء فئات CSS - ستتعطل أداة الاستخراج عند أول إعادة تصميم للنتائج. تمسك بالنص والهيكل.
  • بصمة طلبات مستقيمة. User-Agent، التوقيتات والعناوين المتطابقة في جميع التدفقات تكشف عن شبكة روبوتات. نوع من التنوع في بصمة الأصابع كما تفعل مع IP.

أي نوع من البروكسي تختار

في عام 2026، البروكسي، وليس أداة الاستخراج، يحدد ما إذا كنت سترى النتائج الكاملة. دعونا نفصلها حسب المهام.

بروكسي الهواتف المحمولة - لـ AI Overviews وأثقل الاستفسارات. نظرًا لأن Google تقدم الكتل الذكية أولاً لجمهور الهواتف المحمولة، فإن IP المشغلين الحقيقيين (T-Mobile، Verizon، Vodafone وما إلى ذلك) هي الأكثر استقرارًا في تفعيل AI Overview وتتحمل بشكل ملحوظ أكثر - وفقًا للملاحظات، 50-200 استفسار قبل ظهور الاحتكاك مقابل 5-10 من مركز البيانات. بالإضافة إلى ذلك، يشارك IP CGNAT المحمول عنوانًا واحدًا مع مئات المشتركين الحقيقيين، لذلك تخشى Google حظره. إذا كانت مهمتك هي جمع AI Overviews أو مراقبة SERP الأكثر حماية، ابدأ بـ بروكسي الهواتف المحمولة.

بروكسي السكنية - الحصان العامل للنتائج العضوية والحجم. لجمع النتائج العادية، المواقع، مقتطفات مميزة والحزمة المحلية، توفر IP السكنية (عناوين مزودي الخدمة المنزلية) أفضل نسبة بين السعر والنجاح. من الصعب تمييزها عن المستخدم الحقيقي، وتسمح التدوير بتوسيع الجمع دون انطلاق من عنوان واحد. الخيار الأمثل، عندما لا تكون AI Overview في التركيز، ولكن الحجم والجغرافيا مهمان، هو بروكسي السكنية مع التدوير.

مركز البيانات - فقط للاختبارات الأولية. سريع ورخيص، لكن ضد Google في عام 2026، تعيش الاستفسارات القليلة ولا ترى الكتل الذكية. مناسب لتصحيح منطق أداة الاستخراج، وليس لجمع البيانات القتالية.

غير متأكد مما يجب أخذه لمهمة معينة، ابدأ بتحليل بروكسي السكنية مقابل بروكسي الهواتف المحمولة في 2026: هناك تفاصيل حول أي نوع يوفر المال وأين - البيانات.

الاستنتاج

أصبح استخراج Google في عام 2026 مهمة "كتابة أداة استخراج". أجبرت SearchGuard على تنفيذ JavaScript، وألغت num=100 زادت عدد الطلبات عشرة أضعاف، وأضفت AI Overviews كتلة لا يمكن رؤيتها في الغالب من IP الهواتف المحمولة وتحتاج إلى تحميل بتأخير. كل شيء قابل للحل من الناحية التقنية: أتمتة المتصفح، الاستخراج حسب الهيكل، فترات معقولة وتدوير. لكن الأساس الذي يعتمد عليه الاكتمال والثبات في الجمع هو البروكسي الصحيح: الهواتف المحمولة لـ AI Overviews والاستفسارات المحمية، والسكنية للنتائج العضوية والحجم. ابدأ بنوع البروكسي المناسب لمهمتك - وستتوقف أداة الاستخراج عن التعثر بسبب CAPTCHA.

```