بازگشت به وبلاگ

چگونه در سال ۲۰۲۶ نتایج گوگل را با استفاده از AI Overviews استخراج کنیم: راهنما و پروکسی‌های مورد نیاز

گوگل دسترسی بدون JavaScript را از بین برد، num=100 را لغو کرد و AI Overviews را اضافه کرد که عمدتاً از IP های موبایل قابل مشاهده هستند. بررسی می‌کنیم که چگونه در سال 2026 نتایج جستجو را جمع‌آوری کنیم: چه تغییراتی ایجاد شده، راهنمای گام به گام برای پارس کردن SERP و بلوک‌های AI، مشکلات و نوع پروکسی که باید برای ارگانیک و AI Overviews انتخاب کنیم.

📅۲۳ تیر ۱۴۰۵
چگونه در سال ۲۰۲۶ نتایج گوگل را با استفاده از AI Overviews استخراج کنیم: راهنما و پروکسی‌های مورد نیاز
```html

یک سال پیش، می‌توانستید نتایج گوگل را با یک درخواست GET و پارامتر num=100 دریافت کنید - صد نتیجه به صورت HTML خالص می‌آمد. در سال 2026 این روش دیگر کار نمی‌کند: گوگل دسترسی بدون جاوا اسکریپت را قطع کرده، صد نتیجه در هر صفحه را محدود کرده و یک بلوک AI Overviews را به نتایج اضافه کرده است که به صورت غیرهمزمان رندر می‌شود و از هر IP قابل مشاهده نیست. بیایید بررسی کنیم که چگونه در شرایط جدید SERP را جمع‌آوری کنیم، کجا تله‌های پنهان وجود دارد و چرا انتخاب نوع پروکسی از خود پارسر مهم‌تر شده است.

این راهنما برای چه کسانی است

جمع‌آوری نتایج جستجو (SERP scraping) فقط مربوط به موقعیت‌های SEO نیست. امروز از آن استفاده می‌شود:

  • متخصصان و آژانس‌های SEO - ارگانیک، snippets ویژه، «مردم همچنین می‌پرسند»، نتایج محلی و اینکه آیا سایت در AI Overviews قرار دارد را پیگیری می‌کنند.
  • تحلیلگران بازار - نظارت می‌کنند که گوگل چه کسانی را در بلوک‌های AI برای درخواست‌های تجاری نقل قول می‌کند و چگونه صفحه اول رقبا تغییر می‌کند.
  • تیم‌های AI و داده - SERP را به عنوان منبع داده برای سیستم‌های RAG، آموزش مدل‌ها و بررسی حقایق جمع‌آوری می‌کنند.

همه آن‌ها با یک مشکل مشترک مواجه هستند: گوگل در سال 2026 به طور فعال ترافیک خودکار را از ترافیک زنده تشخیص می‌دهد و بدون زیرساخت مناسب، جمع‌آوری داده‌ها در ده‌ها درخواست اول خراب می‌شود.

چه تغییر کرده است: سه ضربه گوگل به اسکرپرها

برای اینکه راهنما صادقانه باشد، با این موضوع شروع می‌کنیم که چرا دستورالعمل‌های قدیمی دیگر کار نمی‌کنند.

ژانویه 2025 - SearchGuard. گوگل سیستم چالش‌های جاوا اسکریپت را راه‌اندازی کرد: درخواست HTTP معمولی از طریق requests یا httpx اکنون HTML نمی‌گیرد، بلکه صفحه چالش را دریافت می‌کند. بدون اجرای جاوا اسکریپت، نمی‌توان نتایج را مشاهده کرد - پارس کردن «به طور مستقیم» به سرعت شکست می‌خورد.

سپتامبر 2025 - پایان num=100. گوگل پارامتر را که 100 نتیجه را در یک درخواست ارائه می‌داد، حذف کرد. اکنون 100 نتیجه برتر شامل ده درخواست جداگانه با صفحه‌بندی است. برای نظارت عمیق، این به معنای افزایش ده برابری تعداد درخواست‌ها (و به تبع آن، بار روی پروکسی و بودجه) است.

دسامبر 2025 - فشار قانونی. در تاریخ 19 دسامبر 2025، گوگل شکایت DMCA علیه SerpApi ارائه داد و اعلام کرد که SearchGuard یک «ابزار حفاظتی تکنولوژیکی» است و دور زدن آن تحت قوانین ضد دور زدن قرار می‌گیرد. این پیشینه هنوز حل نشده است، اما لحن را تعیین می‌کند: پارسینگ خاکستری گوگل هم از نظر فنی و هم قانونی گران‌تر می‌شود.

به طور جداگانه باید اشاره کرد: API جستجوی سفارشی رسمی گوگل در حال بسته شدن است - به مشتریان فعلی مهلت مهاجرت تا 1 ژانویه 2027 اعلام شده است. به عبارت دیگر، گزینه «قانونی» نیز محدود می‌شود.

جدیدترین ویژگی نتایج - AI Overviews

AI Overviews (در گذشته SGE) یک خلاصه تولید شده توسط هوش مصنوعی در بالای نتایج با لینک به منابع است. برای اسکرپینگ، این عنصر در سال 2026 به سه دلیل پیچیده‌ترین است.

تعداد آن‌ها زیاد است. به گفته Ahrefs، AI Overviews در حدود 30% از درخواست‌ها ظاهر می‌شوند؛ برآوردهای بعدی (Olostep) تا 48% از تمام درخواست‌ها و تا 80% از اطلاعات را نشان می‌دهند. نادیده گرفتن این بلوک به معنای جمع‌آوری تصویری ناقص از نتایج است.

آن‌ها به صورت غیرهمزمان رندر می‌شوند. بلوک در سه حالت وجود دارد: به صورت HTML به سرعت می‌آید (کمترین حالت)، از طریق جاوا اسکریپت چند ثانیه پس از بارگذاری صفحه اصلی بارگذاری می‌شود (متداول‌ترین حالت) یا اصلاً ظاهر نمی‌شود. در بارگذاری تأخیری، پاسخ HTTP خام شامل یک ظرف خالی است - محتوا بعداً بارگذاری می‌شود و پارسر باید صبر کند (در عمل، حدود 8 ثانیه در اتوماسیون مرورگر).

از هر IP قابل مشاهده نیست. این نکته کلیدی است که راهنماهای قدیمی در مورد آن سکوت کرده‌اند: گوگل کاربران موبایل را به عنوان مخاطب اول برای جستجوی AI در نظر می‌گیرد. در عمل، این به این معنی است که از IP‌های دیتاسنتر، AI Overview معمولاً اصلاً ارائه نمی‌شود، در حالی که همان درخواست از طریق اپراتور موبایل بلوک کامل را برمی‌گرداند. حتی بهترین تجمیع‌کننده‌ها نیز ناتوانی را تأیید می‌کنند: SerpApi در ابتدای سال 2026 حدود 68% موفقیت در شناسایی AI Overviews را گزارش کرده است.

تحلیل مرحله به مرحله: چگونه در سال 2026 SERP را جمع‌آوری کنیم

  1. حجم را مشخص کنید. تا ~100 درخواست در روز واقعاً می‌توان با اتوماسیون مرورگر خود انجام داد. از 100 تا 10,000 - به یک پارسر مدیریت شده یا SERP-API نیاز دارید. بیش از 10,000 در روز بدون زیرساخت‌های شرکتی با دسته‌ها و وب‌هوک‌ها امکان‌پذیر نیست. این موضوع کل استک بعدی را تعیین می‌کند.
  2. URL صحیح را جمع‌آوری کنید. نقطه پایانی پایه - /search، پارامترهای کلیدی: q (درخواست، URL-encoding)، hl (زبان رابط)، gl (کشور نتایج)، start (صفحه‌بندی: start=10 - صفحه دوم، start=20 - صفحه سوم و غیره). به خاطر داشته باشید: num=100 دیگر کار نمی‌کند، عمق را فقط با صفحه‌بندی افزایش می‌دهید.
  3. از رندرینگ مرورگر استفاده کنید. از آنجا که بدون جاوا اسکریپت نتایج وجود ندارد، استک پایه - Playwright یا Selenium با Chromium بدون سر است. حتماً نشانه‌های اتوماسیون را حذف کنید (پرچم --disable-blink-features=AutomationControlled)، در غیر این صورت ضد ربات، مرورگر مدیریت شده را از طریق ویژگی‌های navigator شناسایی می‌کند.
  4. منتظر AI Overview باشید. پس از بارگذاری صفحه، بلافاصله DOM را نگیرید: اجازه دهید networkidle تثبیت شود و منتظر بارگذاری بلوک باشید (راهنما - تا 8 ثانیه). وجود بلوک را بهتر است بر اساس متن عنوان «AI Overview» شناسایی کنید، نه بر اساس کلاس‌های CSS - آن‌ها در گوگل پویا هستند و تغییر می‌کنند (کلاس‌های شرطی Kevs9، Y3BBE امروز یکی هستند، فردا دیگری).
  5. بر اساس ساختار پارس کنید، نه بر اساس کلاس‌ها. ارگانیک را بر اساس تگ‌های عنوان (h3) و معناشناسی بگیرید، نه بر اساس نام‌های شکننده کلاس‌ها. از نتایج در سال 2026 قابل دسترسی هستند: نتایج ارگانیک، snippets ویژه، «مردم همچنین می‌پرسند»، درخواست‌های مرتبط، knowledge graph، بسته محلی، تبلیغات و نقل قول‌ها در داخل AI Overview.
  6. IP را بچرخانید و کمی توقف کنید. بین درخواست‌ها وقفه‌های واقعی (4–12 ثانیه) قرار دهید و هر 5 دقیقه IP را تغییر دهید، با تغییر شهر/اپراتور. ریتم بسیار یکنواخت و یک IP - سریع‌ترین راه به سمت CAPTCHA است.

تله‌های پنهان

  • AI Overview «خالی». اگر بلافاصله پس از بارگذاری DOM را بگیرید، بلوک تأخیری خالی خواهد بود - و شما تصمیم می‌گیرید که وجود ندارد. همیشه انتظار و بررسی مجدد را در نظر بگیرید.
  • جلسات یک‌بار مصرف برای بارگذاری. در برخی API‌ها، کلید جلسه برای بارگذاری AI Overview تأخیری یک‌بار مصرف است و حدود 60 ثانیه زنده می‌ماند - روی استفاده مجدد از آن در آینده حساب نکنید.
  • صرفه‌جویی کاذب در دیتاسنتر. IP‌های دیتاسنتر ارزان در 5–10 درخواست به CAPTCHA می‌خورند و به علاوه AI Overviews را نشان نمی‌دهند. صرفه‌جویی به داده‌های ناقص و زمان هدر رفته منجر می‌شود.
  • انتخاب‌گرهای شکننده. به نام‌های کلاس CSS وابسته شده‌اید - پارسر در اولین طراحی مجدد نتایج خراب می‌شود. به متن و ساختار بچسبید.
  • اثر یکنواخت درخواست‌ها. User-Agent، زمان‌ها و هدرهای یکسان در تمام جریان‌ها، ربات‌نت را فاش می‌کند. اثر انگشت را همان‌طور که IP را متنوع می‌کنید، متنوع کنید.

چه نوع پروکسی را انتخاب کنیم

در سال 2026، پروکسی، نه پارسر، تعیین می‌کند که آیا شما نتایج کامل را خواهید دید یا خیر. بیایید بر اساس وظایف تقسیم کنیم.

پروکسی‌های موبایل - برای AI Overviews و سنگین‌ترین درخواست‌ها. از آنجا که گوگل بلوک‌های AI را در درجه اول به مخاطبان موبایل ارائه می‌دهد، IP‌های واقعی اپراتور (T-Mobile، Verizon، Vodafone و مشابه) پایدارترین تحریک‌کننده‌های AI Overview هستند و به طور قابل توجهی بیشتر را تحمل می‌کنند - بر اساس مشاهدات، 50–200 درخواست قبل از ایجاد اصطکاک در مقابل 5–10 در دیتاسنتر. به علاوه، IP‌های CGNAT موبایل یک آدرس را با صدها مشترک زنده تقسیم می‌کنند، بنابراین گوگل از مسدود کردن آن می‌ترسد. اگر وظیفه شما جمع‌آوری دقیقاً AI Overviews یا نظارت بر SERP‌های بسیار محافظت شده است، با پروکسی‌های موبایل شروع کنید.

پروکسی‌های مسکونی - کارگر اصلی برای ارگانیک و حجم. برای جمع‌آوری نتایج عادی، موقعیت‌ها، snippets ویژه و بسته محلی، IP‌های مسکونی (آدرس‌های ارائه‌دهندگان خانگی) بهترین نسبت قیمت و موفقیت را ارائه می‌دهند. آن‌ها به سختی از کاربر واقعی قابل تشخیص هستند و چرخش اجازه می‌دهد جمع‌آوری را بدون شلیک از یک آدرس مقیاس‌پذیر کنید. گزینه بهینه، زمانی که AI Overview در کانون توجه نیست و حجم و جغرافیا مهم هستند، پروکسی‌های مسکونی با چرخش است.

دیتاسنتر - فقط برای آزمایش‌های اولیه. سریع و ارزان، اما در برابر گوگل در سال 2026 فقط تعداد محدودی درخواست زنده می‌ماند و بلوک‌های AI را نمی‌بیند. برای اشکال‌زدایی منطق پارسر مناسب است، نه برای جمع‌آوری واقعی.

اگر مطمئن نیستید که چه چیزی برای وظیفه خاصی انتخاب کنید، با بررسی پروکسی‌های مسکونی در مقابل موبایل در سال 2026 شروع کنید: در آنجا به تفصیل توضیح داده شده است که کدام نوع در کجا پول صرفه‌جویی می‌کند و کجا داده‌ها.

نتیجه‌گیری

جمع‌آوری گوگل در سال 2026 دیگر یک وظیفه «نوشتن پارسر» نیست. SearchGuard مجبور کرد جاوا اسکریپت را رندر کند، لغو num=100 تعداد درخواست‌ها را ده برابر کرد و AI Overviews بلوکی را اضافه کرد که عمدتاً از IP‌های موبایل قابل مشاهده است و با تأخیر بارگذاری می‌شود. از نظر فنی همه چیز قابل حل است: اتوماسیون مرورگر، پارس کردن بر اساس ساختار، وقفه‌های منطقی و چرخش. اما بنیادی که کامل بودن و ثبات جمع‌آوری را حفظ می‌کند، پروکسی‌های صحیح است: پروکسی‌های موبایل برای AI Overviews و درخواست‌های محافظت شده، پروکسی‌های مسکونی برای ارگانیک و حجم. با نوع پروکسی مناسب برای وظیفه خود شروع کنید - و پارسر دیگر به CAPTCHA برخورد نخواهد کرد.

```