بازگشت به وبلاگ

آمازون خریداران را به عنوان ربات شناسایی کرد: ۸ نظر درباره محصول و چرا این موضوع به همه کسانی که داده‌ها را استخراج می‌کنند مربوط می‌شود

در اوایل اوت ۲۰۲۶، آمازون شروع به کاهش تعداد نظرات به هشت عدد برای کسانی کرد که ربات ضد خود را به عنوان اسکرپر شناسایی کرده بود - این موضوع شامل خریداران واقعی بدون VPN و اتوماسیون شد. این اتفاق با لغو حکم قضایی علیه عامل هوش مصنوعی Perplexity همزمان شد. بررسی می‌کنیم که چرا پلتفرم‌ها از مسدودسازی به کاهش آرام محتوای خود می‌روند و این چه معنایی برای جمع‌آوری داده‌ها دارد.

📅۱۹ مرداد ۱۴۰۵
آمازون خریداران را به عنوان ربات شناسایی کرد: ۸ نظر درباره محصول و چرا این موضوع به همه کسانی که داده‌ها را استخراج می‌کنند مربوط می‌شود
```html

در اوایل اوت ۲۰۲۶، ده‌ها خریدار آمازون متوجه شدند که فقط هشت نظر را در کارت محصول می‌بینند - بدون مرتب‌سازی، بدون فیلتر، بدون امکان باز کردن بقیه. هیچ گونه هشدار قبلی وجود نداشت. خدمات پشتیبانی توضیح داد که این وضعیت به دلیل نقض شرایط استفاده «در زمینه جمع‌آوری و استخراج محتوای جامعه» است. به عبارت دیگر، این پلتفرم انسان‌های واقعی را به عنوان اسکرپرها در نظر گرفته است.

این داستان به خودی خود می‌توانست یک اتفاق عجیب به نظر برسد، اگر با یک رویداد دیگر همزمان نمی‌شد: در ۴ اوت ۲۰۲۶، دادگاه تجدیدنظر ناحیه نهم، حکم قضایی که آمازون علیه عامل هوش مصنوعی Perplexity Comet صادر کرده بود را لغو کرد. مسیر قانونی مبارزه با اتوماسیون دچار اختلال شد - و تقریباً به طور همزمان، مسیر فنی به شدت سخت‌تر شد. بیایید بررسی کنیم که چه اتفاقی افتاده و چرا این تغییرات قوانین بازی را برای همه کسانی که داده‌های عمومی را جمع‌آوری می‌کنند، تغییر می‌دهد.

چه اتفاقی افتاد: هشت نظر و تجدیدنظر پنج روزه

اخبار محدودیت‌های گسترده در تاریخ ۳-۴ اوت ۲۰۲۶ توسط TechSpot، Android Authority و Shopifreaks گزارش شد. تصویر برای آسیب‌دیدگان یکسان بود:

  • در هر محصول فقط ۸ نظر به جای لیست کامل در دسترس است؛
  • ابزارهای مرتب‌سازی و فیلتر کردن نظرات ناپدید می‌شوند؛
  • هیچ گونه اطلاع‌رسانی درباره محدودیت وجود ندارد - کاربر خود به این موضوع پی می‌برد؛
  • برای رفع مسدودیت، باید به پشتیبانی پیام داده و تا پنج روز کاری منتظر پاسخ بمانید.

یکی از آسیب‌دیدگان، فرد هال، در اواسط ژوئیه با محدودیت مواجه شد، زمانی که در حال بررسی رطوبت‌گیرها بود. اپراتور چت به نقض شرایط استفاده اشاره کرد که مربوط به استخراج محتوای کاربر است؛ تجدیدنظر چند روز بعد بدون هیچ گونه توضیحی تأیید شد. مورد دوم جالب‌تر است: شون کافمن همان محدودیت هشت نظر را در تمام محصولات به طور متوالی دریافت کرد. او نه از VPN استفاده می‌کند، نه از مسدودکننده‌های تبلیغاتی، نه از مرورگرهای هوش مصنوعی - تنها ویژگی او این است که به مدت طولانی محصولات رقیب را مقایسه کرده و نظرات را به دقت می‌خواند. آمازون به او ۱۰ دلار اعتبار پیشنهاد داد و دسترسی را پس از پنج روز بازگرداند.

بیانیه رسمی شرکت به این صورت است: «ما درک می‌کنیم که ممکن است موارد خاصی وجود داشته باشد که مشتریان نتوانند به نظرات دسترسی پیدا کنند و ما بر روی این موضوع کار کرده‌ایم تا دسترسی را فراهم کنیم». در عین حال، آمازون از افشای جزئیات قابل توجه خودداری کرد: نه تعداد حساب‌های تحت تأثیر، نه رفتارهایی که باعث فعال شدن تشخیص می‌شود، نه تاریخ شروع محدودیت‌ها و نه اصول بررسی تجدیدنظرها. شکایات جداگانه، طبق بحث‌ها، از نوامبر ۲۰۲۵ وجود داشته‌اند - به این معنی که این مکانیزم مدت‌هاست که کار می‌کند و فقط در اوت قابل مشاهده شده است.

چرا اکنون: دادگاه ابزاری راحت را از آمازون گرفت

برای درک زمینه، به زمان‌بندی درگیری آمازون و Perplexity نیاز داریم.

  1. نوامبر ۲۰۲۴ - نوامبر ۲۰۲۵. آمازون به ادعای خود، حداقل پنج هشدار به Perplexity ارسال کرده و از آنها خواسته است که خریدهای نمایندگی را به نمایندگی از کاربران متوقف کنند.
  2. اوت ۲۰۲۵. آمازون مانع فنی علیه Comet ایجاد می‌کند. به گفته آمازون، Perplexity در عرض ۲۴ ساعت راهی برای دور زدن این مانع پیدا کرد و نماینده خود را به عنوان یک جلسه عادی Chrome پنهان کرد به جای اینکه به طور صادقانه خود را معرفی کند.
  3. ۱۰ مارس ۲۰۲۶. قاضی مکسین چسنی در سان‌فرانسیسکو حکم موقتی صادر می‌کند: Comet نمی‌تواند به بخش‌های محافظت‌شده با رمز عبور آمازون وارد شود و به نمایندگی از کاربر خرید کند. عبارت کلیدی این است که نماینده «با اجازه کاربر آمازون عمل می‌کند، اما بدون تأیید آمازون».
  4. ۴ اوت ۲۰۲۶. ناحیه نهم حکم را لغو می‌کند. دادگاه بر این باور بود که آمازون به احتمال زیاد در پرونده قانون تقلب و سوءاستفاده از کامپیوتر پیروز نخواهد شد: زمانی که کاربر به دستیار خود وظیفه‌ای می‌دهد، به سرورهای آمازون خود کاربر با کمک دستیار مراجعه می‌کند، نه Perplexity. CFAA نیاز به اثبات دسترسی غیرمجاز عمدی و خسارت بیش از ۵۰۰۰ دلار در سال دارد - این عناصر در دادگاه مشاهده نشد.

آمازون پاسخ داد که «با احترام با این تصمیم موافق نیست» و حق درخواست تجدیدنظر را برای خود محفوظ می‌دارد. خود پرونده در دادگاه سان‌فرانسیسکو بسته نشده است - فقط حکم موقتی لغو شده است. اما سیگنال به بازار ارسال شده است: تلاش برای معادل‌سازی اقدامات نماینده‌ای که به طور مستقیم به دستور انسان عمل می‌کند، با هک در دادگاه‌ها در حال حاضر موفق نیست.

به‌طور جالب، Perplexity در تمام این مدت تأکید کرده است که این شکایت نه امنیت را محافظت می‌کند، بلکه درآمدهای تبلیغاتی را: نماینده محصول را بدون عبور از نمایش تبلیغاتی که انسان می‌بیند، خریداری می‌کند. این استدلال چندان بی‌پایه نیست: کسب‌وکار تبلیغاتی آمازون در سال ۲۰۲۵ به ارزش ۵۶ میلیارد دلار تخمین زده شده بود و تمام این درآمد به این بستگی دارد که خریدار واقعی خود به تماشا بپردازد.

چه چیزی برای پلتفرم باقی می‌ماند، وقتی دادگاه کمک نمی‌کند

آمازون مدت‌هاست که به طور همزمان در دو جبهه مبارزه می‌کند. علاوه بر دادگاه‌ها، این شرکت به طور مداوم دسترسی ربات‌های هوش مصنوعی را از طریق robots.txt مسدود می‌کند: در لیست مسدود شده‌ها، ربات‌های Meta، Google، Huawei و Mistral قرار دارند و قبل‌تر ربات‌های Anthropic، Perplexity و Google Project Mariner. برای مقایسه: Walmart و eBay چنین مسدودیت‌هایی در robots.txt نداشته‌اند. مشکل این است که robots.txt یک درخواست است، نه یک مانع: این فقط با کسانی که به طور داوطلبانه از آن پیروی می‌کنند، کار می‌کند.

از این رو، گام منطقی این است که حفاظت را به سطحی منتقل کنیم که نیازی به درخواست توافق نباشد. داستان نظرات به این صورت است: به جای مسدود کردن ربات‌های خاص به نام، پلتفرم شروع به ارزیابی رفتار جلسه کرده و نتایج را برای کسانی که الگوی آنها شبیه به ماشین است، کاهش می‌دهد. نظرات - باارزش‌ترین و قابل کپی‌ترین دارایی بازار هستند، بنابراین آزمایش از آنها آغاز شد.

مشکل عملی این رویکرد - تشخیص‌های نادرست. طبقه‌بندی رفتاری به دینامیک تعامل متکی است: ریتم و سرعت حرکات، وقفه‌ها، توالی انتقال، عمق و تکرار بازدیدها. فردی که به طور منظم ده مدل رطوبت‌گیر را مقایسه کرده و تمام نظرات را به ترتیب باز می‌کند، بر اساس این معیارها دقیقاً مانند یک پارسر به نظر می‌رسد. مورد کافمن یک مثال آموزشی است: IP خالص، مرورگر عادی، هیچ اتوماسیونی، و با این حال مسدود شده است.

نتیجه‌گیری اصلی: IP خالص دیگر مجوز نیست

برای کسانی که داده‌های عمومی را جمع‌آوری می‌کنند، از این داستان نتیجه ناخوشایندی حاصل می‌شود. قبلاً منطق ساده بود: شهرت IP بد است - مسدودیت، شهرت خوب است - دسترسی. اکنون آمازون نشان داده است که تصمیم می‌تواند برخلاف سیگنال‌های شبکه‌ای ایده‌آل اتخاذ شود. کاربر از ارائه‌دهنده خانگی خود، از کشور خود، در Chrome واقعی، با تاریخچه کامل خریدها در سال‌ها نشسته است - و با این حال تحت محدودیت قرار می‌گیرد، زیرا بیش از حد به خواندن نظرات پرداخته است.

این اولویت‌ها را در زیرساخت جمع‌آوری داده‌ها تغییر می‌دهد. یک پروکسی مسکونی با کیفیت هنوز هم ضروری است - بدون آن شما حتی نمی‌توانید اولین لایه فیلترها را عبور کنید و همان نتایج را که خریدار محلی می‌بیند، مشاهده کنید. اما دیگر شرط کافی نیست: اگر روی IP خوب، رباتی با ریتم ماشین کار کند، تشخیص‌دهنده شما را در لایه دوم شناسایی می‌کند. تجزیه و تحلیل دقیق این لایه در مطلب ما درباره بیومتریک رفتاری و پروکسی‌ها موجود است.

چه کارهایی باید در عمل انجام داد

  1. «شخصی» و «کاری» را به طور فیزیکی جدا کنید. اگر شما قیمت‌ها و نظرات رقبای خود را از همان مرورگر و با همان IP که در حساب خرید خود وارد می‌شوید، نظارت می‌کنید، در معرض خطر از دست دادن داده‌ها و حساب خود هستید. یک پروفایل جداگانه، یک آدرس خروجی جداگانه، یک جلسه جداگانه.
  2. یک مجموعه - یک وظیفه. نظارت بر Buy Box، جمع‌آوری نظرات و بررسی موجودی نباید از یک مجموعه آدرس یکسان عبور کند: این وظایف الگوی درخواست‌های متفاوتی دارند و ترکیب آنها به معنای جمع‌آوری اثر انگشت ترکیبی است که از هر یک از اجزای آن قابل شناسایی‌تر است.
  3. عمق را در هر جلسه محدود کنید. هشت نظر - عدد تصادفی نیست: این آستانه‌ای است که زیر آن پلتفرم علاقه را عادی می‌داند. نظرات را به صورت بخش‌های کوچک از طریق جلسات مختلف جمع‌آوری کنید به جای اینکه تمام فید را در یک بار بکشید.
  4. ریتم انسانی را حفظ کنید. وقفه‌های تصادفی، سرعت ناهماهنگ انتقال، توالی طبیعی (کارت → نظرات → برگشت به نتایج) ارزان‌تر از چرخش هزار آدرس در صف درخواست‌ها است.
  5. کاهش کیفیت را نظارت کنید، نه فقط خطاها را. خطرناک‌ترین جنبه رویکرد آمازون این است که به شما ۴۰۳ نمی‌دهد. به شما HTTP 200 با محتوای کاهش‌یافته می‌دهد. پارسری که فقط کد پاسخ را بررسی می‌کند، ماه‌ها به درستی هشت نظر از سه هزار را در پایگاه داده ثبت می‌کند و هیچ سیگنال هشدار دهنده‌ای ارسال نمی‌کند. بررسی کامل بودن را اضافه کنید: تعداد عناصر، وجود صفحه‌بندی، حضور بلوک فیلترها.
  6. ذخیره‌سازی را در نظر بگیرید. بر اساس داده‌های تحقیق State of Web Scraping 2026 (Apify و The Web Scraping Club)، ۶۵.۸٪ از متخصصان بیشتر از سال گذشته پروکسی استفاده کرده‌اند و ۵۸.۳٪ بودجه‌ها را افزایش داده‌اند - در حالی که قیمت‌ها برای هر گیگابایت به طور کلی کاهش یافته است. آنچه افزایش می‌یابد، نه قیمت، بلکه حجم و پیچیدگی مورد نیاز است. ۴۳.۱٪ از تیم‌ها در حال حاضر ۲-۳ تأمین‌کننده را برای اطمینان از پایداری نگه می‌دارند.

به‌طور جداگانه، باید به روند معکوس توجه کنید: در حالی که برخی از پلتفرم‌ها فیلترها را پنهان می‌کنند، صنعت سعی در قانونی کردن «ربات‌های خوب» دارد - از طریق امضای رمزنگاری درخواست‌ها و شناسایی واضح نماینده. چگونگی این کار را در مقاله‌ای درباره Web Bot Auth و نماینده‌های امضا شده بررسی کرده‌ایم. مشکل این است که نماینده امضا شده به طور پیش‌فرض خود را به پلتفرم تسلیم می‌کند: آمازون با کمال میل می‌فهمد که با رباتی مواجه است - و رد می‌کند.

چه کسانی در ماه‌های آینده تحت تأثیر قرار خواهند گرفت

کاهش آرام نتایج به جای مسدودیت صادقانه - روشی است که به راحتی قابل کپی‌برداری است. احتمالاً ما این را در سایر پلتفرم‌ها خواهیم دید: این روش ارزان‌تر از کپچا است، معیارهای نرخ خروج را خراب نمی‌کند و به اسکرپر سیگنال واضحی نمی‌دهد که او شناسایی شده است.

بیشترین خطر در سناریوهایی وجود دارد که در آن‌ها کامل بودن داده‌ها مهم است، نه فقط واقعیت دسترسی: تحلیل نظرات برای تحلیل محصولات، نظارت بر شهرت، آموزش مدل‌ها بر روی محتوای کاربر، و اطلاعات رقابتی فروشندگان. اگر شما با یک بازار کار می‌کنید، مفید است که شیوه‌های پایه‌ای دور زدن فیلترها را دوباره مرور کنید - به عنوان مثال، تجزیه و تحلیل ما درباره ضد ربات آمازون در هنگام استخراج قیمت‌ها - و به آن‌ها بررسی کامل بودن پاسخ را اضافه کنید.

این موضوع همچنین شامل افراد عادی می‌شود. کاربری که به عنوان ربات شناسایی شده است، دقیقاً همان عملکردی را که برای آن به بازار آمده بود، از دست می‌دهد: امکان خواندن آنچه درباره محصول نوشته شده است. نه هشدار، نه توضیح، نه زمان مشخصی برای بازگشت - فقط یک نامه به پشتیبانی و پنج روز کاری انتظار.

نتیجه‌گیری

اوت ۲۰۲۶ یک دوراهی را ثبت کرد. دادگاه ناحیه نهم به طور مؤثر گفت: نماینده‌ای که به دستور انسان عمل می‌کند، یک انسان است و نمی‌توان او را تحت قانون سوءاستفاده‌های کامپیوتری قرار داد. پلتفرم‌ها این پاسخ را درک کردند و مبارزه را به جایی منتقل کردند که تصمیمات بدون دادگاه اتخاذ می‌شود - به فیلترهای رفتاری خودشان. آسیب جانبی به شکل خریداران واقعی با محدودیت هشت نظر، به نظر می‌رسد که آمازون را به طور متوسط نگران کرده است.

نتیجه برای عمل ساده است: زیرساخت جمع‌آوری داده‌ها دیگر به عنوان یک مسئله «یافتن IP خوب» نیست. IP خوب یک بلیت ورودی است و سپس شما بر اساس رفتار و میزان درخواست‌های خود ارزیابی می‌شوید. بودجه، عمق درخواست‌ها و کنترل کامل بودن پاسخ را بر اساس این برنامه‌ریزی کنید - و نه تنها بررسی کنید که داده‌ها آمده‌اند، بلکه بررسی کنید که آیا به اندازه کافی آمده‌اند یا خیر.

```