پارسر بر اساس انتخابگرهای CSS زمانی که سایت طراحی خود را تغییر میدهد، خراب میشود. پارسر بر اساس LLM خراب نمیشود، اما برای هر صفحه هزینهای دریافت میکند. در سال 2026، انتخاب بین این دو دیگر به سلیقه مربوط نمیشود: قیمت مدلها به دهها برابر متفاوت شده است و یک صفحه میتواند بسته به اینکه چه چیزی به مدل ارسال کردهاید، ۳۰۰۰ یا ۲۰۰۰۰ توکن هزینه داشته باشد. در زیر مقایسه سه رویکرد از نظر هزینه، قابلیت اطمینان و ترافیک پروکسی، با محاسبه برای ۱۰۰۰ و یک میلیون صفحه آورده شده است.
خلاصه: چه چیزی را انتخاب کنیم
- انتخابگرها (CSS/XPath) — یک الگوی صفحات، حجمهای بزرگ، طراحی پایدار. هزینه استخراج نزدیک به صفر است، اما پشتیبانی بر عهده توسعهدهنده است.
- استخراج LLM — سایتهای مختلف، طراحی ناپایدار، وظایف یکباره. برای هر صفحه هزینه توکن پرداخت میکنید و باید پاسخ را اعتبارسنجی کنید.
- هیبرید — LLM یک بار انتخابگرها را مینویسد، سپس انتخابگرها کار میکنند و مدل فقط زمانی فراخوانی میشود که اعتبارسنجی دادهها شکست بخورد. برای اکثر پارسرهای دائمی، این بهترین گزینه است.
معیارهای مقایسه
ما پنج مورد را مقایسه میکنیم که واقعاً بر هزینه نهایی و کیفیت دادهها تأثیر میگذارند:
- هزینه استخراج برای ۱۰۰۰ صفحه؛
- رفتار در هنگام تغییر طراحی؛
- دقت و ریسک مقادیر ساختگی؛
- سرعت و تأخیر؛
- مصرف ترافیک پروکسی — همانطور که خواهید دید، تقریباً به انتخاب روش بستگی ندارد.
هزینه استخراج LLM: محاسبه بر اساس قیمتها در اکتبر ۲۰۲۶
قیمتهای رسمی برای یک میلیون توکن (ورودی / خروجی) در تعرفه استاندارد:
- Gemini 2.5 Flash-Lite — $۰.۱۰ / $۰.۴۰؛
- Gemini 3.1 Flash-Lite — $۰.۲۵ / $۱.۵۰؛
- Claude Haiku 4.5 — $۱ / $۵؛
- Gemini 3.5 Flash — $۱.۵۰ / $۹.
گوگل و Anthropic دارای Batch API با تخفیف ۵۰٪ برای ورودی و خروجی هستند — برای پارسینگ که پاسخ فوری نیاز ندارد، این اولین اهرم صرفهجویی است.
متغیر اصلی — نه مدل، بلکه چیزی است که شما به آن ارسال میکنید
صفحه HTML خام هنگام ارسال به مدل معمولاً ۱۰–۴۰ هزار توکن را اشغال میکند. Cloudflare با راهاندازی قابلیت Markdown for Agents، مثالی ارائه داد: یک ویدیوی بلاگ یکسان ۱۶۱۸۰ توکن در HTML و ۳۱۵۰ توکن در Markdown وزن دارد — کاهش ۸۰٪. اندازهگیریهای دیگر در مورد اخبار، مستندات و کارتهای محصولات کاهش بین ۶۷ تا ۹۴٪ را نشان میدهد.
برای محاسبه فرضیات را در نظر میگیریم: صفحه خام — ۲۰۰۰۰ توکن، پاکشده به Markdown — ۳۰۰۰، به علاوه ۵۰۰ توکن برای دستورالعمل و طرح، در خروجی ۳۰۰ توکن JSON. برای ۱۰۰۰ صفحه به نتایج زیر میرسیم:
| مدل | HTML خام (۲۰.۵ میلیون ورودی) | Markdown (۳.۵ میلیون ورودی) |
|---|---|---|
| Gemini 2.5 Flash-Lite | ≈ $۲.۱۷ | ≈ $۰.۴۷ |
| Gemini 3.1 Flash-Lite | ≈ $۵.۵۸ | ≈ $۱.۳۳ |
| Claude Haiku 4.5 | ≈ $۲۲.۰۰ | ≈ $۵.۰۰ |
| Gemini 3.5 Flash | ≈ $۳۳.۴۵ | ≈ $۷.۹۵ |
اختلاف — ۷۰ برابر بین بدترین و بهترین گزینه در نتیجه یکسان. دو سوم این تفاوت به پاکسازی ورودی مربوط میشود، نه انتخاب مدل. در یک میلیون صفحه در ماه، این یا حدود $۴۷۰ است، یا بیش از $۳۳,۰۰۰.
یک نکته دیگر: مدلهای Claude از نسخه ۴.۷ به بعد از توکنایزر جدیدی استفاده میکنند که به گفته Anthropic، حدود ۳۰٪ توکن بیشتری برای همان متن تولید میکند. هنگام مقایسه صورتحسابهای نسلهای مختلف مدلها، این نکته را در نظر داشته باشید — Haiku 4.5 بر روی توکنایزر قدیمی کار میکند.
انتخابگرها: تقریباً رایگان، تا زمانی که سایت تغییر نکند
اجرای انتخابگر CSS یا XPath بر روی صفحهای که قبلاً دانلود شده است، کسری از میلیثانیه از پردازنده را هزینه دارد. در راهنمای ScrapingBee، ارزیابی به این صورت است: در طراحی پایدار، یک انتخابگر معمولی تقریباً ۱۰ برابر ارزانتر و سریعتر از استخراج LLM است. در عمل، تفاوت حتی بیشتر است، زیرا انتخابگر هیچ درخواست شبکهای به API مدل ندارد.
هزینه انتخابگرها — در پشتیبانی:
- اگر سایت کلاس را تغییر دهد یا بلوک را در div جدیدی بپیچد — پارسر به آرامی فیلدهای خالی را برمیگرداند؛
- آزمونهای A/B الگوهای مختلفی را به بازدیدکنندگان مختلف نشان میدهند و برخی صفحات پارس نمیشوند؛
- در ۵۰ سایت مختلف، شما ۵۰ مجموعه انتخابگر را پشتیبانی میکنید.
خطرناکترین سناریو — نه سقوط، بلکه فساد آرام دادهها: انتخابگر عنصر مجاور را میگیرد و قیمت قدیمی به جای قیمت فعلی به پایگاه داده نوشته میشود.
LLM: به طراحی پایدار است، اما میتواند اختراع کند
مدلها به مسیر دقیق به عنصر نیاز ندارند — آنها «قیمت» را بر اساس معنا جستجو میکنند. این مشکل کلاسهای نامگذاری شده و الگوهای مختلف را حل میکند. اما سه نوع خطای رایج بوجود میآید که همه کسانی که چنین پارسرهایی را در تولید اجرا کردهاند، توصیف میکنند:
- مقادیر اختراعی — مدل «حدس میزند» قیمت یا شمارهای که در صفحه وجود ندارد؛
- فیلدهای از دست رفته — بخشی از دادهها استخراج نشده است؛
- انحراف ساختار — رشته به جای عدد، نام کلید متفاوت.
محافظت الزامی است: طرح پاسخ دقیق، اعتبارسنجی (برای مثال، Pydantic)، temperature = 0 و تکرار در صورت خطا. دمای صفر پراکندگی را کاهش میدهد، اما توهمات را به طور کامل از بین نمیبرد. برای قیمتها و موجودیها، منطقی است که بررسی «آیا مقدار واقعاً در متن صفحه وجود دارد» را اضافه کنید.
تأخیر نیز بیشتر است: به زمان بارگذاری صفحه از طریق پروکسی، پاسخ مدل اضافه میشود — از کسری از ثانیه تا چند ثانیه. برای نظارت روزانه این مهم نیست، اما برای پیگیری افتها — بحرانی است.
هیبرید: LLM انتخابگرها را مینویسد، نه دادهها را استخراج میکند
راه سوم به طور مستقیم توسط کتابخانههای محبوب پشتیبانی میشود. در Crawl4AI، یک قابلیت تولید طرح وجود دارد: مدل یک بار به نمونههای HTML نگاه میکند و مجموعهای از انتخابگرهای CSS/XPath را برمیگرداند، پس از آن استخراج بدون فراخوانی LLM انجام میشود. در مستندات تأکید شده است که این یک هزینه یکباره است و میتوان طرح را بدون محدودیت دوباره استفاده کرد؛ با چند نمونه، مدل اغلب انتخابگرهای پایدارتر را بر اساس ویژگیها به جای موقعیتهای شکننده مانند nth-child انتخاب میکند.
طرح کاری هیبرید:
- LLM انتخابگرها را بر اساس ۳–۵ نمونه از صفحات یک الگو تولید میکند.
- پارسر بر اساس انتخابگرها کار میکند، هر ورودی را اعتبارسنجی میکند: فیلدها در محل، نوعها صحیح، قیمت در محدوده معقول.
- اگر سهم ورودیهای نامعتبر از آستانه (مثلاً ۲–۵٪) فراتر رفت، صفحه به استخراج LLM میرود و طرح برای تولید مجدد میرود.
- طرح جدید بر روی نمونه کنترل اجرا میشود و تنها پس از آن جایگزین قدیمی میشود.
به این ترتیب، شما فقط در زمان تغییر طراحی برای مدل هزینه میکنید، نه برای هر یک از یک میلیون صفحه.
جدول خلاصه
| معیار | انتخابگرها | استخراج LLM | هیبرید |
|---|---|---|---|
| هزینه استخراج | حدود صفر | $۰.۵–۳۳ برای ۱۰۰۰ صفحه. | حدود صفر + فراخوانیهای یکباره |
| تغییر طراحی | خراب میشود، اغلب به آرامی | معمولاً دوام میآورد | به طور خودکار تعمیر میشود |
| ریسک دادههای اختراعی | وجود ندارد (اما «عنصر نادرست» وجود دارد) | وجود دارد، نیاز به اعتبارسنجی | حداقل |
| سرعت | حداکثر | + پاسخ مدل برای هر صفحه | مانند انتخابگرها |
| سایتهای مختلف | هزینه بالا در پشتیبانی | نقطه قوت | خوب، طرح برای هر الگو |
| ترافیک پروکسی | یکسان — مدل تعداد بایتهای دانلود شده را کاهش نمیدهد | ||
درباره پروکسی: LLM ترافیک را صرفهجویی نمیکند
یک اشتباه رایج در محاسبات — این است که فکر کنید پارسر «هوشمند» در شبکه ارزانتر است. نه: تبدیل HTML به Markdown پس از دانلود انجام میشود، بنابراین صفحه کامل در هر روش استخراج از طریق پروکسی عبور میکند. استثنا — سایتهایی که مالک خود Markdown را بر اساس هدر Accept: text/markdown فعال کرده است (مانند قابلیت Cloudflare)، اما این تصمیم سایت است، نه شما.
برای مقیاس: با وزن HTML ۲۰۰ کیلوبایت بدون تصاویر، ۱۰۰۰ صفحه حدود ۰.۲ گیگابایت است، یا تقریباً $۰.۵۴ برای پروکسیهای مسکونی با قیمت $۲.۷۰ برای هر گیگابایت. با جدول بالا مقایسه کنید: هنگام ارسال HTML خام به Claude Haiku 4.5، هزینه مدل ۴۰ برابر بیشتر از هزینه پروکسی خواهد بود، و هنگام استفاده از Markdown و Flash-Lite، آنها قابل مقایسه هستند. اگر صفحات را با مرورگر بدون سر رندر میکنید، ترافیک به شدت افزایش مییابد — اندازهگیریهایی در مقایسه ما مصرف ترافیک Playwright، Puppeteer و requests برای ۱۰۰۰ صفحه وجود دارد.
چیزی که واقعاً بر ترافیک در هر روش تأثیر میگذارد:
- تصاویر، فونتها و تحلیلها را دانلود نکنید، اگر نیاز نیست؛
- به دنبال API داخلی JSON به جای HTML باشید؛
- تکرارهای غیرضروری انجام ندهید: هر بن و تلاش مجدد — بایتهای پرداخت شده است. برای جزئیات بیشتر در مورد اینکه چرا قیمت هر گیگابایت فریبنده است، به تحلیل هزینه واقعی یک رکورد موفق مراجعه کنید.
برای کاتالوگهای ساده بدون حفاظت سخت ضد ربات، پروکسیهای دیتاسنتر با قیمت $۱.۵۰ برای هر گیگابایت کافی است؛ پروکسیهای مسکونی در جاهایی که IP ها در ورودی محدود میشوند، مورد نیاز هستند.
توصیهها برای سناریوها
- نظارت بر قیمتهای یک تا سه بازار، صدها هزار کارت. هیبرید یا انتخابگرهای خالص با اعتبارسنجی. LLM را فقط برای تولید مجدد طرح متصل کنید.
- جمعآوری دادهها از صدها سایت مختلف (لیستها، شغلها، تماسها). استخراج LLM به Markdown از طریق مدل ارزان در حالت batch. بدون طرح دقیق و اعتبارسنجی اجرا نشود.
- تحقیق یکباره بر روی چند هزار صفحه. LLM: با چند دلار، روزها را در نوشتن انتخابگرها صرفهجویی میکنید.
- دادههایی که خطا هزینه دارد (قیمتها برای قیمتگذاری مجدد، موجودیها). انتخابگرها یا هیبرید به علاوه تطبیق مقدار با متن اصلی صفحه.
- RAG و پایگاههای دانش. در اینجا به ساختار نیاز نیست، بلکه متن خالص مورد نیاز است: تبدیل به Markdown بدون استخراج فیلدها، مدل — فقط در مرحله پاسخ.
نتیجهگیری
استخراج LLM انتخابگرها را جایگزین نکرده است، بلکه نقطه انتخاب را تغییر داده است. ارزانترین گزینه — هیبرید: مدل انتخابگرها را مینویسد و تعمیر میکند، نه اینکه هر صفحه را بخواند. اگر بدون مدل در هر صفحه نمیتوانید کار کنید، ابتدا ورودی را به Markdown پاک کنید و از batch استفاده کنید: این دو مرحله هزینه را ۵–۱۰ برابر کاهش میدهد قبل از اینکه شروع به انتخاب مدل کنید. و به یاد داشته باشید که ترافیک پروکسی به روش استخراج بستگی ندارد: باید در آنچه که دانلود میکنید صرفهجویی کنید، نه در آنچه که تجزیه میکنید.
