← بازگشت به وبلاگ

مقایسه LLM و CSS-سِلکتورها برای پارسینگ: قیمت و اعتبار در سال ۲۰۲۶

ما سه روش استخراج داده‌ها را در هنگام پارس کردن مقایسه می‌کنیم: انتخاب‌گرهای CSS/XPath، استخراج LLM و هیبریدی که در آن مدل انتخاب‌گرها را می‌نویسد. هزینه ۱۰۰۰ صفحه را بر اساس قیمت‌های Gemini و Claude در اکتبر ۲۰۲۶ محاسبه می‌کنیم، ریسک داده‌های ساختگی را بررسی می‌کنیم و توضیح می‌دهیم که چرا مدل در مصرف ترافیک پروکسی صرفه‌جویی نمی‌کند.

📅۹ مهر ۱۴۰۵
مقایسه LLM و CSS-سِلکتورها برای پارسینگ: قیمت و اعتبار در سال ۲۰۲۶

پارسر بر اساس انتخابگرهای CSS زمانی که سایت طراحی خود را تغییر می‌دهد، خراب می‌شود. پارسر بر اساس LLM خراب نمی‌شود، اما برای هر صفحه هزینه‌ای دریافت می‌کند. در سال 2026، انتخاب بین این دو دیگر به سلیقه مربوط نمی‌شود: قیمت مدل‌ها به ده‌ها برابر متفاوت شده است و یک صفحه می‌تواند بسته به اینکه چه چیزی به مدل ارسال کرده‌اید، ۳۰۰۰ یا ۲۰۰۰۰ توکن هزینه داشته باشد. در زیر مقایسه سه رویکرد از نظر هزینه، قابلیت اطمینان و ترافیک پروکسی، با محاسبه برای ۱۰۰۰ و یک میلیون صفحه آورده شده است.

خلاصه: چه چیزی را انتخاب کنیم

  • انتخابگرها (CSS/XPath) — یک الگوی صفحات، حجم‌های بزرگ، طراحی پایدار. هزینه استخراج نزدیک به صفر است، اما پشتیبانی بر عهده توسعه‌دهنده است.
  • استخراج LLM — سایت‌های مختلف، طراحی ناپایدار، وظایف یک‌باره. برای هر صفحه هزینه توکن پرداخت می‌کنید و باید پاسخ را اعتبارسنجی کنید.
  • هیبرید — LLM یک بار انتخابگرها را می‌نویسد، سپس انتخابگرها کار می‌کنند و مدل فقط زمانی فراخوانی می‌شود که اعتبارسنجی داده‌ها شکست بخورد. برای اکثر پارسرهای دائمی، این بهترین گزینه است.

معیارهای مقایسه

ما پنج مورد را مقایسه می‌کنیم که واقعاً بر هزینه نهایی و کیفیت داده‌ها تأثیر می‌گذارند:

  1. هزینه استخراج برای ۱۰۰۰ صفحه؛
  2. رفتار در هنگام تغییر طراحی؛
  3. دقت و ریسک مقادیر ساختگی؛
  4. سرعت و تأخیر؛
  5. مصرف ترافیک پروکسی — همانطور که خواهید دید، تقریباً به انتخاب روش بستگی ندارد.

هزینه استخراج LLM: محاسبه بر اساس قیمت‌ها در اکتبر ۲۰۲۶

قیمت‌های رسمی برای یک میلیون توکن (ورودی / خروجی) در تعرفه استاندارد:

  • Gemini 2.5 Flash-Lite — $۰.۱۰ / $۰.۴۰؛
  • Gemini 3.1 Flash-Lite — $۰.۲۵ / $۱.۵۰؛
  • Claude Haiku 4.5 — $۱ / $۵؛
  • Gemini 3.5 Flash — $۱.۵۰ / $۹.

گوگل و Anthropic دارای Batch API با تخفیف ۵۰٪ برای ورودی و خروجی هستند — برای پارسینگ که پاسخ فوری نیاز ندارد، این اولین اهرم صرفه‌جویی است.

متغیر اصلی — نه مدل، بلکه چیزی است که شما به آن ارسال می‌کنید

صفحه HTML خام هنگام ارسال به مدل معمولاً ۱۰–۴۰ هزار توکن را اشغال می‌کند. Cloudflare با راه‌اندازی قابلیت Markdown for Agents، مثالی ارائه داد: یک ویدیوی بلاگ یکسان ۱۶۱۸۰ توکن در HTML و ۳۱۵۰ توکن در Markdown وزن دارد — کاهش ۸۰٪. اندازه‌گیری‌های دیگر در مورد اخبار، مستندات و کارت‌های محصولات کاهش بین ۶۷ تا ۹۴٪ را نشان می‌دهد.

برای محاسبه فرضیات را در نظر می‌گیریم: صفحه خام — ۲۰۰۰۰ توکن، پاک‌شده به Markdown — ۳۰۰۰، به علاوه ۵۰۰ توکن برای دستورالعمل و طرح، در خروجی ۳۰۰ توکن JSON. برای ۱۰۰۰ صفحه به نتایج زیر می‌رسیم:

مدلHTML خام (۲۰.۵ میلیون ورودی)Markdown (۳.۵ میلیون ورودی)
Gemini 2.5 Flash-Lite≈ $۲.۱۷≈ $۰.۴۷
Gemini 3.1 Flash-Lite≈ $۵.۵۸≈ $۱.۳۳
Claude Haiku 4.5≈ $۲۲.۰۰≈ $۵.۰۰
Gemini 3.5 Flash≈ $۳۳.۴۵≈ $۷.۹۵

اختلاف — ۷۰ برابر بین بدترین و بهترین گزینه در نتیجه یکسان. دو سوم این تفاوت به پاک‌سازی ورودی مربوط می‌شود، نه انتخاب مدل. در یک میلیون صفحه در ماه، این یا حدود $۴۷۰ است، یا بیش از $۳۳,۰۰۰.

یک نکته دیگر: مدل‌های Claude از نسخه ۴.۷ به بعد از توکنایزر جدیدی استفاده می‌کنند که به گفته Anthropic، حدود ۳۰٪ توکن بیشتری برای همان متن تولید می‌کند. هنگام مقایسه صورتحساب‌های نسل‌های مختلف مدل‌ها، این نکته را در نظر داشته باشید — Haiku 4.5 بر روی توکنایزر قدیمی کار می‌کند.

انتخابگرها: تقریباً رایگان، تا زمانی که سایت تغییر نکند

اجرای انتخابگر CSS یا XPath بر روی صفحه‌ای که قبلاً دانلود شده است، کسری از میلی‌ثانیه از پردازنده را هزینه دارد. در راهنمای ScrapingBee، ارزیابی به این صورت است: در طراحی پایدار، یک انتخابگر معمولی تقریباً ۱۰ برابر ارزان‌تر و سریع‌تر از استخراج LLM است. در عمل، تفاوت حتی بیشتر است، زیرا انتخابگر هیچ درخواست شبکه‌ای به API مدل ندارد.

هزینه انتخابگرها — در پشتیبانی:

  • اگر سایت کلاس را تغییر دهد یا بلوک را در div جدیدی بپیچد — پارسر به آرامی فیلدهای خالی را برمی‌گرداند؛
  • آزمون‌های A/B الگوهای مختلفی را به بازدیدکنندگان مختلف نشان می‌دهند و برخی صفحات پارس نمی‌شوند؛
  • در ۵۰ سایت مختلف، شما ۵۰ مجموعه انتخابگر را پشتیبانی می‌کنید.

خطرناک‌ترین سناریو — نه سقوط، بلکه فساد آرام داده‌ها: انتخابگر عنصر مجاور را می‌گیرد و قیمت قدیمی به جای قیمت فعلی به پایگاه داده نوشته می‌شود.

LLM: به طراحی پایدار است، اما می‌تواند اختراع کند

مدل‌ها به مسیر دقیق به عنصر نیاز ندارند — آن‌ها «قیمت» را بر اساس معنا جستجو می‌کنند. این مشکل کلاس‌های نام‌گذاری شده و الگوهای مختلف را حل می‌کند. اما سه نوع خطای رایج بوجود می‌آید که همه کسانی که چنین پارسرهایی را در تولید اجرا کرده‌اند، توصیف می‌کنند:

  • مقادیر اختراعی — مدل «حدس می‌زند» قیمت یا شماره‌ای که در صفحه وجود ندارد؛
  • فیلدهای از دست رفته — بخشی از داده‌ها استخراج نشده است؛
  • انحراف ساختار — رشته به جای عدد، نام کلید متفاوت.

محافظت الزامی است: طرح پاسخ دقیق، اعتبارسنجی (برای مثال، Pydantic)، temperature = 0 و تکرار در صورت خطا. دمای صفر پراکندگی را کاهش می‌دهد، اما توهمات را به طور کامل از بین نمی‌برد. برای قیمت‌ها و موجودی‌ها، منطقی است که بررسی «آیا مقدار واقعاً در متن صفحه وجود دارد» را اضافه کنید.

تأخیر نیز بیشتر است: به زمان بارگذاری صفحه از طریق پروکسی، پاسخ مدل اضافه می‌شود — از کسری از ثانیه تا چند ثانیه. برای نظارت روزانه این مهم نیست، اما برای پیگیری افت‌ها — بحرانی است.

هیبرید: LLM انتخابگرها را می‌نویسد، نه داده‌ها را استخراج می‌کند

راه سوم به طور مستقیم توسط کتابخانه‌های محبوب پشتیبانی می‌شود. در Crawl4AI، یک قابلیت تولید طرح وجود دارد: مدل یک بار به نمونه‌های HTML نگاه می‌کند و مجموعه‌ای از انتخابگرهای CSS/XPath را برمی‌گرداند، پس از آن استخراج بدون فراخوانی LLM انجام می‌شود. در مستندات تأکید شده است که این یک هزینه یک‌باره است و می‌توان طرح را بدون محدودیت دوباره استفاده کرد؛ با چند نمونه، مدل اغلب انتخابگرهای پایدارتر را بر اساس ویژگی‌ها به جای موقعیت‌های شکننده مانند nth-child انتخاب می‌کند.

طرح کاری هیبرید:

  1. LLM انتخابگرها را بر اساس ۳–۵ نمونه از صفحات یک الگو تولید می‌کند.
  2. پارسر بر اساس انتخابگرها کار می‌کند، هر ورودی را اعتبارسنجی می‌کند: فیلدها در محل، نوع‌ها صحیح، قیمت در محدوده معقول.
  3. اگر سهم ورودی‌های نامعتبر از آستانه (مثلاً ۲–۵٪) فراتر رفت، صفحه به استخراج LLM می‌رود و طرح برای تولید مجدد می‌رود.
  4. طرح جدید بر روی نمونه کنترل اجرا می‌شود و تنها پس از آن جایگزین قدیمی می‌شود.

به این ترتیب، شما فقط در زمان تغییر طراحی برای مدل هزینه می‌کنید، نه برای هر یک از یک میلیون صفحه.

جدول خلاصه

معیارانتخابگرهااستخراج LLMهیبرید
هزینه استخراجحدود صفر$۰.۵–۳۳ برای ۱۰۰۰ صفحه.حدود صفر + فراخوانی‌های یک‌باره
تغییر طراحیخراب می‌شود، اغلب به آرامیمعمولاً دوام می‌آوردبه طور خودکار تعمیر می‌شود
ریسک داده‌های اختراعیوجود ندارد (اما «عنصر نادرست» وجود دارد)وجود دارد، نیاز به اعتبارسنجیحداقل
سرعتحداکثر+ پاسخ مدل برای هر صفحهمانند انتخابگرها
سایت‌های مختلفهزینه بالا در پشتیبانینقطه قوتخوب، طرح برای هر الگو
ترافیک پروکسییکسان — مدل تعداد بایت‌های دانلود شده را کاهش نمی‌دهد

درباره پروکسی: LLM ترافیک را صرفه‌جویی نمی‌کند

یک اشتباه رایج در محاسبات — این است که فکر کنید پارسر «هوشمند» در شبکه ارزان‌تر است. نه: تبدیل HTML به Markdown پس از دانلود انجام می‌شود، بنابراین صفحه کامل در هر روش استخراج از طریق پروکسی عبور می‌کند. استثنا — سایت‌هایی که مالک خود Markdown را بر اساس هدر Accept: text/markdown فعال کرده است (مانند قابلیت Cloudflare)، اما این تصمیم سایت است، نه شما.

برای مقیاس: با وزن HTML ۲۰۰ کیلوبایت بدون تصاویر، ۱۰۰۰ صفحه حدود ۰.۲ گیگابایت است، یا تقریباً $۰.۵۴ برای پروکسی‌های مسکونی با قیمت $۲.۷۰ برای هر گیگابایت. با جدول بالا مقایسه کنید: هنگام ارسال HTML خام به Claude Haiku 4.5، هزینه مدل ۴۰ برابر بیشتر از هزینه پروکسی خواهد بود، و هنگام استفاده از Markdown و Flash-Lite، آن‌ها قابل مقایسه هستند. اگر صفحات را با مرورگر بدون سر رندر می‌کنید، ترافیک به شدت افزایش می‌یابد — اندازه‌گیری‌هایی در مقایسه ما مصرف ترافیک Playwright، Puppeteer و requests برای ۱۰۰۰ صفحه وجود دارد.

چیزی که واقعاً بر ترافیک در هر روش تأثیر می‌گذارد:

  • تصاویر، فونت‌ها و تحلیل‌ها را دانلود نکنید، اگر نیاز نیست؛
  • به دنبال API داخلی JSON به جای HTML باشید؛
  • تکرارهای غیرضروری انجام ندهید: هر بن و تلاش مجدد — بایت‌های پرداخت شده است. برای جزئیات بیشتر در مورد اینکه چرا قیمت هر گیگابایت فریبنده است، به تحلیل هزینه واقعی یک رکورد موفق مراجعه کنید.

برای کاتالوگ‌های ساده بدون حفاظت سخت ضد ربات، پروکسی‌های دیتاسنتر با قیمت $۱.۵۰ برای هر گیگابایت کافی است؛ پروکسی‌های مسکونی در جاهایی که IP ها در ورودی محدود می‌شوند، مورد نیاز هستند.

توصیه‌ها برای سناریوها

  • نظارت بر قیمت‌های یک تا سه بازار، صدها هزار کارت. هیبرید یا انتخابگرهای خالص با اعتبارسنجی. LLM را فقط برای تولید مجدد طرح متصل کنید.
  • جمع‌آوری داده‌ها از صدها سایت مختلف (لیست‌ها، شغل‌ها، تماس‌ها). استخراج LLM به Markdown از طریق مدل ارزان در حالت batch. بدون طرح دقیق و اعتبارسنجی اجرا نشود.
  • تحقیق یک‌باره بر روی چند هزار صفحه. LLM: با چند دلار، روزها را در نوشتن انتخابگرها صرفه‌جویی می‌کنید.
  • داده‌هایی که خطا هزینه دارد (قیمت‌ها برای قیمت‌گذاری مجدد، موجودی‌ها). انتخابگرها یا هیبرید به علاوه تطبیق مقدار با متن اصلی صفحه.
  • RAG و پایگاه‌های دانش. در اینجا به ساختار نیاز نیست، بلکه متن خالص مورد نیاز است: تبدیل به Markdown بدون استخراج فیلدها، مدل — فقط در مرحله پاسخ.

نتیجه‌گیری

استخراج LLM انتخابگرها را جایگزین نکرده است، بلکه نقطه انتخاب را تغییر داده است. ارزان‌ترین گزینه — هیبرید: مدل انتخابگرها را می‌نویسد و تعمیر می‌کند، نه اینکه هر صفحه را بخواند. اگر بدون مدل در هر صفحه نمی‌توانید کار کنید، ابتدا ورودی را به Markdown پاک کنید و از batch استفاده کنید: این دو مرحله هزینه را ۵–۱۰ برابر کاهش می‌دهد قبل از اینکه شروع به انتخاب مدل کنید. و به یاد داشته باشید که ترافیک پروکسی به روش استخراج بستگی ندارد: باید در آنچه که دانلود می‌کنید صرفه‌جویی کنید، نه در آنچه که تجزیه می‌کنید.