← العودة إلى المدونة

LLM أو محددات CSS للتجميع: مقارنة الأسعار والموثوقية في 2026

نقارن بين ثلاث طرق لاستخراج البيانات عند التحليل: محددات CSS/XPath، استخراج LLM، والهجين، حيث تكتب النموذج المحددات. نحسب تكلفة 1000 صفحة وفقًا لأسعار Gemini وClaude في أكتوبر 2026، ونحلل مخاطر البيانات الوهمية ونشرح لماذا لا يوفر النموذج حركة مرور الوكيل.

📅٢٠ ربيع الآخر ١٤٤٨ هـ
LLM أو محددات CSS للتجميع: مقارنة الأسعار والموثوقية في 2026

يتعطل المحلل القائم على محددات CSS عندما يغير الموقع تصميمه. بينما لا يتعطل المحلل القائم على LLM، لكنه يتقاضى رسومًا عن كل صفحة. في عام 2026، توقف الاختيار بينهما عن كونه مسألة ذوق: أسعار النماذج تباعدت بشكل كبير، وقد تكلف نفس الصفحة 3000 أو 20000 توكن اعتمادًا على ما أرسلته إلى النموذج. أدناه - مقارنة بين ثلاثة نهج من حيث التكلفة والموثوقية وحركة مرور البروكسي، مع حساب 1000 ومليون صفحة.

باختصار: ماذا تختار

  • المحددات (CSS/XPath) - نموذج واحد للصفحات، أحجام كبيرة، تصميم مستقر. تكلفة الاستخراج قريبة من الصفر، لكن الدعم يقع على عاتق المطور.
  • استخراج LLM - العديد من المواقع المختلفة، تصميم غير مستقر، مهام لمرة واحدة. تدفع مقابل التوكنات على كل صفحة ويجب عليك التحقق من صحة الرد.
  • هجينة - يقوم LLM بكتابة المحددات مرة واحدة، ثم تعمل المحددات، ويتم استدعاء النموذج فقط عندما تفشل التحقق من البيانات. بالنسبة لمعظم المحللين الدائمين، هذا هو الخيار الأمثل.

معايير المقارنة

نقارن بناءً على خمسة نقاط تؤثر فعليًا على التكلفة النهائية وجودة البيانات:

  1. تكلفة الاستخراج لكل 1000 صفحة؛
  2. السلوك عند تغيير التصميم؛
  3. الدقة وخطر القيم المختلقة؛
  4. السرعة والتأخير؛
  5. استهلاك حركة مرور البروكسي - كما سترون، لا يعتمد تقريبًا على اختيار الطريقة.

كم يكلف استخراج LLM: نحسب وفقًا للأسعار في أكتوبر 2026

الأسعار الرسمية لكل مليون توكن (دخول / خروج) على التعرفة القياسية:

  • Gemini 2.5 Flash-Lite - 0.10 دولار / 0.40 دولار؛
  • Gemini 3.1 Flash-Lite - 0.25 دولار / 1.50 دولار؛
  • Claude Haiku 4.5 - 1 دولار / 5 دولارات؛
  • Gemini 3.5 Flash - 1.50 دولار / 9 دولارات.

لدى Google وAnthropic واجهة برمجة تطبيقات Batch مع خصم 50% على الدخول والخروج - للاستخراج حيث لا تحتاج إلى الرد على الفور، هذه هي أول وسيلة للتوفير.

المتغير الرئيسي - ليس النموذج، بل ما ترسله إليه

عادةً ما تأخذ صفحة HTML الخام عند إرسالها إلى النموذج 10-40 ألف توكن. قدمت Cloudflare، عند إطلاق وظيفة Markdown for Agents، مثالاً: نفس مشاركة المدونة تزن 16,180 توكن في HTML و3,150 توكن في Markdown - أي خصم بنسبة 80%. تعطي قياسات أخرى للأخبار، الوثائق وبطاقات المنتجات تقليصًا من 67 إلى 94%.

للحساب، دعونا نفترض: الصفحة الخام - 20,000 توكن، المنظفة إلى Markdown - 3,000، بالإضافة إلى 500 توكن للتعليمات والمخطط، على الخروج 300 توكن JSON. على 1000 صفحة نحصل على:

النموذجHTML الخام (20.5 مليون دخول)Markdown (3.5 مليون دخول)
Gemini 2.5 Flash-Lite≈ 2.17 دولار≈ 0.47 دولار
Gemini 3.1 Flash-Lite≈ 5.58 دولار≈ 1.33 دولار
Claude Haiku 4.5≈ 22.00 دولار≈ 5.00 دولارات
Gemini 3.5 Flash≈ 33.45 دولار≈ 7.95 دولارات

الفارق - 70 مرة بين أسوأ وأفضل خيار مع نفس النتيجة. ثلثا هذه الفجوة تأتي من تنظيف المدخلات، وليس من اختيار النموذج. على مليون صفحة في الشهر، هذا إما حوالي 470 دولارًا، أو أكثر من 33,000 دولار.

تفصيل آخر: تستخدم نماذج Claude بدءًا من الإصدار 4.7 مُرمز توكن جديد، والذي، وفقًا لبيانات Anthropic، يعطي حوالي 30% المزيد من التوكنات لنفس النص. عند مقارنة الفواتير بين أجيال مختلفة من النماذج، ضع ذلك في الاعتبار - Haiku 4.5 يعمل على المُرمز القديم.

المحددات: تقريبًا مجانًا، حتى يتغير الموقع

تنفيذ محدد CSS أو XPath على صفحة تم تنزيلها بالفعل يكلف جزءًا من مللي ثانية من وحدة المعالجة المركزية. في دليل ScrapingBee، التقييم هو: على تصميم مستقر، يكون المحدد العادي أرخص وأسرع بحوالي 10 مرات من استخراج LLM. في الممارسة العملية، الفارق أكبر، لأن المحدد لا يحتاج إلى طلب شبكة إلى واجهة برمجة تطبيقات النموذج.

تكلفة المحددات - في الدعم:

  • إذا أعاد الموقع تسمية الفئة أو غلف الكتلة في div جديد - يقوم المحلل بإرجاع حقول فارغة بصمت؛
  • تظهر اختبارات A/B نماذج مختلفة لزوار مختلفين، ولا يتم تحليل جزء من الصفحات؛
  • على 50 موقعًا مختلفًا، تدعم 50 مجموعة من المحددات.

السيناريو الأكثر خطورة - ليس الفشل، بل الفساد الهادئ للبيانات: يلتقط المحدد عنصرًا مجاورًا، ويكتب السعر القديم في قاعدة البيانات بدلاً من السعر الحالي لأسابيع.

LLM: مقاوم للتصميم، لكنه يمكن أن يخترع

لا يحتاج النموذج إلى مسار دقيق إلى العنصر - يبحث عن "السعر" حسب المعنى. هذا يحل مشكلة الفئات المعاد تسميتها والنماذج المختلفة. لكن تظهر ثلاثة أنواع نموذجية من الأخطاء التي يصفها كل من قام بتشغيل مثل هذه المحللات في الإنتاج:

  • قيم مختلقة - "يخمن" النموذج السعر أو الرقم المرجعي الذي لا يوجد في الصفحة؛
  • حقول مفقودة - لم يتم استخراج جزء من البيانات؛
  • انحراف الهيكل - سلسلة بدلاً من رقم، اسم مفتاح مختلف.

الحماية ضرورية: مخطط صارم للرد، تحقق من الصحة (مثل Pydantic)، درجة الحرارة = 0 وإعادة المحاولة عند الخطأ. تقلل درجة الحرارة الصفرية من التباين، لكنها لا تزيل الهلوسات تمامًا. من المنطقي إضافة تحقق "القيمة موجودة بالفعل في نص الصفحة" للأسعار والمخزونات.

التأخير أيضًا أعلى: يضاف وقت تحميل الصفحة عبر البروكسي إلى رد النموذج - من أجزاء من الثانية إلى عدة ثوانٍ. بالنسبة للمراقبة مرة واحدة في اليوم، هذا ليس مهمًا، لكن لمراقبة الانخفاضات - هذا حاسم.

هجينة: LLM يكتب المحددات، وليس يستخرج البيانات

يدعم الطريق الثالث مباشرة المكتبات الشهيرة. في Crawl4AI، هناك وظيفة لتوليد المخطط: ينظر النموذج مرة واحدة إلى عينات HTML ويعيد مجموعة من محددات CSS/XPath، بعد ذلك يتم الاستخراج بدون استدعاءات LLM. يتم التأكيد في الوثائق على أن هذه تكلفة لمرة واحدة، ويمكن إعادة استخدام المخطط بدون قيود؛ عند وجود عدة عينات، غالبًا ما يختار النموذج محددات أكثر استقرارًا بناءً على السمات بدلاً من المحددات الهشة الموضعية مثل nth-child.

المخطط العملي للهجين:

  1. يقوم LLM بتوليد المحددات بناءً على 3-5 عينات من صفحات نموذج واحد.
  2. يعمل المحلل على المحددات، ويتحقق كل سجل من قبل المدقق: الحقول في مكانها، الأنواع صحيحة، السعر في نطاق معقول.
  3. إذا تجاوزت نسبة السجلات غير الصالحة العتبة (دعنا نقول، 2-5%)، تذهب الصفحة إلى استخراج LLM، ويتم إعادة توليد المخطط.
  4. يتم تشغيل المخطط الجديد على عينة تحكم وفقط بعد ذلك يستبدل القديم.

بهذه الطريقة، تدفع للنموذج فقط في لحظات تغيير التصميم، وليس عن كل صفحة من مليون صفحة.

جدول ملخص

المعيارالمحدداتاستخراج LLMهجينة
تكلفة الاستخراجقريبة من الصفر0.5-33 دولار لكل 1000 صفحة.قريبة من الصفر + استدعاءات لمرة واحدة
تغيير التصميميتعطل، غالبًا بصمتعادةً ما يتحمليتم إصلاحه تلقائيًا
خطر البيانات المختلقةلا يوجد (لكن هناك "ليس العنصر الصحيح")يوجد، يحتاج إلى تحققحد أدنى
السرعةقصوى+ رد النموذج على كل صفحةمثل المحددات
الكثير من المواقع المختلفةمكلف في الدعمنقطة قوةجيد، مخطط لكل نموذج
حركة مرور البروكسيمتساوية - النموذج لا يقلل من البايتات المحملة

عن البروكسي: LLM لا يوفر حركة المرور

خطأ شائع في الحسابات هو الاعتقاد بأن المحلل "الذكي" أرخص في الشبكة. لا: يتم تحويل HTML إلى Markdown بعد التنزيل، لذلك تمر الصفحة الكاملة عبر البروكسي مع أي طريقة للاستخراج. الاستثناء هو المواقع التي قام مالكها بتفعيل تسليم Markdown بنفس عنوان Accept: text/markdown (كما في وظيفة Cloudflare)، لكن هذا قرار الموقع، وليس قرارك.

للمقياس: عند وزن HTML 200 كيلوبايت بدون صور، فإن 1000 صفحة - حوالي 0.2 غيغابايت، أو حوالي 0.54 دولار على البروكسيات السكنية بسعر 2.70 دولار لكل غيغابايت. قارن مع الجدول أعلاه: عند إرسال HTML الخام إلى Claude Haiku 4.5، ستكون فاتورة النموذج 40 مرة أكبر من فاتورة البروكسي، بينما عند استخدام Markdown وFlash-Lite تكون متقاربة. إذا كنت تقوم بتقديم الصفحات باستخدام متصفح بدون رأس، ستزداد حركة المرور بشكل كبير - هناك قياسات في مقارنتنا لاستهلاك حركة المرور باستخدام Playwright وPuppeteer وrequests على 1000 صفحة.

ما يؤثر فعليًا على حركة المرور مع أي طريقة:

  • عدم تحميل الصور، الخطوط والتحليلات إذا لم تكن ضرورية؛
  • البحث عن واجهة برمجة تطبيقات JSON الداخلية بدلاً من HTML؛
  • عدم القيام بتكرارات غير ضرورية: كل حظر وإعادة محاولة - هذه بايتات مدفوعة. لمزيد من التفاصيل حول لماذا تكلفة الغيغابايت مضللة، انظر تحليل التكلفة الحقيقية للسجل الناجح.

للكتالوجات البسيطة بدون حماية مضادة للبوت صارمة، يكفي البروكسيات من مراكز البيانات بسعر 1.50 دولار لكل غيغابايت؛ تحتاج إلى السكنية حيث يتم قطع IP الاستضافة عند الدخول.

توصيات للسيناريوهات

  • مراقبة الأسعار لواحد إلى ثلاثة أسواق، مئات الآلاف من البطاقات. هجينة أو محددات نقية مع مدقق. يتم توصيل LLM فقط لإعادة توليد المخطط.
  • جمع البيانات من مئات المواقع المتنوعة (العملاء، الوظائف، جهات الاتصال). استخراج LLM على Markdown من خلال نموذج رخيص في وضع الدفعة. لا تبدأ بدون مخطط صارم والتحقق.
  • بحث لمرة واحدة على عدة آلاف من الصفحات. LLM: مقابل بضعة دولارات، توفر أيامًا في كتابة المحددات.
  • البيانات التي تكون فيها الخطأ مكلفًا (أسعار لإعادة التسعير، المخزونات). محددات أو هجينة بالإضافة إلى التحقق من القيمة مع النص الأصلي للصفحة.
  • RAG وقواعد المعرفة. هنا تحتاج إلى نص نقي، وليس هيكل: تحويل إلى Markdown بدون استخراج الحقول، النموذج - فقط في مرحلة الرد.

الاستنتاج

لم يستبدل استخراج LLM المحددات، بل نقل نقطة الاختيار. الأرخص هو الهجين: النموذج يكتب ويصلح المحددات، وليس يقرأ كل صفحة. إذا لم يكن بالإمكان الاستغناء عن النموذج في كل صفحة، قم أولاً بتنظيف المدخلات إلى Markdown واستخدم الدفعة: هذان الخطوتان يقللان الفاتورة بمقدار 5-10 مرات قبل أن تبدأ في اختيار النموذج. وتذكر أن حركة مرور البروكسي لا تعتمد على طريقة الاستخراج: يجب توفيرها على ما تقوم بتحميله، وليس على كيفية تحليله.