CSS-चुनावकों पर पार्सर तब टूट जाता है जब साइट लेआउट बदलती है। LLM पर पार्सर नहीं टूटता, लेकिन हर पृष्ठ के लिए शुल्क लिया जाता है। 2026 में, उनके बीच का चयन स्वाद का मामला नहीं रहा: मॉडल की कीमतें कई गुना भिन्न हो गईं, और एक ही पृष्ठ की कीमत 3,000 या 20,000 टोकन हो सकती है, इस पर निर्भर करते हुए कि आपने मॉडल में क्या भेजा। नीचे - पैसे, विश्वसनीयता और प्रॉक्सी ट्रैफिक के लिए तीन दृष्टिकोणों की तुलना की गई है, 1,000 और एक मिलियन पृष्ठों के लिए गणना के साथ।
संक्षेप में: क्या चुनें
- चुनावक (CSS/XPath) - एक पृष्ठ का टेम्पलेट, बड़े वॉल्यूम, स्थिर लेआउट। निकासी की लागत लगभग शून्य है, लेकिन समर्थन डेवलपर पर निर्भर है।
- LLM-निकासी - कई विभिन्न साइटें, अस्थिर लेआउट, एक बार के कार्य। प्रत्येक पृष्ठ पर टोकन के लिए भुगतान करें और उत्तर को मान्य करना आवश्यक है।
- हाइब्रिड - LLM एक बार चुनावक लिखता है, आगे चुनावक काम करते हैं, और मॉडल केवल तब बुलाया जाता है जब डेटा की जांच विफल हो जाती है। अधिकांश स्थायी पार्सरों के लिए यह सबसे अच्छा विकल्प है।
तुलना के मानदंड
हम पांच बिंदुओं पर तुलना करते हैं, जो अंतिम बिल और डेटा की गुणवत्ता पर वास्तव में प्रभाव डालते हैं:
- 1,000 पृष्ठों पर निकासी की लागत;
- लेआउट बदलने पर व्यवहार;
- कल्पित मानों की सटीकता और जोखिम;
- गति और विलंब;
- प्रॉक्सी ट्रैफिक की खपत - यह, जैसा कि आप देखेंगे, विधि के चयन पर लगभग निर्भर नहीं करता।
LLM-निकासी की लागत: अक्टूबर 2026 के मूल्य निर्धारण के अनुसार गणना करें
मानक टैरिफ पर एक मिलियन टोकन (इनपुट / आउटपुट) के लिए आधिकारिक कीमतें:
- Gemini 2.5 Flash-Lite - $0.10 / $0.40;
- Gemini 3.1 Flash-Lite - $0.25 / $1.50;
- Claude Haiku 4.5 - $1 / $5;
- Gemini 3.5 Flash - $1.50 / $9.
Google और Anthropic के पास बैच एपीआई है जिसमें इनपुट और आउटपुट पर 50% छूट है - उन पार्सिंग के लिए जहां उत्तर तुरंत आवश्यक नहीं है, यह बचत का पहला साधन है।
मुख्य चर - मॉडल नहीं, बल्कि वह है जो आप इसे भेजते हैं
कच्चा HTML पृष्ठ आमतौर पर मॉडल में भेजने पर 10-40 हजार टोकन लेता है। Cloudflare ने एजेंटों के लिए Markdown फ़ंक्शन शुरू करते समय एक उदाहरण दिया: एक ही ब्लॉग पोस्ट HTML में 16,180 टोकन और Markdown में 3,150 टोकन है - 80% की कमी। समाचार, दस्तावेज़ और उत्पाद कार्ड के अन्य माप 67% से 94% तक की कमी दिखाते हैं।
गणना के लिए, हम मान लेते हैं: कच्चा पृष्ठ - 20,000 टोकन, Markdown में साफ किया गया - 3,000, साथ में 500 टोकन निर्देश और योजना के लिए, आउटपुट में 300 टोकन JSON। 1,000 पृष्ठों पर हमें मिलता है:
| मॉडल | कच्चा HTML (20.5 मिलियन इनपुट) | Markdown (3.5 मिलियन इनपुट) |
|---|---|---|
| Gemini 2.5 Flash-Lite | ≈ $2.17 | ≈ $0.47 |
| Gemini 3.1 Flash-Lite | ≈ $5.58 | ≈ $1.33 |
| Claude Haiku 4.5 | ≈ $22.00 | ≈ $5.00 |
| Gemini 3.5 Flash | ≈ $33.45 | ≈ $7.95 |
बुरा और अच्छा विकल्प के बीच 70 गुना का अंतर है जब परिणाम समान होता है। इस अंतर का दो तिहाई हिस्सा इनपुट की सफाई से आता है, न कि मॉडल के चयन से। एक महीने में एक मिलियन पृष्ठों के लिए, यह या तो लगभग $470 है, या $33,000 से अधिक।
एक और विवरण: Claude मॉडल 4.7 से नए टोकनाइज़र का उपयोग करते हैं, जो Anthropic के अनुसार, समान पाठ पर लगभग 30% अधिक टोकन देता है। विभिन्न पीढ़ियों के मॉडल के बिलों की तुलना करते समय इसे ध्यान में रखें - Haiku 4.5 पुराने टोकनाइज़र पर काम करता है।
चुनावक: लगभग मुफ्त, जब तक साइट नहीं बदलती
पहले से डाउनलोड की गई पृष्ठ पर CSS या XPath चुनावक का निष्पादन प्रोसेसर के एक अंश का समय लेता है। ScrapingBee के मार्गदर्शिका में यह मूल्यांकन है: स्थिर लेआउट पर सामान्य चुनावक LLM-निकासी की तुलना में लगभग 10 गुना सस्ता और तेज है। प्रैक्टिकल में, अंतर और भी अधिक है, क्योंकि चुनावक के पास मॉडल एपीआई के लिए कोई नेटवर्क अनुरोध नहीं होता।
चुनावकों की कीमत - समर्थन में है:
- यदि साइट ने वर्ग का नाम बदल दिया या ब्लॉक को नए div में लपेट दिया - पार्सर चुपचाप खाली फ़ील्ड लौटाता है;
- A/B परीक्षण विभिन्न आगंतुकों को विभिन्न टेम्पलेट दिखाते हैं, और कुछ पृष्ठ पार्स नहीं होते;
- 50 विभिन्न साइटों पर आप 50 चुनावक सेट का समर्थन करते हैं।
सबसे खतरनाक परिदृश्य - गिरावट नहीं, बल्कि डेटा का चुपचाप खराब होना है: चुनावक पड़ोसी तत्व को पकड़ता है, और डेटाबेस में हफ्तों तक पुरानी कीमत लिखी जाती है बजाय वर्तमान के।
LLM: लेआउट के प्रति स्थिर, लेकिन कल्पना करने में सक्षम
मॉडल को तत्व के लिए सटीक पथ की आवश्यकता नहीं है - यह अर्थ के अनुसार "कीमत" की खोज करता है। यह पुनः नामित वर्गों और विभिन्न टेम्पलेट्स की समस्या को हल करता है। लेकिन तीन प्रकार की विफलताएँ आती हैं, जिन्हें सभी ने उन पार्सरों को चलाने के दौरान अनुभव किया है:
- कल्पित मान - मॉडल "अनुमान" लगाता है कि कीमत या आर्टिकल पृष्ठ पर नहीं है;
- छूटे हुए फ़ील्ड - डेटा का एक हिस्सा निकाला नहीं गया;
- संरचना का प्रवाह - संख्या के बजाय स्ट्रिंग, कुंजी का अन्य नाम।
सुरक्षा अनिवार्य है: सख्त उत्तर योजना, मान्यता (उदाहरण के लिए, Pydantic), तापमान = 0 और त्रुटि पर पुनरावृत्ति। शून्य तापमान भिन्नता को कम करता है, लेकिन पूरी तरह से भ्रांतियों को समाप्त नहीं करता। कीमतों और शेष के लिए, यह समझदारी है कि "मान वास्तव में पृष्ठ के पाठ में मौजूद है" की जांच जोड़ें।
विलंब भी अधिक है: प्रॉक्सी के माध्यम से पृष्ठ लोडिंग के समय में मॉडल का उत्तर जोड़ा जाता है - अंश सेकंड से लेकर कई सेकंड तक। दैनिक निगरानी के लिए यह महत्वपूर्ण नहीं है, ड्रॉप की निगरानी के लिए यह महत्वपूर्ण है।
हाइब्रिड: LLM चुनावक लिखता है, डेटा नहीं निकालता
तीसरा रास्ता लोकप्रिय पुस्तकालयों द्वारा सीधे समर्थित है। Crawl4AI में योजना उत्पन्न करने की सुविधा है: मॉडल एक बार HTML के नमूनों को देखता है और CSS/XPath चुनावकों का एक सेट लौटाता है, इसके बाद निकासी LLM को कॉल किए बिना होती है। दस्तावेज़ में यह स्पष्ट किया गया है कि यह एक बार की लागत है, और योजना को बिना किसी सीमाओं के पुनः उपयोग किया जा सकता है; कई नमूनों के साथ, मॉडल अक्सर गुणों के अनुसार अधिक स्थिर चुनावकों का चयन करता है बजाय नाजुक स्थिति जैसे nth-child।
हाइब्रिड का कार्यात्मक योजना:
- LLM 3-5 समान टेम्पलेट के पृष्ठों के नमूनों के अनुसार चुनावक उत्पन्न करता है।
- पार्सर चुनावकों पर काम करता है, प्रत्येक रिकॉर्ड को मान्य करने वाला: फ़ील्ड मौजूद हैं, प्रकार सही हैं, कीमत उचित सीमा में है।
- यदि अमान्य रिकॉर्ड का अनुपात सीमा (मान लीजिए, 2-5%) से अधिक हो जाता है, तो पृष्ठ LLM-निकासी में चला जाता है, और योजना पुनः उत्पन्न करने के लिए जाती है।
- नई योजना नियंत्रण नमूने पर चलती है और केवल तब पुरानी को बदलती है।
इस प्रकार, आप केवल लेआउट बदलने के क्षणों में मॉडल के लिए भुगतान करते हैं, न कि एक मिलियन पृष्ठों में से प्रत्येक के लिए।
सारणीबद्ध तालिका
| मानदंड | चुनावक | LLM-निकासी | हाइब्रिड |
|---|---|---|---|
| निकासी की लागत | लगभग शून्य | $0.5-33 प्रति 1,000 पृष्ठ। | लगभग शून्य + एक बार के कॉल |
| लेआउट का परिवर्तन | टूट जाता है, अक्सर चुपचाप | आमतौर पर सहन करता है | स्वचालित रूप से ठीक हो जाता है |
| कल्पित डेटा का जोखिम | नहीं (लेकिन "गलत तत्व" है) | है, मान्यता की आवश्यकता है | न्यूनतम |
| गति | अधिकतम | + प्रत्येक पृष्ठ पर मॉडल का उत्तर | चुनावकों के समान |
| कई विभिन्न साइटें | समर्थन में महंगा | मजबूत पक्ष | अच्छा, प्रत्येक टेम्पलेट के लिए योजना |
| प्रॉक्सी ट्रैफिक | समान - मॉडल डाउनलोड किए गए बाइट्स को कम नहीं करता | ||
प्रॉक्सी के बारे में: LLM ट्रैफिक की बचत नहीं करता
गणनाओं में एक सामान्य गलती यह है कि "स्मार्ट" पार्सर नेटवर्क में सस्ता है। नहीं: HTML को Markdown में परिवर्तित करना डाउनलोड के बाद होता है, इसलिए प्रॉक्सी के माध्यम से किसी भी निकासी विधि के साथ पूरा पृष्ठ गुजरता है। अपवाद - साइटें जहां मालिक ने स्वयं Accept: text/markdown शीर्षक द्वारा Markdown को सक्षम किया है (जैसे Cloudflare के फ़ंक्शन में), लेकिन यह साइट का समाधान है, आपका नहीं।
पैमाने के लिए: यदि HTML का वजन 200 KB है बिना चित्रों के, तो 1,000 पृष्ठ लगभग 0.2 GB है, या लगभग $0.54 पर रिहायशी प्रॉक्सी $2.70 प्रति GB। ऊपर की तालिका की तुलना करें: यदि आप कच्चे HTML को Claude Haiku 4.5 में भेजते हैं, तो मॉडल का बिल प्रॉक्सी के बिल से 40 गुना अधिक होगा, और Markdown और Flash-Lite में वे तुलनीय होंगे। यदि आप हेडलेस ब्राउज़र के माध्यम से पृष्ठों को रेंडर करते हैं, तो ट्रैफिक कई गुना बढ़ जाएगा - हमारे तुलना में माप हैं Playwright, Puppeteer और 1,000 पृष्ठों पर अनुरोधों के ट्रैफिक की खपत.
जो वास्तव में किसी भी विधि के साथ ट्रैफिक पर प्रभाव डालता है:
- यदि आवश्यक न हो तो चित्र, फ़ॉन्ट और विश्लेषण को न डाउनलोड करें;
- HTML के बजाय आंतरिक JSON API की तलाश करें;
- अतिरिक्त पुनरावृत्तियों से बचें: प्रत्येक बैन और पुनः प्रयास - ये भुगतान किए गए बाइट्स हैं। GB की कीमत क्यों भ्रामक है, इस पर अधिक जानकारी - सफल रिकॉर्ड की वास्तविक लागत में।
कठोर एंटी-बॉट सुरक्षा के बिना सरल कैटलॉग के लिए डेटा सेंटर प्रॉक्सी $1.50 प्रति GB पर्याप्त हैं; रिहायशी उन जगहों पर आवश्यक हैं जहां होस्टिंग का IP प्रवेश पर काटा जाता है।
परिदृश्यों के लिए सिफारिशें
- एक से तीन मार्केटप्लेस की कीमतों की निगरानी, सैकड़ों हजारों कार्ड। हाइब्रिड या शुद्ध चुनावक के साथ मान्यता। योजना के पुनर्जनन के लिए केवल LLM को जोड़ें।
- सैकड़ों विभिन्न साइटों से डेटा संग्रह (लीड, नौकरियां, संपर्क)। LLM-निकासी Markdown के माध्यम से सस्ती मॉडल में बैच मोड में। बिना सख्त योजना और मान्यता के शुरू न करें।
- कुछ हजार पृष्ठों पर एक बार का अध्ययन। LLM: कुछ डॉलर में आप चुनावकों को लिखने में दिन बचाते हैं।
- डेटा जहां गलती की कीमत होती है (मूल्य पुनः मूल्यांकन के लिए, शेष)। चुनावक या हाइब्रिड प्लस मूल्य की जांच पृष्ठ के मूल पाठ के साथ।
- RAG और ज्ञान के आधार। यहां संरचना की आवश्यकता नहीं है, बल्कि शुद्ध पाठ है: फ़ील्ड निकासी के बिना Markdown में रूपांतरण, मॉडल केवल उत्तर के चरण पर।
निष्कर्ष
LLM-निकासी ने चुनावकों को प्रतिस्थापित नहीं किया, बल्कि चयन के बिंदु को स्थानांतरित किया। सबसे सस्ता - हाइब्रिड: मॉडल चुनावकों को लिखता और ठीक करता है, न कि प्रत्येक पृष्ठ को पढ़ता है। यदि प्रत्येक पृष्ठ पर मॉडल के बिना नहीं किया जा सकता, तो पहले इनपुट को Markdown में साफ करें और बैच का उपयोग करें: ये दो कदम बिल को 5-10 गुना कम करते हैं इससे पहले कि आप मॉडल का चयन करना शुरू करें। और याद रखें, प्रॉक्सी ट्रैफिक निकासी विधि पर निर्भर नहीं करता है: इसकी बचत उस पर होनी चाहिए जो आप डाउनलोड करते हैं, न कि उस पर जो आप विश्लेषण करते हैं।
