← Quay lại blog

LLM hoặc CSS-selector để phân tích: so sánh giá cả và độ tin cậy năm 2026

So sánh ba cách trích xuất dữ liệu khi phân tích: bộ chọn CSS/XPath, trích xuất LLM và phương pháp kết hợp, trong đó mô hình viết bộ chọn. Chúng tôi tính toán chi phí cho 1.000 trang theo giá của Gemini và Claude vào tháng 10 năm 2026, phân tích rủi ro của dữ liệu giả mạo và giải thích lý do tại sao mô hình không tiết kiệm băng thông proxy.

📅1 tháng 10, 2026
LLM hoặc CSS-selector để phân tích: so sánh giá cả và độ tin cậy năm 2026

Trình phân tích cú pháp dựa trên bộ chọn CSS bị hỏng khi trang web thay đổi bố cục. Trình phân tích cú pháp dựa trên LLM không bị hỏng, nhưng tính phí cho mỗi trang. Vào năm 2026, sự lựa chọn giữa chúng không còn là vấn đề sở thích: giá của các mô hình đã chênh lệch hàng chục lần, và cùng một trang có thể tốn 3.000 hoặc 20.000 token tùy thuộc vào những gì bạn gửi vào mô hình. Dưới đây là so sánh ba phương pháp về chi phí, độ tin cậy và lưu lượng proxy, tính toán cho 1.000 và một triệu trang.

Tóm tắt: nên chọn cái nào

  • Bộ chọn (CSS/XPath) — một mẫu trang, khối lượng lớn, bố cục ổn định. Chi phí trích xuất gần như bằng không, nhưng việc hỗ trợ thuộc về nhà phát triển.
  • Trích xuất LLM — nhiều trang web khác nhau, bố cục không ổn định, nhiệm vụ một lần. Bạn phải trả tiền cho token trên mỗi trang và phải xác thực phản hồi.
  • Hybrid — LLM viết bộ chọn một lần, sau đó bộ chọn hoạt động, và mô hình chỉ được gọi khi kiểm tra dữ liệu thất bại. Đối với hầu hết các trình phân tích cú pháp cố định, đây là lựa chọn tối ưu.

Các tiêu chí so sánh

Chúng tôi so sánh theo năm điểm mà thực sự ảnh hưởng đến hóa đơn cuối cùng và chất lượng dữ liệu:

  1. chi phí trích xuất cho 1.000 trang;
  2. hành vi khi thay đổi bố cục;
  3. độ chính xác và rủi ro của các giá trị giả mạo;
  4. tốc độ và độ trễ;
  5. tiêu thụ lưu lượng proxy — như bạn sẽ thấy, điều này gần như không phụ thuộc vào phương pháp được chọn.

Chi phí trích xuất LLM: tính theo giá vào tháng 10 năm 2026

Giá chính thức cho một triệu token (đầu vào / đầu ra) theo mức giá tiêu chuẩn:

  • Gemini 2.5 Flash-Lite — $0,10 / $0,40;
  • Gemini 3.1 Flash-Lite — $0,25 / $1,50;
  • Claude Haiku 4.5 — $1 / $5;
  • Gemini 3.5 Flash — $1,50 / $9.

Cả Google và Anthropic đều có Batch API với giảm giá 50% cho đầu vào và đầu ra — cho việc phân tích, nơi mà phản hồi không cần ngay lập tức, đây là cách tiết kiệm đầu tiên.

Biến số chính — không phải mô hình, mà là những gì bạn gửi vào nó

Trang HTML thô khi gửi vào mô hình thường chiếm 10–40 nghìn token. Cloudflare, khi khởi động chức năng Markdown for Agents, đã đưa ra ví dụ: cùng một bài viết blog có kích thước 16.180 token trong HTML và 3.150 token trong Markdown — giảm 80%. Các phép đo khác về tin tức, tài liệu và thẻ sản phẩm cho thấy sự giảm từ 67 đến 94%.

Để tính toán, chúng ta sẽ giả định: trang thô — 20.000 token, đã được làm sạch thành Markdown — 3.000, cộng thêm 500 token cho hướng dẫn và sơ đồ, đầu ra là 300 token JSON. Trên 1.000 trang, chúng ta có:

Mô hìnhHTML thô (20,5 triệu đầu vào)Markdown (3,5 triệu đầu vào)
Gemini 2.5 Flash-Lite≈ $2,17≈ $0,47
Gemini 3.1 Flash-Lite≈ $5,58≈ $1,33
Claude Haiku 4.5≈ $22,00≈ $5,00
Gemini 3.5 Flash≈ $33,45≈ $7,95

Sự chênh lệch — lên đến 70 lần giữa lựa chọn tồi tệ nhất và tốt nhất với cùng một kết quả. Hai phần ba sự khác biệt này đến từ việc làm sạch đầu vào, chứ không phải từ việc chọn mô hình. Trên một triệu trang mỗi tháng, điều này có thể tốn khoảng $470 hoặc hơn $33.000.

Thêm một chi tiết: các mô hình Claude bắt đầu từ phiên bản 4.7 sử dụng bộ phân tách mới, mà theo dữ liệu của Anthropic, cung cấp khoảng 30% token nhiều hơn cho cùng một văn bản. Khi so sánh hóa đơn của các thế hệ mô hình khác nhau, hãy lưu ý điều này — Haiku 4.5 hoạt động trên bộ phân tách cũ.

Bộ chọn: gần như miễn phí, cho đến khi trang web thay đổi

Việc thực hiện bộ chọn CSS hoặc XPath trên một trang đã tải xuống chỉ tốn một phần mili giây của bộ xử lý. Trong hướng dẫn của ScrapingBee, đánh giá như sau: trên bố cục ổn định, bộ chọn thông thường rẻ hơn và nhanh hơn khoảng 10 lần so với trích xuất LLM. Trên thực tế, sự khác biệt còn lớn hơn nữa, vì bộ chọn không có yêu cầu mạng đến API của mô hình.

Giá của bộ chọn nằm ở việc hỗ trợ:

  • nếu trang web đổi tên lớp hoặc bọc khối trong một div mới — trình phân tích cú pháp sẽ im lặng trả về các trường trống;
  • các thử nghiệm A/B cho thấy các mẫu khác nhau cho các khách truy cập khác nhau, và một phần các trang không được phân tích;
  • trên 50 trang web khác nhau, bạn hỗ trợ 50 bộ bộ chọn khác nhau.

Scenari nguy hiểm nhất không phải là sự sụp đổ, mà là sự hỏng dữ liệu âm thầm: bộ chọn kéo theo phần tử bên cạnh, và trong cơ sở dữ liệu, giá cũ được ghi lại thay vì giá hiện tại trong nhiều tuần.

LLM: bền vững với bố cục, nhưng có khả năng tưởng tượng

Các mô hình không cần đường dẫn chính xác đến phần tử — chúng tìm kiếm "giá" theo nghĩa. Điều này giải quyết vấn đề các lớp đã đổi tên và các mẫu khác nhau. Nhưng có ba loại lỗi điển hình xuất hiện, mà tất cả những ai đã chạy các trình phân tích cú pháp như vậy trong sản xuất đều mô tả:

  • giá trị giả mạo — mô hình "đoán" giá hoặc mã sản phẩm mà không có trên trang;
  • các trường bị bỏ qua — một phần dữ liệu không được trích xuất;
  • trôi cấu trúc — chuỗi thay vì số, tên khóa khác.

Bảo vệ là bắt buộc: sơ đồ phản hồi nghiêm ngặt, xác thực (ví dụ: Pydantic), temperature = 0 và lặp lại khi có lỗi. Nhiệt độ bằng không giảm độ phân tán, nhưng không loại bỏ hoàn toàn ảo giác. Đối với giá và tồn kho, hợp lý khi thêm kiểm tra "giá trị thực sự xuất hiện trong văn bản của trang".

Độ trễ cũng cao hơn: thời gian tải trang qua proxy cộng thêm phản hồi của mô hình — từ vài phần giây đến vài giây. Đối với việc giám sát hàng ngày, điều này không quan trọng, nhưng đối với việc theo dõi sự giảm giá — thì rất quan trọng.

Hybrid: LLM viết bộ chọn, không trích xuất dữ liệu

Con đường thứ ba được hỗ trợ trực tiếp bởi các thư viện phổ biến. Trong Crawl4AI, có chức năng tạo sơ đồ: mô hình một lần nhìn vào các mẫu HTML và trả về một bộ bộ chọn CSS/XPath, sau đó việc trích xuất diễn ra mà không cần gọi LLM. Trong tài liệu, nhấn mạnh rằng đây là chi phí một lần, và sơ đồ có thể được tái sử dụng không giới hạn; với nhiều mẫu, mô hình thường chọn các bộ chọn bền vững hơn dựa trên thuộc tính thay vì các vị trí dễ bị tổn thương như nth-child.

Sơ đồ làm việc của hybrid:

  1. LLM tạo bộ chọn từ 3–5 mẫu trang của cùng một mẫu.
  2. Trình phân tích cú pháp hoạt động trên các bộ chọn, mỗi bản ghi được kiểm tra bởi bộ xác thực: các trường có mặt, loại đúng, giá trong khoảng hợp lý.
  3. Nếu tỷ lệ bản ghi không hợp lệ vượt quá ngưỡng (ví dụ, 2–5%), trang sẽ chuyển sang trích xuất LLM, và sơ đồ sẽ được tái tạo.
  4. Sơ đồ mới được chạy trên mẫu kiểm soát và chỉ sau đó thay thế sơ đồ cũ.

Vì vậy, bạn chỉ phải trả tiền cho mô hình vào những thời điểm thay đổi bố cục, chứ không phải cho mỗi trang trong một triệu trang.

Bảng tổng hợp

Tiêu chíBộ chọnTrích xuất LLMHybrid
Chi phí trích xuấtgần như bằng không$0,5–33 cho 1.000 trang.gần như bằng không + các cuộc gọi một lần
Thay đổi bố cụchỏng, thường im lặngthường sống sótsửa chữa tự động
Rủi ro dữ liệu giả mạokhông (nhưng có "không phải phần tử đó")có, cần xác thựctối thiểu
Tốc độtối đa+ phản hồi của mô hình trên mỗi trangnhư bộ chọn
Nhiều trang web khác nhauđắt trong việc hỗ trợđiểm mạnhtốt, sơ đồ cho mỗi mẫu
Lưu lượng proxygiống nhau — mô hình không giảm byte tải xuống

Về proxy: LLM không tiết kiệm lưu lượng

Một sai lầm thường gặp trong tính toán là cho rằng trình phân tích cú pháp "thông minh" rẻ hơn trên mạng. Không: việc chuyển đổi HTML thành Markdown xảy ra sau khi tải xuống, vì vậy toàn bộ trang đi qua proxy bất kể phương pháp trích xuất nào. Ngoại lệ là các trang web mà chủ sở hữu tự bật việc cung cấp Markdown qua tiêu đề Accept: text/markdown (như trong chức năng Cloudflare), nhưng đây là quyết định của trang web, không phải của bạn.

Để có quy mô: với kích thước HTML 200 KB không có hình ảnh, 1.000 trang — khoảng 0,2 GB, hoặc khoảng $0,54 cho proxy dân cư với giá $2,70 cho mỗi GB. So sánh với bảng trên: khi gửi HTML thô vào Claude Haiku 4.5, hóa đơn cho mô hình sẽ cao gấp 40 lần hóa đơn cho proxy, trong khi với Markdown và Flash-Lite, chúng tương đương. Nếu bạn đang kết xuất các trang bằng trình duyệt headless, lưu lượng sẽ tăng lên nhiều lần — có các phép đo trong so sánh của chúng tôi về tiêu thụ lưu lượng của Playwright, Puppeteer và requests trên 1.000 trang.

Những gì thực sự ảnh hưởng đến lưu lượng bất kể phương pháp nào:

  • không tải hình ảnh, phông chữ và phân tích nếu không cần thiết;
  • tìm kiếm API JSON nội bộ thay vì HTML;
  • không thực hiện các lần lặp lại không cần thiết: mỗi lần bị cấm và thử lại — đó là byte đã trả tiền. Tìm hiểu thêm về lý do tại sao giá cho mỗi GB là lừa đảo trong phân tích giá thực sự của một bản ghi thành công.

Đối với các danh mục đơn giản mà không có bảo vệ chống bot nghiêm ngặt, chỉ cần proxy trung tâm dữ liệu với giá $1,50 cho mỗi GB; proxy dân cư cần thiết ở những nơi mà IP của máy chủ bị cắt ở đầu vào.

Khuyến nghị cho các kịch bản

  • Theo dõi giá của một đến ba thị trường, hàng trăm nghìn thẻ. Hybrid hoặc bộ chọn thuần với bộ xác thực. Kết nối LLM chỉ để tái tạo sơ đồ.
  • Thu thập dữ liệu từ hàng trăm trang web khác nhau (dẫn đầu, việc làm, liên hệ). Trích xuất LLM trên Markdown qua mô hình rẻ trong chế độ batch. Không khởi động nếu không có sơ đồ nghiêm ngặt và xác thực.
  • Nghiên cứu một lần trên vài nghìn trang. LLM: với vài đô la, bạn tiết kiệm được nhiều ngày viết bộ chọn.
  • Dữ liệu mà sai sót có giá trị (giá cho việc tái định giá, tồn kho). Bộ chọn hoặc hybrid cộng với kiểm tra giá trị với văn bản gốc của trang.
  • RAG và cơ sở tri thức. Ở đây cần không phải cấu trúc, mà là văn bản thuần: chuyển đổi sang Markdown mà không trích xuất các trường, mô hình — chỉ ở giai đoạn phản hồi.

Kết luận

Trích xuất LLM không thay thế bộ chọn, mà đã chuyển điểm lựa chọn. Rẻ nhất là hybrid: mô hình viết và sửa chữa bộ chọn, chứ không đọc từng trang. Nếu không thể tránh khỏi mô hình trên mỗi trang, trước tiên hãy làm sạch đầu vào thành Markdown và sử dụng batch: hai bước này giảm hóa đơn xuống 5–10 lần trước khi bạn bắt đầu chọn mô hình. Và hãy nhớ rằng lưu lượng proxy không phụ thuộc vào phương pháp trích xuất: bạn cần tiết kiệm nó từ những gì bạn tải xuống, không phải từ cách bạn phân tích.