Quay lại blog

API chính thức, bộ dữ liệu sẵn có hay trình phân tích riêng: nên chọn cái nào trong năm 2026

Các API chính thức đã tăng giá đáng kể, một phần đã đóng cửa cho khách hàng mới, và các tòa án lần đầu tiên đã có ý kiến về việc truy cập của các tác nhân AI. Chúng tôi so sánh API chính thức, việc mua bộ dữ liệu và việc tự phân tích qua proxy theo bảy tiêu chí và cung cấp ma trận lựa chọn cho năm kịch bản điển hình.

📅20 tháng 8, 2026
API chính thức, bộ dữ liệu sẵn có hay trình phân tích riêng: nên chọn cái nào trong năm 2026

Dữ liệu để theo dõi giá, đào tạo mô hình hoặc phân tích B2B có thể được thu thập theo ba cách: trả tiền cho nền tảng để có API chính thức, mua bộ dữ liệu đã hoàn thiện từ nhà cung cấp hoặc tự thu thập bằng cách sử dụng parser qua proxy. Vào năm 2026, việc lựa chọn không còn là vấn đề sở thích: giá của các API chính thức đã tăng lên đáng kể, một số trong số đó đã đóng cửa cho khách hàng mới, và các tòa án lần đầu tiên đã đưa ra phán quyết về quyền truy cập của các đại lý AI. Chúng tôi sẽ phân tích ba kênh theo bảy tiêu chí và cung cấp ma trận lựa chọn cho các kịch bản cụ thể.

Các tiêu chí để so sánh

So sánh "API so với parsing" chỉ dựa vào giá cả là sai lầm lớn nhất. Giá trị thực tế của kênh được cấu thành từ bảy thông số, và mỗi kịch bản có trọng số riêng:

  • Giá mỗi đơn vị dữ liệu — theo yêu cầu, theo bản ghi hoặc theo gigabyte lưu lượng truy cập.
  • Phạm vi — liệu kênh có chứa các trường và đối tượng mà bạn cần hay không.
  • Tính mới — dữ liệu thời gian thực hay ảnh chụp từ một tuần trước.
  • Trạng thái pháp lý — hợp đồng với nền tảng, giấy phép của nhà cung cấp hoặc thu thập dữ liệu công khai với rủi ro của riêng bạn.
  • Thời gian đến dữ liệu đầu tiên — từ vài phút đến vài tuần phê duyệt thủ công.
  • Độ ổn định — kênh thường bị hỏng bao nhiêu lần và điều gì xảy ra khi các quy tắc thay đổi.
  • Kiểm soát định dạng — liệu bạn có thể nhận được các trường tùy ý hay bạn chỉ nhận những gì được cung cấp.

Kênh 1. API chính thức của nền tảng

Kênh hợp pháp nhất và cũng là kênh có giá cả không thể đoán trước. Những gì đã xảy ra với các API lớn đến tháng 8 năm 2026:

  • X (Twitter) — kể từ ngày 6 tháng 2 năm 2026, mô hình trả tiền theo mức sử dụng đã trở thành mặc định cho các nhà phát triển mới: không có gói miễn phí, không thể đăng ký gói Basic hoặc Pro cho khách hàng mới. Giá là $0,005 cho mỗi bài đọc và $0,015 cho mỗi bài đăng ($0,20 nếu bài đăng có liên kết), giới hạn là 2 triệu bài đọc mỗi tháng. Sau đó — chỉ có Enterprise khoảng từ $42,000 mỗi tháng. Các gói cố định cũ ($200 Basic, $5,000 Pro) chỉ còn lại cho những người đăng ký hiện tại.
  • Reddit — quyền truy cập thương mại có giá khoảng $12,000 mỗi tháng cho 50 triệu yêu cầu, vượt quá giới hạn khoảng $0,24 cho 1,000 yêu cầu. 100 yêu cầu miễn phí mỗi phút trên OAuth-client không được cấp phép cho mục đích thương mại, và sự phê duyệt thương mại phải trải qua xem xét thủ công từ 2 đến 4 tuần mà không có đảm bảo kết quả.
  • Amazon — Product Advertising API 5.0 không còn nhận khách hàng mới và sẽ ngừng hoạt động: ngày 30 tháng 4 năm 2026 được công bố là ngày ngừng hỗ trợ, ngày 15 tháng 5 — ngừng hoạt động, với việc chuyển sang Creators API. Quyền truy cập phụ thuộc vào doanh số: cần tối thiểu 10 bán hàng giới thiệu đủ điều kiện trong 30 ngày qua, và mỗi gian hàng riêng biệt, nếu không tài khoản sẽ nhận được 429 và bị loại khỏi quyền truy cập.
  • Instagram — Basic Display API đã chính thức ngừng hoạt động vào ngày 4 tháng 12 năm 2024, không còn dữ liệu từ các tài khoản cá nhân qua Graph API, chỉ hỗ trợ Business và Creator. Để sản xuất, cần có App Review và xác minh doanh nghiệp, và ứng dụng không qua xem xét sẽ mất các endpoint mà nó đã sử dụng trong giai đoạn phát triển.

Khi API chính thức có lợi: bạn cần dữ liệu từ các tài khoản và khách hàng của mình, khối lượng nhỏ và ổn định, và tính hợp pháp quan trọng hơn giá cả — ví dụ, cho việc tích hợp vào SaaS mà bạn bán cho khách hàng doanh nghiệp. Khi thua: cần một cái nhìn rộng về thị trường, dữ liệu công khai của người khác hoặc các trường mà API không có.

Kênh 2. Bộ dữ liệu hoàn chỉnh từ nhà cung cấp

Thị trường dữ liệu web có giấy phép trong hai năm qua đã hình thành thành một ngành công nghiệp riêng. Tham khảo về giá: tại Bright Data, các bộ dữ liệu hoàn chỉnh có giá từ $2,50 cho 1,000 bản ghi, tức là $250 cho 100,000, với mức giảm lên đến 80% tùy thuộc vào tần suất cập nhật; thu thập có quản lý theo yêu cầu — từ $1,500 mỗi tháng, các đăng ký ngành như phân tích bán lẻ — từ $250 mỗi tháng.

Điểm mạnh rõ ràng: dữ liệu đã được làm sạch, loại bỏ trùng lặp và đưa vào sơ đồ, bạn có hợp đồng và hóa đơn, và có thể nhận được các dòng đầu tiên trong ngày thanh toán. Chi phí kỹ thuật — bằng không.

Điểm yếu sẽ xuất hiện sau. Thứ nhất, độ trễ về tính mới: bạn lấy một mẫu với tần suất cập nhật mà nhà cung cấp đã đặt ra, và để theo dõi giá trong thời gian thực thì thường không đạt yêu cầu. Thứ hai, phạm vi của người khác: nếu thị trường, khu vực hoặc ngôn ngữ cần thiết không có trong danh mục, bạn chỉ có thể thêm nó qua đơn đặt hàng tùy chỉnh và giá khác. Thứ ba, sơ đồ cố định: trường không có trong bộ dữ liệu sẽ không thể lấy được.

Khi bộ dữ liệu có lợi: nghiên cứu một lần, đào tạo mô hình trên mẫu lịch sử, kiểm tra giả thuyết nhanh chóng, khi thời gian đến kết quả có giá trị hơn chi phí của một dòng. Khi thua: cần tính mới trong giờ, các trường không chuẩn hoặc địa lý hẹp.

Kênh 3. Parser riêng của bạn qua proxy

Tại đây, bạn không trả tiền cho dữ liệu mà là cho cơ sở hạ tầng truy cập: lưu lượng proxy, rendering và thời gian kỹ thuật. Thị trường proxy cư trú vào năm 2026 đã phân chia thành ba cấp độ — doanh nghiệp (Bright Data, Oxylabs) trong khoảng $8,5–12 cho mỗi gigabyte, phân khúc trung bình (Decodo, SOAX, NetNut) trong khoảng $3–6, ngân sách (IPRoyal, Webshare) — từ $1,75 cho mỗi gigabyte theo hình thức trả tiền theo mức sử dụng.

Nhưng giá mỗi gigabyte là một chỉ số dễ gây hiểu lầm. Cần tính chi phí cho mỗi yêu cầu thành công: proxy trung tâm dữ liệu với giá $1 cho mỗi gigabyte là vô dụng nếu trang web mục tiêu cắt giảm 90% yêu cầu — bạn đang trả tiền cho khối lượng yêu cầu lại gấp mười lần. Với IP cư trú, tỷ lệ phản hồi thành công trên các nền tảng bảo vệ giữ ở mức khoảng 90–99%, trong khi với các mục tiêu tương tự, tỷ lệ này của proxy trung tâm dữ liệu giảm xuống còn 40–60%, và trên các bảo vệ nặng — còn 20–30%. Chúng tôi đã phân tích chi tiết về trọng số trang, yêu cầu lại và chi phí ẩn trong tài liệu bao nhiêu thực sự tốn để thu thập một triệu trang.

Một câu hỏi riêng là ranh giới giữa proxy thô và API thu thập dữ liệu hoàn chỉnh: nó phụ thuộc vào trọng số phản hồi, và đây là chủ đề của so sánh giữa proxy, unblockers và API thu thập dữ liệu.

Khi parser riêng của bạn có lợi: cần các trường tùy ý, tính mới trong phút, phạm vi rộng của các nền tảng và giá cả có thể dự đoán trên khối lượng lớn. Khi thua: bạn không có kỹ sư để sửa chữa pipeline, và khối lượng được đo bằng hàng nghìn trang mỗi tháng — trong trường hợp này, tốt hơn là mua bộ dữ liệu.

Tầng pháp lý: điều gì đã thay đổi vào năm 2026

Vào ngày 4 tháng 8 năm 2026, Tòa phúc thẩm số 9 của Hoa Kỳ đã bãi bỏ lệnh cấm tạm thời, cản trở đại lý AI Perplexity truy cập vào Amazon theo yêu cầu của người dùng. Tòa án đã quyết định rằng khi người dùng giao nhiệm vụ cho đại lý thực hiện hành động trên Amazon, "quyền truy cập" vào các hệ thống của Amazon được thực hiện bởi chính người dùng, chứ không phải Perplexity: luật CFAA nói về "người nhận quyền truy cập", tức là về con người, chứ không phải về công cụ phần mềm. Đây là quyết định đầu tiên ở cấp độ tòa phúc thẩm về giao điểm giữa AI đại lý và luật liên bang về gian lận máy tính — chúng tôi đã phân tích chi tiết trong bài viết riêng về quyết định trong vụ kiện Amazon chống lại Perplexity.

Kết luận thực tiễn cho việc lựa chọn kênh: quyết định này giảm bớt một phần rủi ro từ việc tự động hóa theo yêu cầu của người dùng cụ thể, nhưng không làm cho việc thu thập dữ liệu của người khác trở nên miễn phí và không rủi ro. Điều khoản sử dụng của nền tảng, quyền tác giả đối với nội dung và bảo vệ dữ liệu cá nhân vẫn không thay đổi. API chính thức vẫn là kênh duy nhất mà bạn có hợp đồng; bộ dữ liệu chuyển một phần trách nhiệm cho nhà cung cấp; việc tự thu thập dữ liệu công khai là khu vực mà bạn tự quyết định.

Ma trận lựa chọn cho kịch bản

  1. Theo dõi giá của đối thủ trong thời gian thực. API chính thức gần như luôn không đạt yêu cầu: các trường cần thiết không có hoặc quyền truy cập phụ thuộc vào doanh số, như ở Amazon. Bộ dữ liệu bị tụt lại về tính mới. Lựa chọn — parser riêng của bạn trên proxy cư trú với tần suất quét theo biến động giá.
  2. Đào tạo mô hình trên tập dữ liệu lịch sử. Tính mới không quan trọng, khối lượng rất lớn, sơ đồ tiêu chuẩn. Lựa chọn — bộ dữ liệu đã hoàn thiện; việc tự thu thập khối lượng như vậy từ đầu gần như luôn tốn kém hơn.
  3. Phát sinh khách hàng B2B và làm phong phú CRM. API chính thức cho các hồ sơ của người khác gần như không tồn tại. Lựa chọn hợp lý — bộ dữ liệu có giấy phép cộng với việc làm phong phú thêm bằng parser riêng của bạn cho các trường hẹp.
  4. Phân tích SMM cho các tài khoản của mình. API chính thức là không thể thay thế: Instagram Graph cho Business/Creator, X pay-per-use cho khối lượng đọc nhỏ. Việc thu thập dữ liệu của chính mình là vô nghĩa.
  5. Nghiên cứu thị trường một lần trong hai tuần. Tính toán thời gian: nếu kỹ sư mất nhiều thời gian cho pipeline hơn giá của bộ dữ liệu — hãy mua bộ dữ liệu. Nếu không có dữ liệu trong danh mục, hãy khởi động một parser tạm thời trên proxy cư trú với thanh toán theo lưu lượng và tắt nó sau dự án.

Hybrid như một tiêu chuẩn

Trên thực tế, các đội trưởng thành vào năm 2026 không chọn một kênh duy nhất, mà phân chia nhiệm vụ theo ba kênh: API chính thức — nơi dữ liệu là của riêng bạn và hợp đồng là bắt buộc; bộ dữ liệu — cho nền tảng lịch sử và khởi đầu nhanh chóng; parser riêng — cho tính mới, các trường không chuẩn và khối lượng, nơi kinh tế gigabyte vượt qua chi phí cho mỗi bản ghi. Các IP trung tâm dữ liệu sẽ được sử dụng cho các mục tiêu dễ dàng và kiểm tra nội bộ, trong khi các IP cư trú và di động sẽ được sử dụng cho các nền tảng có bảo vệ thực sự.

Điều quan trọng nhất cần ghi nhớ: hãy tính toán không phải bảng giá, mà là chi phí cho một bản ghi có thể sử dụng với tính đến yêu cầu lại, độ trễ và thời gian kỹ thuật. Theo chỉ số này, kênh "đắt" thường trở nên rẻ, trong khi kênh "rẻ" lại ngược lại.

Kết luận

Các API chính thức vào năm 2026 đã trở thành kênh để làm việc với dữ liệu của riêng bạn và khối lượng nhỏ: X đã chuyển các nhà phát triển mới sang thanh toán theo từng lần sử dụng, Reddit giữ quyền truy cập thương mại ở mức $12,000 mỗi tháng, Amazon đóng cửa PA-API, Instagram đã cắt đứt các tài khoản cá nhân. Các bộ dữ liệu đã hoàn thiện đóng lại lịch sử và khởi đầu nhanh chóng từ $2,50 cho mỗi nghìn bản ghi, nhưng không cung cấp tính mới và các trường tùy ý. Parser riêng qua proxy vẫn là kênh duy nhất có quyền kiểm soát hoàn toàn đối với sơ đồ và tần suất cập nhật — và có lợi về mặt tài chính trên khối lượng, nếu tính toán chi phí cho mỗi yêu cầu thành công, chứ không phải gigabyte. Nếu kịch bản của bạn yêu cầu dữ liệu mới từ các nền tảng bảo vệ, hãy bắt đầu với bài kiểm tra proxy cư trú trên mục tiêu thực và đo lường tỷ lệ phản hồi thành công — con số này sẽ giải quyết tranh cãi giữa ba kênh nhanh hơn bất kỳ bảng nào.