Kịch bản mà ai cũng gặp phải khi làm việc với proxy một cách nghiêm túc. Bạn lấy một IP cư trú với địa lý "Đức". Mở checker - nó trung thực ghi là Germany, Frankfurt. Bạn truy cập vào trang web mục tiêu - và nó hiển thị tiền tệ Hà Lan, kết quả Hà Lan và banner cookie Hà Lan. Checker thứ hai cho biết, IP thực sự ở Bỉ. Ai đang nói dối?
Không ai cả. Vấn đề là IP không có tọa độ. Địa lý không phải là thuộc tính của địa chỉ, mà là ý kiến của một cơ sở dữ liệu cụ thể, mà nó thu thập được bằng các phương pháp gián tiếp. Có nhiều cơ sở dữ liệu, chúng độc lập và có sự khác biệt - một cách hệ thống và có thể dự đoán. Dưới đây, chúng ta sẽ phân tích từ đâu mà những dữ liệu này xuất hiện, độ sai số thực tế lớn đến mức nào theo các phép đo mới nhất và phải làm gì với điều này trong thực tế.
IP không có địa lý - chỉ có những ước lượng
Trong gói không có trường "quốc gia". Tất cả những gì internet biết về địa chỉ là ai được cấp theo tài liệu của nhà đăng ký và các tuyến đường BGP dẫn đến đâu. Từ đó, các cơ sở dữ liệu thương mại (MaxMind, IPinfo, IP2Location, DB-IP và những cái khác) thu thập suy đoán, kết hợp năm nguồn:
- Ghi chép RIR và whois. Quốc gia trong ghi chép là quyền tài phán của tổ chức được cấp khối, chứ không phải nơi mà các máy chủ vật lý đứng. Nhà cung cấp Đức có thể dễ dàng triển khai địa chỉ ở Amsterdam.
- Dữ liệu địa lý. Định dạng dữ liệu địa lý tự xuất bản được quy định bởi RFC 8805 (2020), vào năm 2024 nó được thay thế bởi RFC 9632 - với xác thực và phát hiện thông qua RDAP. Nhà điều hành tự công bố nơi đặt mạng con của mình. Đây là nguồn duy nhất có thẩm quyền, nhưng độ phủ rất hạn chế: đến cuối năm 2023, dữ liệu địa lý đã công bố khoảng 2.800 hệ thống tự trị - khoảng 34 triệu địa chỉ IPv4, hoặc 0,8% tổng số phát hành toàn cầu.
- Định tuyến và tiền tố BGP. Nếu biết một địa chỉ nằm ở đâu, cơ sở dữ liệu sẽ suy diễn cho toàn bộ tiền tố. Từ đó, phần lớn các lỗi xảy ra.
- Đo lường độ trễ. Tam giác hóa theo RTT từ các điểm đã biết - hoạt động tốt ở các thành phố châu Âu đông đúc, nhưng sụp đổ ở những nơi có ít điểm đo.
- Dữ liệu từ đối tác. Tín hiệu từ các ứng dụng và dịch vụ, đối chiếu IP với tọa độ GPS của thiết bị.
Mỗi nhà cung cấp trộn lẫn điều này theo tỷ lệ và quy tắc riêng của họ. Kết quả không nhất thiết phải trùng khớp.
Độ sai số lớn đến mức nào: phép đo năm 2026
Vào ngày 21 tháng 5 năm 2026, các nhà nghiên cứu từ Virginia Tech (Syed Tauhidun Nabi, Jocelyn Bliton, Tijay Chung, Shaddi Hasan) đã công bố công trình "Lost in the Prefix: Revisiting IP Geolocation Accuracy Across Networks and Geographies". Họ đã so sánh bốn cơ sở dữ liệu - MaxMind GeoLite2, IPinfo, IP2Location DB11 và DB-IP Lite - với tiêu chuẩn từ 16.010 đầu dò RIPE Atlas ở 175 quốc gia và 21.292 cặp "IP - trường học" từ dự án UNICEF Giga. Tổng cộng có 37.302 quan sát, trong đó 74,7% là IPv4 và 25,3% là IPv6.
Các con số chính:
- Mạng cố định: độ sai số trung vị từ 3–16 km tùy thuộc vào nhà cung cấp. Đối với internet dây ở các nước phát triển, địa lý hoạt động tốt.
- Mạng di động: độ sai số trung vị từ 179–207 km. Đây là khoảng cách gấp hơn mười lần so với mạng cố định, và nó giống nhau ở cả bốn cơ sở dữ liệu.
- Tỷ lệ sai sót lớn (trên 100 km) theo khu vực: Châu Âu 9–20%, Châu Mỹ 8–22%, Châu Á 53–61%, Châu Phi 66–72%.
- Nguyên nhân: khoảng 70% tiền tố di động trải dài vật lý hơn 100 km. Càng lớn tiền tố, độ sai số càng cao - bất kể nhà cung cấp, loại mạng và khu vực.
Điều quan trọng là: cả bốn cơ sở dữ liệu đều sai sót tương đối giống nhau và ở những nơi giống nhau. Đây không phải là "nhà cung cấp kém so với nhà cung cấp tốt" - đây là một hạn chế chung của phương pháp. Ở các quốc gia thuộc Nam toàn cầu, tỷ lệ tiền tố "thô" cao gấp 2–3 lần, vì vậy lỗi cũng cao hơn ở đó.
MaxMind tự xác định giới hạn của mình một cách trung thực: 99,8% độ chính xác ở cấp quốc gia, khoảng 80% ở cấp tiểu bang/khu vực ở Mỹ và 66% ở cấp thành phố - trong đó "thành phố" có nghĩa là nằm trong bán kính 50 km. Đặc biệt lưu ý rằng các địa chỉ trong mạng di động được sử dụng bởi các điện thoại ở khoảng cách xa, và trong trường hợp VPN hoặc proxy, cơ sở dữ liệu định vị máy chủ, không phải người dùng cuối.
Tại sao checker và trang web thấy khác nhau
Đây chính là bí mật của kịch bản ban đầu. Checker mà bạn mở ra cho thấy dữ liệu từ cơ sở dữ liệu của nó. Trang web mục tiêu nhìn vào cơ sở dữ liệu của nó. Đây là hai câu trả lời khác nhau cho cùng một câu hỏi, và cả hai đều "đúng" trong hệ tọa độ của chúng.
Ba cơ chế cụ thể dẫn đến sự khác biệt:
- Các nhà cung cấp khác nhau. Trang web sử dụng Cloudflare lấy quốc gia từ tiêu đề CF-IPCountry - đây là dữ liệu riêng của Cloudflare, và chúng thường không trùng khớp với những gì MaxMind cung cấp cho cùng một địa chỉ vào cùng một thời điểm. Các dịch vụ phát trực tiếp và hệ thống thanh toán thường giữ danh sách riêng, bổ sung bằng lịch sử hành vi.
- Độ tuổi dữ liệu khác nhau. GeoLite2 City và Country miễn phí được cập nhật hai lần một tuần - vào thứ Ba và thứ Sáu. GeoIP2 thương mại được phát hành mỗi ngày làm việc. Một trang web dựa trên bức ảnh cơ sở dữ liệu một năm sẽ thấy bức tranh của năm trước. Điều này cũng giải thích tại sao các mạng con mới "có mặt" trong nhiều tuần.
- Độ chi tiết khác nhau. Các nhà cung cấp có chính sách khác nhau: một số cung cấp thành phố, trong khi những người khác cố tình làm tròn đến khu vực hoặc quốc gia nếu độ tin cậy thấp. Việc thiếu thành phố không phải là lỗi, mà là từ chối đoán.
Bốn tình huống mà sự khác biệt gần như đảm bảo
- Proxy di động. Trường hợp tồi tệ nhất theo định nghĩa: CGNAT, một tiền tố cho nửa đất nước, độ sai số trung vị gần 200 km. Yêu cầu một IP di động có thành phố chính xác là vô nghĩa - mạng không được thiết lập như vậy. Cũng hữu ích để kiểm tra xem IP đó thực sự là di động, không phải là trung tâm dữ liệu với ASN giả mạo: phân tích phương pháp - trong tài liệu cách phân biệt proxy 4G thật và ASN giả.
- Các khối đã được bán lại và chuyển đi. Sau khi chuyển giao mạng con IPv4 cho chủ sở hữu mới, quốc gia cũ vẫn tồn tại trong các cơ sở dữ liệu trong nhiều tháng. Thị trường địa chỉ thứ cấp rất sôi động, vì vậy đây là hiện tượng phổ biến, không phải là điều kỳ lạ.
- Anycast và đám mây. Một tiền tố giống nhau được công bố từ hàng chục điểm trên thế giới. Cơ sở dữ liệu buộc phải gộp điều này thành một vị trí - và bất kỳ lựa chọn nào cũng sẽ sai cho hầu hết các yêu cầu.
- Đăng ký tại văn phòng chính. Nhà cung cấp được đăng ký ở một quốc gia, nhưng cơ sở hạ tầng được giữ ở quốc gia khác. Cơ sở dữ liệu lấy tài liệu, vì không có dữ liệu nào khác.
Phải làm gì trong thực tế
- Kiểm tra ở nơi quan trọng, không phải trong checker. Bài kiểm tra duy nhất có ý nghĩa - mở trang web mục tiêu và xem quốc gia và tiền tệ mà nó đã hiển thị. Nếu nhiệm vụ là kết quả địa phương của Google hoặc giá khu vực, checker không phải là tiêu chí chấp nhận.
- So sánh ít nhất ba cơ sở dữ liệu. Nếu MaxMind, IPinfo và DB-IP đồng ý - có khả năng cao rằng trang web mục tiêu cũng sẽ thấy như vậy. Sự khác biệt giữa chúng là tín hiệu cho thấy địa chỉ đang gây tranh cãi và sẽ gặp vấn đề.
- Phân tách yêu cầu "quốc gia" và "thành phố". Quốc gia trên một nhà cung cấp đáng tin cậy là đáng tin cậy (99,8% theo đánh giá của MaxMind). Thành phố là một đại lượng xác suất với bán kính khoảng 50 km ngay cả trong trường hợp tốt nhất. Xây dựng logic kinh doanh dựa trên thành phố chỉ có thể với một khoảng trống cho sai số.
- Xem tiền tố, không phải địa chỉ. Kiểm tra whois và kích thước của khối được công bố. Nếu IP nằm trong /16, trải dài trên nửa đất nước, sẽ không có sự gắn kết chính xác nào.
- Đừng nhầm lẫn địa lý với danh tiếng. Quốc gia chính xác không nói lên điều gì về việc địa chỉ có bị đánh dấu là proxy hay không. Đây là một kiểm tra riêng theo các cơ sở dữ liệu khác nhau - được phân tích chi tiết trong tài liệu về huyền thoại về IP "sạch" và các checker danh tiếng.
- Hỏi nhà cung cấp về dữ liệu địa lý. Nếu nhà điều hành mạng con đã công bố dữ liệu địa lý theo RFC 9632, quốc gia và thành phố đến từ chính nó, không phải từ những suy đoán. Đây là lập luận mạnh mẽ nhất ủng hộ một nhóm cụ thể. Các điều chỉnh qua dữ liệu địa lý MaxMind được nhập và kiểm tra mỗi ngày làm việc, các sửa đổi đơn lẻ - trong 1–2 ngày làm việc, sau đó chúng sẽ được đưa vào bản phát hành tiếp theo của cơ sở dữ liệu.
Cách điều này ảnh hưởng đến việc chọn loại proxy
Từ các phép đo, có một quy tắc đơn giản. Nếu nhiệm vụ yêu cầu địa lý chính xác - kết quả địa phương của công cụ tìm kiếm, giá khu vực, quảng cáo nhắm mục tiêu địa lý - hãy chọn proxy cư trú trên các đường dây cố định: ở đó độ sai số trung bình được đo bằng đơn vị km. Nếu nhiệm vụ yêu cầu sự tin cậy của nền tảng đối với loại mạng - mạng xã hội, ứng dụng nhắn tin, ứng dụng di động - hãy chọn proxy di động, nhưng hãy chuẩn bị rằng điểm trên bản đồ sẽ dao động trong phạm vi khu vực. Kết hợp cả hai yêu cầu trong một IP về mặt vật lý là không thể: đây là hạn chế của kiến trúc mạng di động, không phải chất lượng của nhóm.
Đối với các khu vực có tỷ lệ sai sót lớn - Châu Á, Châu Phi - hãy lập kế hoạch ở cấp quốc gia, không phải thành phố. Ở đó, theo dữ liệu nghiên cứu, mỗi địa chỉ thứ hai hoặc thứ ba cách xa vị trí thực tế hơn một trăm km ở bất kỳ nhà cung cấp nào.
Kết luận
"Quốc gia không được xác định" gần như không bao giờ có nghĩa là bạn đã bị lừa với proxy. Thường thì điều này có nghĩa là bạn đã so sánh câu trả lời của hai cơ sở dữ liệu khác nhau và ngạc nhiên rằng chúng không trùng khớp. Trình tự hành động đúng: tìm hiểu cơ sở dữ liệu nào mà trang mục tiêu đang đọc, kiểm tra địa lý chính xác trên đó, so sánh các địa chỉ gây tranh cãi từ nhiều nguồn và không yêu cầu độ chính xác thành phố từ các mạng di động, điều mà họ không có và sẽ không có.
Và hãy nhớ con số chính của năm nay: 3–16 km trên các đường dây cố định so với 179–207 km trên mạng di động. Nó giải thích phần lớn các khiếu nại về địa lý đối với proxy ngay cả trước khi bạn mở ticket hỗ trợ.
