블로그로 돌아가기

프록시 가격이 $/GB로 잘못된 정보입니다: 성공적인 기록의 비용을 계산하세요

저렴한 기가바이트는 종종 비싼 것보다 더 비쌉니다. 가격과 계정 사이의 세 가지 요소를 분석하고, 성공적으로 추출된 천 개의 레코드의 비용 공식을 도출하며, 2026년의 실제 가격을 기준으로 $2/GB가 $6/GB에 비해 불리하다는 것을 계산합니다.

📅2026년 8월 23일
프록시 가격이 $/GB로 잘못된 정보입니다: 성공적인 기록의 비용을 계산하세요
```html

프록시 제공자의 가격 목록은 공급자를 비교하는 것이 간단한 일처럼 보이도록 구성되어 있습니다: 한 곳에서는 기가바이트가 $1이고, 다른 곳에서는 $8입니다 — 차이는 8배입니다. 하지만 실제로는 1달러에 기가바이트를 구매한 팀이 8달러를 지불한 팀보다 수집된 데이터에 대해 더 많은 비용을 지불하는 경우가 많습니다. 그 이유는 마케팅이나 숨겨진 수수료 때문이 아닙니다: 기가바이트당 가격은 단순히 귀하의 작업을 측정하는 단위가 아닙니다. 귀하는 트래픽을 구매하는 것이 아니라 성공적으로 추출된 레코드를 구매하는 것이며, 이 두 가지 사이에는 각 프로젝트마다 다른 곱셈 인자가 있습니다.

청구서는 당신이 계산한 것과는 다릅니다

전형적인 장면: 백만 개의 상품 카드를 수집할 계획을 세우고, 페이지당 200KB를 예상하여 계산한 결과 200GB와 약 1500달러의 예산을 마련했습니다. 한 달 후 개인 대시보드에는 900GB와 예산의 세 배에 해당하는 청구서가 나타납니다. 아무도 속이지 않았습니다: 계산에 없었던 세 가지가 변경되었습니다.

가격과 청구서 간의 차이는 항상 동일한 구성 요소로 나뉩니다. 이를 개별적으로 분석하면 공식이 자연스럽게 형성됩니다.

가격과 청구서 사이의 세 가지 곱셈 인자

1. 페이지의 실제 무게는 얼마인가

“200KB”라는 평가는 머리에서 나온 것이며, 순수 HTML에 해당합니다. 실제 무게는 페이지를 가져오는 방법에 따라 달라집니다. 현대 상점의 원시 HTML 응답은 일반적으로 수백 킬로바이트입니다. 그러나 headless 브라우저에서 모든 스크립트, 글꼴, 이미지 및 분석이 포함된 완전히 렌더링된 페이지는 2-5MB의 무게를 가집니다. 동일한 데이터를 얻는 두 가지 방법 간의 차이는 규모의 차이이며, 이는 전적으로 귀하의 트래픽에 영향을 미칩니다.

업계 계산은 일반적으로 비최적화 수집의 경우 1-3MB, 최적화된 경우 100-300KB의 범위를 사용합니다. 이 두 모드 간에는 “약간의 절약”이 아니라 동일한 프로젝트에서 10배의 차이가 있습니다.

2. 응답 중 어떤 비율이 실제로 유용한가

두 번째 곱셈 인자는 성공률, 즉 유용한 콘텐츠를 반환한 요청의 비율입니다. 페이지 대신 CAPTCHA, 403 오류, 데이터가 없는 빈 프레임, 대체 페이지로의 리디렉션 — 이 모든 것은 하나의 레코드도 제공하지 않은 유료 트래픽입니다.

산술은 간단하고 무자비합니다: 요청 수 = 필요한 레코드 ÷ 성공률. 95%의 성공률로 백만 개의 레코드를 얻기 위해서는 105만 개의 요청이 필요합니다. 70%의 성공률에서는 143만 개, 60%에서는 167만 개가 필요합니다. 즉, 성공률이 95%에서 60%로 떨어지면 청구서에 거의 60%가 추가됩니다. 기가바이트당 가격은 전혀 변하지 않았습니다.

3. 재시도, 타임아웃 및 부가 트래픽

이 위에 부가적인 트래픽이 쌓입니다. 성숙한 관리 플랫폼의 경우 재전송은 약 0.1-3%를 차지하는 반면, 자작 Scrapy 파이프라인에서는 5-15%에 달하며, 이 비율은 규모에 따라 증가합니다. 차단된 도메인을 5번 연속으로 공격하는 공격적인 재시도 로직은 이러한 비율을 쉽게 수십 퍼센트로 증가시킵니다.

거짓말하지 않는 메트릭

모든 것을 하나의 수치로 모아보겠습니다. 기가바이트당 달러가 아니라 성공적으로 추출된 1000개의 레코드의 비용을 계산해야 합니다:

  • 1000개 레코드당 가격 = (응답의 평균 무게(GB) ÷ 성공률) × (1 + 재시도 비율) × 기가바이트당 가격 × 1000

이 공식의 가치는 비교할 수 없는 제안을 비교할 수 있게 해준다는 것입니다. 차단 비율이 40%인 저렴한 풀과 차단 비율이 5%인 비싼 풀은 마침내 동일한 축에 놓이게 됩니다. 흥미롭게도, 지난 1년 동안 이 메트릭에 도달한 것은 바로 제공자들입니다: 업계 자료에서 “가격 나누기 성공률”이라는 표현이 점점 더 자주 등장하고 있으며, 단순한 기가바이트당 가격이 아닙니다.

돈으로 어떻게 보이는가

백만 개의 레코드, 평균 페이지 500KB, 레지던트 트래픽 $8/GB를 가정해 보겠습니다 — 시장의 전형적인 중간입니다. 성공률만 변경해 보겠습니다:

  • 95% 성공률 — 105만 개 요청, 약 525GB, 대략 $4,200
  • 70% 성공률 — 143만 개 요청, 약 715GB, 대략 $5,720
  • 60% 성공률 — 167만 개 요청, 약 835GB, 대략 $6,680

차이는 동일한 가격에서 거의 $2,500입니다. 이제 가격 목록에서 하늘과 땅처럼 보이는 두 가지 제안을 비교해 보겠습니다. 제공자 A: $2/GB이지만 귀하의 목표에서 55%의 성공률을 유지합니다. 제공자 B: $6/GB이고 92%의 성공률을 보입니다. 동일한 500KB와 백만 개의 레코드에서 A는 약 910GB와 $1,820, B는 약 545GB와 $3,270입니다. 여기서 A는 실제로 더 저렴하며, 이는 정직한 결과입니다: 가격 차이가 클 경우 낮은 성공률이 항상 이익을 잠식하지는 않습니다.

하지만 A에 15%의 재시도를 추가하고 B에 3%를 추가하면, 저렴한 풀은 종종 콘텐츠 대신 대체 페이지를 제공하기 때문에 headless 렌더링을 포함해야 하며, A의 페이지 무게는 500KB인 B에 비해 1.5MB로 증가합니다. 재계산: A는 약 3.1TB와 $6,200, B는 약 560GB와 $3,370입니다. 상황이 뒤바뀌었습니다. 바로 이 때문에 “누가 기가바이트를 더 저렴하게 제공하는가”라는 질문은 독립적인 의미가 없습니다: 답은 귀하의 목표, 스택 및 차단 비율에 따라 달라집니다.

왜 스크래핑 API는 다르게 계산되는가 — 그리고 어떻게 비교할 수 있는가

시장의 일부는 전혀 기가바이트를 판매하지 않는다는 점에서 별도의 복잡성이 있습니다. 스크래핑 API와 웹 언블로커는 요청에 대해 비용을 청구하며, 복잡성에 따라 요금을 부과합니다. 2026년의 가격 범위는 1000페이지에 대해 다음과 같습니다:

  • 단순 HTML: ScrapeOps 약 $0.19, ScraperAPI 약 $0.49, Scrape.do 약 $0.58, ScrapingBee 약 $0.66, Bright Data 약 $1.00
  • JS 렌더링 포함 (보통 1개 대신 5크레딧): ScrapeOps 약 $0.95, Scrape.do 약 $2.90, ScrapingBee 약 $3.30, ScraperAPI 약 $4.90, Bright Data 약 $5.00
  • 안티봇 보호가 있는 사이트 (10-25 크레딧): ScrapeOps 약 $1.90, Scrape.do 약 $4.45, ScraperAPI 약 $5.96, ScrapingBee 약 $6.60, Bright Data는 $8-15 범위

하나의 제공자 내에서의 차이에 주목하십시오: ScraperAPI의 경우 단순 페이지와 보호된 페이지는 12배 차이가 납니다. “요청당 요금”은 기가바이트보다 예측 가능해 보이지만, 목표가 첫 번째 카테고리에서 세 번째 카테고리로 이동하면 — 이는 귀하의 개입 없이 사이트 소유자의 결정에 의해 발생합니다.

이것은 여전히 동일한 공식으로 귀결됩니다: 요청 비용 ÷ 성공률 × 1000. 이후 “$3.30에 1000개의 JS 페이지”와 “$6에 레지던트 트래픽 기가바이트”라는 제안을 나란히 놓을 수 있습니다. 접근 방식에 대한 보다 광범위한 분석은 공식 API, 준비된 데이터 세트 또는 자체 파서에서 별도로 다루었습니다; 여기서는 그들의 비용 비교 가능성만이 중요합니다.

하루 저녁에 측정하기

공식은 귀하의 숫자가 없으면 쓸모가 없으며, 좋은 소식은 이를 얻는 것이 몇 시간의 작업이라는 것입니다. 귀하의 실제 URL에 대한 1000개의 요청으로 파일럿을 진행하면 필요한 모든 정보를 얻을 수 있습니다.

  1. 대표적인 목표 샘플을 가져오십시오 — 메인 페이지가 아니라 실제로 프로덕션에서 수집할 카드, 카테고리 및 결과입니다. 메인 페이지에서의 성공률은 아무것도 예측하지 않습니다.
  2. 네 가지 카운터를 별도로 기록하십시오: 데이터가 있는 유효한 응답, HTTP 오류, CAPTCHA 및 챌린지, “빈 200” — 필요한 콘텐츠가 없는 코드 200입니다. 마지막 카테고리는 가장 교활합니다: 형식적으로는 성공이지만, 실제로는 유료 쓰레기입니다.
  3. 제공자의 통계에서 실제 트래픽 양을 측정하십시오, 귀하의 추정이 아니라. 계산된 페이지 무게와 실제 무게 간의 차이는 일반적으로 이러한 파일럿의 첫 번째 발견입니다.
  4. 재시도를 별도의 항목으로 계산하십시오, 요청의 총 수에 녹이지 마십시오.
  5. 같은 날 두 번째 제공자에서 반복하십시오. 성공률은 안티봇 시스템의 기분과 함께 변동하며, 일주일에 걸쳐 나뉘어진 측정값은 비교할 수 없습니다.

파일럿이 낮은 성공률을 보였다면, 공급자를 변경하는 데 서두르지 마십시오: 먼저 원인을 이해하는 것이 좋습니다. 문제의 전형적인 출처에 대한 분석은 낮은 성공률의 프록시 진단 방법에 수집되어 있으며, 동일한 메트릭에 대한 정기적인 모니터링은 지속적으로 수행해야 합니다. 종종 문제는 헤더, 타이밍 또는 클라이언트의 TLS 핑거프린트에 있으며, IP의 품질과는 전혀 관련이 없습니다.

할인보다 숫자를 더 많이 움직이는 네 가지 레버

메트릭이 계산되면 가장 민감한 부분이 보입니다. 가격의 10% 할인은 사용 가능한 레버 중 가장 약한 것입니다.

응답의 무게. 가장 빠른 이익입니다. 필요한 것만 가져오면 트래픽이 2-10배 줄어듭니다. headless 브라우저가 필수라면, 요청 가로채기 수준에서 이미지, 글꼴, 미디어 및 외부 스크립트를 차단하십시오 — 콘텐츠는 손상되지 않으며, 양은 크게 줄어듭니다. 압축 및 ETag에 따른 조건부 요청을 활성화하십시오: 지난 탐색 이후 변경되지 않은 페이지는 304 응답을 받아야 하며, 메가바이트가 아닙니다.

성공률. 60-95% 범위에서 성공률이 10% 포인트 증가할 때마다 청구서의 수십 퍼센트가 발생합니다. 여기서는 돈이 아니라 엔지니어링이 작용합니다: 올바른 클라이언트 핑거프린트, 합리적인 속도, 특정 목표에 적합한 IP 유형입니다.

프록시 유형의 혼합. 모든 트래픽을 레지던트 풀을 통해 보내는 것은 가장 일반적이고 가장 비싼 실수입니다. 상당수의 목표는 데이터 센터 프록시를 통해 잘 제공되며, 이는 10배 더 저렴합니다; 레지던트 주소는 실제로 필요할 때만 사용하는 것이 좋습니다. 습관이 아닌 목표에 따라 라우팅하면 프록시 비용을 60-70% 절감할 수 있습니다.

재시도 규율. 지수 지연, 시도 한도, 반복이 효과가 없는 코드에서 반복을 포기합니다. 3%와 15%의 부가 트래픽 간의 차이는 세심한 포장과 그 부재 간의 차이입니다. 이 문제의 실질적인 측면은 프록시를 통한 트래픽 소비 최적화 자료에서 분석되었습니다.

트래픽을 넘어 남는 것

비용의 전체 그림은 프록시 청구서를 넘어 더 넓으며, “직접 수집”과 “기성품 구매” 사이에서 선택할 때 이를 기억하는 것이 중요합니다. 월 백만 페이지 규모의 프로젝트에 대한 업계 평가에 따르면, self-hosted 솔루션의 비용은 다음과 같습니다: 레지던트 트래픽 $500-1500, 엔지니어링 시간 $1000-2000, 인프라 $300-500. 총 $2000-4400의 월 비용 — 이는 비즈니스 로직을 작성하기 전입니다. 엔지니어의 시급이 약 $100일 경우, 부서진 선택기를 수리하는 데 며칠이 걸리면 프록시 청구서보다 더 비쌀 수 있습니다.

이는 자가 수집에 대한 반론이 아닙니다 — 이는 엔지니어링 시간을 기가바이트와 동일한 예산 항목으로 계산해야 한다는 주장입니다. 요금 모델도 신중하게 선택해야 합니다: 안정적인 긴 세션의 경우 전용 IP에 대한 요금이 메가바이트당 요금보다 더 유리할 수 있습니다.

간단히 말해

기가바이트당 가격은 데이터의 가격이 아니라 네 가지 곱셈 인자 중 하나의 가격입니다. 제공자를 이 가격으로 비교하는 것은 리터당 가격으로 자동차를 선택하는 것과 같으며, 연비에 대한 질문은 하지 않는 것입니다. 비교의 작업 단위는 하나입니다: 귀하의 목표에서 성공적으로 추출된 1000개의 레코드의 비용은 얼마인지, 귀하의 응답 무게, 성공률 및 재시도와 함께입니다.

연간 요금제에 가입하기 전에 1000개의 요청으로 이를 계산하십시오. 가격 목록에서 가장 저렴한 제안이 다른 모든 제안보다 더 비쌀 수 있다는 것이 자주 밝혀지며, 가장 큰 절약의 여지는 할인 협상에 있는 것이 아니라 이미지를 로드하지 않도록 하는 두 개의 코드 줄에 있습니다.

```