La pregunta "¿cuánto cuesta raspar un millón de páginas?" casi siempre recibe una respuesta inútil: "depende del sitio". Depende, pero no de manera mística. El costo se descompone en cuatro componentes medibles, y cualquiera de ellos se puede calcular de antemano, antes de que llegue la factura por el tráfico. A continuación, la aritmética práctica: de dónde provienen los gigabytes, por qué el precio "por GB" no dice nada sobre su presupuesto y qué palancas realmente reducen el presupuesto drásticamente.
La métrica principal — no el precio por gigabyte, sino el precio por solicitud exitosa
Los proveedores compiten en cifras en la vitrina: $1/GB, $3/GB, $0.30 por mil solicitudes. Estos números no son comparables entre sí, hasta que los lleves a una sola magnitud — el costo de una extracción de datos exitosa. Esto es lo que enfatizan los análisis de mercado: las cifras crudas "por GB" y "por 1000 solicitudes" no son comparables sin tener en cuenta el peso de la página y la tasa de respuestas exitosas.
La fórmula que es suficiente para la planificación:
Presupuesto = (número de páginas objetivo ÷ tasa de éxito) × peso promedio de la página × precio por GB + gastos fijos
Tres variables en la primera parte y una en la segunda. Vamos a desglosar cada una.
Componente 1: cuánto pesa una página
Esta es la variable más subestimada. La variación aquí no es de porcentajes, sino de órdenes de magnitud, y depende de cómo obtienes la página:
- Solicitud HTTP normal sin renderizado — 50–150 KB. Solo obtienes el documento HTML.
- Renderizado completo en un navegador sin cabeza — 100–300 KB con una configuración cuidadosa.
- Navegador "tal cual", sin filtros — 0.2–1 MB o más. Pagas por imágenes, fuentes, scripts publicitarios, analítica y reproductores de video que no necesitas.
La diferencia entre el primer y el tercer punto es de hasta veinte veces en la misma página. Para un millón de páginas, esta diferencia es entre 50 GB y 1000 GB de tráfico.
Componente 2: precio por gigabyte según tipos de proxy
Los rangos de mercado relevantes para 2026 son los siguientes:
- Data center — $0.50–3 por GB o una tarifa mensual por IP.
- Residenciales — $1–8 por GB. Referencia de calidad de precios: alrededor de $1/GB — una excelente oferta, $3–4/GB — el medio del mercado, $5–8/GB — segmento corporativo.
- Móviles (4G/5G) — $2–15 por GB.
- ISP / residenciales estáticos — $1.5–5 por IP al mes.
- APIs de scraping listas — $0.30–12 por 1000 solicitudes.
La tentación de tomar lo más barato es comprensible, pero se rompe con el siguiente componente.
Componente 3: tasa de éxito — el multiplicador oculto del presupuesto
Cada solicitud bloqueada aún la pagas: el tráfico se ha gastado, no hay datos. Por lo tanto, el número real de solicitudes es igual al objetivo, dividido por la tasa de éxito, y el multiplicador crece de manera no lineal:
- éxito del 95% — sobrepago del 5%;
- éxito del 70% — necesitarás aproximadamente 400 mil solicitudes más por cada millón de registros objetivo;
- éxito del 60% — se necesitan 2.5 veces más solicitudes.
Por eso un data center a $0.50/GB en un sitio protegido resulta más caro que residenciales a $3/GB: Cloudflare, DataDome y Akamai marcan los ASN de data center por defecto, y pagas por el flujo de rechazos. Según estimaciones de julio de 2026, los proxies móviles mantienen un 90–95% de éxito contra los sistemas anti-bot modernos — donde el data center no pasa en absoluto.
Conclusión práctica: el tipo de proxy se elige no por el precio, sino por el objetivo. Catálogos simples y APIs abiertas — data center. Tiendas, redes sociales, agregadores con protección — residenciales. Los sitios más agresivos y las versiones móviles de los sitios — móviles.
Tres escenarios para un millón de páginas
Reunamos los números. La condición es la misma: un millón de páginas útiles.
Escenario A — "disciplinado". Cliente HTTP sin navegador, 100 KB por página, residenciales a $2/GB, éxito del 95%. Total: 1.05 millones de solicitudes × 100 KB ≈ 105 GB ≈ $210.
Escenario B — "típico". Navegador sin cabeza con filtrado de recursos, 250 KB por página, residenciales a $3/GB, éxito del 85%. Total: 1.18 millones × 250 KB ≈ 295 GB ≈ $885.
Escenario C — "sin configuración". El navegador carga todo, 800 KB por página, residenciales a $5/GB, éxito del 65%. Total: 1.54 millones × 800 KB ≈ 1230 GB ≈ $6150.
La diferencia entre A y C es casi de treinta veces, con el mismo resultado al final. Ninguna de las variables fue exótica: todo esto son configuraciones predeterminadas comunes frente a una atención cuidadosa. Para referencia: las estimaciones de la industria para una empresa de tamaño medio que procesa un millón de solicitudes al mes en diferentes sitios dan entre $1000–3000 al mes — es decir, entre los escenarios B y C.
Qué no se incluye en el tráfico, pero sí en la factura
Los proxies son generalmente el mayor, pero no el único artículo:
- Captcha. La solución cuesta $0.50–3 por mil. Con un 5% de páginas con captcha en un millón, son 50 mil soluciones — $25–150. Aceptable. Con un 50% — ya $250–1500, y la cuestión deja de ser técnica.
- Infraestructura. $20–200 al mes para volúmenes modestos; $200–500 para un pequeño tamaño y $3000–10,000 para flujos realmente grandes.
- Almacenamiento y tráfico saliente. Alrededor de $0.023 por GB al mes por almacenamiento de objetos y $0.09 por GB de salida en grandes nubes — una bagatela en cientos de gigabytes, una cantidad notable en decenas de terabytes.
- Personas. La línea más cara, que se olvida. Un parser listo para producción son 8–12 semanas de desarrollo, luego 4–8 horas al mes en sitios simples y 20+ horas en protegidos. Con una tarifa de $75/hora, el soporte de una fuente protegida cuesta más de $1500 al mes — más que todo el tráfico en el escenario B.
Cinco palancas que realmente reducen el presupuesto
- Elimina el navegador donde no es necesario. Si los datos están en HTML o en una API interna — el renderizado es innecesario. Esta es la principal palanca: menos 60–80% de tráfico.
- Bloquea recursos si el navegador es necesario. Imágenes, fuentes, medios, scripts publicitarios y analíticos se desactivan con una sola regla de interceptación de solicitudes y ofrecen un ahorro múltiple. Un análisis detallado de las técnicas está en el material sobre optimización del gasto de tráfico a través de proxies.
- Clasifica los objetivos por dificultad. Pasar toda la lista a través del canal más caro es el error más común del presupuesto. Clasifica las fuentes en "abiertas", "moderadamente protegidas" y "agresivas" y asigna a cada una su tipo de proxy.
- Construye la política de reintentos de manera consciente. Repetir ciegamente tres veces ante un fallo triplica el tráfico en objetivos problemáticos. Debes repetir solo aquellos códigos de respuesta donde la repetición tiene sentido, y con una IP diferente, no con la misma.
- Cachea y no recojas lo mismo dos veces. Listas, paginación, pasadas repetidas por el catálogo — aquí se pierden fácilmente decenas de por ciento del presupuesto.
Cuándo es más barato un API listo y cuándo tu propio stack
Debes calcular el costo total de propiedad, no solo la línea "por GB". Referencias del mercado: un parser propio para 100 mil páginas al mes cuesta entre $700–1650 incluyendo soporte, mientras que un API listo para el mismo volumen cuesta entre $50–300. En números grandes, la situación se invierte: 1 millón de solicitudes al mes a través de un API cuesta entre $250–2490, mientras que construir tu propia infraestructura para 10 TB al mes se estima en aproximadamente $230 mil al año frente a $100–150 mil por el servicio.
Regla general: mientras el volumen sea pequeño y haya muchos sitios — opta por la solución lista, pagas por el soporte ajeno. Cuando el volumen es estable, hay pocos objetivos y están bien estudiados — tu propio stack en proxies es más barato, porque dejas de pagar el sobreprecio por el renderizado que no necesitas. Una comparación detallada de ambos enfoques está en el análisis de proxies contra scraping API y web unblocker.
Qué cambia en otoño de 2026
Hay un factor que elevará los cálculos. A partir del 15 de septiembre de 2026, Cloudflare trasladará nuevos dominios a la bloqueo de categorías Training y Agent por defecto — en páginas con publicidad; los cambios afectan a nuevos clientes, nuevos sitios de clientes existentes y todos los clientes del plan gratuito. Los crawlers de búsqueda siguen siendo permitidos. Paralelamente, Pay Per Crawl se transforma en Pay Per Use: el editor recibe dinero no por el hecho de eludir la página, sino por el uso del contenido en la respuesta de IA.
El contexto es simple: según Cloudflare, el 52% de las solicitudes de crawlers en su red ahora se destinan a entrenar IA frente al 22% en primavera de 2025. La red se está cerrando, y el sentido práctico para el presupuesto es que la tasa de éxito en fuentes protegidas disminuirá en promedio, lo que significa que el multiplicador oculto del presupuesto del tercer componente se volverá más significativo. Incorpora esto en tu plan, en lugar de enterarte por la factura.
En resumen
El costo de raspar no es el precio por gigabyte, sino el producto del peso de la página, el precio del canal y la inversa de la tasa de éxito. La diferencia entre un pipeline cuidadoso y uno descuidado en un millón de páginas se mide no en porcentajes, sino en órdenes de magnitud. Antes de negociar un descuento con el proveedor, calcula cuánto pagas por cargar imágenes que no raspas y por repeticiones que no deberían haber ocurrido. Generalmente, hay más dinero ahí que en cualquier descuento.
```