La lista de precios del proveedor de proxies está diseñada de tal manera que comparar proveedores parece una tarea sencilla: un gigabyte cuesta $1, otro $8 — la diferencia es de ocho veces. En la práctica, el equipo que compró un gigabyte por un dólar paga regularmente más por los datos recopilados que aquel que pagó ocho. La razón no está en el marketing ni en comisiones ocultas: el precio por gigabyte simplemente no es la unidad en la que se mide su tarea. No está comprando tráfico — está comprando registros extraídos con éxito, y entre estas dos magnitudes hay una cadena de multiplicadores que son únicos para cada proyecto.
La factura llega no por lo que usted calculó
Escena típica: planeaban recopilar un millón de tarjetas de productos, presupuestaron 200 KB por página, obtuvieron 200 GB calculados y un presupuesto de alrededor de mil quinientos dólares. Un mes después, en su cuenta personal — 900 GB y una factura tres veces mayor que la estimación. Nadie fue engañado: tres cosas cambiaron que no estaban en el cálculo.
La brecha entre el precio y la factura siempre se descompone en los mismos componentes. Vale la pena desglosarlos por separado — luego la fórmula se ensamblará sola.
Tres multiplicadores entre el precio y la factura
1. Cuánto pesa realmente la página
La estimación de "200 KB" proviene de la nada y se refiere al HTML desnudo. El peso real depende de cómo usted obtiene la página. La respuesta HTML cruda de una tienda moderna suele ser de cientos de kilobytes. Pero una página completamente renderizada en un navegador sin cabeza, con todos los scripts, fuentes, imágenes y analíticas, pesa entre 2 y 5 MB. La diferencia entre las dos formas de obtener los mismos datos es un orden de magnitud, y recae completamente en su tráfico.
Los cálculos de la industria suelen manejar un rango de 1 a 3 MB para la recopilación no optimizada y de 100 a 300 KB para la optimizada. Entre estos dos modos no hay "un poco de ahorro", sino una diferencia de diez veces en el mismo proyecto.
2. Qué proporción de respuestas es realmente útil
El segundo multiplicador es la tasa de éxito, la proporción de solicitudes que devolvieron contenido útil. Un captcha en lugar de una página, 403, un marco vacío sin datos, redirección a una página de error — todo esto es tráfico pagado que no proporcionó ningún registro.
La aritmética es simple y despiadada: número de solicitudes = registros necesarios ÷ tasa de éxito. Con un 95% de éxito, para un millón de registros se necesitan 1,05 millones de solicitudes. Con un 70% — ya son 1,43 millones. Con un 60% — 1,67 millones. Es decir, la caída de la tasa de éxito del 95% al 60% por sí sola añade casi un 60% a la factura, con el precio del gigabyte completamente inalterado.
3. Reintentos, tiempos de espera y tráfico adicional
Encima de esto se suma el tráfico adicional de la propia envoltura. Aquí la diferencia entre un stack maduro y uno apresurado es enorme: en plataformas gestionadas bien ajustadas, los reenvíos consumen alrededor del 0,1–3% adicional, en un pipeline Scrapy hecho a medida — del 5 al 15%, y la proporción aumenta con la escala. Una lógica de reintento agresiva, que golpea un dominio bloqueado cinco veces seguidas, puede convertir fácilmente estos porcentajes en decenas.
Métrica que no miente
Unamos todo en una sola magnitud. No se deben contar dólares por gigabyte, sino el costo de mil registros extraídos con éxito:
- Precio por 1000 registros = (peso promedio de la respuesta en GB ÷ tasa de éxito) × (1 + proporción de reintentos) × precio por GB × 1000
El valor de esta fórmula radica en que hace que las ofertas incomparables sean comparables. Un pool barato con una tasa de bloqueo del 40% y uno caro con una tasa de bloqueo del 5% finalmente se encuentran en el mismo eje. Es notable que los propios proveedores han llegado a esta misma métrica en el último año: en los materiales de la industria, cada vez más se escucha la formulación "precio dividido por tasa de éxito", en lugar del precio bruto por gigabyte.
Cómo se ve en dinero
Tomemos un millón de registros, una página promedio de 500 KB y tráfico residencial a $8/GB — un típico punto medio del mercado. Solo cambiamos la tasa de éxito:
- 95% de éxito — 1,05 millones de solicitudes, alrededor de 525 GB, aproximadamente $4,200
- 70% de éxito — 1,43 millones de solicitudes, alrededor de 715 GB, aproximadamente $5,720
- 60% de éxito — 1,67 millones de solicitudes, alrededor de 835 GB, aproximadamente $6,680
La diferencia es de casi $2,500 en el mismo precio. Ahora comparemos dos ofertas que en la lista de precios parecen el cielo y la tierra. Proveedor A: $2/GB, pero tiene un 55% de éxito en su objetivo. Proveedor B: $6/GB y 92% de éxito. Con los mismos 500 KB y un millón de registros, A obtiene alrededor de 910 GB y $1,820, mientras que B obtiene alrededor de 545 GB y $3,270. Aquí A es realmente más barato, y este es un resultado honesto: con una gran brecha en el precio, una baja tasa de éxito no siempre consume las ganancias.
Pero añada a A un 15% de reintentos frente al 3% de B, añada el renderizado sin cabeza, que se incluye precisamente porque el pool barato a menudo devuelve un placeholder en lugar de contenido — y el peso de la página en A sube a 1,5 MB frente a 500 KB en B. Recalculando: A — alrededor de 3,1 TB y $6,200, B — alrededor de 560 GB y $3,370. La situación se ha invertido. Por eso la pregunta "¿quién tiene el gigabyte más barato?" no tiene sentido por sí sola: la respuesta depende de su objetivo, su stack y su tasa de bloqueo.
Por qué los scraping API se consideran de otra manera — y cómo compararlos
Una dificultad adicional es que parte del mercado no vende gigabytes en absoluto. Los scraping API y los desbloqueadores web cobran por solicitudes, y las tarifan según la complejidad. El rango de precios para 2026 por 1000 páginas es el siguiente:
- HTML simple: ScrapeOps alrededor de $0.19, ScraperAPI alrededor de $0.49, Scrape.do alrededor de $0.58, ScrapingBee alrededor de $0.66, Bright Data alrededor de $1.00
- Con renderizado JS (normalmente 5 créditos en lugar de uno): ScrapeOps alrededor de $0.95, Scrape.do alrededor de $2.90, ScrapingBee alrededor de $3.30, ScraperAPI alrededor de $4.90, Bright Data alrededor de $5.00
- Sitios bajo protección anti-bot (10–25 créditos): ScrapeOps alrededor de $1.90, Scrape.do alrededor de $4.45, ScraperAPI alrededor de $5.96, ScrapingBee alrededor de $6.60, Bright Data en el rango de $8–15
Observe la brecha dentro de un mismo proveedor: una página simple y una página bajo protección en ScraperAPI difieren en doce veces. La tarifa "por solicitud" parece más predecible que los gigabytes hasta el momento en que el objetivo se mueve de la primera categoría a la tercera — y esto sucede sin su participación, por decisión del propietario del sitio.
Esto se reduce a la misma fórmula: costo por solicitud ÷ tasa de éxito × 1000. Después de esto, la oferta "$3.30 por 1000 páginas JS" y la oferta "$6 por gigabyte de tráfico residencial" finalmente se pueden poner una al lado de la otra. Un análisis más amplio de los enfoques en sí — API oficial, conjunto de datos listo o su propio parser — lo hemos tratado por separado; aquí solo importa su comparabilidad en términos de dinero.
Medición en una noche
La fórmula es inútil sin sus propios números, y la buena noticia es que obtenerlos es un trabajo de un par de horas. Un piloto de 1000 solicitudes en sus URL reales proporciona todo lo necesario.
- Tome una muestra representativa de objetivos — no la página principal, sino esas tarjetas, categorías y resultados que va a recopilar en producción. La tasa de éxito en la página principal no predice nada.
- Registre por separado cuatro contadores: respuestas válidas con datos, errores HTTP, captchas y desafíos, "códigos 200 vacíos" — código 200 sin el contenido necesario. La última categoría es la más engañosa: formalmente es un éxito, pero en realidad es basura pagada.
- Obtenga el volumen real de tráfico de las estadísticas del proveedor, no de sus propias estimaciones. La discrepancia entre el peso calculado y el real de la página suele ser el primer hallazgo de tal piloto.
- Cuente los reintentos como una línea separada, y no los disuelva en el número total de solicitudes.
- Repita con el segundo proveedor el mismo día. La tasa de éxito fluctúa junto con el estado de ánimo de los sistemas anti-bot, y las mediciones separadas por una semana no son comparables.
Si el piloto mostró una baja tasa de éxito, no se apresure a cambiar de proveedor: primero vale la pena entender la razón. El análisis de las fuentes típicas del problema se ha recopilado en el material sobre cómo diagnosticar una baja tasa de éxito en proxies, y el control regular de las mismas métricas debe convertirse en un hábito. A menudo, el problema radica en los encabezados, el tiempo o la huella TLS del cliente, y no en la calidad de la IP.
Cuatro palancas que mueven el número más que un descuento
Cuando la métrica se ha calculado, se hace evidente dónde es más sensible. Un descuento del 10% en el precio es la palanca más débil disponible.
Peso de la respuesta. La forma más rápida de ganar. Recoger solo lo que se necesita reduce el tráfico entre 2 y 10 veces. Si el navegador sin cabeza es obligatorio, bloquee a nivel de interceptación de solicitudes imágenes, fuentes, medios y scripts de terceros — el contenido no se ve afectado, y el volumen disminuye drásticamente. Active la compresión y las solicitudes condicionales por ETag: una página que no ha cambiado desde la última exploración debería costarle una respuesta 304, no un megabyte.
Tasa de éxito. Cada diez puntos porcentuales de éxito en el rango del 60 al 95% son decenas de porcentajes en la factura. Aquí no se trata de dinero, sino de ingeniería: una huella de cliente correcta, un ritmo razonable, el tipo correcto de IP para un objetivo específico.
Mezcla de tipos de proxies. Hacer pasar todo el tráfico a través de un pool residencial es el error más común y costoso. Una parte significativa de los objetivos se puede obtener perfectamente con proxies de centros de datos, que son diez veces más baratos; las direcciones residenciales solo deben gastarse en lo que realmente lo requiere. La ruta debe ser según el objetivo, no por costumbre, lo que reduce los gastos en proxies en un 60–70%.
Disciplina de reintentos. Retraso exponencial, límite de intentos, renuncia a reintentos en códigos que no se resuelven con un reintento. La diferencia entre el 3% y el 15% de tráfico adicional es la diferencia entre una envoltura cuidadosa y su ausencia. El aspecto práctico de esta cuestión se ha analizado en el material sobre optimización del gasto de tráfico a través de proxies.
Qué queda fuera del tráfico
La imagen completa de los gastos es más amplia que la factura de proxies, y esto es algo que debe tener en cuenta al elegir entre "recopilar uno mismo" y "comprar uno listo". Para un proyecto del tamaño de un millón de páginas al mes, las estimaciones de la industria para una solución auto-alojada son las siguientes: tráfico residencial $500–1500, tiempo de ingeniería $1000–2000, infraestructura $300–500. En total, $2000–4400 al mes — y esto antes de escribir la lógica de negocio en sí. Con una tarifa de ingeniero de alrededor de $100 por hora, varios días dedicados a reparar selectores rotos son más costosos que la factura mensual por proxies.
No es un argumento en contra de la recopilación autónoma — es un argumento a favor de considerar las horas de ingeniería como una línea de presupuesto igual que los gigabytes. El modelo de tarificación también debe elegirse de manera consciente: para sesiones largas y estables, pagar por una IP dedicada a menudo resulta más rentable que por megabyte.
En resumen
El precio por gigabyte no es el precio de los datos, sino el precio de uno de los cuatro factores multiplicadores. Comparar proveedores por este precio es lo mismo que elegir un automóvil por el precio del litro de gasolina, sin preguntar sobre el consumo. La unidad de trabajo para la comparación es una: cuánto cuesta mil registros extraídos con éxito en sus objetivos, con su peso de respuesta, su tasa de éxito y sus reintentos.
Calcule esto en un piloto de mil solicitudes antes de suscribirse a un plan anual. A menudo se descubre que la oferta más barata en la lista de precios le cuesta más que todas las demás — y que la mayor reserva de ahorro no está en negociar un descuento, sino en un par de docenas de líneas de código que desactivan la carga de imágenes.
```