El parser está funcionando. HTTP 200 fluyen sin parar, los proxies están activos, el captcha no aparece, y la cola de enlaces sigue creciendo. Pero después de una semana se descubre que la mitad de los precios recopilados son ficticios, y los gigabytes de tráfico se han ido a páginas que no existen en el sitio real. No es un fallo del parser ni un mal pool de IP. Es un nuevo modo de protección: el sitio no te bloquea, el sitio te alimenta.
En un año y medio, la industria de la protección anti-bots ha cambiado silenciosamente de objetivo. El bloqueo es una medida costosa y notable: el scraper ve un 403, repara su huella, cambia de subred y regresa. Es mucho más rentable no interferir en su trabajo, sino hacer que su trabajo sea inútil. A continuación, se presentan tres mecánicas que ya están funcionando en producción en millones de sitios, y un conjunto de verificaciones que las detectan de tu lado.
Primera mecánica: tarpit en lugar de bloqueo
El tarpit (tarpit, "pozo de alquitrán") es un generador de sitios infinitos. El crawler recibe una página HTML válida con decenas de enlaces, cada enlace lleva a otra página generada de la misma manera, y la cola de rastreo nunca se vacía.
La herramienta de código abierto más conocida es Nepenthes. Su configuración muestra bien la intención: por defecto, el servidor mantiene la respuesta de 10 a 65 segundos, entrega texto "de charla de Markov", generado a partir de un corpus, y lo hace de manera determinista: la misma URL siempre devuelve la misma basura, para que las páginas parezcan archivos estáticos normales y no trampas. Los datos se entregan en pequeñas porciones, "de unos pocos bytes", para agotar los tiempos de espera del cliente. El autor presenta una medición de una hora de funcionamiento: 1850 clientes diferentes, 10,015 solicitudes y 56,020 segundos de retraso total — alrededor de quince horas de tiempo de máquina ajena desperdiciado.
Iocaine funciona de manera diferente: actúa como un proxy inverso frente al sitio real, y en la primera interceptación entrega al bot un enlace "envenenado" único y lo identifica a su regreso, generando texto mediante cadenas de Markov — con la expectativa de que este texto entrará en el conjunto de entrenamiento.
En Cloudflare, el mismo truco se convirtió en un producto: AI Labyrinth, presentado en marzo de 2025. Las páginas de cebo no se generan al vuelo: se utiliza una línea de pre-generación en Workers AI, el resultado se almacena en R2 y se distribuye rápidamente. Los enlaces al laberinto se incrustan en páginas normales a través de una transformación HTML, y en las propias trampas hay directivas meta contra la indexación, para que no se vea afectada la entrega. Lo principal aquí no es el tiempo desperdiciado del bot, sino la señal: a través de enlaces ocultos para los humanos y etiquetados con nofollow, solo el automático navega, y avanzar tres niveles dentro de tal laberinto se convierte en la huella de un mal bot. Cloudflare estima la magnitud del problema por el cual se hizo esto en más de 50 mil millones de solicitudes de crawlers de IA por día — poco menos del 1% de todo el tráfico de la red.
Cómo se ve el tarpit en tus registros
Una imagen característica: una cola de varios miles de URL que solo crece, el tiempo de respuesta se mantiene constantemente alrededor de un segundo y medio o más, los códigos HTTP son todos 200, y el número de registros útiles extraídos es cero. Ningún 403, ningún captcha, y ninguna salida: por muchas páginas que se hayan rastreado, nuevos enlaces aparecen más rápido de lo que se cierran los antiguos.
Segunda mecánica: contenido envenenado para agentes de IA
Si la primera mecánica quema recursos, la segunda golpea los resultados. Los investigadores Minghao Luo y Liang Chen publicaron en junio de 2026 un trabajo con el simulador FORGE (Fake Online Recommendations in Generative Environments): probaron 12 grandes modelos de lenguaje en 225 productos en 15 categorías — desde ropa hasta electrónica. La mecánica del ataque es simple: en el texto de la página, una marca real es reemplazada por una ficticia.
El resultado — una página falsificada da hasta un 27% de casos en que el asistente recomienda una marca inexistente, y reemplazar los tres primeros resultados de búsqueda eleva esta proporción al 73.8%. Los modelos no solo repetían el nombre falso — también inventaban virtudes para él, incluyendo supuesta popularidad en comunidades. Las tres defensas propuestas (un prompt de escepticismo, consenso sobre el conocimiento interno del modelo, verificación entre documentos) o no funcionaron, o crearon nuevos problemas. La conclusión de los autores: la verificación debe hacerse más arriba en la cadena — en la etapa de recopilación, no en la etapa de razonamiento.
La tercera mecánica completa el panorama. En el trabajo "A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See" (Shaked Zychlinski) se describe el cloaking, dirigido precisamente a agentes de IA: el sitio reconoce al agente por los atributos del navegador, las firmas del marco de automatización y las características de la red, y le entrega una versión diferente de la página — con instrucciones ocultas y hechos alterados. Una persona que abra la misma URL ve una página normal, por lo que una verificación manual "entré, todo está bien" no prueba nada.
Por qué esto es principalmente una cuestión de presupuesto
El tarpit está diseñado para que cada página sea barata para el sitio y cara para ti. Cuando el tráfico se paga por gigabytes, el generador de páginas infinitas se convierte en un contador de tus gastos: pagas por megabytes de texto de Markov que nunca se convertirá en una línea en la base de datos. Es exactamente la misma aritmética que con las solicitudes fallidas: el precio por gigabyte no dice nada sobre el costo del resultado, hasta que cuentas el costo de un registro exitoso, no de una solicitud.
De aquí surge la primera regla práctica: el límite de tráfico debe establecerse a nivel de dominio y tarea, no solo a nivel de cuenta. Un dominio que ha consumido más de un gigabyte y no ha devuelto ningún registro debe ser detenido automáticamente — sin esto, una sola trampa puede consumir el presupuesto diario durante la noche.
Siete verificaciones que atrapan basura
- Cuenta el yield, no los códigos de respuesta. La principal métrica de la línea de producción es la proporción de solicitudes que han dado un registro válido con los campos obligatorios completos. Mientras mires la proporción de 200, el tarpit parece ser una fuente perfectamente saludable.
- URL canaria. Cada N solicitudes, solicita una dirección que sabes que no existe dentro del dominio — con un segmento de ruta aleatorio. Un sitio normal responderá con un 404 o un redireccionamiento, el generador entregará una página completa con texto y enlaces. Esta es la verificación más barata y más confiable.
- Cross-validación desde otro perfil de IP. Toma la misma URL por dos rutas diferentes — por ejemplo, a través de IP residencial y a través de móvil — y compara el hash de los campos clave: precios, nombres, disponibilidad. La discrepancia en la misma URL y en un tiempo de solicitud cercano significa que te están mostrando diferentes versiones de la página, y al menos una de ellas no está destinada a humanos.
- No sigas enlaces invisibles. Enlaces con nofollow, tamaños cero,
display:noneo fuera de la pantalla — son cebos, y hacer clic en ellos es la huella del bot. Filtra estos en la etapa de extracción de enlaces, no después. - Techos estrictos en la respuesta. Limita no solo el tiempo de espera, sino también el tamaño máximo del cuerpo y la profundidad máxima de rastreo desde el punto de entrada. La entrega lenta en pequeños fragmentos es un signo típico de un pozo, no de un servidor lento.
- Busca la plantilla del texto. La generación de Markov se delata con estadísticas: longitud de párrafos sospechosamente uniforme, n-gramas repetidos entre páginas "diferentes", decenas de enlaces salientes en ausencia de elementos estructurales como precios, artículos o fechas. Una simple verificación de shingles repetidos entre páginas adyacentes del dominio filtra tales fuentes en bloque.
- Verifica los números con sentido común. Un precio fuera del rango histórico, un producto sin coincidencias en tu propia base de marcas, un salto repentino en la variedad — son reglas de validación que deben estar en su lugar antes de registrar en la base, no en un informe un mes después. Especialmente si los datos luego entran en un modelo o en una decisión automática de compra.
Qué hacer con el conjunto de datos ya recopilado
Si surge la sospecha a posteriori, ordena no por fechas, sino por fuentes. Agrupa los registros por dominio y observa tres magnitudes: la proporción de páginas sin campos obligatorios, el número promedio de enlaces salientes en la página y la variación en la longitud del texto. Los dominios trampa suelen destacarse de inmediato en los tres aspectos. Luego, verifica selectivamente las URL controvertidas desde otro perfil de IP — si los datos no coinciden, todo el conjunto de ese dominio debe ser reconstruido, no corregido con filtros.
Es importante revisar las reglas para escenarios de agentes, donde el modelo navega por las páginas y toma decisiones por sí mismo. Es precisamente allí donde el reemplazo de una página tiene el mayor efecto, y no hay un intermediario que pueda notar la extrañeza. La mínima protección es exigir confirmación del hecho de dos fuentes independientes y no permitir que el agente actúe con datos obtenidos de un único dominio.
En resumen
Los bots han superado a los humanos en la proporción de tráfico, y la protección ha respondido no solo con filtros: hoy es más barato alimentar a un automático con basura creíble que discutir con él mediante bloqueos. Hay tres consecuencias prácticas. Cuenta los registros útiles, no los estados de respuesta. Mantén verificaciones canarias y límites de tráfico para cada dominio. Compara páginas controvertidas desde diferentes perfiles de IP: la discrepancia de versiones de la misma página es la prueba de que te están mostrando un internet separado, preparado especialmente para bots. Los proxies en este esquema solo resuelven una tarea — ofrecen una segunda mirada independiente a la página; todo lo demás lo hace la validación de tu lado.
