Blog

Derniers articles et informations sur les proxies, le web scraping et l'infrastructure Internet

Firecrawl, Crawl4AI et Crawlee utilisent par défaut l'IP de votre serveur et chargent la page en entier — avec des images qui ne seront de toute façon pas incluses dans le markdown. Nous allons examiner où dans chaque outil il est possible de configurer un proxy, comment activer l'escalade multi-niveaux (requête directe → centre de données → résidentielles) et comment couper le trafic média pour que la collecte de corpus pour RAG ne se transforme pas en facture de gigaoctets.

📅 22 août 2026
Lire l'article

Le 4 août 2026, plus de 20 services de contournement des blocages ont cessé de fonctionner en Russie en même temps. La raison n'est pas dans le protocole : des adresses IP et des sous-réseaux entiers de fournisseurs d'hébergement ont été filtrés. Nous analysons en quoi le blocage par espace d'adresses diffère du DPI, ce que propose le Ministère du Numérique concernant les « listes blanches » et pourquoi les proxies résidentiels et mobiles ont une surface de blocage différente.

📅 21 août 2026
Lire l'article