Retour au blog

Proxies pour le scraping de Zalando : comment contourner la protection et collecter des données sans être banni

Zalando bloque les parseurs plus agressivement que la plupart des marketplaces européens. Nous examinons quels proxies fonctionnent, comment les configurer et comment éviter un ban lors de la collecte de données sur les prix et les produits.

📅25 juillet 2026
```html

Zalando est la plus grande marketplace de mode en Europe avec plus de 50 millions d'acheteurs actifs. Pour surveiller les prix des concurrents, analyser l'assortiment et suivre les tendances, les vendeurs et les analystes scrutent régulièrement ses pages. Le problème est que Zalando utilise une protection multi-niveaux : Cloudflare, des pages JavaScript dynamiques et un blocage agressif des IP suspectes. Sans des proxies correctement configurés, votre scraper ne survivra pas 10 minutes.

Pourquoi Zalando bloque les scrapers : comment fonctionne la protection

Zalando n'est pas simplement une boutique en ligne, c'est une plateforme avec des milliers de marques et des millions de SKU. Les données sur les prix, les stocks et les réductions sont un actif précieux que l'entreprise protège activement. Le système de protection anti-bot de Zalando fonctionne à plusieurs niveaux simultanément, et comprendre ces niveaux est la première étape vers un scraping réussi.

Cloudflare comme premier barrière. Toutes les requêtes vers Zalando passent par Cloudflare. Cela signifie qu'avant de recevoir le HTML de la page, votre IP est vérifiée pour sa réputation, le comportement des requêtes est analysé et un score de risque est évalué. Les adresses IP des centres de données (AWS, Google Cloud, Hetzner, OVH) sont bloquées presque instantanément — elles sont répertoriées dans des bases de données comme sources de trafic automatisé.

Rendu JavaScript. La plupart des pages de Zalando sont des applications à page unique (SPA) sur React. Les données sur les produits sont chargées dynamiquement via des requêtes API. Un simple scraper HTTP qui télécharge le HTML obtiendra une page vide ou un squelette minimal sans données. Pour un fonctionnement normal, il faut soit un navigateur complet (Playwright, Puppeteer, Selenium), soit des requêtes directes à l'API interne de Zalando — ce qui nécessite une analyse supplémentaire.

Analyse comportementale. Zalando suit non seulement les IP, mais aussi les modèles de comportement : la fréquence des requêtes, l'ordre de navigation des pages, l'absence de clics et de défilement, les en-têtes du navigateur. Si 20 requêtes proviennent d'une même IP en 5 secondes — c'est clairement un bot. Si le User-Agent indique "Python Requests" — le blocage est immédiat.

Restrictions géolocalisées. Zalando opère dans 25 pays d'Europe, et chaque version du site (zalando.de, zalando.fr, zalando.pl, etc.) a ses propres règles. Tenter de scraper la version allemande avec une IP venant de la Russie ou des États-Unis suscite des soupçons accrus et se termine souvent par une redirection ou un blocage. Pour collecter des données correctement, il faut des IP du même pays que la version cible du site.

Résumé de la protection de Zalando :

  • Les IP des centres de données sont automatiquement bloquées par Cloudflare
  • Un rendu par navigateur est nécessaire (JavaScript)
  • Fréquence des requêtes — pas plus de 1-2 par seconde par IP
  • L'IP doit correspondre au pays cible du site
  • Les en-têtes des requêtes doivent imiter un utilisateur réel

Quels proxies conviennent à Zalando : comparaison des types

Tous les proxies ne sont pas également utiles pour le scraping de Zalando. Analysons chaque type et évaluons honnêtement son applicabilité à cette tâche.

Type de proxy Fonctionne avec Zalando ? Vitesse Coût Pour quelles tâches
Proxies résidentiels ✅ Oui, bien Moyenne Moyenne Surveillance des prix, collecte de catalogue
Proxies mobiles ✅ Oui, excellent Moyenne Élevée Tâches complexes, risque élevé
Proxies de centres de données ❌ Bloqués Élevée Faible Inadaptés pour Zalando
Publics/gratuits ❌ Ne fonctionnent pas Faible Gratuit Inutiles

Proxies résidentiels — le choix optimal pour la plupart des tâches de scraping de Zalando. Ce sont de vraies adresses IP d'utilisateurs Internet domestiques en Allemagne, en France, en Pologne et dans d'autres pays européens. Cloudflare ne peut pas distinguer une requête provenant de cette IP d'une requête d'un acheteur ordinaire. La rotation des IP à chaque requête permet de scaler le scraping sans risque de blocage d'une adresse spécifique.

Proxies mobiles — encore plus fiables, mais plus chers. Les IP des opérateurs mobiles (Deutsche Telekom, Orange, T-Mobile) ont le score de confiance le plus élevé auprès de Cloudflare, car derrière une IP mobile peuvent se cacher des centaines d'utilisateurs via NAT. Cela signifie que même avec une fréquence élevée de requêtes d'une même IP, le blocage est peu probable. Les proxies mobiles doivent être utilisés pour des tâches où le coût de l'erreur est élevé — par exemple, lors de la surveillance des ventes flash en temps réel.

Proxies de centres de données pour Zalando sont pratiquement inutiles. Cloudflare maintient des bases de données à jour des ASN (systèmes autonomes) des fournisseurs de cloud et des hébergeurs. Une requête avec une IP d'AWS eu-west-1 ou Hetzner obtiendra soit 403 Forbidden, soit un CAPTCHA infini. Même si vous parvenez à passer une ou deux requêtes, lors du scaling, toute la plage d'IP sera bloquée.

Proxies résidentiels pour Zalando : configuration et rotation

Supposons que vous ayez choisi des proxies résidentiels. Il est maintenant important de les configurer correctement — une mauvaise configuration annulera tous les avantages des IP résidentielles. Analysons les paramètres clés.

Rotation des IP : session collante vs aléatoire

Les proxies résidentiels ont deux modes de fonctionnement : session collante (une IP pendant plusieurs minutes) et rotation à chaque requête. Pour Zalando, une approche combinée est recommandée :

  • Session collante de 1 à 3 minutes — pour scraper la fiche produit dans son intégralité (photo principale, description, tableau des tailles, prix). Cela imite le comportement d'un véritable acheteur qui examine le produit.
  • Changement d'IP entre les catégories — lorsque vous passez d'une section du catalogue à une autre, changez d'IP. Cela réduit la probabilité d'accumuler un profil de comportement suspect.
  • Rotation en cas d'erreurs — si vous recevez 429 (Trop de requêtes) ou 403, changez immédiatement d'IP et faites une pause de 30 à 60 secondes.

Géolocalisation des proxies : choisissez le bon pays

C'est un point critique que beaucoup négligent. Si vous scrapez zalando.de — utilisez des IP allemandes. Si zalando.fr — françaises. Un non-respect de la géolocalisation des proxies et de la version du site est l'un des moyens les plus rapides d'obtenir un blocage.

De plus, différentes versions de Zalando affichent différents prix, assortiments et réductions. Par exemple, la version allemande a souvent un choix plus large que la polonaise, et les prix dans la version française peuvent différer de 10 à 20 % par rapport à la version espagnole pour les mêmes articles. Si votre tâche est d'analyser les prix sur plusieurs marchés, vous aurez besoin de proxies de chaque pays cible.

En-têtes des requêtes : imitation d'un véritable navigateur

Même avec une IP résidentielle, vous serez bloqué si les requêtes semblent automatiques. L'ensemble minimal d'en-têtes à transmettre est :

User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0.0.0 Safari/537.36
Accept-Language: de-DE,de;q=0.9,en;q=0.8
Accept: text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,*/*;q=0.8
Accept-Encoding: gzip, deflate, br
Referer: https://www.zalando.de/
  

Attention : Accept-Language doit correspondre au pays de votre proxy. Une IP allemande avec l'en-tête Accept-Language: ru-RU est un drapeau rouge immédiat pour le système de protection.

Outils pour scraper Zalando sans code

Si vous n'êtes pas développeur mais que vous devez régulièrement collecter des données de Zalando — il existe plusieurs solutions prêtes à l'emploi. Examinons les outils les plus populaires qui prennent en charge la connexion de proxies personnalisés.

Octoparse et ParseHub — scrapers visuels

Octoparse et ParseHub sont des applications de bureau avec une interface visuelle. Vous cliquez littéralement sur les éléments de la page et indiquez ce qu'il faut collecter : nom du produit, prix, réduction, tableau des tailles, note. Les deux outils prennent en charge la connexion de proxies personnalisés.

Configuration des proxies dans Octoparse : ouvrez Paramètres → Paramètres de proxy → Ajouter un proxy. Entrez l'adresse du serveur, le port, le nom d'utilisateur et le mot de passe. Pour Zalando, choisissez le type HTTPS (pas SOCKS5 — il fonctionne moins bien avec Cloudflare). Activez l'option "Rotate proxy" si vous avez un pool d'adresses.

Point important pour Zalando : puisque le site utilise JavaScript, dans Octoparse, vous devez activer le mode "Rendu par navigateur" (rendu complet via le navigateur intégré). Sans cela, les données sur les prix et la disponibilité ne seront pas chargées correctement.

Bright Data Scraping Browser et similaires

Pour des tâches plus complexes, il existe des solutions cloud spécialisées — des navigateurs gérés avec des proxies intégrés et un contournement de la protection anti-bot. Ils prennent en charge tout le travail de rotation des IP, de gestion des cookies et de résolution des CAPTCHA. Inconvénient — coût plus élevé par rapport à l'utilisation de proxies personnalisés.

Google Sheets + ImportXML — pour des tâches simples

Si vous devez suivre les prix de 10 à 20 produits spécifiques, et non scraper tout le catalogue — vous pouvez utiliser Google Sheets avec la fonction ImportXML ou ImportHTML. Cela ne nécessite pas de proxies et fonctionne pour une surveillance de base. Cependant, pour une collecte de données à grande échelle, cette méthode n'est pas adaptée : Zalando commence rapidement à renvoyer des erreurs pour les requêtes Google.

Navigateurs anti-détection pour le multi-comptes manuel

Si votre tâche n'est pas le scraping automatique, mais la gestion de plusieurs comptes vendeurs sur le programme partenaire de Zalando, alors les navigateurs anti-détection entrent en jeu : Dolphin Anty, AdsPower, GoLogin ou Multilogin. Chaque profil dans un tel navigateur a une empreinte unique (fingerprint) et se connecte via un proxy distinct. Cela permet de travailler avec plusieurs comptes depuis un seul ordinateur sans risque de liaison.

Schéma de configuration dans Dolphin Anty : créez un nouveau profil → dans la section Proxy, indiquez le type HTTPS ou SOCKS5, entrez les données du proxy résidentiel du pays européen souhaité → choisissez le pays et la langue du navigateur correspondant au proxy → enregistrez le profil. Chaque profil apparaîtra comme un utilisateur distinct d'un pays européen spécifique.

Géotargeting : scraping de Zalando par pays et régions

Zalando est présent dans 25 pays européens, et chaque marché représente une opportunité commerciale distincte. Comprendre la géographie de la plateforme vous aidera à configurer vos proxies de manière plus précise et à obtenir des données plus précieuses.

Version du site Pays du proxy Langue du navigateur Particularités du marché
zalando.de Allemagne de-DE Plus grand marché, assortiment complet
zalando.fr France fr-FR Panier moyen élevé, marques de luxe
zalando.pl Pologne pl-PL Marché en forte croissance, différences de prix
zalando.es Espagne es-ES Réductions saisonnières, marques locales
zalando.nl Pays-Bas nl-NL Acheteurs actifs, taux de retour élevé

Pourquoi est-ce important dans la pratique ? Imaginez que vous êtes acheteur ou analyste pour une marque de mode. Vous devez comprendre comment vos concurrents fixent les prix de leurs produits sur différents marchés. L'arbitrage des prix transfrontaliers (lorsqu'un produit en Pologne coûte beaucoup moins cher qu'en Allemagne) est une réelle opportunité commerciale qui ne peut être identifiée qu'en scrappant plusieurs versions du site avec les proxies appropriés.

Il est également important de prendre en compte que Zalando affiche un assortiment différent selon le pays. Certaines marques ne sont présentes que dans certaines régions, et des collaborations exclusives peuvent être disponibles uniquement sur un marché. Pour une analyse complète de l'environnement concurrentiel, il est nécessaire de scraper toutes les versions du site pertinentes pour vous.

Erreurs typiques lors du scraping de Zalando et comment les éviter

Au fil des années de travail avec les marketplaces européennes, une liste d'erreurs a été accumulée, que presque tous les débutants commettent. Analysons-les en détail pour que vous ne tombiez pas dans les mêmes pièges.

Erreur 1 : Fréquence de requêtes trop élevée

L'erreur la plus courante est d'essayer de scraper aussi vite que possible. La logique est claire : plus c'est rapide, mieux c'est. Mais Zalando suit la fréquence des requêtes et, si le seuil est dépassé, ralentit d'abord les réponses (limitation de taux), puis bloque l'IP.

Solution : ajoutez des délais aléatoires entre les requêtes — de 2 à 8 secondes. L'aléatoire est important : un délai fixe de 3 secondes semble aussi suspect qu'aucun délai. Une personne réelle ne clique pas avec la précision d'un métronome.

Erreur 2 : Utilisation d'une seule IP pour tout le scraping

Même une IP résidentielle sera bloquée si elle envoie 500 requêtes en une heure. Un utilisateur réel ne parcourt pas 500 pages de catalogue en 60 minutes.

Solution : utilisez un pool de proxies avec rotation. Idéalement — pas plus de 20-30 requêtes par IP pendant une session, puis changement d'adresse. En travaillant avec un pool de plus de 100 IP résidentielles, vous pouvez collecter des milliers de pages par jour sans blocages.

Erreur 3 : Ignorer robots.txt et la structure du site

Zalando a un fichier robots.txt qui indique clairement les sections interdites aux bots. Scraper ces sections est non seulement techniquement plus compliqué, mais augmente également le risque de réclamations juridiques. Avant de commencer, examinez le robots.txt : https://www.zalando.de/robots.txt

Erreur 4 : Scraping sans gestion des erreurs

Si votre scraper ne gère pas les codes de réponse 403, 429, 503 — il continuera à envoyer des requêtes même après un blocage, ce qui ne fera qu'aggraver la situation. La bonne logique : reçu 429 → pause de 60 secondes → changement d'IP → répétition de la requête. Reçu 403 → changement immédiat d'IP.

Erreur 5 : Utilisation de chaînes User-Agent obsolètes

User-Agent Chrome 89 en 2024 — c'est un drapeau rouge. Les systèmes de protection savent quelles versions de navigateurs sont actuelles. Utilisez des chaînes User-Agent à jour et mettez-les à jour régulièrement. Une bonne pratique est d'avoir un pool de 5-10 chaînes User-Agent différentes et de les faire tourner avec le changement d'IP.

Erreur 6 : Scraping aux heures de pointe

Pendant les heures de soirée (18h00–22h00 heure d'Europe centrale), la charge sur Zalando est maximale, la protection fonctionne en mode renforcé, et le seuil de déclenchement des systèmes anti-bot est abaissé. Lancez le scraping à grande échelle la nuit (02h00–06h00 CET) — moins de concurrence pour les ressources, protection moins agressive.

Checklist : configuration rapide des proxies pour Zalando

Utilisez cette checklist avant de lancer le scraping de Zalando. Chaque point est important — ignorer l'un d'eux augmente considérablement le risque de blocage.

✅ Checklist de configuration des proxies pour Zalando

Choix des proxies :

  • ☐ Proxies résidentiels ou mobiles choisis (pas de centres de données)
  • ☐ Proxies du pays européen souhaité (correspond à la version du site)
  • ☐ Pool d'au moins 20-50 IP pour rotation
  • ☐ Protocole HTTPS (préférable à SOCKS5 pour Cloudflare)

Configuration des requêtes :

  • ☐ User-Agent à jour (Chrome 120+ ou Firefox 120+)
  • ☐ Accept-Language correspond au pays du proxy
  • ☐ Referer défini sur la page d'accueil de Zalando
  • ☐ Délais aléatoires de 2-8 secondes entre les requêtes
  • ☐ Gestion des codes 403, 429, 503 avec changement d'IP

Pour le rendu JavaScript :

  • ☐ Mode de rendu par navigateur activé dans le scraper
  • ☐ Attente de chargement des éléments dynamiques configurée
  • ☐ Images et médias désactivés pour accélérer (optionnel)

Tests :

  • ☐ Proxy vérifié via un service de vérification IP (assurez-vous qu'il montre le pays souhaité)
  • ☐ Requête test effectuée sur 5-10 pages avant le scaling
  • ☐ Vérification de la précision des données obtenues (prix, nom, tailles)

Que scraper sur Zalando : scénarios pratiques

Comprendre pourquoi vous scrapez aide à configurer correctement les outils. Voici les scénarios commerciaux les plus courants :

Surveillance des prix des concurrents. Si vous vendez via le programme partenaire de Zalando, il est crucial de savoir comment les concurrents fixent les prix pour des articles similaires. Scraper les prix une fois par jour ou toutes les quelques heures permet de réagir rapidement aux changements et de rester compétitif.

Analyse de l'assortiment et des tendances. Quelles marques ajoutent de nouvelles collections ? Quelles catégories croissent le plus rapidement ? Scraper les nouveautés et les best-sellers fournit des insights précieux pour les acheteurs et les chefs de produit.

Suivi des réductions et des soldes. Zalando organise des soldes saisonnières (End of Season Sale), pendant lesquelles les réductions atteignent 70 %. La surveillance automatique permet de détecter en premier le début des soldes et la baisse des prix sur des articles spécifiques.

Collecte de données pour les agrégateurs de prix. Si vous développez un service de comparaison de prix pour les vêtements et les chaussures, Zalando est une source de données incontournable pour le marché européen.

Conclusion

Le scraping de Zalando est une tâche tout à fait réalisable si elle est abordée de manière systématique. Les conclusions clés de cet article : les proxies de centres de données ne fonctionnent pas à cause de Cloudflare ; les proxies résidentiels du pays européen souhaité sont le choix optimal pour la plupart des tâches ; les proxies mobiles offrent la fiabilité maximale avec un risque élevé de blocage. La géolocalisation des proxies doit correspondre strictement à la version du site, et les requêtes doivent imiter le comportement d'un utilisateur réel : délais aléatoires, en-têtes à jour, langue correcte du navigateur.

Respecter ces règles permet de collecter de manière stable des données sur les prix, l'assortiment et les réductions sur l'ensemble des 25 marchés européens de Zalando — sans blocages ni perte de données.

Si vous prévoyez de lancer une surveillance des prix ou une collecte de données sur les produits de Zalando, nous vous recommandons de commencer par des proxies résidentiels avec géotargeting sur le pays européen souhaité — ils offrent le meilleur équilibre entre fiabilité, vitesse et coût pour cette tâche.

```