Les données pour le suivi des prix, l'entraînement des modèles ou l'analyse B2B peuvent être obtenues de trois manières : payer la plateforme pour une API officielle, acheter un ensemble de données prêt à l'emploi auprès d'un fournisseur ou le collecter soi-même à l'aide d'un parseur via un proxy. En 2026, le choix n'est plus une question de goût : les prix des API officielles ont augmenté de manière significative, certaines d'entre elles se sont fermées aux nouveaux clients, et les tribunaux ont pour la première fois pris position sur l'accès des agents IA. Nous analysons trois canaux selon sept critères et fournissons une matrice de choix pour des scénarios spécifiques.
Quels critères comparer
Comparer « API contre parsing » uniquement sur le prix est la principale erreur. Le coût réel d'un canal est composé de sept paramètres, et chaque scénario a son propre poids :
- Prix par unité de données — par requête, par enregistrement ou par gigaoctet de trafic.
- Couverture — le canal contient-il précisément les champs et objets dont vous avez besoin.
- Actualité — données en temps réel ou instantané d'il y a une semaine.
- Statut juridique — contrat avec la plateforme, licence du fournisseur ou collecte de données publiques à vos risques et périls.
- Temps jusqu'aux premières données — de quelques minutes à plusieurs semaines d'approbation manuelle.
- Stabilité — à quelle fréquence le canal tombe-t-il en panne et que se passe-t-il lorsque les règles changent.
- Contrôle du format — pouvez-vous obtenir des champs arbitraires ou devez-vous prendre ce qui est fourni.
Canal 1. API officielle de la plateforme
Le canal le plus prévisible sur le plan juridique et le plus imprévisible en termes de prix. Voici ce qui s'est passé avec les grandes API d'ici août 2026 :
- X (Twitter) — depuis le 6 février 2026, le modèle pay-per-use est devenu le défaut pour les nouveaux développeurs : il n'y a pas de tarif gratuit, il n'est pas possible pour les nouveaux clients de s'abonner à Basic ou Pro. Les tarifs sont de 0,005 $ par lecture de post et 0,015 $ par publication (0,20 $, si le post contient un lien), avec un plafond de 2 millions de lectures par mois. Au-delà, il n'y a que l'Enterprise à partir d'environ 42 000 $ par mois. Les anciens tarifs fixes (200 $ Basic, 5 000 $ Pro) ne sont disponibles que pour les abonnés existants.
- Reddit — l'accès commercial coûte environ 12 000 $ par mois pour 50 millions d'appels, au-delà de la limite, environ 0,24 $ pour 1 000 requêtes. Les 100 requêtes gratuites par minute sur OAuth-client ne sont pas licenciées pour un usage commercial, et l'approbation commerciale elle-même passe par une révision manuelle de 2 à 4 semaines sans garantie de résultat.
- Amazon — l'API Product Advertising 5.0 n'accepte plus de nouveaux clients et est en cours de retrait : le 30 avril 2026 a été annoncé comme la date de fin de support, le 15 mai — la désactivation, avec migration vers l'API Creators. L'accès dépend des ventes : il faut au minimum 10 ventes de référence qualifiées au cours des 30 derniers jours, et cela pour chaque vitrine séparément, sinon le compte reçoit un 429 et perd l'accès.
- Instagram — l'API Basic Display est définitivement morte depuis le 4 décembre 2024, les données des comptes personnels via l'API Graph ne sont plus disponibles, seuls les comptes Business et Creator sont pris en charge. Pour la production, une révision d'application et une vérification de l'entreprise sont nécessaires, et une application qui n'a pas passé la révision perd les points de terminaison utilisés lors de la phase de développement.
Quand l'API officielle est gagnante : vous avez besoin de données de vos comptes et clients, le volume est petit et stable, et la propreté juridique est plus importante que le prix — par exemple, pour une intégration dans un SaaS que vous vendez à des clients d'entreprise. Quand elle perd : vous avez besoin d'un large échantillon du marché, de données publiques d'autres personnes ou de champs qui ne sont tout simplement pas disponibles dans l'API.
Canal 2. Ensemble de données prêt à l'emploi du fournisseur
Le marché des données web sous licence s'est formé en une industrie distincte au cours des deux dernières années. Indicateur de prix : chez Bright Data, les ensembles de données prêts à l'emploi coûtent à partir de 2,50 $ pour 1 000 enregistrements, soit 250 $ pour 100 000, avec des réductions allant jusqu'à 80 % selon la fréquence de mise à jour ; la collecte gérée pour une tâche — à partir de 1 500 $ par mois, les abonnements sectoriels comme l'analyse de détail — à partir de 250 $ par mois.
Les points forts sont évidents : les données sont déjà nettoyées, dédupliquées et mises en forme, vous avez un contrat et une facture, et vous pouvez obtenir les premières lignes le jour du paiement. Aucun coût d'ingénierie.
Les points faibles apparaissent plus tard. Tout d'abord, le retard d'actualité : vous prenez un échantillon avec la fréquence de mise à jour fixée par le fournisseur, et pour le suivi des prix en temps réel, cela est souvent inapproprié. Deuxièmement, la couverture d'autrui : si le marché, la région ou la langue souhaités ne sont pas dans le catalogue, vous ne pouvez l'ajouter que par une commande personnalisée et un autre prix. Troisièmement, le schéma fixe : un champ qui n'est pas dans l'ensemble de données ne peut pas être obtenu de quelque manière que ce soit.
Quand l'ensemble de données est gagnant : étude ponctuelle, entraînement de modèle sur un échantillon historique, vérification rapide d'hypothèse, lorsque le temps jusqu'au résultat est plus précieux que le coût d'une ligne. Quand il perd : vous avez besoin d'actualité en heures, de champs non standard ou d'une géographie étroite.
Canal 3. Votre propre parseur via un proxy
Ici, vous ne payez pas pour les données, mais pour l'infrastructure d'accès : trafic proxy, rendu et temps d'ingénierie. Le marché des proxies résidentiels en 2026 s'est divisé en trois niveaux — entreprise (Bright Data, Oxylabs) autour de 8,5 à 12 $ par gigaoctet, segment moyen (Decodo, SOAX, NetNut) à 3-6 $, budget (IPRoyal, Webshare) — à partir de 1,75 $ par gigaoctet en pay-as-you-go.
Mais le prix par gigaoctet est une métrique trompeuse. Il faut considérer le coût d'une requête réussie : les proxies de centre de données à 1 $ par gigaoctet sont inutiles si le site cible rejette 90 % des requêtes — vous payez pour un volume dix fois plus élevé de tentatives. Les IP résidentielles ont un taux de réponses réussies sur des plateformes sécurisées d'environ 90 à 99 %, tandis que pour les centres de données, ce taux tombe à 40-60 %, et sur une protection lourde — à 20-30 %. Nous avons examiné la répartition détaillée du poids de la page, des tentatives et des coûts cachés dans l'article combien cela coûte réellement de scraper un million de pages.
Une question distincte est de savoir où se situe exactement la frontière entre les proxies bruts et l'API de scraping prête à l'emploi : elle dépend du poids de la réponse, et c'est le sujet de notre comparaison entre proxies, déblocages et API de scraping.
Quand votre propre parseur est gagnant : vous avez besoin de champs arbitraires, d'actualité en minutes, d'une large couverture de plateformes et d'un prix prévisible sur un grand volume. Quand il perd : vous n'avez pas d'ingénieur pour réparer le pipeline, et le volume est mesuré en milliers de pages par mois — il est alors moins cher d'acheter un ensemble de données.
Couche juridique : ce qui a changé en 2026
Le 4 août 2026, le Neuvième circuit d'appel des États-Unis a annulé l'interdiction préliminaire qui empêchait l'agent IA Perplexity d'accéder à Amazon au nom des utilisateurs. Le tribunal a statué que lorsque l'utilisateur demande à l'agent d'effectuer une action sur Amazon, « l'accès » aux systèmes d'Amazon est effectivement réalisé par l'utilisateur, et non par Perplexity : la loi CFAA parle de « celui qui » obtient l'accès, c'est-à-dire d'une personne, et non d'un outil logiciel. C'est la première décision au niveau du circuit d'appel à l'intersection de l'IA agent et de la loi fédérale sur la fraude informatique — nous avons examiné les détails dans un article distinct sur la décision dans l'affaire Amazon contre Perplexity.
Conclusion pratique pour le choix du canal : la décision réduit une partie du risque lié à l'automatisation au nom d'un utilisateur spécifique, mais ne rend pas la collecte massive de données d'autrui gratuite et sans risque. Les conditions d'utilisation de la plateforme, les droits d'auteur sur le contenu et la protection des données personnelles n'ont pas disparu. L'API officielle reste le seul canal où vous avez un contrat ; l'ensemble de données transfère une partie de la responsabilité au fournisseur ; le scraping de données publiques est une zone où la décision vous appartient.
Matrice de choix pour le scénario
- Suivi des prix des concurrents en temps réel. L'API officielle est presque toujours inappropriée : les champs nécessaires ne sont pas disponibles ou l'accès est lié aux ventes, comme chez Amazon. L'ensemble de données est en retard sur l'actualité. Le choix — votre propre parseur sur des proxies résidentiels avec une fréquence de passage adaptée à la volatilité des prix.
- Entraînement d'un modèle sur un corpus historique. L'actualité n'est pas critique, le volume est énorme, le schéma est standard. Le choix — un ensemble de données prêt à l'emploi ; la collecte de ce volume depuis zéro est presque toujours plus coûteuse.
- Génération de leads B2B et enrichissement de CRM. Les API officielles pour des profils d'autres personnes n'existent pratiquement pas. Un choix raisonnable — un ensemble de données sous licence plus un enrichissement ponctuel avec votre propre parseur sur des champs étroits.
- Analyse SMM de vos comptes. L'API officielle est sans alternative : Instagram Graph pour Business/Creator, X pay-per-use pour de petits volumes de lecture. Scraper vos propres données n'a pas de sens.
- Étude de marché ponctuelle de deux semaines. Comptez le temps : si un ingénieur passe plus de temps sur le pipeline que le coût de l'ensemble de données, — achetez l'ensemble de données. Si les données ne sont pas dans les catalogues, mettez en place un parseur temporaire sur des proxies résidentiels avec paiement pour le trafic et éteignez-le après le projet.
Hybride comme norme
En pratique, les équipes matures en 2026 ne choisissent pas un seul canal, mais répartissent les tâches sur trois : API officielle — là où les données sont les siennes et un contrat est obligatoire ; ensemble de données — pour une base historique et un démarrage rapide ; propre parseur — pour l'actualité, les champs non standard et le volume, où l'économie du gigaoctet l'emporte sur le paiement par enregistrement. Les IP de centre de données sont alors utilisées pour des cibles légères et des vérifications internes, tandis que les résidentielles et mobiles sont utilisées pour des plateformes avec une réelle protection.
Le principal à retenir : ne comptez pas le tarif, mais le coût d'un enregistrement utilisable en tenant compte des tentatives, du retard et du temps d'ingénierie. Sur cette métrique, un canal « cher » s'avère régulièrement bon marché, tandis qu'un canal « bon marché » peut être l'inverse.
Conclusion
Les API officielles en 2026 sont devenues un canal pour travailler avec ses propres données et de petits volumes : X a transféré les nouveaux développeurs vers un paiement à l'unité, Reddit maintient l'entrée commerciale à 12 000 $ par mois, Amazon ferme l'API PA, Instagram a coupé les comptes personnels. Les ensembles de données prêts à l'emploi ferment l'histoire et le démarrage rapide à partir de 2,50 $ pour mille enregistrements, mais ne fournissent pas d'actualité et de champs arbitraires. Votre propre parseur via un proxy reste le seul canal avec un contrôle total sur le schéma et la fréquence de mise à jour — et est rentable sur le volume, si l'on considère le coût d'une requête réussie, et non d'un gigaoctet. Si votre scénario nécessite des données fraîches de plateformes protégées, commencez par un test de proxies résidentiels sur une cible réelle et mesurez le taux de réponses réussies — ce chiffre tranchera le débat entre les trois canaux plus rapidement que n'importe quel tableau.
```