Octoparse et ParseHub sans code : guide étape par étape pour le web scraping avec des proxies mobiles
Introduction
Dans ce guide étape par étape, vous apprendrez à effectuer du web scraping sans programmation avec deux outils no-code populaires : Octoparse et ParseHub, en utilisant des proxies mobiles. Nous configurerons l'environnement, connecterons un fournisseur de proxies mobiles, examinerons une tâche réelle de collecte de données, testerons l'anti-bannissement et les limites, et enfin, nous vérifierons et exporterons le résultat. À la fin, vous obtiendrez un processus de web scraping résistant aux blocages, prêt à être scalé et mis à jour régulièrement.
Pour qui ce guide : pour les débutants qui souhaitent commencer rapidement sans code ; pour les marketeurs, analystes et spécialistes des données ayant besoin d'un processus de collecte d'informations fiable et facile à comprendre ; pour les utilisateurs avancés, des conseils d'optimisation seront présents dans la section « Fonctions avancées ».
Ce qu'il faut savoir à l'avance : des compétences de base en informatique et en navigation. La programmation n'est pas nécessaire.
Temps requis : 2 à 4 heures pour l'ensemble du processus, y compris l'installation, la configuration des proxies et le test de web scraping. Si vous avez déjà de l'expérience avec les outils, comptez 60 à 90 minutes.
Préparation préalable
Outils et accès nécessaires :
- Un compte Octoparse (Windows, macOS ; version cloud disponible). Toute version actuelle de 2025 à 2026 convient.
- Un compte ParseHub (application de bureau pour Windows / macOS et compte web). Choisissez la version actuelle.
- Un compte et l'accès à des proxies mobiles d'un fournisseur fiable. Un service avec des IP mobiles réelles, une authentification par login et mot de passe et une gestion flexible de la rotation conviendra. Un bon exemple est mobileproxy.space comme fournisseur de proxies mobiles et d'outils d'automatisation.
- Un site de test autorisant le web scraping éducatif. Nous utiliserons une ressource de démonstration à des fins d'apprentissage — « Books to Scrape » (site public de démonstration pour la pratique). Vous pouvez remplacer cet exemple par un autre site, si vous avez l'autorisation et que cela ne viole pas les règles du site.
Configuration système requise :
- PC avec Windows 10/11 ou macOS 12+ avec 8 Go de RAM et 2 à 4 Go d'espace disque libre.
- Internet stable de 10 Mb/s ou plus.
- Capacité d'installation de logiciels et accès aux paramètres réseau pour vérifier les proxies.
Ce qu'il faut télécharger et installer :
- Téléchargez et installez Octoparse depuis le site officiel du développeur. Pendant l'installation, choisissez la langue de l'interface et le répertoire d'installation. À la fin, connectez-vous à votre compte ou créez-en un nouveau.
- Téléchargez et installez ParseHub. Lancez l'application et connectez-vous à votre compte.
- Abonnez-vous chez le fournisseur de proxies mobiles. Dans votre espace personnel, obtenez l'adresse du proxy (hôte et port), le login et le mot de passe. Si un panneau de rotation IP est disponible, indiquez l'intervalle pour changer d'adresse, par exemple toutes les 3 à 10 minutes.
Création de sauvegardes (actuel pour les projets) :
- Dans Octoparse, exportez votre projet dans un fichier .otd après chaque changement important.
- Dans ParseHub, après configuration, sauvegardez le projet et faites une copie locale du fichier projet via le menu « Fichier » → « Enregistrer sous ».
Conseil : Conservez vos données d'authentification proxy séparément des projets. Utilisez un gestionnaire de mots de passe et créez des accès distincts pour les tâches d'apprentissage et de production.
Concepts de base
Termes clés en termes simples :
- Web scraper sans code — un programme qui permet de collecter des données sur des sites sans programmation. L'utilisateur configure par clics : quoi ouvrir, quoi cliquer, quoi extraire.
- Proxy — un serveur intermédiaire à travers lequel passent vos requêtes internet. Le site voit non pas votre IP réelle, mais l'IP du proxy.
- Proxies mobiles — des proxies utilisant de vraies adresses IP des opérateurs mobiles (3G/4G/5G). Elles changent plus souvent et apparaissent naturelles pour les sites, ce qui réduit le risque de blocages lors d'une utilisation prudente.
- Rotation d'IP — changement périodique de l'adresse IP. Dans les proxies mobiles, cela peut être automatique par un minuteur ou par un interrupteur API dans le panneau du fournisseur.
- Sélecteur — moyen d'indiquer sur la page quel élément extraire (par exemple, le titre d'un produit, le prix). Dans Octoparse et ParseHub, cela se fait par clics sur les éléments de la page.
- Pagination — navigation entre les pages d'une liste de résultats (boutons « Suivant », numéros de pages).
- Séance — une série de requêtes depuis une seule IP. Une « séance collante » ou sticky session garde l'IP pour terminer la tâche sans changer d'adresse au milieu.
Principes de fonctionnement de base :
- Le web scraper ouvre une page, attend que la page soit chargée, trouve les éléments nécessaires, extrait le texte, les liens ou les attributs, passe à la page suivante et répète le processus.
- Le proxy est ajouté une fois dans les paramètres du projet. Ensuite, toutes les requêtes réseau passent par lui.
- Pour la stabilité, utilisez des vitesses modérées, des pauses entre les actions et une rotation d'IP.
Ce qu'il est important de comprendre avant de commencer :
- Respectez les règles du site source et la législation de votre pays. Respectez le fichier robots.txt et les conditions d'utilisation du site. Obtenez une autorisation si vous prévoyez une extraction intensive.
- Ne collectez pas de données personnelles non destinées à la collecte automatique. Ne travaillez qu'avec des informations ouvertes et autorisées.
- Le but des proxies mobiles est de garantir un fonctionnement stable et correct, et non de contourner les restrictions établies par la loi ou par le propriétaire du site.
⚠️ Attention : Ne jamais utiliser de proxy et d'outils de scraping pour des actions interdites par la législation locale ou les règles du site. Ce guide est destiné à des scénarios légitimes d'apprentissage et de travail avec un accès autorisé aux données.
Étape 1 : Planifier la tâche et préparer la structure des données
Objectif de l'étape
Déterminer quelles données sont nécessaires, où elles se trouvent sur la page, comment naviguer entre les pages, et convenir des règles de fréquence des requêtes. Le résultat est un plan simple champ → sélecteur → source et liste d'URL pour commencer.
Instructions détaillées
- Ouvrez le site éducatif avec des produits (exemple : Books to Scrape). Assurez-vous qu'il s'agit d'une ressource de démonstration autorisant le scraping éducatif.
- Déterminez les champs à extraire : nom du produit, prix, évaluation, disponibilité (En stock), lien vers la carte produit et couverture (URL de l'image).
- Fixez la structure des données : créez un tableau dans Google Sheets ou Excel avec les colonnes Title, Price, Rating, Availability, ProductURL, ImageURL.
- Vérifiez la pagination : trouvez le bouton « suivant » ou les numéros de pages en bas de la liste. Notez la classe CSS ou le texte du bouton (par exemple, « li.next a »).
- Évaluez la profondeur : combien de pages et de produits. Pour un test éducatif, prenez 3 à 5 pages.
- Déterminez la fréquence des requêtes : commencez par 1 requête toutes les 2 à 4 secondes puis des pauses progressives avant la pagination.
Conseil : Plus l'objectif initial est simple et clair, plus le débogage sera facile. Commencez par 1 à 2 champs (par exemple, nom et prix), puis ajoutez les autres.
Résultat attendu
Vous disposez d'une liste d'URL de pages pour commencer, d'une liste de champs et d'une compréhension de la navigation entre les pages.
Problèmes possibles et solutions
- Il n'est pas clair où se trouve l'élément requis. Solution : survolez l'élément dans le navigateur et utilisez « Inspecter l'élément » pour rechercher un attribut ou une classe unique.
- Pagination instable. Solution : utilisez le bouton « suivant » au lieu des numéros de pages, c'est plus simple et stable.
✅ Vérification : Dans votre tableau, vous avez une liste de champs et 3 à 5 URL de départ. La compréhension de la pagination est confirmée.
Étape 2 : Obtenir et vérifier le proxy mobile
Objectif de l'étape
Obtenez un proxy mobile, recevez l'adresse, le port, le login et le mot de passe, choisissez le mode de rotation d'IP et assurez-vous que le proxy fonctionne de manière stable.
Instructions détaillées
- Connectez-vous à votre espace personnel chez le fournisseur de proxies mobiles. Un service approprié est mobileproxy.space, où sont disponibles des IP mobiles des opérateurs, une rotation configurable et une documentation sur les formats d'autorisation.
- Créez un compte proxy. Indiquez le pool de villes ou de pays nécessaires pour la tâche. Pour un projet éducatif, utilisez la région par défaut.
- Copie des paramètres : hôte (par exemple, gw.provider.example), port (par exemple, 10000–20000), login et mot de passe. Conservez ces données dans un gestionnaire de mots de passe.
- Configurez la rotation d'IP : choisissez un intervalle de 3 à 10 minutes. Pour une collecte stable sur les pages, utilisez une sticky session de 5 à 15 minutes, afin que l'IP ne change pas au milieu de l'extraction de la fiche produit.
- Testez le proxy pour vérifier son fonctionnement : ouvrez un navigateur et définissez le proxy système (HTTP) sur l'hôte : port donné avec le login et le mot de passe. Accédez à une page « montrer l'IP » ou à un service autorisé où votre adresse externe est visible, et vérifiez que l'IP a changé pour une mobile.
- Désactivez le proxy système dans le navigateur après la vérification pour ne pas perturber le fonctionnement des outils par la suite.
Conseil : Si le fournisseur propose un bouton API « changer d'IP », notez l'URL. Cela sera utile pour changer manuellement l'IP entre les exécutions de tâches.
Résultat attendu
Vous avez des identifiants actifs pour le proxy mobile et une confirmation que l'IP est correctement substituée et la rotation est configurée.
Problèmes possibles et solutions
- Erreur d'authentification dans le navigateur. Solution : vérifiez la précision du login et du mot de passe, en tenant compte de la casse.
- Le site ne s'ouvre pas via le proxy. Solution : changez de nœud ou de port dans le cabinet du fournisseur, ou contactez le support. Assurez-vous d'utiliser le protocole pris en charge (HTTP/HTTPS).
✅ Vérification : Vous confirmez qu'il y a une IP externe pour le proxy mobile et que vous savez comment lancer la rotation si nécessaire.
Étape 3 : Configuration du proxy mobile dans Octoparse
Objectif de l'étape
Connecter le proxy mobile à un projet spécifique dans Octoparse, de manière à ce que toutes les requêtes passent par celui-ci avec la rotation et les délais requis.
Instructions détaillées
- Lancez Octoparse et connectez-vous à votre compte. Sur l'écran principal, cliquez sur « + Nouveau » ou « Créer une tâche ».
- Entrez l'URL de départ de votre liste (par exemple, la page d'accueil de la section « Livres »). Cliquez sur « Enregistrer l'URL » ou « Démarrer » pour prévisualiser.
- Ouvrez les paramètres du projet. Dans le panneau de gauche, trouvez la section « Paramètres », « Avancé » ou « Paramètres de tâche » (le nom peut varier selon la version). Allez dans le bloc « Proxy » ou « Rotation d'IP ».
- Sélectionnez « Utiliser mon proxy » ou « Proxy personnalisé ». Saisissez l'hôte et le port de votre proxy mobile.
- Indiquez l'authentification : entrez le login et le mot de passe. Si l'option « Se souvenir des identifiants » est disponible, activez-la.
- Activez la rotation IP dans Octoparse (si disponible), ou laissez la rotation du côté du fournisseur. Si Octoparse permet de « Changer d'IP toutes les X minutes », synchronisez l'intervalle avec les paramètres dans le cabinet des proxies (par exemple, 5 minutes).
- Définissez la vitesse : dans « Vitesse » ou « Paramètres d'exécution », définissez des délais de 2 à 4 secondes entre les actions et de 5 à 8 secondes avant la pagination. Activez l'option « Randomiser le délai », si disponible.
- Enregistrez les paramètres. Cliquez sur « Tester la connexion » (si disponible) pour vous assurer que le projet peut accéder à Internet via le proxy.
Conseil : Conservez différents profils de proxy pour différents projets. Dans les noms, indiquez la région et l'intervalle de rotation pour éviter toute confusion.
⚠️ Attention : Ne lancez pas de plusieurs flux en parallèle sur un même IP mobile. Cela pourrait entraîner une activité suspecte. Préférez étendre le nombre de proxies.
Résultat attendu
Le projet dans Octoparse est enregistré, passe le test de connexion, et la prévisualisation des pages s'ouvre de manière stable.
Problèmes possibles et solutions
- « Échec de la connexion via proxy ». Solution : vérifiez l'hôte : port, l'authentification, assurez-vous qu'il n'y a pas de proxy système dans l'OS qui entre en conflit avec l'application.
- La page se charge trop lentement. Solution : augmentez le délai de chargement dans « Avancé » et réduisez le nombre de requêtes simultanées.
✅ Vérification : Dans la prévisualisation d'Octoparse, les pages s'ouvrent sans erreurs, et les journaux de connexion indiquent des accès via votre proxy.
Étape 4 : Configuration du proxy mobile dans ParseHub
Objectif de l'étape
Connecter le proxy mobile au projet ParseHub de manière à ce que tous les appels réseau passent par l'adresse IP spécifiée avec authentification et délais.
Instructions détaillées
- Ouvrez ParseHub et créez un nouveau projet : bouton « Nouveau projet », entrez l'URL de départ. Attendez que la page se charge dans la fenêtre de prévisualisation.
- Accédez aux paramètres du projet. Dans le panneau de droite ou via l'icône « engrenage », ouvrez « Paramètres du projet » ou « Réseau » (le nom peut varier selon la version).
- Trouvez la section « Proxy » ou « Utiliser le serveur proxy ». Sélectionnez le protocole HTTP/HTTPS, entrez l'hôte et le port de votre proxy mobile.
- Indiquez le login et le mot de passe pour l'authentification. Si une case « Sauvegarder les identifiants » est disponible, activez-la.
- Réglez les délais dans les paramètres d'exécution : « Délai avant les actions » 2 à 4 secondes, « Délai de chargement des pages » 20 à 40 secondes, « Randomiser les délais » si cette option est disponible.
- Enregistrez les paramètres. Si un bouton « Tester le proxy » ou « Tester la connexion » est disponible, effectuez la vérification.
- Retournez à la fenêtre de prévisualisation et actualisez la page. Assurez-vous que le contenu se charge de manière stable et sans erreurs d'authentification.
Conseil : Si votre fournisseur dispose de différents points de sortie (villes), utilisez différentes hôtes pour des projets ParseHub séparés. Cela facilitera l'analyse des journaux et améliorera la résilience.
Résultat attendu
Le projet ParseHub s'ouvre sans erreurs sur les pages et le mode proxy est actif.
Problèmes possibles et solutions
- Une demande d'authentification réapparaît plusieurs fois. Solution : saisissez à nouveau le login et le mot de passe dans les paramètres, vérifiez s'il n'y a pas d'espaces supplémentaires lors de la copie.
- La page ne se charge pas dans la prévisualisation. Solution : augmentez le délai, assurez-vous que le proxy fonctionne (vérifiez dans le navigateur), si nécessaire, changez de nœud chez le fournisseur.
✅ Vérification : Dans la prévisualisation de ParseHub, les pages s'ouvrent de manière stable via le proxy. Il n'y a pas d'erreurs 407 Proxy Authentication Required.
Étape 5 : Créer et exécuter une tâche dans Octoparse (exemple)
Objectif de l'étape
Configurer une chaîne d'actions dans Octoparse pour extraire le nom, le prix, l'évaluation, la disponibilité, le lien et l'image à partir d'une liste de produits. Obtenez un scénario stable avec pagination et exportation.
Instructions détaillées étape par étape
- Dans le projet déjà connecté au proxy, entrez l'URL de départ de la section du catalogue. Cliquez sur « Go » pour prévisualiser.
- Cliquez sur « Détection automatique des données de la page web » (Auto-detect web page data). Attendez qu'Octoparse surligne les blocs de produits et propose des champs.
- Vérifiez les champs proposés. Si nécessaire, cliquez sur le titre du produit et choisissez « Extraire le texte » ; pour le prix — « Extraire le texte » ; pour le lien — « Extraire l'URL » ; pour l'image — « Extraire l'URL de l'image » ; pour l'évaluation — extrayez l'attribut de classe, puis transformez-le en évaluation lisible.
- Créez un « Boucle d'éléments » pour les fiches : assurez-vous qu'Octoparse a identifié la liste répétitive. Si ce n'est pas le cas, sélectionnez manuellement deux éléments identiques de la liste et cliquez sur « Sélectionner tout » pour créer la boucle.
- Ajoutez la pagination : cliquez sur le bouton « suivant » en bas et sélectionnez « Cliquer pour paginer ». Définissez une limite sur le nombre de pages, par exemple 3 pour le test.
- Définissez des pauses : dans les paramètres « Cliquer » pour la pagination, ajoutez « Attendre avant la prochaine action » de 5 à 8 secondes.
- Ouvrez « Prévisualisation des données ». Vérifiez que vous avez les colonnes Title, Price, Rating (potentiellement comme classe « star-rating Three » et ainsi de suite), Availability, ProductURL, ImageURL.
- Si nécessaire, ajoutez des étapes « Nettoyer les données » : éliminez les symboles monétaires du prix, mappez la classe d'évaluation à un nombre (One–Five → 1–5), coupez les espaces.
- Enregistrez le projet et lancez « Exécuter » avec les paramètres suivants : « Exécution locale » pour test ; intervalles de délais — par défaut issus des paramètres, flux — 1.
- Après l'exportation, choisissez le format CSV ou Excel. Indiquez le chemin de sauvegarde et le nom du fichier, par exemple octoparse_books_test.xlsx.
Conseil : Si la détection automatique a sélectionné des éléments superflus, supprimez-les manuellement dans le panneau « Champs ». Ne conservez que les colonnes nécessaires, cela améliorera la performance et simplifiera le post-traitement.
Conseil : Pour une évaluation correcte de la « Disponibilité », extrayez non seulement le texte, mais vérifiez aussi si l'élément « availability » est présent sur la fiche. Si l'élément a un attribut indiquant une quantité, ajoutez-le comme champ séparé.
Résultat attendu
Vous obtenez un ensemble de données correct sur 3 à 5 pages : pas moins de 60 à 100 lignes avec tous les champs et des liens valides.
Problèmes possibles et solutions
- « Boucle d'éléments » ne se crée pas. Solution : sélectionnez manuellement deux éléments adjacents identiques de la fiche et cliquez sur « Sélectionner tout ». Ensuite, ajoutez « Extraire les données » pour chaque sous-élément nécessaire.
- L'évaluation s'extrait comme texte de classe. Solution : utilisez « Nettoyer les données » avec la fonction « Remplacer » pour mapper « star-rating Three » → « 3 ».
- La pagination ne clique pas. Solution : augmentez « Attendre pour l'élément » et « Délai d'attente », assurez-vous de sélectionner précisément l'élément de lien et non le conteneur.
✅ Vérification : Dans la prévisualisation et l'export final, les valeurs des colonnes correspondent aux attentes. Aucune ligne vide, les liens sont cliquables et les images s'ouvrent.
Étape 6 : Créer et exécuter une tâche dans ParseHub (exemple)
Objectif de l'étape
Collecter un ensemble de données similaire dans ParseHub, en configurant la sélection des éléments, la pagination et l'exportation.
Instructions détaillées étape par étape
- Dans le projet ouvert de ParseHub, cliquez sur l'outil « Sélectionner » et cliquez sur le titre du premier produit. Ensuite, cliquez sur le titre du deuxième produit pour définir le modèle de l'élément répétitif. La liste sera surlignée en vert.
- Dans le panneau de droite, cliquez sur « Extraire » pour extraire le texte du titre. Renommez le champ en Title.
- De même, sélectionnez le prix sur la première et la deuxième fiche. Cliquez sur « Extraire », choisissez le type « Texte », nommez le champ Price.
- Pour le lien vers la fiche, sélectionnez le titre du produit et dans les propriétés du champ, indiquez « Extraire » → « URL » au lieu du texte. Nommez le champ ProductURL.
- Pour l'image, sélectionnez l'image sur la fiche et choisissez « Extraire » → « URL de l'image ». Nommez le champ ImageURL.
- Pour l'évaluation, cliquez sur l'icône des étoiles ou le bloc de texte d'évaluation. S'il est intégré dans la classe, extrayez l'attribut « class », puis configurez « Transformer » avec la règle de remplacement « One »–« Five » en chiffres.
- Ajoutez « Disponibilité » : cliquez sur le bloc de disponibilité et extrayez le texte. Nommez le champ Availability.
- Configurez la pagination : cliquez sur le bouton « suivant » ou sur le numéro de la page suivante et sélectionnez « Cliquer ». Définissez « Répéter le modèle actuel » jusqu'à 3 à 5 pages.
- Ajoutez des délais dans les actions « Cliquer » et « Attendre » de 4 à 8 secondes avant de naviguer entre les pages. Activez « Randomiser » si cette option est disponible.
- Cliquez sur « Exécuter » pour un lancement local. Attendez la fin et exportez le résultat en CSV/Excel.
Conseil : Si ParseHub sélectionne un conteneur trop large, resserrez votre choix : cliquez à nouveau sur le bon sous-élément ou utilisez « Sélection vide » et ajoutez les éléments progressivement.
Conseil : Pour des pages complexes, ajoutez une étape « Attendre l'élément » avec un attribut CSS spécifique, afin d'attendre le bon bloc avant d'extraire.
Résultat attendu
Vous obtenez un ensemble de données similaire, comparable à l'export de Octoparse, ce qui confirme la logique correcte et la stabilité de fonctionnement du proxy.
Problèmes possibles et solutions
- La liste n'est pas définie. Solution : sélectionnez deux fiches identiques consécutives pour que ParseHub voie le motif de répétition.
- Des champs sont parfois vides. Solution : augmentez les délais après le chargement de la page et utilisez « Attendre l'élément » pour le contenu.
✅ Vérification : Les données s'exportent successivement sans sauts, l'export en CSV/Excel s'ouvre et respecte la structure.
Étape 7 : Anti-bannissement et limites : comment maintenir la stabilité
Objectif de l'étape
Protéger les processus contre les blocages excessifs grâce à un rythme mesuré, une rotation appropriée et un contrôle de la qualité des requêtes.
Paramètres recommandés
- Rythme des requêtes : maintenez 1 à 2 requêtes par seconde au maximum, mais mieux vaut rester calme — 1 requête toutes les 2 à 4 secondes.
- Délai lors de la pagination : 5 à 10 secondes, de préférence avec aléatoire.
- Rotation d'IP : toutes les 3 à 10 minutes. Pour des fiches longues, utilisez une session collante de 5 à 15 minutes pour ne pas perdre le contexte.
- Parallélisme : 1 flux sur 1 IP mobile. Pour l'évolutivité, ajoutez de nouveaux proxies et non des flux sur une IP.
- Timeouts : Délai de chargement des pages de 20 à 45 secondes, réessayer 1 à 2 fois en cas d'échec du chargement.
- Pause entre les exécutions : 3 à 5 minutes pour laisser le réseau « refroidir » après une longue session.
Conseil : Tenez un registre : notez l'intervalle de rotation, le volume de pages collectées et les taux d'erreur. Cela vous aidera à ajuster les limites.
⚠️ Attention : Évitez de contourner les limites techniques du site. Si la ressource interdit clairement le scraping automatisé, n'utilisez pas le scraping. Travaillez uniquement là où c'est autorisé, et avec un volume que le site peut supporter sans dommage.
Résultat attendu
Diminution des erreurs de chargement, absence de pics de captcha et de blocages, collecte de données harmonieuse.
Problèmes possibles et solutions
- Captcha fréquente apparaît. Solution : réduisez la vitesse, augmentez les délais, réduisez le parallélisme, si nécessaire, changez de région de proxy chez le fournisseur.
- Réponses 403/429 aléatoires. Solution : ajoutez plus de pauses, réduisez la profondeur lors d'une exécution unique, utilisez un planificateur avec des intervalles.
✅ Vérification : Dans les journaux, le nombre de refus diminue. Le temps moyen par page est stable, et le pourcentage global de champs remplis augmente.
Étape 8 : Export, validation et structuration des données
Objectif de l'étape
Exporter correctement les résultats, vérifier leur intégrité et les structurer pour faciliter l'analyse.
Instructions détaillées
- Exportez les résultats d'Octoparse en Excel (XLSX) et de ParseHub en CSV. Renommez les fichiers avec la date, par exemple books_octoparse_2026-06-22.xlsx et books_parsehub_2026-06-22.csv.
- Ouvrez l'exportation et vérifiez la présence de toutes les colonnes. Comparez 5 à 10 enregistrements aléatoires avec le site manuellement.
- Vérifiez les doublons : triez par ProductURL et supprimez les lignes répétées.
- Nettoyez les données : supprimez le symbole de monnaie du prix, transformez le prix en nombre, normalisez les évaluations de 1 à 5, supprimez les espaces.
- Sauvegardez le fichier final comme version master. Faites une copie pour le travail et une autre pour l'archive.
Conseil : Établissez des règles simples de contrôle de qualité : au moins 95% de remplissage des champs clés et pas plus de 2% de doublons lors du test.
Résultat attendu
Un ensemble de données propre et complet, prêt pour l'analyse ou l'importation en BI/CRM.
Problèmes possibles et solutions
- Mauvaise codage CSV. Solution : ouvrez le fichier dans un éditeur, choisissez UTF-8 ou importez-le dans Google Sheets en spécifiant la codification.
- Mélange de séparateurs. Solution : exportez vers XLSX ou spécifiez un point-virgule comme séparateur.
✅ Vérification : Un contrôle manuel de 10 enregistrements confirme la validité. Les champs correspondent au format attendu.
Étape 9 : Automatisation des exécutions et contrôle de la stabilité
Objectif de l'étape
Configurer des lancements réguliers des tâches, des journaux et du monitoring, pour maintenir le résultat sans intervention manuelle.
Instructions détaillées
- Dans Octoparse, ouvrez « Planifier » ou « Planificateur de tâches ». Créez un emploi du temps, par exemple quotidiennement à 02h00. Indiquez des limites de profondeur et un nombre de lignes par exécution.
- Dans ParseHub, configurez « Planifier les exécutions » via le bureau web : choisissez la fréquence (une fois par jour ou par semaine), limitez le temps d'exécution et le nombre de pages.
- Configurez les notifications : activez les alertes par email pour l'achèvement des tâches et pour les erreurs.
- Ajoutez un contrôle de la rotation d'IP : dans le panneau du fournisseur, activez la mise à jour automatique de l'IP par minuteur, synchronisez cela avec le lancement du calendrier. Si nécessaire, prévoyez un changement de l'IP avant le lancement.
- Conservez des journaux : exportez le journal des exécutions en CSV une fois par semaine pour analyse. Notez le temps, le nombre de lignes collectées, et le nombre d'erreurs de chargement.
Conseil : Effectuez un petit test de contrôle 10 à 15 minutes avant le calendrier principal pour vous assurer que le site est accessible et que le proxy fonctionne.
Résultat attendu
Les tâches se lancent de façon stable selon le calendrier, les données sont mises à jour, et en cas d'erreurs, vous recevez des notifications et réagissez rapidement.
Problèmes possibles et solutions
- La tâche échoue la nuit. Solution : activez la nouvelle exécution en cas d'erreurs, augmentez les délais, réduisez la profondeur.
- Parfois, l'IP ne change pas à temps. Solution : prévoyez le changement d'IP 1 à 2 minutes avant le lancement du calendrier.
✅ Vérification : Le journal affiche des exécutions nocturnes réussies, vous recevez des emails à leur achèvement, et le volume de données augmente conformément aux plans.
Vérification des résultats
Liste de contrôle : ce qui doit fonctionner
- Octoparse et ParseHub ouvrent les pages de départ sans erreurs, le proxy est actif.
- Les champs sont correctement extraits, la pagination fonctionne et attend le chargement.
- L'export en CSV/XLSX crée des fichiers lisibles sans distorsion.
- Le pourcentage moyen de champs vides ne dépasse pas 5% dans l'ensemble de test.
- La rotation d'IP fonctionne selon l'intervalle donné, il n'y a pas d'erreurs d'authentification.
Comment tester
- Lancez un test rapide sur 2 à 3 pages et vérifiez les journaux : le taux de succès de 95% ou plus.
- Vérifiez dix enregistrements aléatoires manuellement en les comparant avec le site.
- Vérifiez si l'IP externe change conformément au calendrier dans le panneau du fournisseur.
Indicateurs de réussite
- Lancement sans erreurs d'authentification de proxy.
- Absence de captchas fréquentes et réponses 403/429.
- Temps stable par page et volume de données prévisible par exécution.
Erreurs courantes et solutions
- Problème : « 407 Proxy Authentication Required ». Cause : login/mot de passe incorrect. Solution : vérifiez les identifiants, supprimez les espaces supplémentaires lors de la copie, enregistrez les paramètres et testez à nouveau.
- Problème : les pages ne se chargent pas ou se chargent très lentement. Cause : délai d'attente trop court, nœud surchargé, vitesse de requêtes élevée. Solution : augmentez le délai d'attente, réduisez la vitesse, changez de nœud chez le fournisseur.
- Problème : des champs sont vides dans certaines lignes. Cause : les éléments ne sont pas à l'écran. Solution : ajoutez « Attendre l'élément », augmentez les délais et activez la randomisation.
- Problème : la pagination fonctionne mais les données ne changent pas. Cause : l'élément sélectionné n'est pas correct ou il faut attendre la mise à jour. Solution : sélectionnez le lien à l'intérieur du bouton « suivant », ajoutez « Attendre la navigation ».
- Problème : enregistrements en double. Cause : collecte de fiches identiques sur des pages adjacentes à cause des filtres. Solution : filtrez par ProductURL, activez la vérification des doublons lors de l'exportation.
- Problème : blocages IP soudains. Cause : rythme trop agressif. Solution : réduisez le parallélisme à un flux par IP, augmentez les pauses, utilisez une session collante d'une longueur raisonnable.
- Problème : codage incorrect du CSV. Cause : paramètres régionaux système. Solution : utilisez XLSX ou importez le CSV avec une configuration explicite de UTF-8.
Fonctions avancées
Configurations avancées :
- Planification de la rotation : configurez le changement automatique d'IP dans le cabinet du fournisseur avant le début de chaque exécution planifiée. Cela réduira la probabilité d'accumulation de traces comportementales sur une seule IP.
- Sessions collantes pour les fiches : lors du passage à la fiche produit, maintenez l'IP pendant 5 à 10 minutes pour terminer la collecte depuis la même adresse. Cela réduit le risque de divergences.
- Nettoyage des données à la volée : utilisez « Nettoyer les données » dans Octoparse et « Transformer » dans ParseHub pour normaliser les prix, évaluations et liens pendant la collecte.
- Division des tâches : divisez la collecte en deux étapes — listes et fiches. D'abord collectez les ProductURL, puis passez par elles séparément. Cela facilite le contrôle de qualité et les redémarrages.
- Intégrations : exportez directement vers Google Sheets ou des bases de données, si votre tarif le permet. Configurez des notifications de qualité de données.
Optimisation :
- Vitesse contre stabilité : ne visez pas la vitesse maximale. Une collecte stable de 1 à 2 pages par minute est souvent meilleure que des accès par à-coups avec un risque élevé de blocages.
- Regionalité : si le site est géo-sensible, choisissez des proxies mobiles d'une région spécifique pour des résultats cohérents.
Conseil : Tenez un « passeport de projet » : listez le site, la fréquence, les limites, la rotation, les points de défaillance et les contacts du support proxy. Cela accélère la réaction en cas d'incidents.
FAQ
Question : Comment savoir si le proxy est réellement mobile ?
Réponse : Le type de réseau (3G/4G/5G) et l'opérateur sont indiqués dans le cabinet du fournisseur. Les IP mobiles changent souvent lors de la rotation et appartiennent à des plages caractéristiques des opérateurs de télécommunications.
Question : Peut-on utiliser un proxy mobile pour deux tâches en même temps ?
Réponse : Non recommandé. Un flux par IP mobile est optimal pour la stabilité. Élargissez le nombre de proxies.
Question : Que choisir : la rotation chez le fournisseur ou dans le parser ?
Réponse : La rotation chez le fournisseur est plus fiable. Dans le parser, laissez les pauses de base et les timeouts, faites la rotation d'IP depuis le panneau des proxies pour éviter des conflits.
Question : Comment traiter les captchas ?
Réponse : Réduisez la vitesse, augmentez les délais, utilisez une rotation plus douce et un parallélisme moindre. Travaillez uniquement dans le cadre des règles permises du site et de la législation.
Question : Que faire si le site change sa mise en page ?
Réponse : Réajustez les sélecteurs : dans Octoparse, mettez à jour « Extraire les données » par de nouveaux éléments ; dans ParseHub, créez des sélections affinées. Testez toujours sur 2 à 3 pages.
Question : Comment sécuriser les mots de passe pour les proxies ?
Réponse : Utilisez un gestionnaire de mots de passe et des comptes distincts pour les projets d'apprentissage et de production. Ne conservez pas les mots de passe dans des documents ouverts.
Question : Comment vérifier rapidement que la rotation a fonctionné ?
Réponse : Vérifiez le panneau du fournisseur ou effectuez une requête courte pour afficher l'IP dans le navigateur via ce même proxy avant de lancer la tâche.
Question : Comment éviter des doublons lors de lancements réguliers ?
Réponse : Conservez le champ clé (par exemple, ProductURL) et comparez-le avec l'historique. En cas de doublons désactivés, utilisez le filtrage lors de l'importation dans le stockage.
Question : Peut-on fusionner les données d'Octoparse et de ParseHub ?
Réponse : Oui. Alignez les exportations sur la clé ProductURL et conservez prioritairement le champ avec le taux de remplissage le plus élevé. Cela aide à valider le résultat.
Question : Où trouver tous les pas pour configurer le proxy dans ce guide ?
Réponse : Rendez-vous aux sections « Étape 3 » et « Étape 4 » via les liens internes : configuration du proxy dans Octoparse et configuration du proxy dans ParseHub.
Conclusion
En résumé : vous avez installé et configuré Octoparse et ParseHub, connecté des proxies mobiles, créé des modèles de scraping fonctionnels avec pagination et validation, configuré l'anti-bannissement, l'exportation et des exécutions régulières. En résultat, vous avez un processus de collecte de données reproductible sans code avec une résistance aux blocages grâce à un rythme prudent et à des IP mobiles.
Ensuite : étendez le volume par l'ajout de proxies mobiles et de calendriers, améliorez la qualité grâce à des transformations de données, intégrez des exports dans BI ou CRM. Si vous utilisez des services comme mobileproxy.space, explorez les fonctionnalités supplémentaires du panneau de rotation et des journaux d'activité.
Perspectives de développement : apprenez à analyser la structure des pages complexes, utilisez un nettoyage avancé et une normalisation des données, ajoutez un contrôle de qualité avec des seuils de remplissage. Pour des tâches avancées, envisagez des pipelines en cascade : collecte de liste, puis de fiches, puis de médias. N'oubliez pas de toujours travailler dans le respect des règles du site et de la législation.
Conseil : Avant tout changement important, effectuez une sauvegarde du projet et conservez les paramètres actuels du proxy séparément. Cela fera gagner du temps lors du retour en arrière.