Octoparse i ParseHub bez kodu: krok po kroku do parsowania z mobilnymi proxy
Wprowadzenie
W tym przewodniku krok po kroku nauczysz się uruchamiać parsowanie bez programowania w dwóch popularnych narzędziach no-code — Octoparse i ParseHub — przy użyciu mobilnych proxy. Skonfigurujemy środowisko, połączymy się z dostawcą mobilnych proxy, rozwiążemy rzeczywisty przykład zbierania danych, wprowadzimy antyban i limity, a potem przetestujemy i wyeksportujemy wyniki. Na koniec uzyskasz odporny na blokady proces parsowania, gotowy do skalowania i regularnego aktualizowania danych.
Dla kogo ten przewodnik: dla początkujących, którzy chcą szybko rozpocząć bez kodu; dla marketerów, analityków i specjalistów ds. danych, którzy potrzebują niezawodnego i zrozumiałego procesu zbierania informacji; dla zaawansowanych użytkowników — w sekcji „Dodatkowe możliwości” znajdują się porady dotyczące optymalizacji.
Co musisz wiedzieć wcześniej: podstawowe umiejętności obsługi komputera i przeglądarki. Programowanie nie jest wymagane.
Ile czasu to zajmie: 2–4 godziny na pełen cykl, w tym instalacja, konfiguracja proxy i testowe parsowanie. Jeśli masz już doświadczenie w narzędziach — 60–90 minut.
Przygotowanie
Nieodzowne narzędzia i dostęp:
- Konto w Octoparse (Windows, macOS; dostępna wersja w chmurze). Dowolna aktualna wersja z lat 2025–2026 będzie odpowiednia.
- Konto w ParseHub (aplikacja desktopowa na Windows/macOS i konto w sieci). Wybierz aktualną wersję.
- Konto i dostęp do mobilnych proxy od zaufanego dostawcy. Właściwy serwis powinien mieć rzeczywiste mobilne IP, autoryzację przy użyciu loginu i hasła oraz elastyczne zarządzanie rotacją. Dobrym przykładem jest mobileproxy.space jako dostawca mobilnych proxy i narzędzi automatyzacji.
- Testowa strona, która zezwala na edukacyjne parsowanie. Będziemy korzystać z zasobów demonstracyjnych do celów edukacyjnych — „Books to Scrape” (publiczna strona demo do praktyki). Możesz zastąpić przykład inną stroną, jeśli masz na to pozwolenie i nie narusza to zasad serwisu.
Wymagania systemowe:
- PC z Windows 10/11 lub macOS 12+ z 8 GB RAM i wolnymi 2–4 GB na dysku.
- Stabilne połączenie internetowe 10 Mb/s lub lepsze.
- Możliwość instalacji oprogramowania oraz dostęp do ustawień sieciowych w celu sprawdzenia proxy.
Co należy pobrać i zainstalować:
- Pobierz i zainstaluj Octoparse z oficjalnej strony dewelopera. Podczas instalacji wybierz język interfejsu oraz katalog instalacji. Po zakończeniu, zaloguj się na swoje konto lub utwórz nowe.
- Pobierz i zainstaluj ParseHub. Uruchom aplikację i zaloguj się na swoje konto.
- Wybierz plan u dostawcy mobilnych proxy. W panelu osobistym uzyskaj adres proxy (host i port), login i hasło. Jeśli dostępna jest opcja rotacji IP, wybierz interwał zmiany adresu, np. co 3–10 minut.
Tworzenie kopii zapasowych (aktualne dla projektów):
- W Octoparse eksportuj projekt do pliku .otd po każdej większej zmianie.
- W ParseHub, po skonfigurowaniu, zapisz projekt i utwórz lokalną kopię pliku projektu poprzez menu „File” → „Save As”.
Porada: Przechowuj dane uwierzytelniające proxy osobno od projektów. Używaj menedżera haseł i twórz oddzielne dostęp dla zadań edukacyjnych i produkcyjnych.
Podstawowe pojęcia
Kluczowe pojęcia podane w prosty sposób:
- No-code parser — program, który umożliwia zbieranie danych ze stron bez programowania. Użytkownik ustawia za pomocą kliknięć: co otworzyć, co nacisnąć, co wydobyć.
- Proxy — serwer pośredniczący, przez który przechodzą twoje zapytania internetowe. Strona widzi nie twój prawdziwy IP, a IP proxy.
- Mobilne proxy — proxy korzystające z rzeczywistych adresów IP operatorów telefonii komórkowej (3G/4G/5G). Zmieniają się one częściej i wyglądają naturalnie dla stron, co zmniejsza ryzyko blokad przy ostrożnym używaniu.
- Rotacja IP — okresowa zmiana adresu IP. W mobilnych proxy może być automatyczna, zgodnie z harmonogramem lub za pomocą API w panelu dostawcy.
- Selektor — sposób wskazania na stronie, jaki element wydobyć (np. tytuł produktu, cena). W Octoparse i ParseHub osiąga się to przez klikanie w elementy strony.
- Paginacja — przechodzenie pomiędzy stronami z listą wyników (przyciski „Next”, numery stron).
- Sessja — sekwencja zapytań z jednego IP. „Lepka” lub sticky-sessja przechowuje IP na czas trwania zadania, aby zakończyć je bez zmiany adresu w trakcie.
Podstawowe zasady działania:
- Parser otwiera stronę, czeka na jej załadowanie, znajduje potrzebne elementy, wydobywa tekst, linki lub atrybuty, przechodzi na następną stronę i powtarza proces.
- Proxy dodaje się raz w ustawieniach projektu. Potem wszystkie zapytania sieciowe przechodzą przez nie.
- Dla stabilności używaj umiarkowanych prędkości, przerw między działaniami i rotacji IP.
Co jest ważne przed rozpoczęciem:
- Przestrzegaj zasad strony źródłowej oraz prawodawstwa swojego kraju. Szanuj plik robots.txt i warunki użytkowania serwisu. Uzyskaj zezwolenie, jeżeli planujesz intensywne pobieranie danych.
- Nie wydobywaj danych osobowych, które nie są przeznaczone do zbierania automatycznego. Pracuj tylko z otwartymi i dozwolonymi informacjami.
- Celem mobilnych proxy jest stabilna i prawidłowa praca, a nie omijanie ograniczeń prawnych lub ustalonych przez właściciela strony.
⚠️ Uwaga: Nigdy nie używaj proxy oraz narzędzi do parsowania do działań, które są zakazane przez lokalne prawo lub zasady strony. Ten przewodnik jest przeznaczony do legalnych scenariuszy edukacyjnych i roboczych z dozwolonym dostępem do danych.
Krok 1: Planowanie zadania i przygotowanie struktury danych
Cel etapu
Określić, jakie dane są potrzebne, gdzie się znajdują na stronie, jak przechodzić pomiędzy stronami oraz ustalić zasady częstotliwości zapytań. Wynik — prosty plan pole → selektor → źródło oraz lista URL do startu.
Szczegółowa instrukcja
- Otwórz stronę edukacyjną z produktami (przykład: Books to Scrape). Upewnij się, że jest to zasób demo, który zezwala na edukacyjne zbieranie danych.
- Określ pola do wydobycia: nazwa produktu, cena, ocena, dostępność (In stock), link do karty oraz okładka (URL obrazu).
- Ustal strukturę danych: utwórz tabelę w Google Sheets lub Excel z kolumnami Title, Price, Rating, Availability, ProductURL, ImageURL.
- Sprawdź paginację: znajdź przycisk „next” lub numery stron na dole listy. Zapisz klasę CSS lub tekst przycisku (np. „li.next a”).
- Oceń głębokość: ile stron i produktów. Na próbkę edukacyjną weź 3–5 stron.
- Ustal częstotliwość zapytań: rozpocznij od 1 zapytania co 2–4 sekundy oraz stopniowych przerw przed paginacją.
Porada: Im prostszy i czystszy początkowy cel, tym łatwiejsza będzie debugowanie. Zacznij od 1–2 pól (np. nazwa i cena), a następnie dodawaj pozostałe.
Oczekiwany wynik
Masz listę URL stron do startu, spis pól oraz zrozumienie, jak przechodzić pomiędzy stronami.
Możliwe problemy i rozwiązania
- Niejasne, gdzie znajduje się potrzebny element. Rozwiązanie: najedź kursorem na element w przeglądarce i użyj „Widok źródła”, aby znaleźć unikalny atrybut lub klasę.
- Niestabilna paginacja. Rozwiązanie: użyj przycisku „next” zamiast numerów stron, będzie to prostsze i bardziej stabilne.
✅ Weryfikacja: W twojej tabeli znajduje się lista pól oraz 3–5 początkowych URL. Zrozumienie paginacji zostało potwierdzone.
Krok 2: Uzyskanie i sprawdzenie mobilnego proxy
Cel etapu
Uzyskać mobilne proxy, zdobyć adres, port, login i hasło, wybrać tryb rotacji IP i upewnić się, że proxy działa stabilnie.
Szczegółowa instrukcja
- Zaloguj się do panelu osobistego dostawcy mobilnych proxy. Użyj odpowiedniego przykładu serwisu: mobileproxy.space, gdzie dostępne są mobilne IP operatorów, konfigurowana rotacja oraz dokumentacja dotycząca formatów autoryzacji.
- Utwórz konto proxy. Wprowadź potrzebny zasięg miast lub krajów, jeśli to konieczne dla zadania. W przypadku projektu edukacyjnego użyj domyślnego regionu.
- Skopiuj ustawienia: host (np. gw.provider.example), port (np. 10000–20000), login i hasło. Zapisz te dane w menedżerze haseł.
- Skonfiguruj rotację IP: wybierz interwał 3–10 minut. Dla stabilnego zbiory danych użyj sticky-sesji przez 5–15 minut, aby IP nie zmieniło się w środku wydobywania karty produktu.
- Sprawdź działanie proxy: otwórz przeglądarkę i ustaw proxy systemowe (HTTP) na podany host:port z loginem i hasłem. Wejdź na stronę „pokaż IP” lub dowolny dozwolony serwis, na którym widać twój zewnętrzny adres, i upewnij się, że IP zmieniło się na mobilne.
- Po weryfikacji wyłącz proxy systemowe w przeglądarce, aby nie przeszkadzało w dalszej pracy narzędzi.
Porada: Jeśli dostawca oferuje przycisk API „zmień IP”, zanotuj jego adres URL. Będzie to przydatne do ręcznej zmiany IP pomiędzy uruchomieniami zadań.
Oczekiwany wynik
Masz aktywne dane mobilnego proxy oraz potwierdzenie, że IP jest poprawnie zmieniane, a rotacja jest ustawiona.
Możliwe problemy i rozwiązania
- Błąd autoryzacji w przeglądarce. Rozwiązanie: sprawdź poprawność loginu i hasła, uwzględnij wielkość liter.
- Strona nie otwiera się przez proxy. Rozwiązanie: zmień węzeł lub port w panelu dostawcy, lub skontaktuj się z obsługą klienta. Upewnij się, że używasz wspieranego protokołu (HTTP/HTTPS).
✅ Weryfikacja: Potwierdzasz zewnętrzny IP mobilnego proxy i wiesz, jak uruchomić rotację w razie potrzeby.
Krok 3: Ustawienie mobilnego proxy w Octoparse
Cel etapu
Połączyć mobilne proxy z konkretnym projektem w Octoparse, aby wszystkie zapytania przechodziły przez nie z odpowiednią rotacją i opóźnieniami.
Szczegółowa instrukcja
- Uruchom Octoparse i zaloguj się na konto. Na głównym ekranie kliknij „+ Nowy” lub „Utwórz zadanie”.
- Wprowadź początkowy URL z twojej listy (np. strona główna działu „Książki”). Naciśnij „Zapisz URL” lub „Rozpocznij”, aby zobaczyć podgląd.
- Otwórz ustawienia projektu. W lewej szpuli znajdź sekcję „Ustawienia”, „Zaawansowane” lub „Ustawienia zadań” (nazwa może różnić się w zależności od wersji). Przejdź do bloku „Proxy” lub „Rotacja IP”.
- Wybierz „Używaj mojego proxy” lub „Proxy niestandardowe”. Wprowadź host i port swojego mobilnego proxy.
- Wprowadź dane autoryzacyjne: wprowadź login i hasło. Jeśli dostępna jest opcja „Zapamiętaj dane uwierzytelniające”, włącz ją.
- Aktywuj rotację IP w Octoparse (jeśli dostępna), lub pozostaw rotację po stronie dostawcy. Jeśli Octoparse zezwala na „Zmień IP co X minut”, zsynchronizuj interwał z ustawieniami w panelu proxy (np. 5 minut).
- Ustal prędkość: w „Prędkości” lub „Ustawieniach wykonania” ustaw opóźnienia 2–4 sekundy między działaniami oraz 5–8 sekund przed paginacją. Włącz opcję „Zrandomizuj opóźnienie”, jeśli jest dostępna.
- Zapisz ustawienia. Kliknij „Testuj połączenie” (jeśli jest dostępne), aby upewnić się, że projekt widzi internet przez proxy.
Porada: Przechowuj różne profile proxy dla różnych projektów. W nazwach wskazuj region i interwał rotacji, aby uniknąć zamieszania.
⚠️ Uwaga: Nie włączaj równoczesnego uruchamiania wielu wątków na jednym mobilnym IP. To może prowadzić do podejrzanej aktywności. Lepiej skalować przez liczbę proxy.
Oczekiwany wynik
Projekt w Octoparse jest zapisywany, przez „Testuj połączenie” przechodzi weryfikację, a podgląd stron otwiera się stabilnie.
Możliwe problemy i rozwiązania
- Strona ładuje się zbyt wolno. Rozwiązanie: zwiększ czas oczekiwania na załadowanie w „Zaawansowane” i zmniejsz liczbę jednoczesnych zapytań.
✅ Weryfikacja: W podglądzie Octoparse strony otwierają się bez błędów, a log połączeń wskazuje na odwołania przez twoje proxy.
Krok 4: Ustawienie mobilnego proxy w ParseHub
Cel etapu
Połączyć mobilne proxy z projektem ParseHub, aby wszystkie wywołania sieciowe przechodziły przez wskazany adres IP z autoryzacją i opóźnieniami.
Szczegółowa instrukcja
- Otwórz ParseHub i stwórz nowy projekt: przycisk „Nowy projekt”, wprowadź początkowy URL. Poczekaj, aż strona załaduje się w oknie podglądu.
- Przejdź do ustawień projektu. W prawym panelu lub przez ikonę „zębatki” otwórz „Ustawienia projektu” lub „Sieć” (nazwa może się różnić w zależności od wersji).
- Znajdź sekcję „Proxy” lub „Użyj serwera proxy”. Wybierz protokół HTTP/HTTPS, wprowadź host i port swojego mobilnego proxy.
- Wprowadź login i hasło do autoryzacji. Jeśli jest pole wyboru „Zapisz dane uwierzytelniające”, aktywuj je.
- Ustal opóźnienia w ustawieniach wykonania: „Opóźnienie przed akcjami” 2–4 sekundy, „Czas oczekiwania na załadowanie strony” 20–40 sekund, „Zrandomizuj opóźnienia”, jeśli jest to dostępne.
- Zapisz ustawienia. Jeśli dostępny jest przycisk „Testuj proxy” lub „Testuj połączenie”, przeprowadź test.
- Wróć do okna podglądu i odśwież stronę. Upewnij się, że treść ładuje się stabilnie, bez błędów autoryzacji.
Porada: Jeśli twój dostawca ma różne punkty wyjścia (miasta), dla poszczególnych projektów ParseHub używaj różnych hostów. To uprości analizę logów i zwiększy stabilność.
Oczekiwany wynik
Projekt ParseHub otwiera strony bez błędów, a tryb proxy jest aktywny.
Możliwe problemy i rozwiązania
- Autoryzacja pojawia się wielokrotnie. Rozwiązanie: ponownie wprowadź login i hasło w ustawieniach, upewnij się, że nie ma nadmiaru spacji podczas kopiowania.
- Strona nie ładuje się w podglądzie. Rozwiązanie: zwiększ czas oczekiwania, upewnij się, że proxy działa (sprawdź w przeglądarce), w razie potrzeby zmień węzeł u dostawcy.
✅ Weryfikacja: W podglądzie ParseHub strony stabilnie otwierają się przez proxy. Brak błędów 407 Proxy Authentication Required.
Krok 5: Tworzymy i uruchamiamy zadanie w Octoparse (przykład)
Cel etapu
Skonfigurować sekwencję działań w Octoparse do wydobycia nazwy, ceny, oceny, dostępności, linku i obrazu na przykładzie listy produktów. Uzyskać stabilny scenariusz z paginacją i eksportem.
Szczegółowa instrukcja
- W projekcie z already connected proxy wprowadź początkowy URL z katalogu. Naciśnij „Go”, aby zobaczyć podgląd.
- Naciśnij „Auto-detect web page data” (Autoodkrywanie). Poczekaj, aż Octoparse podświetli bloki listy produktów i zaproponuje pola.
- Sprawdź proponowane pola. Jeśli to konieczne, kliknij na tytule produktu i wybierz „Wydobądź tekst”; na cenie — „Wydobądź tekst”; na linku — „Wydobądź URL”; na obrazie — „Wydobądź URL obrazu”; na ocenie — wydobądź atrybut klasy, a następnie skonwertuj go na czytelną ocenę.
- Utwórz „Pętlę przedmiotu” dla kart: upewnij się, że Octoparse zidentyfikował powtarzający się wykaz. Jeśli nie, ręcznie wybierz dwa identyczne elementy listy i kliknij „Wybierz wszystkie”, aby utworzyć pętlę.
- Dodaj paginację: kliknij przycisk „next” na dole i wybierz „Kliknij, aby przejść do paginacji”. Ustaw ograniczenie liczby stron, na przykład 3 na test.
- Ustal opóźnienia: w ustawieniach „Kliknij” dla paginacji dodaj „Czekaj przed kolejną akcją” 5–8 sekund.
- Otwórz „Podgląd danych”. Sprawdź, czy masz kolumny Title, Price, Rating (możliwe jako klasa „star-rating Three” itp.), Availability, ProductURL, ImageURL.
- W razie potrzeby dodaj kroki „Czyszczenie danych”: usunięcie symbolu waluty z ceny, mapowanie klasy oceny na liczby (One–Five → 1–5), usunięcie spacji.
- Zapisz projekt i uruchom „Run” z następującymi parametrami: „Lokalne uruchomienie” do testu; interwały opóźnień — domyślnie z ustawień, wątki — 1.
- Po zakończeniu eksportu wybierz format CSV lub Excel. Wskaź ścieżkę zapisu oraz nazwę pliku, na przykład octoparse_books_test.xlsx.
Porada: Jeśli autoodkrycie wybrało zbędne elementy, usuń je ręcznie w panelu „Fields”. Zostaw tylko potrzebne kolumny, to przyspieszy pracę i uprości obróbkę postprodukcji.
Porada: Aby poprawne „Availability”, wydobywaj nie tylko tekst, ale i upewnij się, że element „availability” znajduje się na karcie. Jeśli dany element ma atrybut z ilością, dodaj go jako oddzielne pole.
Oczekiwany wynik
Możliwe problemy i rozwiązania
- Nie tworzy się „Pętla przedmiotu”. Rozwiązanie: wybierz dwa sąsiadujące identyczne elementy karty ręcznie i kliknij „Wybierz wszystkie”. Następnie dodaj „Wydobądź dane” dla każdego potrzebnego podelementu.
- Ocena jest wydobywana jako tekst klasy. Rozwiązanie: użyj „Czyszczenie danych” z funkcją „Zamień” do mapowania „star-rating Three” → „3”.
- Paginacja nie działa. Rozwiązanie: zwiększ „Czekaj na element” i „Czas oczekiwania”, upewnij się, że wybrany jest dokładnie element linku, a nie kontener.
✅ Weryfikacja: W podglądzie i ostatecznym eksporcie wartości kolumn odpowiadają oczekiwaniom. Brak pustych wierszy, linki są klikalne, obrazy się ładują.
Krok 6: Tworzymy i uruchamiamy zadanie w ParseHub (przykład)
Cel etapu
Zebrać analogiczny zestaw danych w ParseHub, konfigurując wybór elementów, paginację i eksport.
Szczegółowa instrukcja
- W otwartym projekcie ParseHub kliknij narzędzie „Wybierz” i kliknij tytuł pierwszego produktu. Następnie kliknij tytuł drugiego produktu, aby ustawić szablon powtarzającego się elementu. Lista podświetli się na zielono.
- W prawym panelu kliknij „Wydobądź” w celu wydobycia tekstu tytułu. Zmień nazwę pola na Title.
- Podobnie wybierz cenę na pierwszej i drugiej karcie. Kliknij „Wydobądź”, wybierz typ „Tekst”, nazwij pole Price.
- Dla linku do karty wybierz tytuł produktu i w polu właściwości wybierz „Wydobądź” → „URL” zamiast tekstu. Nazwij pole ProductURL.
- Dla obrazu zaznacz obraz na karcie i wybierz „Wydobądź” → „URL obrazu”. Nazwij pole ImageURL.
- Dla oceny kliknij ikonę gwiazdek lub blok tekstu oceny. Jeśli jest wbudowane w klasę, wydobądź atrybut „class”, a następnie skonfiguruj „Transform” regułą zamiany „One”–„Five” na liczby.
- Dodaj „Dostępność”: kliknij blok dostępności i wydobądź tekst. Nazwij pole Availability.
- Skonfiguruj paginację: kliknij przycisk „next” lub numer następnej strony i wybierz „Kliknij”. Ustal „Powtórz bieżący szablon” do 3–5 stron.
- Dodaj opóźnienia w działaniach „Kliknij” i „Czekaj” na 4–8 sekund przed przejściem pomiędzy stronami. Włącz „Zrandomizuj” w razie potrzeby.
- Naciśnij „Uruchom” dla lokalnego uruchomienia. Poczekaj na zakończenie i wyeksportuj wyniki do CSV/Excel.
Porada: Jeśli ParseHub zaznacza zbyt szeroki kontener, zawęż wybór: kliknij ponownie na żądanym podelemencie albo użyj „Pusty wybór” i dodawaj elementy stopniowo.
Porada: Dla skomplikowanych stron dodaj krok „Czekaj na element” z określonym atrybutem CSS, aby poczekać na wymagany blok przed wydobywaniem.
Oczekiwany wynik
Uzyskujesz analogiczny zestaw danych, porównywalny z eksportem z Octoparse, co potwierdza poprawność logiki i stabilność pracy proxy.
Możliwe problemy i rozwiązania
- Lista nie jest określona. Rozwiązanie: wybierz dwie identyczne karty pod rząd, aby ParseHub zauważył wzór powtarzania.
- Pola czasami są puste. Rozwiązanie: zwiększ opóźnienia po załadowaniu strony i użyj „Czekaj na element” dla zawartości.
✅ Weryfikacja: Dane wydobywane są sekwencyjnie bez luk, eksport do CSV/Excel otwiera się i odpowiada strukturze.
Krok 7: Antyban i limity: jak zachować stabilność
Cel etapu
Chronić procesy przed nadmiernymi blokadami poprzez właściwe tempo, rotację i kontrolę jakości zapytań.
Rekomendowane ustawienia
- Tempo zapytań: utrzymuj 1–2 zapytania na sekundę maksymalnie, ale lepiej spokojniej — 1 zapytanie co 2–4 sekundy.
- Opóźnienia przy paginacji: 5–10 sekund, najlepiej z randomizacją.
- Rotacja IP: co 3–10 minut. Dla długich kart używaj sticky-sesji 5–15 minut, aby nie stracić kontekstu.
- Paralelizm: 1 wątek na 1 mobilne IP. W celu skalowania dodawaj nowe proxy, a nie wątki na jednym IP.
- Czasy oczekiwania: Czas ładowania strony 20–45 sekund, powtórne próby ładowania 1–2 razy w przypadku niepowodzenia.
- Przerwa między uruchomieniami: 3–5 minut, aby dać sieci „odpocząć” po długiej sesji.
Porada: Prowadź dziennik: zapisuj interwał rotacji, ilość zebranych stron i wskaźniki błędów. To pomoże precyzyjnie dostosować limity.
⚠️ Uwaga: Unikaj omijania technicznych ograniczeń strony. Jeśli zasób wyraźnie zakazuje automatycznego zbierania, nie stosuj parsowania. Pracuj tylko tam, gdzie jest to dozwolone i z taką ilością, jaką strona może obsłużyć bez uszczerbku.
Oczekiwany wynik
Zmniejszenie błędów ładowania, brak wzrostów captcha oraz blokad, równomierne zbieranie danych.
Możliwe problemy i rozwiązania
- Pojawia się częsta captcha. Rozwiązanie: zmniejsz prędkość, zwiększ opóźnienia, zmniejsz paralelizm, w razie potrzeby zmień region proxy u dostawcy.
- Losowe odpowiedzi 403/429. Rozwiązanie: dodaj więcej przerw, zmniejsz głębokość jednego uruchomienia, użyj harmonogramu z interwałami.
✅ Weryfikacja: W logach zmniejsza się liczba odmów. Średni czas na stronę jest stabilny, a ogólny procent wypełnionych pól wzrasta.
Krok 8: Eksport, walidacja i strukturyzacja danych
Cel etapu
Prawidłowo wyeksportować wyniki, sprawdzić ich integralność i przekształcić je w struktura przyjazną analizie.
Szczegółowa instrukcja
- Wyeksportuj wyniki z Octoparse do Excel (XLSX) i z ParseHub do CSV. Zmień nazwy plików na datę, np. books_octoparse_2026-06-22.xlsx oraz books_parsehub_2026-06-22.csv.
- Otwórz eksport i sprawdź obecność wszystkich kolumn. Porównaj 5–10 losowych rekordów z serwisem ręcznie.
- Sprawdź duplikaty: posortuj według ProductURL i usuń powtarzające się wiersze.
- Wyczyść dane: usuń symbol waluty, przekształć cenę na liczbę, znormalizuj ocenę na 1 do 5, obetnij spacje.
- Zapisz finalny plik jako wersję master. Stwórz kopię do pracy oraz oddzielną do archiwum.
Porada: Wprowadź proste zasady kontroli jakości: co najmniej 95% wypełnionych kluczowych pól i nie więcej niż 2% duplikatów w teście.
Oczekiwany wynik
Czysty i kompletny zestaw danych, gotowy do analizy lub załadunku w BI/CRM.
Możliwe problemy i rozwiązania
- Niepoprawna kodowanie CSV. Rozwiązanie: otwórz plik w edytorze, wybierz UTF-8 lub zaimportuj do Google Sheets, podając kodowanie.
- Mieszanie separatorów. Rozwiązanie: eksportuj do XLSX lub podaj średnik jako separator.
✅ Weryfikacja: Ręczne porównanie 10 rekordów potwierdza poprawność. Pola odpowiadają oczekiwanemu formatowi.
Krok 9: Automatyzacja uruchomień i kontrola stabilności
Cel etapu
Skonfigurować regularne uruchomienia zadań, logi i monitorowanie, aby utrzymać wyniki bez ręcznego udziału.
Szczegółowa instrukcja
- W Octoparse otwórz „Harmonogram” lub „Harmonogram zadań”. Stwórz harmonogram, na przykład codziennie o 02:00. Ustal ograniczenia głębokości oraz limit wierszy na uruchomienie.
- W ParseHub skonfiguruj „Harmonogram uruchomień” przez panel osobisty: wybierz częstotliwość (raz dziennie lub tygodniowo), ogranicz czas wykonania oraz liczbę stron.
- Skonfiguruj powiadomienia: włącz powiadomienia e-mail o zakończeniu zadań oraz błędach.
- Dodaj kontrolę rotacji IP: w panelu dostawcy ustaw automatyczną aktualizację IP zgodnie z harmonogramem, zsynchronizuj ją z uruchomieniem harmonogramu. Jeśli to konieczne, ustaw zmianę IP przed uruchomieniem.
- Przechowuj logi: eksportuj dziennik uruchomień do CSV co tydzień do analizy. Zapisuj czas, ilość zebranych wierszy, liczbę błędów ładowania.
Porada: Wykonaj kontrolowy mały bieg przez 10–15 minut przed głównym harmonogramem, aby upewnić się, że strona jest dostępna, a proxy działa.
Oczekiwany wynik
Zadania stabilnie uruchamiane zgodnie z harmonogramem, dane są aktualizowane, a w przypadku błędów otrzymujesz powiadomienia i szybko reagujesz.
Możliwe problemy i rozwiązania
- Zadanie pada w nocy. Rozwiązanie: włącz ponowne uruchamianie w przypadku błędów, dodaj dłuższe czasy oczekiwania, zmniejsz głębokość.
- Czasami IP nie zdąży się zmienić. Rozwiązanie: ustaw zmianę IP na 1–2 minuty przed startem harmonogramu.
✅ Weryfikacja: W logach są udane nocne uruchomienia, wiadomości o zakończeniu docierają a ilość danych rośnie zgodnie z planem.
Weryfikacja wyniku
Lista kontrolna: co powinno działać
- Octoparse i ParseHub otwierają strony startowe bez błędów, proxy jest aktywne.
- Pola są poprawnie wydobywane, paginacja działa i czeka na załadowanie.
- Eksport do CSV/XLSX tworzy czytelne pliki bez zniekształceń.
- Średni procent pustych pól nie przekracza 5% w zestawie testowym.
- Rotacja IP działa zgodnie z zadanym interwałem, nie ma błędów autoryzacji.
Jak przetestować
- Uruchom krótki bieg na 2-3 stronach i sprawdź logi: udział udanych załadunków nie mniej niż 95%.
- Sprawdź dziesięć losowych rekordów ręcznie, porównując je z serwisem.
- Sprawdź, czy zewnętrzne IP zmienia się zgodnie z harmonogramem w panelu dostawcy.
Wskaźniki udanego wykonania
- Uruchomienie bez błędów autoryzacji proxy.
- Brak częstych captcha i odpowiedzi 403/429.
- Stabilny czas na stronę i przewidywalna ilość danych za uruchomienie.
Typowe błędy i rozwiązania
- Problem: „407 Proxy Authentication Required”. Przyczyna: niewłaściwy login/hasło. Rozwiązanie: sprawdź dane uwierzytelniające, usuń nadmiarowe spacje podczas kopiowania, zapisz ustawienia i przetestuj ponownie.
- Problem: strony nie ładują się lub ładują się bardzo wolno. Przyczyna: zbyt krótki timeout, przeciążony węzeł, wysoka prędkość zapytań. Rozwiązanie: zwiększ czas oczekiwania, zmniejsz prędkość, zmień węzeł u dostawcy.
- Problem: pola są puste w niektórych wierszach. Przyczyna: elementy nie zdążyły się narysować. Rozwiązanie: dodaj „Czekaj na element”, zwiększ opóźnienia i włącz randomizację.
- Problem: paginacja działa, ale dane się nie zmieniają. Przyczyna: wybrano niewłaściwy element lub trzeba poczekać na odświeżenie. Rozwiązanie: wybierz link wewnątrz przycisku „next”, dodaj „Czekaj na nawigację”.
- Problem: powtarzające się rekordy. Przyczyna: zbieranie tych samych kart na sąsiadujących stronach z powodu filtrów. Rozwiązanie: filtracja według ProductURL, włączenie weryfikacji duplikatów podczas eksportu.
- Problem: nagłe blokady IP. Przyczyna: zbyt agresywne tempo. Rozwiązanie: zmniejsz paralelizm do jednego wątku na IP, zwiększ przerwy, użyj sticky-sesji rozsądnej długości.
- Problem: niewłaściwe kodowanie CSV. Przyczyna: ustawienia lokalne systemu. Rozwiązanie: użyj XLSX lub zaimportuj CSV z wyraźnym ustawieniem UTF-8.
Dodatkowe możliwości
Zaawansowane ustawienia:
- Planowanie rotacji: skonfiguruj automatyczną zmianę IP w panelu dostawcy przed rozpoczęciem każdego zaplanowanego uruchomienia. To zmniejszy ryzyko gromadzenia śladów behawioralnych na jednym IP.
- Sticky-sesje dla kart: przy przechodzeniu do karty produktu przytrzymuj IP przez 5–10 minut, aby zakończyć zbieranie z jednego adresu. To zmniejsza ryzyko niespójności.
- Czyszczenie danych na bieżąco: używaj „Czyszczenie danych” w Octoparse i „Transform” w ParseHub do normalizacji ceny, oceny i linków już podczas zbierania danych.
- Podział zadań: dziel zbieranie na dwa etapy — lista i karty. Najpierw zbieraj ProductURL, a potem przechodź przez nie. To upraszcza kontrolę jakości i ponowne uruchomienia.
- Integracje: eksportuj bezpośrednio do Google Sheets lub baz danych, jeśli twój plan to wspiera. Skonfiguruj powiadomienia o jakości danych.
Optymalizacja:
- Prędkość versus stabilność: nie dąż do maksymalnej prędkości. Stabilne 1–2 strony na minutę często lepsze niż nagłe przyspieszenia z ryzykiem blokad.
- Regionalność: jeśli strona jest geoczuła, wybieraj mobilne proxy z konkretnego regionu dla spójnych wyników.
Porada: Prowadź „paszport projektu”: wymień stronę, częstotliwość, limity, rotację, punkty awarii i kontakty wsparcia proxy. To przyspiesza reakcję na incydenty.
FAQ
Pytanie: Jak sprawdzić, czy proxy jest naprawdę mobilne?
Odpowiedź: W panelu dostawcy wskazywany jest typ sieci (3G/4G/5G) i operator. Mobilne IP często zmieniają się przy rotacji i mają charakterystyczne zakresy operatorów telefonii.
Pytanie: Czy można używać jednego mobilnego proxy w dwóch zadaniach?
Odpowiedź: Nie zaleca się. Jeden wątek na jeden mobilny IP — optymalnie dla stabilności. Skaluj przez liczbę proxy.
Pytanie: Co wybrać: rotację u dostawcy czy w parserze?
Odpowiedź: Niezawodniej rotacja u dostawcy. W parserze zostaw podstawowe opóźnienia i czasy oczekiwania, a zmianę IP zrób w panelu proxy, aby uniknąć konfliktów.
Pytanie: Jak radzić sobie z captchami?
Odpowiedź: Zmniejsz prędkość, zwiększ opóźnienia, korzystaj z bardziej płynnej rotacji i mniejszego paralelizmu. Pracuj tylko w ramach dozwolonych zasad strony oraz przepisów prawnych.
Pytanie: Co zrobić, jeśli strona zmieni układ?
Odpowiedź: Przeinstaluj selektory: w Octoparse zaktualizuj „Extract data” na nowe elementy; w ParseHub utwórz precyzyjniejsze wybory. Zawsze testuj na 2-3 stronach.
Pytanie: Jak bezpiecznie przechowywać hasła do proxy?
Odpowiedź: Używaj menedżera haseł i osobnych kont dla projektów edukacyjnych i produkcyjnych. Nie zapisuj haseł w otwartych dokumentach.
Pytanie: Jak szybko sprawdzić, czy rotacja działa?
Odpowiedź: Sprawdź w panelu dostawcy lub wykonaj krótki wniosek do serwisu pokazującego IP w przeglądarce przez to samo proxy przed uruchomieniem zadania.
Pytanie: Jak unikać duplikatów przy regularnych uruchomieniach?
Odpowiedź: Zachowuj kluczowe pole (np. ProductURL) i porównuj je z historią. W wyłącznych duplikatach stosuj filtrację przy imporcie do bazy danych.
Pytanie: Czy mogę łączyć dane z Octoparse i ParseHub?
Odpowiedź: Tak. Połącz eksporty przez klucz ProductURL i priorytetowo zostawiaj pole, w którym wypełnienie jest wyższe. Pomaga to walidować wynik.
Pytanie: Gdzie znajdę wszystkie kroki dotyczące ustawienia proxy w tym przewodniku?
Odpowiedź: Przejdź do sekcji „Krok 3” oraz „Krok 4” przez linki wewnętrzne: ustawienie proxy w Octoparse i ustawienie proxy w ParseHub.
Podsumowanie
Podsumowując: zainstalowałeś i skonfigurowałeś Octoparse i ParseHub, podłączyłeś mobilne proxy, stworzyłeś działające szablony parsowania z paginacją i walidacją, skonfigurowałeś antyban, eksport oraz regularne uruchomienia. Na wyjściu — powtarzalny proces zbierania danych bez kodu z odpornym na blokady dzięki ostrożnemu tempu i mobilnym IP.
Co robić dalej: skaluj objętość przez dodanie mobilnych proxy i harmonogramów, zwiększaj jakość przez transformacje danych, integruj eksporty w BI lub CRM. Jeśli korzystasz z serwisów klasy mobileproxy.space, zgłębiaj dodatkowe funkcje panelu rotacji oraz logi aktywności.
Gdzie się rozwijać: ucz się analizować strukturę złożonych stron, wykorzystuj rozszerzone czyszczenie i normalizację danych, dodawaj kontrolę jakości z progami wypełnienia. Dla zaawansowanych zadań rozważ kaskadowe pipeliny: zbieranie listy, następnie kart, a potem mediów. Przypominamy: zawsze pracuj w ramach zasad strony i przepisów prawnych.
Porada: Przed jakąkolwiek większą zmianą zrób kopię zapasową projektu i zapisz aktualne ustawienia proxy osobno. To zaoszczędzi czas w przypadku przywracania.