Ik bouw een aangepaste website scraper met geplande runs en schone CSV-export
Over deze dienst
Ik maak schone Python scrapers die web data voor jou ophalen op een schema. Productprijzen, vastgoedvermeldingen, concurrentencatalogi, reviews of leads.
Wat je krijgt. Een werkende scraper gebouwd met Python en Playwright. Het verwerkt JavaScript-gestuurde sites, paginering, anti-bot edge cases en gestructureerde extractie via JSON LD of configureerbare CSS selectors. Output als CSV, JSON, Excel, Google Sheets of direct naar je database.
Veelgebruikte toepassingen. Concurrentieprijsmonitoring met dagelijkse Slack-alerts bij prijsdalingen. Vastgoedvermeldingen verzamelen over portals. Productcatalogus en review extractie voor e-commerce. Leadgeneratie uit directories en vermeldingssites. Nieuws en artikelen voor analytics of RAG-pijplijnen.
Premium voegt volledige automatisering toe. GitHub Actions cron, CSV-verschillen en alerts bij veranderingen. Zelfde architectuur als mijn openbare concurrentieprijsmonitor repo op GitHub.
Ik ben eerlijk over de limieten. Sites met agressieve anti-bot bescherming zoals Cloudflare Turnstile, login-walls of alleen residentiële toegang kunnen betaalde proxies vereisen of niet de moeite waard zijn om te scrapen. Ik vertel je vooraf als jouw doel hierin valt.
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Welke informatie heb je nodig om aan de slag te gaan?
De URL(s) van de site(s) die je wilt scrapen, de exacte velden die je nodig hebt (bijvoorbeeld productnaam, prijs, SKU, afbeeldings-URL), het outputformaat (CSV/JSON/Excel/Sheets/DB) en hoe vaak je wilt dat het draait (eenmalig, dagelijks, elk uur).
Is webscraping legaal?
Over het algemeen ja voor publiek toegankelijke data, maar het hangt af van de Terms of Service van de site en wat je met de data doet (GDPR voor persoonlijke data, copyright voor content hergebruik). Ik scrape alleen openbare data, respecteer robots.txt waar redelijk, en voeg beleefde vertragingen toe. Voor grey-area doelen geef ik een risicovoorlichting.
Wat als de website zijn layout verandert en de scraper breekt?
Mijn scrapers gebruiken gelaagde extractie (JSON-LD eerst, microdata, CSS selectors als fallback) zodat de meeste redesigns ze niet breken. Selectors staan in de config, niet in de code, dus kleine wijzigingen zijn 1-regel fixes. Als het binnen 14 dagen breekt en met config te herstellen is, repareer ik het gratis.
Kun je inloggen, captcha of anti-bot bescherming aan?
Inloggen: ja, als je credentials aanlevert en er geen hard captcha is. Basis anti-bot (UA, snelheidslimieten): ja, via headers en vertragingen. Hard anti-bot (Cloudflare Turnstile, hCaptcha, residentiële IP's): mogelijk met betaalde proxies, maar kosten gaan omhoog en betrouwbaarheid daalt. Ik vertel je vooraf.
Waar draait de scraper na levering?
Basis/Standard: je draait het op je eigen machine of server (ik geef instructies). Premium: ik zet het in op GitHub Actions (gratis voor publiek, royaal voor privé), draait volgens schema zonder jouw input. AWS Lambda, Render of je eigen VPS op aanvraag.
Hoe zit het met doorlopende kosten?
GitHub Actions: gratis voor de meeste gevallen. Opslag: CSV-bestand (gratis). Proxies (alleen als de site ze vereist): vanaf 30 dollar per maand bij providers zoals Bright Data of Smartproxy. Ik reken niets na levering, tenzij je wilt dat ik de scraper onderhoud of uitbreid.

