Ik scrape elke openbare website in een schone csv of json dataset
Data opschonen, web scraping en spreadsheet automatisering
Over deze dienst
Je krijgt binnen 48 uur meestal een schone CSV- en JSON-dataset van elke openbare website.
Vertel me de URL en de velden die je nodig hebt, zoals productnaam, prijs, beoordeling en link, en ik lever een gestructureerde dataset plus een coverage report dat precies laat zien welke pagina's bezocht zijn en hoe compleet elk veld is.
Hoe het werkt: een headless browser laadt elke pagina zoals een echte bezoeker dat doet, zodat JavaScript-gestuurde listings werken. robots.txt wordt gecontroleerd voordat elke request wordt gedaan en nageleefd. Pagina's worden automatisch gevolgd tot de limiet die je instelt, met een bewuste pauze tussen de pagina's.
Je ontvangt dataset.csv, dataset.json en coverage.md, waarin elke bezochte pagina met status en recordaantal wordt vermeld, plus een percentage volledigheid per veld zodat je kunt zien wat de bron echt niet had.
Alleen openbare pagina's. Ik scrape niet achter logins of paywalls, ik omzeil geen CAPTCHAs of snelheidslimieten, en ik verzamel geen persoonlijke contactgegevens zoals e-mails of telefoonnummers. Bestel die alsjeblieft niet.
Dit is een AI-ondersteunde workflow met menselijke review voor levering. Stuur eerst de URL en ik vertel je eerlijk of het mogelijk is.
Technologie:
Python
•
Beautiful Soup
•
Toneelschrijver
•
Pandas
Techniek:
Geautomatiseerd
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Kun je een site scrapen die een login vereist?
Nee. Deze dienst dekt alleen publiek bereikbare pagina's. Alles achter een login, paywall of CAPTCHA valt buiten de scope en ik weiger het te doen.
Kun je een lijst maken van e-mails of telefoonnummers?
Nee. Ik verzamel geen persoonlijke contactgegevens. Dat breekt de voorwaarden van Fiverr en privacywetten in de meeste landen. Openbare bedrijfsgegevens zoals bedrijfsnamen, categorieën, prijzen en openbare URL's zijn wel toegestaan.
Wat als de site scraping blokkeert in robots.txt?
Ik controleer robots.txt voor elke request en respecteer het. Als het pad verboden is, vertel ik je dat voordat ik begin en annuleer ik de opdracht, in plaats van het te omzeilen.
De data die ik nodig heb staat op de pagina van elk item, niet in de lijst. Kun je dat krijgen?
Ja, dat is de Premium tier. De listing wordt eerst verzameld en daarna wordt elke detailpagina bezocht en samengevoegd in dezelfde rij. Vertel me welke velden op de detailpagina staan.
Gebruik je AI hiervoor?
Ja, dit is een AI-ondersteunde workflow en een mens controleert elke levering voordat deze wordt verzonden. De dataset wordt alleen voor jouw opdracht gemaakt.

