Ik bouw Python web scraping bots en AI data extractie pipelines
LLM Engineer en Data Scientist: NLP, GenAI, ML die resultaten opleveren
Over deze dienst
Ik bouw scrapers en data pipelines die blijven werken na de eerste run.
8 jaar ervaring in data engineering en AI. Eerdere werkzaamheden:
- Distributed crawlers gebouwd voor Facebook, Instagram, TikTok, Twitter, zoekmachines en e-commerce sites, die leidinggevenden BI dashboards voeden
- Een ETL pipeline ontwikkeld die meer dan 10 miljoen boekrecords van Amazon, Ingram en Goodreads normaliseert en automatisch 50% van de dubbele en conflicterende data oplost
- Scrapers gemaakt die ruwe data aanleveren voor een intern AI-product
Wat ik kan doen:
- Product-, prijs- en reviewgegevens van e-commerce winkels
- Bedrijfsvermeldingen en directories voor lead research
- Vastgoed, vacatures, nieuws en evenementvermeldingen
- Sites met veel JavaScript, oneindige scroll en inlogpagina’s waar je toegang toe hebt
- AI extractie: rommelige pagina’s en PDFs omzetten in gestructureerde velden met LLMs
- Geplande runs die verse data naar Google Sheets, een database of je API sturen
Tools: Python, Scrapy, Playwright, Selenium, BeautifulSoup, Pandas, PostgreSQL, MongoDB, AWS
Elke levering wordt schoongemaakt, gededupliceerd en gecontroleerd voordat het bij jou terechtkomt.
Ik haal alleen publiek beschikbare data op. Stuur me de website link voorafgaand aan de bestelling zodat ik kan bevestigen dat het mogelijk is.
Technologie:
Python
•
Scrapy
•
Selenium
•
Apollo
•
Email Extractor
Techniek:
Geautomatiseerd
Veelgestelde vragen
Automatische vertaling
Kun je elke website schrapen?
De meeste openbare websites, ja. Sommige sites blokkeren scraping sterk of verbieden het in hun voorwaarden. Stuur me de link voorafgaand aan de bestelling en ik bevestig wat mogelijk is en hoe lang het duurt.
Lever je de code of alleen de data?
Data Pull levert alleen data. Scraper + Code en Automated Pipeline bevatten volledige Python broncode die je zelf opnieuw kunt uitvoeren.
Kun je data op een schema scrapen?
Ja. De Automated Pipeline draait dagelijks, wekelijks of op elk gewenst interval, met meldingen als een site verandert en de scraper een update nodig heeft.
In welke formaten kan ik de data krijgen?
CSV, Excel, JSON, Google Sheets of direct in je PostgreSQL, MySQL of MongoDB database. Ik kan het ook via een eenvoudige API beschikbaar maken.
Hoe gebruik je AI bij scraping?
Voor pagina’s zonder gestructureerde data, zoals PDFs, listings of vrije tekst beschrijvingen, gebruik ik LLMs om velden zoals namen, prijzen en specificaties te extraheren in een consistente tabel.
Scrap je persoonlijke data of achter logins?
Ik haal alleen publieke data op, en pagina’s achter een login alleen als jij het account bezit en toegang hebt tot die data. Ik verzamel geen privé persoonlijke informatie.

