Ik doe python web scraping of PDF data extractie naar Excel, CSV of json
Web app, automatisering en chatbot ontwikkelaar
Over deze dienst
Heb je data nodig van een website, een directory, een online catalogus, of van honderden PDFs en facturen? Ik haal het eruit en lever een schoon, klaar-voor-gebruik dataset in Excel, CSV, JSON of Google Sheets.
Typische opdrachten:
- Productcatalogi en prijslijsten
- Bedrijvengidsen, lijsten en openbare registers
- Tabellen en lijnitems uit PDF-facturen, rapporten of gescande documenten
- Openbare statistieken, open data en artikelen voor analyse
- Prijsmonitoring die automatisch opnieuw draait (Premium)
Wat je krijgt:
- Deduplicated, schoongemaakte en consistent geformatteerde data
- Exact de kolommen die je hebt gevraagd, met een voorbeeld binnen 12 uur
- Een validatiesamenvatting (verzamelde rijen, hiaten, notities)
- Een herbruikbaar Python script met instructies (Standard en Premium)
Ik werk alleen met publiek toegankelijke data, met respect voor websitevoorwaarden en privacywetgeving: geen persoonlijke data verzamelen, geen login omzeilen, geen CAPTCHA omzeilen.
Leveringen beschikbaar in Engels, Frans, Nederlands, Duits, Spaans, Turks, Arabisch en meer.
Stuur me de link(en) of een voorbeeldbestand en ik bevestig de haalbaarheid en het juiste pakket voordat je bestelt.
Technologie:
Python
•
Scrapy
•
Beautiful Soup
•
Toneelschrijver
•
Pandas
Techniek:
Geautomatiseerd
Veelgestelde vragen
Automatische vertaling
Kun je elke website schrapen?
De meeste publieke websites, ja. Platforms waarvan de voorwaarden scraping verbieden (marktplaatsen, sociale netwerken, review sites) en sites met login worden afgewezen. Stuur de link voor bestelling: ik bevestig schriftelijk wat mogelijk is, welke kolommen en ongeveer hoeveel rijen je krijgt. Die boodschap is de scope van de opdracht.
Wat wordt bedoeld met één bron?
Eén website (alle pagina's van hetzelfde type, bijvoorbeeld elke productpagina van een winkel) of één batch PDFs met hetzelfde layout.
In welk formaat ontvang ik het?
Excel (.xlsx), CSV, JSON of Google Sheets, met de kolommen die jij specificeert.
Lever je het script?
Ja, in Standard en Premium, met instructies zodat je het zelf opnieuw kunt draaien. Geplande scrapers (Premium) draaien op jouw eigen account, bijvoorbeeld GitHub Actions of een kleine server; ik zet het samen met jou op.
Wat betreft persoonlijke data?
Van websites verzamel ik geen persoonlijke data van individuen (privé e-mails, telefoonnummers) of iets dat GDPR schendt. Data uit je eigen documenten, zoals facturen, is prima.
Kun je data uit gescande PDFs halen?
Ja, inclusief OCR voor scans. Nauwkeurigheid wordt eerst gevalideerd op een voorbeeld.
Zijn er projecten die uitgesloten zijn?
Alles gerelateerd aan gokken, volwassen content, alcohol, muziek/entertainment, dating, interest-gebaseerde leningen/investeringen, of school/universiteitsopdrachten die bedoeld zijn om als jouw eigen werk in te dienen, en alles dat de voorwaarden van een website schendt.

