Het lijkt erop dat deze dienst tijdelijk niet beschikbaar is
Ik scrape websites en docs naar schone markdown data voor llm en rag
Nederland
Python Web Scraping en Data Extractie ontwikkelaar
Over deze dienst
Heb je een website of documentatiesite die omgezet moet worden in schone, gestructureerde data? Dat is wat ik doe.
Ik bouw aangepaste Python scrapers die een site crawlen en elke pagina omzetten in schone Markdown, CSV of JSON met metadata, een manifest en een coverage report zodat je precies weet wat er is vastgelegd. Ideaal voor LLM en RAG datasets, kennisbanken, onderzoek en migraties.
Wat je krijgt:
- Schone, gestructureerde data in jouw voorkeursformaat
- Deduplicatie + coverage report (geen rommel, geen ontbrekende pagina’s)
- JavaScript-gerenderde sites worden afgehandeld met Playwright, niet alleen statisch HTML
- Data die ik zelf uitvoer en verifieer voor levering
Hoe ik werk, eerlijk gezegd:
- Ik respecteer robots.txt, rate limits en sitevoorwaarden
- Geen anti-bot of CAPTCHA bypassing. Als een site actief beschermd is, vertel ik dat voordat je bestelt
- Scrapers zijn afhankelijk van de huidige structuur van een site; toekomstige sitewijzigingen zijn een aparte taak
Wil je de broncode of terugkerende data refreshes? Beide zijn beschikbaar als extra opties.
Stuur me een bericht met de site en de data die je nodig hebt, en ik vertel je eerlijk of het een goede match is en hoe ik het aanpak.
Technologie:
Python
•
Beautiful Soup
•
Toneelschrijver
•
Pandas
Techniek:
Geautomatiseerd
Veelgestelde vragen
Automatische vertaling
Kun je elke website schrapen?
De meeste statische en JavaScript-gerenderde sites, ja. Ik doorbreek geen anti-bot of CAPTCHA-beveiligingen, dus een klein deel van zwaar beveiligde sites valt buiten de scope. Ik vertel je dat altijd vooraf voordat je bestelt.
In welk formaat ontvang ik de gegevens?
Markdown, CSV of JSON, afhankelijk van jouw voorkeur, plus een manifest en een coverage report. Ik kan formaten combineren indien nodig.
Blijft de scraper later werken?
Het werkt tegen de site zoals die op het moment van levering is. Als de structuur later verandert, is het bijwerken een aparte taak, en ik bied data refreshes aan als extra service.
Krijg ik de broncode?
Standaard ontvang je de data. De volledige Python broncode met een README is beschikbaar als extra, zodat je het zelf kunt draaien.

