Ik bouw ETL, ELT data pipelines met python, spark, airflow en dbt
Data- en AI-engineer, Python, PySpark, Airflow en Cloud ETL
Over deze dienst
Over deze dienst:
Wil je dat je data wordt opgeschoond, getransformeerd en betrouwbaar stroomt van bron naar bestemming? Ik bouw ETL/ELT-pipelines met moderne data engineering tools zoals Python, PySpark, SQL, Apache Airflow, dbt en Databricks, volgens de Medallion Architecture (Bronze/Silver/Gold) voor schone, productieklare datalaagjes.
Recent werk omvat een pipeline die live data via API binnenhaalt, deze via Airflow orkestreert met automatische foutmeldingen, transformeert met meer dan 10 dbt-modellen met 60+ datakwaliteitstests, en deze weergeeft in een Power BI-dashboard plus een aparte Databricks-pipeline die e-commerce data end-to-end verwerkt met PySpark.
Wat ik aanbied:
- Ontwerp en ontwikkeling van ETL/ELT-pipelines (batch)
- Data opschonen, valideren en kwaliteitscontroles uitvoeren
- Implementatie van Medallion Architecture (Bronze/Silver/Gold)
- Orkestratie met Apache Airflow
- Data transformatie met dbt, SQL, PySpark
- Databricks pipeline ontwikkeling
- API-gebaseerde data-inname
- Dashboard integratie (Power BI)
Waarom met mij werken:
- Werk dat echt verifieerbaar is, elk oplevering wordt ondersteund door een openbare GitHub repo
- Duidelijke communicatie, realistische deadlines
- Schoon, gedocumenteerd, productieklare code, geen wegwerpscripts
Bestemmingsplatform:
PostgreSQL
•
Amazon S3
•
Overige
Tools & platforms:
Azure Data Factory
•
Overige
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Wat voor soort data pipelines kun je bouwen?
Ik bouw ETL/ELT pipelines die data uit APIs, databases, platte bestanden (CSV/Excel) of websites halen. Ik maak de data schoon, transformeer en test deze met Python, PySpark en dbt, en lever het in een gestructureerd formaat aan je database of data warehouse (zoals PostgreSQL of Databricks).
Ik ben niet technisch, kun je me toch helpen?
Absoluut. De meeste van mijn klanten zijn geen engineers. Vertel me je einddoel in gewoon Nederlands (bijvoorbeeld "Ik wil mijn dagelijkse verkoop- en voorraadgegevens op één plek hebben"), en ik regel de technische architectuur en leg het eenvoudig uit.
Kun je een pipeline automatiseren die dagelijks of wekelijks draait?
Ja. Ik ben gespecialiseerd in het gebruiken van Apache Airflow om workflows te orkestreren en automatiseren. Afhankelijk van je pakket kan ik geplande runs instellen, taakafhankelijkheden en automatische e-mailalerts bij falen van een pipeline onderdeel.
Kun je helpen met web scraping?
Ja. Ik kan web scrapers maken met Python om data van openbare websites te halen, waarbij ik ervoor zorg dat het project voldoet aan wettelijke eisen en site regels. Ik kan ook direct met APIs integreren, wat ik altijd aanbeveel voor betere stabiliteit.
Wat is de "Medallion Architecture"?
Het is een best-practice dat data organiseert in drie lagen: Bronze (ruwe data), Silver (schoongemaakte en gefilterde data) en Gold (zakelijk gereed data). Ik gebruik dit om te zorgen dat je uiteindelijke rapporten gebaseerd zijn op zeer betrouwbare, geteste data.
Kan dit integreren met BI-tools?
Ja. Ik ontwerp de laatste laag van je data pipeline zo dat tools zoals Power BI, Tableau of andere analytics platforms er direct op kunnen aansluiten en de data efficiënt kunnen opvragen.
Wat is AI data verrijking?
AI data enrichment betekent het gebruik van AI of LLM tools om meer betekenis en structuur toe te voegen aan ruwe, rommelige data. Bijvoorbeeld, ongestructureerde klantfeedback kan automatisch worden gecategoriseerd op sentiment, of specifieke entiteiten (zoals namen of locaties) kunnen worden gehaald uit grote tekstblokken.
Kun je AI of LLM verrijking aan mijn data toevoegen?
Ja. Ik kan AI/LLM workflows integreren in je pipeline om taken zoals samenvatting, classificatie, tagging en het omzetten van ongestructureerde tekst naar schone, querybare databasevelden te regelen voordat het je dashboard bereikt.
Gebruik je datakwaliteitstests?
Ja. Ik geloof sterk dat datakwaliteit ingebouwd moet worden, niet achteraf toegevoegd. Ik gebruik dbt om geautomatiseerde tests te implementeren (controle op nulls, duplicaten of geaccepteerde waarden) zodat je pipeline je waarschuwt voor slechte data voordat je rapporten kapot gaan.

