Ik bouw datastromen die
Over deze dienst
Ik bouw productie-achtige ETL-pijplijnen met PySpark voor transformatie, Airflow voor orkestratie en Delta Lake voor opslag, hetzelfde stack dat ik dagelijks gebruik in mijn data engineering werk.
Wat wordt behandeld:
- Bronzen-naar-Zilveren (raw-naar-schoon) transformatielogica in PySpark
- Ontwerp van Airflow DAG met juiste planning en afhankelijkheidsbeheer
- Delta Lake tabelopzet met versiebeheer
- Optioneel: Trino/Metabase dashboard bovenop de opgeschoonde data
- Volledig in-house, zelfgehoste pijplijnarchitectuur zonder afhankelijkheid van third-party managed ETL-platforms (Fivetran, Airbyte Cloud, etc.) als je liever de volledige stack in eigen beheer hebt
Voor we beginnen met het ontwerpen van de pipeline vraag ik naar je datavolume en bronformaat, omdat er veel verschil is tussen een CSV met 10k rijen en een streamingbron, en ik zal eerlijk inschatten in plaats van een generiek sjabloon te hergebruiken.
Veelgestelde vragen
Automatische vertaling
Werk je met cloud data bronnen (S3, GCS, Azure Blob)?
Ja — geef je bron aan in de requirements.
Kun je een bestaande kapotte pipeline repareren in plaats van een nieuwe te bouwen?
Ja, stuur me eerst een bericht met details — de prijs verschilt van nieuwe bouw opdrachten.
Heb ik mijn eigen Airflow instantie nodig?
Nee, ik kan er een opzetten (lokaal/Docker) als onderdeel van de oplevering, of binnen jouw bestaande omgeving werken als je toegang geeft.
Kun je dit bouwen zonder afhankelijk te zijn van managed third-party ETL tools?
Ja — ik bouw volledig in-house/self-hosted pipelines (PySpark + Airflow + Delta Lake) in plaats van tools zoals Fivetran of Airbyte Cloud aan elkaar te koppelen. Beschikbaar bij de Premium tier.
