Ik bouw een productieklare ETL data pipeline met AWS, airflow en pyspark
Data engineer, AWS, Apache Airflow, Spark, PostgreSQL, ETL
Over deze dienst
Ben je verdrinkt in ruwe data zonder betrouwbare manier om het te verwerken?
Ik bouw productieklare data pipelines die automatisch draaien, meegroeien met je data en nooit stilletjes kapot gaan. Geen spaghetti scripts. Geen handmatige stappen. Gewoon schone, betrouwbare data precies waar je het nodig hebt.
Wat ik bouw
- ETL pipelines met Python en PySpark voor extract, transform, load, klaar
- Apache Airflow DAGs voor volledig geautomatiseerde, geplande workflows
- Medallion Architecture pipelines (Bronze, Silver, Gold) met datakwaliteit op elk niveau
- AWS data platforms S3 data lake, Glue, EMR op EKS, IAM, Terraform
- Cloud ingestion pipelines van elke bron naar PostgreSQL, MySQL, ClickHouse of Supabase
- Volledig gecontaineriseerde setups met Docker en Docker Compose
- Deployments met één commando via CI/CD, geen handmatig SSH, geen runbooks
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
V: Welke informatie heb je nodig om te beginnen?
A: Jouw data bron (S3, API, database, CSV), jouw doelbestemming, transformatie-eisen en hoe vaak de pipeline moet draaien.
Q: Kan ik met mijn bestaande infrastructuur werken?
A: Ja. Stuur me details en ik beoordeel de compatibiliteit voordat we beginnen.
Q: Heb ik een AWS-account nodig?
A: Voor AWS-gebaseerd werk ja — je hebt je eigen account nodig. Ik kan je begeleiden bij de setup indien nodig.
V: Wordt de code van mij?
A: Absoluut. Alle broncode wordt bij oplevering aan jou overgedragen.
V: Kunt u grote datasets verwerken?
A: Ja. Ik gebruik PySpark en EMR op EKS omdat ze speciaal zijn ontworpen voor grootschalige data verwerking.
Q: Wat als iets kapot gaat na levering?
A: Ja. Ik bied ondersteuning na oplevering. Stuur me een bericht en ik los het op.

